Fondazione in formazione Custodia provvisoria: Celiums Solutions LLC Leggi la nota sullo stato

Sistema software 03 / Inferenza

Reti ternarie su CPU, con matematica esatta e memoria utilizzata deliberatamente.

Hyphae BitNet è il repository di base per l'attuale runtime celiums-bitnet: generazione one-shot, servizio HTTP nativo, un ABI C sperimentale e benchmark di precompilazione/decodifica.

Rendi operativi i modelli ternari supportati su normali server CPU senza trasformare kernel approssimativi, crescita incontrollata della RAM o componenti interni ereditati del motore in comportamenti nascosti del prodotto.

01 / Benefits

Perché esiste il runtime

L'obiettivo è la larghezza di banda della memoria

I pesi ternari compressi riducono i byte trasmessi in streaming per token; i layout di calcolo consumano RAM solo quando il percorso hardware ne trae vantaggio.

Accumulo esatto

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

Budget RAM chiusi in caso di errore

Il caricamento del modello o la creazione della sessione rifiuta di superare il limite del set di lavoro configurato invece di rendere l'host inutilizzabile.

Caricamento limitato per famiglia di modelli

L'architettura supportata e le combinazioni di tipi di file sono esplicite; I modelli ordinari Llama/Qwen Q4 e i formati Q2 in collisione vengono rifiutati.

Interfacce di proprietà del prodotto

Le applicazioni utilizzano la CLI celiums-bitnet, C ABI o il sottoinsieme HTTP nativo invece di legarsi agli interni GGML.

Evidenze prima del marketing

I benchmark includono digest del modello, limite RAM, CPU/ISA, suddivisione precompilazione/decodifica, JSON non elaborato e non rivendicazioni esplicite.

02 / Architecture

Flusso dell’inferenza nel runtime

GGUF pieno rimane il negozio durevole. Un layout di calcolo in memoria opzionale e preventivato corrisponde all'ISA della CPU; precompilare e decodificare quindi utilizzare kernel diversi.

  1. 01

    GGUF convalidato

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    Porta del bilancio

    ram_budget riserva spazio per l'host e fallisce prima dell'allocazione se il layout selezionato non può adattarsi

  3. 03

    Immagine di calcolo ISA

    ARM i8mm espande Q1 in int8 ±1; x86 VNNI mantiene i pannelli 4×8 bit-packed; I2_S utilizza percorsi tinyBLAS rigorosi

  4. 04

    Prefill

    GEMM riutilizza ciascun pannello del peso su otto e poi su quattro righe di attivazione

  5. 05

    Decodifica

    GEMV gestisce un token e trasmette in streaming l'immagine del peso una volta; le ottimizzazioni di precompilazione non pretendono di accelerare la decodifica

  6. 06

    Tempo di esecuzione pubblico

    Tokenizzazione, precompilazione, decodifica, logit, campionamento, cancellazione, callback in streaming, bench HTTP/SSE e JSONL

03 / Surface

Ambito di prodotto supportato

BitNet certificato 2B

Microsoft BitNet b1.58 2B in MOSTLY_I2_S con porte di identità e precisione di conversione bloccate.

Testo della CPU Bonsai 27B

Famiglia Q1_0 Qwen35 prequantizzata con segni a 1 bit, scale a blocchi FP16, DeltaNet più attenzione e selezione esplicita della famiglia.

Runtime e servizio

Generazione one-shot, completamento HTTP nativo/sottoinsieme chat, SSE, chiavi API, metriche, sequenze di arresto e cancellazione cooperativa.

Gateway Hyphae opzionale

Un processo Rust separato può aggiungere recupero, memoria, ricevute, registro, prove, cache semantica e MCP senza collegare Hyphae a GGML.

04 / Evidence

Effetti hardware misurati

La precompilazione e la decodifica hanno linee del tetto diverse. Le ricevute pubblicate riportano entrambi e preservano i casi in cui un layout aiuta una fase ma ne danneggia un'altra.

5.6×

Preriempimento Graviton 4 su un thread

Q1 expand-to-int8 vs packed mmap

2.3×

Decodifica Graviton 4 su un thread

un numero elevato di thread può regredire

+8.6%

Precompilazione Xeon su un thread

8-row vs 4-row GEMM

64 B

bilancio deliberatamente inadeguato

rifiutato prima dell'assegnazione del modello

Le cifre di Graviton e Xeon si applicano solo ai modelli, ai digest, alle macchine, ai conteggi di thread, alle lunghezze di prompt/generazione e al limite di 64 GiB indicati. L'espansione di Q1 può ridurre la decodifica high-thread quando la DRAM è satura.

05 / Cosa fa oggi

Cosa fa oggi

  • Esegue BitNet 2B I2_S certificato e la famiglia di testi CPU Bonsai 27B Q1_0 esplicita.
  • Fornisce comandi run/serve/bench/validate/version della CLI, un'ABI C sperimentale e un sottoinsieme HTTP a forma di OpenAI.
  • Seleziona profili CPU nativi, AVX2 portatili o scalari e layout di elaborazione a budget.
  • Convalida il comportamento esatto del kernel tramite oracoli scalari/generici, disinfettanti, test dei pacchetti e gate di rilascio supportati da modello.
06 / Cosa intende fare

Cosa intende fare

  • Confronta ulteriori riquadri esatti del kernel e quantizzazione dell'attivazione condivisa.
  • Esplora la compattazione esatta a canale zero e le codifiche ternarie più dense senza potatura approssimativa.
  • Valuta AMX come percorso di sola precompilazione mantenendo compressi i pesi persistenti.
  • Pianificazione multisequenza matura e proprietà delle richieste asincrone.
  • Sposta i percorsi GPU dagli esperimenti ereditati ai kernel I2_S generici ed esplicitamente testati prima delle richieste di supporto.
07 / Limiti espliciti

Ciò che deliberatamente rifiuta

  • Non un corridore modello llama.cpp arbitrario; le combinazioni architettura/quantizzazione non supportate vengono rifiutate.
  • Nessuna inferenza GPU supportata, batch continuo, API OpenAI completa, incorporamenti, strumenti, logprobs o TLS integrato nel prodotto corrente.
  • Nessuna rivendicazione di identità bit a bit universale tra ISA o certificazione del checkpoint di origine.
  • L'attuale binario pubblico e gli artefatti di rilascio mantengono il nome del prodotto celiums-bitnet; il repository di base non cancella la proprietà upstream o del modello.

Hyphae BitNet

Rendi operativi i modelli ternari supportati su normali server CPU senza trasformare kernel approssimativi, crescita incontrollata della RAM o componenti interni ereditati del motore in comportamenti nascosti del prodotto.