Largura de banda da memória é o alvo
Os pesos ternários compactados reduzem os bytes transmitidos por token; layouts de computação gastam RAM somente quando o caminho do hardware é beneficiado.
Sistema de software 03 / Inferência
Hyphae BitNet é o repositório básico para o tempo de execução atual do celiums-bitnet: geração única, serviço HTTP nativo, um C ABI experimental e benchmarks de pré-preenchimento/decodificação.
Torne os modelos ternários suportados operacionais em servidores de CPU comuns sem transformar kernels aproximados, crescimento descontrolado de RAM ou componentes internos herdados do mecanismo em comportamento oculto do produto.
01 / Benefits
Os pesos ternários compactados reduzem os bytes transmitidos por token; layouts de computação gastam RAM somente quando o caminho do hardware é beneficiado.
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
A carga do modelo ou a criação de sessão recusa-se a exceder o limite do conjunto de trabalho configurado em vez de tornar o host inutilizável.
A arquitetura suportada e as combinações de tipo de arquivo são explícitas; modelos Llama/Qwen Q4 comuns e formatos Q2 em colisão são recusados.
Os aplicativos usam a CLI celiums-bitnet, C ABI ou subconjunto HTTP nativo em vez de vincular aos componentes internos do GGML.
Os benchmarks incluem resumos de modelo, limite de RAM, CPU/ISA, divisão de pré-preenchimento/decodificação, JSON bruto e não declarações explícitas.
02 / Architecture
A GGUF embalada continua sendo a loja durável. Um layout de computação na memória opcional e orçado corresponde ao ISA da CPU; preencha e decodifique e use kernels diferentes.
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget reserva espaço para o host e falha antes da alocação se o layout selecionado não couber
ARM i8mm expande Q1 para int8 ±1; x86 VNNI mantém painéis 4×8 compactos; I2_S usa caminhos tinyBLAS estritos
GEMM reutiliza cada painel de peso em oito e quatro linhas de ativação
GEMV lida com um token e transmite a imagem de peso uma vez; otimizações de pré-preenchimento não pretendem acelerar a decodificação
Tokenizar, preencher previamente, decodificar, logits, amostragem, cancelamento, retornos de chamada de streaming, bancos HTTP/SSE e JSONL
03 / Surface
Microsoft BitNet b1.58 2B em MOSTLY_I2_S com identidade de conversão fixada e portas de exatidão.
Família Q1_0 Qwen35 pré-quantizada com sinais de 1 bit, escalas de bloco FP16, DeltaNet mais atenção e seleção explícita de família.
Geração única, conclusão de HTTP/subconjunto de bate-papo nativo, SSE, chaves de API, métricas, sequências de parada e cancelamento cooperativo.
Um processo Rust separado pode adicionar recuperação, memória, recibos, registro, provas, cache semântico e MCP sem vincular Hyphae ao GGML.
04 / Evidence
O pré-preenchimento e a decodificação têm linhas de telhado diferentes. Os recibos publicados relatam ambos e preservam casos em que um layout ajuda uma fase, mas prejudica outra.
Q1 expand-to-int8 vs packed mmap
altas contagens de threads podem regredir
8-row vs 4-row GEMM
recusado antes da alocação do modelo
Os números Graviton e Xeon se aplicam apenas aos modelos nomeados, resumos, máquinas, contagens de threads, comprimentos de prompt/geração e limite de 64 GiB. A expansão do Q1 pode reduzir a decodificação de alto thread quando a DRAM satura.
Hyphae BitNet