El ancho de banda de la memoria es el objetivo
Los pesos ternarios empaquetados reducen los bytes transmitidos por token; Los diseños informáticos gastan RAM solo cuando la ruta del hardware se beneficia.
Sistema de software 03 / Inferencia
Hyphae BitNet es el repositorio básico para el tiempo de ejecución actual de celiums-bitnet: generación de una sola vez, servicio HTTP nativo, una ABI C experimental y puntos de referencia de precarga/decodificación.
Haga que los modelos ternarios admitidos sean operativos en servidores de CPU normales sin convertir los núcleos aproximados, el crecimiento descontrolado de la RAM o los componentes internos heredados del motor en un comportamiento oculto del producto.
01 / Benefits
Los pesos ternarios empaquetados reducen los bytes transmitidos por token; Los diseños informáticos gastan RAM solo cuando la ruta del hardware se beneficia.
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
La carga del modelo o la creación de sesiones se niegan a exceder el límite del conjunto de trabajo configurado en lugar de inutilizar el host.
Las combinaciones de arquitectura y tipos de archivos admitidas son explícitas; Se rechazan los modelos Llama/Qwen Q4 normales y los formatos Q2 en colisión.
Las aplicaciones utilizan la CLI celiums-bitnet, C ABI o el subconjunto HTTP nativo en lugar de vincularse a elementos internos de GGML.
Los puntos de referencia incluyen resúmenes de modelos, límite de RAM, CPU/ISA, división de precarga/decodificación, JSON sin formato y no reclamaciones explícitas.
02 / Architecture
El GGUF empaquetado sigue siendo el almacenamiento persistente. Una disposición de cálculo en memoria opcional y sujeta a presupuesto se adapta a la ISA de la CPU; el prefill y la decodificación usan kernels diferentes.
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget reserva el espacio libre del host y falla antes de la asignación si el diseño seleccionado no cabe
ARM i8mm expande Q1 a int8 ±1; x86 VNNI mantiene paneles de 4×8 llenos de bits; I2_S usa rutas estrictas tinyBLAS
GEMM reutiliza cada panel de peso en ocho y luego cuatro filas de activación
GEMV maneja un token y transmite la imagen de peso una vez; Las optimizaciones de precarga no pretenden acelerar la decodificación.
Tokenizar, precompletar, decodificar, logits, muestreo, cancelación, streaming de devoluciones de llamadas, bancos HTTP/SSE y JSONL
03 / Surface
Microsoft BitNet b1.58 2B en MOSTLY_I2_S con identidad de conversión fijada y puertas de exactitud.
Familia Q1_0 Qwen35 precuantizada con signos de 1 bit, escalas de bloque FP16, atención DeltaNet plus y selección de familia explícita.
Generación de una sola vez, subconjunto de chat/completación HTTP nativo, SSE, claves API, métricas, secuencias de detención y cancelación cooperativa.
Un proceso de Rust separado puede agregar recuperación, memoria, recibos, registro, pruebas, caché semántica y MCP sin vincular Hyphae a GGML.
04 / Evidence
El prefill y la decodificación tienen distintos límites de rendimiento. Los registros publicados informan de ambos y conservan los casos en que una disposición mejora una fase pero perjudica la otra.
Q1 expand-to-int8 vs packed mmap
un alto número de hilos puede retroceder
8-row vs 4-row GEMM
rechazado antes de la asignación del modelo
Las cifras de Graviton y Xeon se aplican solo a los modelos, resúmenes, máquinas, recuentos de subprocesos, longitudes de mensajes/generación y límite de 64 GiB mencionados. Ampliar Q1 puede reducir la decodificación de subprocesos altos cuando la DRAM se satura.
Hyphae BitNet