内存带宽是目标
打包三元权重减少了每个令牌传输的字节数;仅当硬件路径受益时,计算布局才会消耗 RAM。
软件系统03/推理
Hyphae BitNet 是当前 celiums-bitnet 运行时的基础存储库:一次性生成、本机 HTTP 服务、实验性 C ABI 和预填充/解码基准。
使受支持的三元模型在普通 CPU 服务器上运行,而无需将近似内核、不受控制的 RAM 增长或继承的引擎内部结构转变为隐藏的产品行为。
01 / Benefits
打包三元权重减少了每个令牌传输的字节数;仅当硬件路径受益时,计算布局才会消耗 RAM。
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
模型加载或会话创建拒绝超出配置的工作集上限,而不是使主机无法使用。
支持的架构和文件类型组合是明确的;拒绝普通 Llama/Qwen Q4 型号和碰撞 Q2 格式。
应用程序使用 celiums-bitnet CLI、C ABI 或本机 HTTP 子集,而不是绑定到 GGML 内部。
基准包括模型摘要、RAM 上限、CPU/ISA、预填充/解码分割、原始 JSON 和显式非声明。
02 / Architecture
包装好的 GGUF 仍然是耐用存储。可选的、预算内存计算布局与 CPU ISA 相匹配;预填充和解码然后使用不同的内核。
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget 保留主机余量,如果所选布局不适合,则在分配之前失败
ARM i8mm将Q1扩展为int8±1; x86 VNNI 保留位封装的 4×8 面板; I2_S 使用严格的tinyBLAS 路径
GEMM 在八个激活行和四个激活行中重复使用每个重量面板
GEMV 处理一个令牌并传输一次权重图像;预填充优化不会假装加速解码
标记化、预填充、解码、登录、采样、取消、流回调、HTTP/SSE 和 JSONL 工作台
03 / Surface
MOSTLY_I2_S 中的 Microsoft BitNet b1.58 2B 具有固定的转换身份和精确性门。
预量化 Q1_0 Qwen35 系列,具有 1 位符号、FP16 块尺度、DeltaNet 加注意力和显式系列选择。
一次性生成、本机 HTTP 完成/聊天子集、SSE、API 密钥、指标、停止序列和协作取消。
单独的 Rust 进程可以添加检索、内存、收据、注册表、证明、语义缓存和 MCP,而无需将 Hyphae 链接到 GGML。
04 / Evidence
预填充和解码具有不同的屋顶线。公布的收据报告了两种情况,并保留了布局有助于一个阶段但损害另一个阶段的情况。
Q1 expand-to-int8 vs packed mmap
高线程数可能会回归
8-row vs 4-row GEMM
模型分配前被拒绝
Graviton 和 Xeon 数据仅适用于指定的模型、摘要、机器、线程数、提示/生成长度和 64 GiB 上限。扩大Q1可以在DRAM饱和时减少高线程解码。