メモリ帯域幅が目標です
パックされた 3 値の重みにより、トークンごとにストリーミングされるバイト数が削減されます。コンピューティング レイアウトは、ハードウェア パスにメリットがある場合にのみ RAM を消費します。
ソフトウェアシステム03 / 推論
Hyphae BitNet は、現在の celiums-bitnet ランタイムの基盤リポジトリです。ワンショット生成、ネイティブ HTTP サービス、実験的な C ABI、プレフィル/デコード ベンチマークなどを備えています。
近似カーネル、制御されていない RAM の増加、または継承されたエンジン内部を隠れた製品動作に変えることなく、サポートされている 3 値モデルを通常の CPU サーバー上で動作させることができます。
01 / Benefits
パックされた 3 値の重みにより、トークンごとにストリーミングされるバイト数が削減されます。コンピューティング レイアウトは、ハードウェア パスにメリットがある場合にのみ RAM を消費します。
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
モデルの読み込みまたはセッションの作成は、ホストを使用不能にする代わりに、構成されたワーキングセットの上限を超えることを拒否します。
サポートされるアーキテクチャとファイル タイプの組み合わせは明示的です。通常の Llama/Qwen Q4 モデルと衝突する Q2 フォーマットは拒否されます。
アプリケーションは、GGML 内部にバインドする代わりに、celiums-bitnet CLI、C ABI、またはネイティブ HTTP サブセットを使用します。
ベンチマークには、モデル ダイジェスト、RAM キャップ、CPU/ISA、プリフィル/デコード分割、生の JSON、および明示的な非クレームが含まれます。
02 / Architecture
パックされた GGUF は耐久性のあるストアのままです。オプションの予算に応じたインメモリ コンピューティング レイアウトは、CPU ISA と一致します。プリフィルとデコードを行ってから、異なるカーネルを使用します。
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget はホストのヘッドルームを予約しますが、選択したレイアウトが適合しない場合は割り当て前に失敗します。
ARM i8mm は Q1 を int8 ±1 に拡張します。 x86 VNNI はビットパックされた 4×8 パネルを保持します。 I2_S は厳密な tinyBLAS パスを使用します
GEMM は、各ウェイト パネルを 8 行と 4 行のアクティベーション行にわたって再利用します。
GEMV は 1 つのトークンを処理し、重み画像を 1 回ストリーミングします。プレフィルの最適化はデコードを高速化するふりをしません
トークン化、プレフィル、デコード、ロジット、サンプリング、キャンセル、ストリーミング コールバック、HTTP/SSE、および JSONL ベンチ
03 / Surface
Microsoft BitNet b1.58 2B (MOSTLY_I2_S) (ピン留めされた変換 ID と正確性ゲートを備え)。
1 ビット符号、FP16 ブロック スケール、DeltaNet プラス アテンション、明示的なファミリー選択を備えた事前量子化 Q1_0 Qwen35 ファミリ。
ワンショット生成、ネイティブ HTTP 完了/チャット サブセット、SSE、API キー、メトリクス、停止シーケンス、および協調キャンセル。
別の Rust プロセスでは、Hyphae を GGML にリンクせずに、取得、メモリ、レシート、レジストリ、プルーフ、セマンティック キャッシュ、および MCP を追加できます。
04 / Evidence
プリフィルとデコードには異なるルーフラインがあります。公開されたレシートは両方を報告しており、レイアウトがあるフェーズでは役に立ちますが、別のフェーズでは害を及ぼすケースを保存しています。
Q1 expand-to-int8 vs packed mmap
スレッド数が多いと退行する可能性がある
8-row vs 4-row GEMM
モデル割り当て前に拒否されました
Graviton および Xeon の数値は、指定されたモデル、ダイジェスト、マシン、スレッド数、プロンプト/生成の長さ、および 64 GiB の上限にのみ適用されます。 Q1 を拡張すると、DRAM が飽和した場合のハイスレッド デコードを減らすことができます。