Yayasan dalam pembentukan Penatalayanan sementara: Celiums Solutions LLC Baca catatan status

Sistem perangkat lunak 03 / Inferensi

Jaringan ternary pada CPU, dengan matematika dan memori yang tepat digunakan dengan sengaja.

Hyphae BitNet adalah repositori dasar untuk runtime celiums-bitnet saat ini: pembuatan sekali pakai, penyajian HTTP asli, C ABI eksperimental, dan tolok ukur pra-pengisian/dekode.

Menjadikan model ternary yang didukung beroperasi pada server CPU biasa tanpa mengubah perkiraan kernel, pertumbuhan RAM yang tidak terkendali, atau internal mesin yang diwarisi menjadi perilaku produk yang tersembunyi.

01 / Benefits

Mengapa runtime ini ada

Bandwidth memori adalah targetnya

Bobot ternary yang dikemas mengurangi byte yang dialirkan per token; tata letak komputasi menggunakan RAM hanya jika jalur perangkat keras diuntungkan.

Akumulasi yang tepat

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

Anggaran RAM yang gagal ditutup

Pemuatan model atau pembuatan sesi menolak untuk melebihi batas set kerja yang dikonfigurasi dan bukannya membuat host tidak dapat digunakan.

Pemuatan terbatas berdasarkan keluarga model

Arsitektur yang didukung dan kombinasi tipe file bersifat eksplisit; model Llama/Qwen Q4 biasa dan format Q2 yang bertabrakan ditolak.

Antarmuka milik produk

Aplikasi menggunakan celiums-bitnet CLI, C ABI, atau subset HTTP asli alih-alih mengikat ke internal GGML.

Bukti sebelum pemasaran

Tolok ukurnya mencakup ringkasan model, batas RAM, CPU/ISA, pemisahan pra-pengisian/dekode, JSON mentah, dan non-klaim eksplisit.

02 / Architecture

Alur inferensi dalam runtime

GGUF yang dikemas tetap menjadi toko yang tahan lama. Tata letak komputasi dalam memori opsional yang dianggarkan cocok dengan ISA CPU; pra-isi dan dekode lalu gunakan kernel yang berbeda.

  1. 01

    GGUF yang tervalidasi

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    Gerbang anggaran

    ram_budget mencadangkan ruang utama host dan gagal sebelum alokasi jika tata letak yang dipilih tidak sesuai

  3. 03

    Gambar komputasi ISA

    ARM i8mm memperluas Q1 ke int8 ±1; x86 VNNI menyimpan panel 4×8 yang penuh bit; I2_S menggunakan jalur tinyBLAS yang ketat

  4. 04

    Prefill

    GEMM menggunakan kembali setiap panel bobot di delapan dan empat baris aktivasi

  5. 05

    Dekode

    GEMV menangani satu token dan mengalirkan gambar bobot satu kali; pengoptimalan pra-pengisian tidak berpura-pura mempercepat dekode

  6. 06

    Waktu proses publik

    Tokenisasi, pengisian awal, dekode, logit, pengambilan sampel, pembatalan, panggilan balik streaming, HTTP/SSE, dan bangku JSONL

03 / Surface

Cakupan produk yang didukung

BitNet 2B bersertifikat

Microsoft BitNet b1.58 2B di MOSTLY_I2_S dengan gerbang identitas dan ketepatan konversi yang disematkan.

Teks CPU Bonsai 27B

Keluarga Q1_0 Qwen35 yang telah dikuantisasi sebelumnya dengan tanda 1-bit, skala blok FP16, DeltaNet plus perhatian, dan pemilihan keluarga eksplisit.

Waktu proses dan penayangan

Pembuatan sekali pakai, penyelesaian HTTP asli/subset obrolan, SSE, kunci API, metrik, urutan penghentian, dan pembatalan kooperatif.

Gerbang Hyphae opsional

Proses Rust terpisah dapat menambahkan pengambilan, memori, tanda terima, registri, bukti, cache semantik, dan MCP tanpa menghubungkan Hyphae ke GGML.

04 / Evidence

Efek perangkat keras terukur

Prefill dan decode memiliki garis atap yang berbeda. Tanda terima yang diterbitkan melaporkan keduanya dan menyimpan kasus-kasus di mana tata letak membantu satu fase tetapi merugikan fase lainnya.

5.6×

Pengisian awal Graviton 4 pada satu thread

Q1 expand-to-int8 vs packed mmap

2.3×

Graviton 4 memecahkan kode dalam satu thread

jumlah thread yang tinggi dapat mengalami kemunduran

+8.6%

Xeon prefill di satu thread

8-row vs 4-row GEMM

64 B

kegagalan anggaran yang disengaja

ditolak sebelum alokasi model

Angka Graviton dan Xeon hanya berlaku untuk model, intisari, mesin, jumlah thread, panjang prompt/generasi, dan batas 64 GiB yang disebutkan. Memperluas Q1 dapat mengurangi decode high-thread ketika DRAM jenuh.

05 / Kemampuan saat ini

Kemampuan saat ini

  • Menjalankan BitNet 2B I2_S bersertifikat dan keluarga teks CPU Bonsai 27B Q1_0 yang eksplisit.
  • Menyediakan perintah CLI run/serve/bench/validate/version, C ABI eksperimental, dan subset HTTP berbentuk OpenAI.
  • Memilih profil CPU asli, AVX2 portabel, atau skalar dan tata letak komputasi yang dianggarkan.
  • Memvalidasi perilaku kernel yang tepat melalui skalar/oracle generik, pembersih, pengujian paket, dan gerbang rilis yang didukung model.
06 / Arah pengembangan

Arah pengembangan

  • Bandingkan ubin kernel tambahan dan kuantisasi aktivasi bersama.
  • Jelajahi pemadatan saluran nol yang tepat dan pengkodean ternary yang lebih padat tanpa perkiraan pemangkasan.
  • Evaluasi AMX sebagai jalur hanya pra-pengisian sambil menjaga agar bobot yang ada tetap dikemas.
  • Penjadwalan multi-urutan yang matang dan kepemilikan permintaan asinkron.
  • Pindahkan jalur GPU dari eksperimen yang diwariskan ke kernel I2_S generik yang diuji secara eksplisit sebelum klaim dukungan.
07 / Batas yang jelas

Apa yang sengaja ditolaknya

  • Bukan pelari model llama.cpp sembarangan; kombinasi arsitektur/kuantisasi yang tidak didukung ditolak.
  • Tidak ada inferensi GPU yang didukung, pengelompokan berkelanjutan, API OpenAI lengkap, penyematan, alat, logprob, atau TLS bawaan pada produk saat ini.
  • Tidak ada klaim identitas bitwise universal di seluruh ISA atau sertifikasi pos pemeriksaan sumber.
  • Artefak biner dan rilis publik saat ini mempertahankan nama produk celiums-bitnet; repositori yayasan tidak menghapus kepemilikan upstream atau model.

Hyphae BitNet

Menjadikan model ternary yang didukung beroperasi pada server CPU biasa tanpa mengubah perkiraan kernel, pertumbuhan RAM yang tidak terkendali, atau internal mesin yang diwarisi menjadi perilaku produk yang tersembunyi.