Stiftung in Gründung Interimistische Treuhand: Celiums Solutions LLC Statushinweis lesen

Softwaresystem 03 / Inferenz

Ternäre Netzwerke auf CPUs, mit exakter Mathematik und bewusst genutztem Speicher.

Hyphae BitNet ist das Basis-Repository für die aktuelle Celiums-Bitnet-Laufzeit: One-Shot-Generierung, native HTTP-Bereitstellung, ein experimentelles C-ABI und Vorfüll-/Dekodierungs-Benchmarks.

Machen Sie unterstützte ternäre Modelle auf normalen CPU-Servern betriebsbereit, ohne ungefähre Kernel, unkontrolliertes RAM-Wachstum oder übernommene Engine-Interna in verstecktes Produktverhalten umzuwandeln.

01 / Benefits

Warum die Runtime existiert

Die Speicherbandbreite ist das Ziel

Gepackte ternäre Gewichte reduzieren die pro Token gestreamten Bytes; Compute-Layouts verbrauchen nur dann RAM, wenn der Hardware-Pfad davon profitiert.

Exakte Akkumulation

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

Geschlossene RAM-Budgets

Das Laden des Modells oder die Sitzungserstellung weigert sich, die konfigurierte Obergrenze für den Arbeitssatz zu überschreiten, anstatt den Host unbrauchbar zu machen.

Familienbeschränktes Laden

Unterstützte Architektur- und Dateitypkombinationen sind explizit; Gewöhnliche Llama/Qwen-Q4-Modelle und kollidierende Q2-Formate werden abgelehnt.

Produkteigene Schnittstellen

Anwendungen verwenden die Celiums-Bitnet-CLI, C ABI oder die native HTTP-Teilmenge, anstatt an GGML-Interna zu binden.

Nachweise vor Marketing

Zu den Benchmarks gehören Modell-Digests, RAM-Obergrenze, CPU/ISA, Prefill-/Decode-Split, Roh-JSON und explizite Nichtansprüche.

02 / Architecture

Inferenzfluss durch die Runtime

Verpacktes GGUF bleibt der dauerhafte Speicher. Ein optionales, budgetiertes In-Memory-Rechenlayout entspricht der CPU-ISA; Vorfüllen und dekodieren und dann unterschiedliche Kernel verwenden.

  1. 01

    Validierter GGUF

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    Budgettor

    ram_budget reserviert Host-Headroom und schlägt vor der Zuweisung fehl, wenn das ausgewählte Layout nicht passt

  3. 03

    ISA-Rechenbild

    ARM i8mm erweitert Q1 auf int8 ±1; x86 VNNI sorgt für bitgepackte 4×8-Panels; I2_S verwendet strikte tinyBLAS-Pfade

  4. 04

    Prefill

    GEMM verwendet jedes Gewichtsfeld über acht und dann vier Aktivierungsreihen hinweg wieder

  5. 05

    Decode

    GEMV verarbeitet ein Token und streamt das Gewichtsbild einmal; Prefill-Optimierungen geben nicht vor, die Dekodierung zu beschleunigen

  6. 06

    Öffentliche Laufzeit

    Tokenisieren, Vorfüllen, Dekodieren, Logits, Sampling, Stornierung, Streaming-Rückrufe, HTTP/SSE- und JSONL-Bänke

03 / Surface

Unterstützter Produktumfang

Zertifiziertes BitNet 2B

Microsoft BitNet b1.58 2B in MOSTLY_I2_S mit angehefteten Konvertierungsidentitäts- und Genauigkeitstoren.

Bonsai 27B CPU-Text

Vorquantisierte Q1_0 Qwen35-Familie mit 1-Bit-Vorzeichen, FP16-Blockskalen, DeltaNet plus Aufmerksamkeit und expliziter Familienauswahl.

Laufzeit und Servieren

One-Shot-Generierung, native HTTP-Vervollständigung/Chat-Teilmenge, SSE, API-Schlüssel, Metriken, Stoppsequenzen und kooperativer Abbruch.

Optionales Hyphae-Gateway

Ein separater Rust-Prozess kann Abruf, Speicher, Belege, Registrierung, Beweise, semantischen Cache und MCP hinzufügen, ohne Hyphae mit GGML zu verknüpfen.

04 / Evidence

Gemessene Hardwareeffekte

Vorfüllung und Dekodierung haben unterschiedliche Dachlinien. Die veröffentlichten Belege berichten über beides und bewahren Fälle, in denen ein Layout einer Phase hilft, einer anderen jedoch schadet.

5.6×

Graviton 4-Vorfüllung an einem Gewinde

Q1 expand-to-int8 vs packed mmap

2.3×

Graviton 4 dekodiert in einem Thread

Hohe Fadenzahlen können sich zurückbilden

+8.6%

Xeon-Vorfüllung in einem Thread

8-row vs 4-row GEMM

64 B

absichtliches Versagen des Budgets

vor Modellvergabe abgelehnt

Die Graviton- und Durch die Erweiterung von Q1 kann die High-Thread-Dekodierung reduziert werden, wenn der DRAM ausgelastet ist.

05 / Was es heute leistet

Was es heute leistet

  • Führt zertifiziertes BitNet 2B I2_S und die explizite Bonsai 27B Q1_0 CPU-Textfamilie aus.
  • Bietet CLI-Befehle zum Ausführen/Servieren/Bench/Validieren/Versionieren, ein experimentelles C-ABI und eine OpenAI-förmige HTTP-Teilmenge.
  • Wählt native, portable AVX2- oder skalare CPU-Profile und budgetierte Rechenlayouts aus.
  • Validiert das genaue Kernel-Verhalten durch skalare/generische Oracles, Sanitizer, Pakettests und modellgestützte Release-Gates.
06 / Was geplant ist

Was geplant ist

  • Vergleichen Sie zusätzliche exakte Kernelkacheln und die gemeinsame Aktivierungsquantisierung.
  • Entdecken Sie die exakte Nullkanalkomprimierung und dichtere ternäre Kodierungen ohne ungefähre Bereinigung.
  • Bewerten Sie AMX als reinen Prefill-Pfad, bei dem die persistenten Gewichte gepackt bleiben.
  • Ausgereifte Planung mehrerer Sequenzen und asynchroner Anforderungsbesitz.
  • Verschieben Sie GPU-Pfade von geerbten Experimenten auf generische, explizit getestete I2_S-Kernel, bevor Supportansprüche geltend gemacht werden.
07 / Explizite Grenzen

Was es bewusst ablehnt

  • Kein beliebiger llama.cpp-Modellläufer; Nicht unterstützte Architektur-/Quantisierungskombinationen werden abgelehnt.
  • Keine unterstützte GPU-Inferenz, kontinuierliches Batching, vollständige OpenAI-API, Einbettungen, Tools, Logprobs oder integriertes TLS im aktuellen Produkt.
  • Kein Anspruch auf universelle bitweise Identität über ISAs oder Quell-Checkpoint-Zertifizierung.
  • Die aktuellen öffentlichen Binär- und Release-Artefakte behalten den Produktnamen celiums-bitnet; Das Foundation-Repository löscht weder den Upstream- noch den Modellbesitz.

Hyphae BitNet

Machen Sie unterstützte ternäre Modelle auf normalen CPU-Servern betriebsbereit, ohne ungefähre Kernel, unkontrolliertes RAM-Wachstum oder übernommene Engine-Interna in verstecktes Produktverhalten umzuwandeln.