फाउंडेशन निर्माणाधीन अंतरिम संरक्षक: Celiums Solutions LLC स्थिति नोट पढ़ें

सॉफ्टवेयर सिस्टम 03/अनुमान

सीपीयू पर टर्नरी नेटवर्क, सटीक गणित और मेमोरी के साथ जानबूझकर उपयोग किया जाता है।

हाइफ़े बिटनेट वर्तमान सेलियम-बिटनेट रनटाइम के लिए आधार भंडार है: एक-शॉट पीढ़ी, मूल HTTP सेवा, एक प्रयोगात्मक सी एबीआई, और प्रीफ़िल/डीकोड बेंचमार्क।

अनुमानित कर्नेल, अनियंत्रित रैम वृद्धि, या विरासत में मिले इंजन आंतरिक को छिपे हुए उत्पाद व्यवहार में बदले बिना सामान्य सीपीयू सर्वर पर समर्थित टर्नरी मॉडल को चालू करें।

01 / Benefits

रनटाइम क्यों मौजूद है

मेमोरी बैंडविड्थ लक्ष्य है

पैक्ड टर्नरी वेट प्रति टोकन स्ट्रीम किए गए बाइट्स को कम करते हैं; कंप्यूट लेआउट रैम तभी खर्च करते हैं जब हार्डवेयर पथ लाभान्वित होता है।

सटीक संचय

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

विफल-बंद रैम बजट

मॉडल लोड या सत्र निर्माण होस्ट को अनुपयोगी बनाने के बजाय कॉन्फ़िगर किए गए वर्किंग-सेट कैप से अधिक होने से इंकार कर देता है।

मॉडल-परिवार के अनुसार नियंत्रित लोडिंग

समर्थित आर्किटेक्चर और फ़ाइल-प्रकार संयोजन स्पष्ट हैं; साधारण लामा/क्यूवेन क्यू4 मॉडल और टकराने वाले क्यू2 प्रारूपों को अस्वीकार कर दिया गया है।

उत्पाद-स्वामित्व वाले इंटरफ़ेस

एप्लिकेशन जीजीएमएल इंटर्नल से बाइंडिंग के बजाय सेलियम-बिटनेट सीएलआई, सी एबीआई, या मूल HTTP सबसेट का उपयोग करते हैं।

मार्केटिंग से पहले सत्यापन रिकॉर्ड

बेंचमार्क में मॉडल डाइजेस्ट, रैम कैप, सीपीयू/आईएसए, प्रीफिल/डीकोड स्प्लिट, कच्चा JSON और स्पष्ट गैर-दावा शामिल हैं।

02 / Architecture

रनटाइम में इन्फ़रेंस का प्रवाह

पैक्ड जीजीयूएफ टिकाऊ स्टोर बना हुआ है। एक वैकल्पिक, बजटयुक्त इन-मेमोरी कंप्यूट लेआउट सीपीयू आईएसए से मेल खाता है; पहले से भरें और डीकोड करें फिर अलग-अलग कर्नेल का उपयोग करें।

  1. 01

    मान्य जीजीयूएफ

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    बजट द्वार

    ram_budget होस्ट हेडरूम को सुरक्षित रखता है और यदि चयनित लेआउट फिट नहीं हो पाता है तो आवंटन से पहले विफल हो जाता है

  3. 03

    आईएसए गणना छवि

    ARM i8mm Q1 को int8 ±1 तक विस्तारित करता है; x86 वीएनएनआई बिट-पैक्ड 4×8 पैनल रखता है; I2_S सख्त tinyBLAS पथों का उपयोग करता है

  4. 04

    प्रीफ़िल

    GEMM प्रत्येक भार पैनल को आठ और फिर चार सक्रियण पंक्तियों में पुन: उपयोग करता है

  5. 05

    डीकोड

    GEMV एक टोकन को संभालता है और वजन छवि को एक बार स्ट्रीम करता है; प्रीफ़िल अनुकूलन डिकोड में तेजी लाने का दिखावा नहीं करता है

  6. 06

    सार्वजनिक रनटाइम

    टोकनाइज़, प्रीफ़िल, डीकोड, लॉगिट्स, सैंपलिंग, कैंसिलेशन, स्ट्रीमिंग कॉलबैक, HTTP/SSE, और JSONL बेंच

03 / Surface

समर्थित उत्पाद सीमा

प्रमाणित बिटनेट 2बी

Microsoft BitNet b1.58 2B MOSTLY_I2_S में पिन किए गए रूपांतरण पहचान और सटीकता गेट के साथ।

बोनसाई 27बी सीपीयू टेक्स्ट

1-बिट संकेतों, एफपी16 ब्लॉक स्केल, डेल्टानेट प्लस ध्यान और स्पष्ट पारिवारिक चयन के साथ पूर्व-मात्राबद्ध Q1_0 Qwen35 परिवार।

रनटाइम और सर्विंग

एक-शॉट पीढ़ी, मूल HTTP पूर्णता/चैट सबसेट, एसएसई, एपीआई कुंजी, मेट्रिक्स, स्टॉप अनुक्रम और सहकारी रद्दीकरण।

वैकल्पिक हाइफ़े गेटवे

एक अलग रस्ट प्रक्रिया हाइफ़े को जीजीएमएल में लिंक किए बिना पुनर्प्राप्ति, मेमोरी, रसीदें, रजिस्ट्री, सबूत, सिमेंटिक कैश और एमसीपी जोड़ सकती है।

04 / Evidence

मापे गए हार्डवेयर प्रभाव

प्रीफिल और डीकोड की रूफलाइन अलग-अलग होती है। प्रकाशित रसीदें दोनों की रिपोर्ट करती हैं और उन मामलों को संरक्षित करती हैं जहां एक लेआउट एक चरण में मदद करता है लेकिन दूसरे को नुकसान पहुंचाता है।

5.6×

एक धागे पर ग्रेविटॉन 4 प्रीफ़िल

Q1 expand-to-int8 vs packed mmap

2.3×

ग्रेविटॉन 4 एक थ्रेड पर डिकोड करता है

उच्च थ्रेड गिनती पुनः प्राप्त हो सकती है

+8.6%

ज़ीऑन एक धागे पर प्रीफ़िल करें

8-row vs 4-row GEMM

64 B

जानबूझकर असफल बजट

मॉडल आवंटन से पहले मना कर दिया

ग्रेविटॉन और ज़ीऑन के आंकड़े केवल नामित मॉडल, डाइजेस्ट, मशीन, थ्रेड काउंट, प्रॉम्प्ट/जेनरेशन लंबाई और 64 GiB कैप पर लागू होते हैं। DRAM संतृप्त होने पर Q1 का विस्तार करने से हाई-थ्रेड डिकोड कम हो सकता है।

05 / अभी क्या करता है

अभी क्या करता है

  • प्रमाणित BitNet 2B I2_S और स्पष्ट बोनसाई 27B Q1_0 CPU टेक्स्ट परिवार चलाता है।
  • सीएलआई रन/सर्व/बेंच/मान्य/संस्करण कमांड, एक प्रयोगात्मक सी एबीआई और एक ओपनएआई-आकार का HTTP सबसेट प्रदान करता है।
  • देशी, पोर्टेबल AVX2, या स्केलर सीपीयू प्रोफाइल और बजट गणना लेआउट का चयन करता है।
  • स्केलर/जेनेरिक ओरेकल, सैनिटाइज़र, पैकेज परीक्षण और मॉडल-समर्थित रिलीज़ गेट्स के माध्यम से सटीक कर्नेल व्यवहार को मान्य करता है।
06 / आगे क्या करना चाहता है

आगे क्या करना चाहता है

  • अतिरिक्त सटीक कर्नेल टाइल्स और साझा सक्रियण परिमाणीकरण की तुलना करें।
  • अनुमानित काट-छाँट के बिना सटीक शून्य-चैनल संघनन और सघन टर्नरी एनकोडिंग का अन्वेषण करें।
  • लगातार वजन को पैक रखते हुए एएमएक्स का मूल्यांकन प्रीफिल-ओनली पथ के रूप में करें।
  • परिपक्व बहु-अनुक्रम शेड्यूलिंग और अतुल्यकालिक अनुरोध स्वामित्व।
  • समर्थन दावों से पहले GPU पथों को विरासत में मिले प्रयोगों से सामान्य, स्पष्ट रूप से परीक्षण किए गए I2_S कर्नेल में ले जाएं।
07 / स्पष्ट सीमाएँ

जिसे यह जानबूझकर मना करता है

  • कोई मनमाना llama.cpp मॉडल धावक नहीं; असमर्थित वास्तुकला/परिमाणीकरण संयोजन अस्वीकार कर दिए जाते हैं।
  • वर्तमान उत्पाद में कोई समर्थित जीपीयू अनुमान, निरंतर बैचिंग, पूर्ण ओपनएआई एपीआई, एम्बेडिंग, टूल, लॉगप्रोब या अंतर्निहित टीएलएस नहीं है।
  • आईएसए या स्रोत-चेकपॉइंट प्रमाणीकरण में सार्वभौमिक बिटवाइज़ पहचान का कोई दावा नहीं।
  • वर्तमान सार्वजनिक बाइनरी और रिलीज़ कलाकृतियाँ सीलियम्स-बिटनेट उत्पाद नाम को बरकरार रखती हैं; फ़ाउंडेशन रिपॉजिटरी अपस्ट्रीम या मॉडल स्वामित्व को नहीं मिटाती है।

Hyphae BitNet

अनुमानित कर्नेल, अनियंत्रित रैम वृद्धि, या विरासत में मिले इंजन आंतरिक को छिपे हुए उत्पाद व्यवहार में बदले बिना सामान्य सीपीयू सर्वर पर समर्थित टर्नरी मॉडल को चालू करें।