Проект називається BitNet (або bitnet.cpp) — офіційний фреймворк від Microsoft для запуску 1.58-бітних LLM. Чому 1.58, а не 1? Бо три можливі значення (-1, 0, 1) — це log₂(3) ≈ 1.58 біта інформації. Невелике математичне уточнення, яке пояснює чому модель зберігає більше, ніж здається з назви.
На ARM процесорах BitNet дає прискорення від 1.37x до 5.07x порівняно зі звичайними моделями. На x86 — від 2.37x до 6.17x. Споживання енергії падає на 55-82%. Тобто той самий ноутбук, той самий чіп — але модель працює вдвічі-вшестеро швидше і жере значно менше батареї.
Найвражаючий показник: модель на 100 мільярдів параметрів запускається на одному CPU зі швидкістю 5-7 токенів на секунду — а це приблизно темп людського читання. Раніше для таких розмірів потрібні були кластери з GPU вартістю десятки тисяч доларів. Тепер — звичайний сервер.
Microsoft вже випустила офіційну модель BitNet-b1.58-2B-4T на Hugging Face — 2.4 млрд параметрів, навчена на 4 трильйонах токенів. З травня 2025 є підтримка GPU. Код відкритий під MIT-ліцензією, понад 35 тисяч зірок на GitHub — один з найшвидших зростань репозиторію в категорії AI-інфраструктури.
Якщо ця архітектура масштабується і зберігає якість при більших розмірах — а перші дані виглядають обнадійливо — це перекреслює поточну логіку AI-індустрії, де все зав'язане на дорогих GPU. Приватні локальні моделі, AI на мобільних пристроях, edge-inference — з BitNet все це стає значно реалістичнішим, ніж рік тому.