Ternary Bonsai 2: 27B помещается в 6 ГБ — AI-дайджест

Ternary Bonsai 2: 27B помещается в 6 ГБ — AI-дайджест

Ternary Bonsai 2 ужала Qwen3.8-27B до 6 ГБ и запускается в браузере при заявленных 98,2% качества. Swift Qwen 3.8 27B набрал 105 493 скачивания за шесть дней на −58,3% токенов, а Cactus Needle 3 разбирает команды на процессоре в 8–29 МБ.

Главное сегодня

Ternary Bonsai 2: модель на 27B помещается в 6 ГБ и запускается в браузере

Ternary Bonsai 2 — тернарная производная Qwen3.8-27B — занимает меньше 6 ГБ, что в 9 раз меньше версии FP16, при заявленных 98,2% сохранённого качества. Тернарная модель — это модель, у которой каждый вес ограничен тремя значениями вместо дробного числа, и именно это даёт кратное сокращение размера без смены архитектуры: исходная гибридная causal-LM на 27 миллиардов параметров сохранена целиком. Коллекция выложена на Hugging Face, там же работает демонстрация прямо в браузере на WebGPU — то есть модель такого класса впервые запускается на обычном ноутбуке без установки чего-либо. В обсуждении 18 сентября 2026 года цифру 98,2% приняли сдержанно: независимой проверки заявленного качества пока нет, а один из пробовавших сообщил, что в браузерной демонстрации модель зацикливалась на вопросах про Rust.

Swift Qwen 3.8 27B: 105 493 скачивания за шесть дней на обещании «меньше думать»

Swift Qwen 3.8 27B набрал 105 493 скачивания за шесть дней и вышел на первое место среди дообучений Hugging Face и девятое в общем тренде. Авторы целятся не в качество ответа, а в его стоимость: дообучение борется с избыточными рассуждениями и заявляет −58,3% израсходованных токенов и ускорение в 1,95 раза без потери точности. Рост был резким — с 24 тысяч скачиваний на второй день до 105 493 на шестой. Показательна реакция сообщества: пользователи почти сразу пересобрали модель под свои среды исполнения, один перевёл её в NInfer V3 и сообщил о полном контексте 262 тысячи токенов с обработкой изображений на RTX 5090, другой сконвертировал квантизацию NVFP4 в формат GGUF ради совместимости с llama.cpp.

Cactus Needle 3: автоматизация на процессоре в 8–29 МБ против 88,4 у DeepSeek V4 Flash

Cactus Needle 3 — семейство моделей функционального вызова с бинарями на 8–29 МБ, работающих только на процессоре, — набирает 86,0 на Mobile Actions против 88,4 у DeepSeek V4 Flash. Функциональный вызов — это режим, в котором модель не пишет ответ словами, а возвращает структурированный вызов инструмента с параметрами; здесь он удерживается грамматикой, которая не даёт выйти за пределы валидного JSON. Семейство нарезается по глубине: от 2 до 20 слоёв и от 25 до 121 миллиона разворачиваемых параметров — «лестница интеллекта», где под задачу берётся минимальный работающий слой. Разрыв с фронтир-моделью в четыре десятых процента при разнице в размере на три порядка — главный аргумент в пользу того, чтобы разбор команд уводить с сервера на устройство. Готовые сценарии для такой обвязки собраны в шаблонах автоматизаций AI SKILLS.

Моллик: нынешние модели уже способны на недели работы, и почти никто этим не пользуется

Итан Моллик в эссе «The Overhang» от 18 сентября 2026 года утверждает, что GPT-6 Astra и Fable 5.1 уже достаточны для преобразующего эффекта в больших секторах экономики, а используются едва. В подтверждение он приводит собственные прогоны: Astra превратила текстовую игру Zork 1977 года в полноценную трёхмерную приключенческую игру, самостоятельно решив, как выглядит белый дом и грю, которого в оригинале только упоминают. Fable 5.1 восстановила библиотеку Умберто Эко по десятку видео, фотографиям фонда и двум каталогам: прочитала корешки покадрово, вывела планировку и расставила около 5 000 опознанных книг среди 27 000 полочных мест, пометив каждую как «точно», «предположительно» или «неизвестно». Трейлер своей книги Моллик получил за 45 минут — модель сама освоила Blender, написала сценарий, собрала трёхмерную сцену и озвучила её.

Цифры и факты

Разные точки зрения: сколько качества переживает сжатие модели

Спор 18 сентября 2026 года идёт вокруг одной цифры — 98,2% сохранённого качества, заявленных для Ternary Bonsai 2 при девятикратном сокращении размера. Проверить её пока не на чем: независимого замера нет ни у кого.

За. Практический интерес очевиден: модель на 27 миллиардов параметров, помещающаяся в 6 ГБ и запускающаяся в браузере, доступна на железе, на котором фронтир недосягаем в принципе — и запускаемая модель полезнее недостижимой.

Нейтрально. Сообщество прямо говорит, что намерено проверять заявку самостоятельно: утверждение авторов о сохранении качества принимается как гипотеза, а не как результат, и до независимых прогонов ссылаться на 98,2% как на факт нельзя.

Против. Одно наблюдение уже есть: в браузерной демонстрации модель зацикливалась на вопросах по Rust. Это может быть дефектом исполнения в WebGPU, а может — следствием сжатия; различить эти два объяснения без замеров невозможно, и именно поэтому цифра остаётся заявкой.

Инструменты и приёмы

Коротко