Ternary Bonsai 2: 27B помещается в 6 ГБ — AI-дайджест

Ternary Bonsai 2 ужала Qwen3.8-27B до 6 ГБ и запускается в браузере при заявленных 98,2% качества. Swift Qwen 3.8 27B набрал 105 493 скачивания за шесть дней на −58,3% токенов, а Cactus Needle 3 разбирает команды на процессоре в 8–29 МБ.
Главное сегодня
Ternary Bonsai 2: модель на 27B помещается в 6 ГБ и запускается в браузере
Ternary Bonsai 2 — тернарная производная Qwen3.8-27B — занимает меньше 6 ГБ, что в 9 раз меньше версии FP16, при заявленных 98,2% сохранённого качества. Тернарная модель — это модель, у которой каждый вес ограничен тремя значениями вместо дробного числа, и именно это даёт кратное сокращение размера без смены архитектуры: исходная гибридная causal-LM на 27 миллиардов параметров сохранена целиком. Коллекция выложена на Hugging Face, там же работает демонстрация прямо в браузере на WebGPU — то есть модель такого класса впервые запускается на обычном ноутбуке без установки чего-либо. В обсуждении 18 сентября 2026 года цифру 98,2% приняли сдержанно: независимой проверки заявленного качества пока нет, а один из пробовавших сообщил, что в браузерной демонстрации модель зацикливалась на вопросах про Rust.
Swift Qwen 3.8 27B: 105 493 скачивания за шесть дней на обещании «меньше думать»
Swift Qwen 3.8 27B набрал 105 493 скачивания за шесть дней и вышел на первое место среди дообучений Hugging Face и девятое в общем тренде. Авторы целятся не в качество ответа, а в его стоимость: дообучение борется с избыточными рассуждениями и заявляет −58,3% израсходованных токенов и ускорение в 1,95 раза без потери точности. Рост был резким — с 24 тысяч скачиваний на второй день до 105 493 на шестой. Показательна реакция сообщества: пользователи почти сразу пересобрали модель под свои среды исполнения, один перевёл её в NInfer V3 и сообщил о полном контексте 262 тысячи токенов с обработкой изображений на RTX 5090, другой сконвертировал квантизацию NVFP4 в формат GGUF ради совместимости с llama.cpp.
Cactus Needle 3: автоматизация на процессоре в 8–29 МБ против 88,4 у DeepSeek V4 Flash
Cactus Needle 3 — семейство моделей функционального вызова с бинарями на 8–29 МБ, работающих только на процессоре, — набирает 86,0 на Mobile Actions против 88,4 у DeepSeek V4 Flash. Функциональный вызов — это режим, в котором модель не пишет ответ словами, а возвращает структурированный вызов инструмента с параметрами; здесь он удерживается грамматикой, которая не даёт выйти за пределы валидного JSON. Семейство нарезается по глубине: от 2 до 20 слоёв и от 25 до 121 миллиона разворачиваемых параметров — «лестница интеллекта», где под задачу берётся минимальный работающий слой. Разрыв с фронтир-моделью в четыре десятых процента при разнице в размере на три порядка — главный аргумент в пользу того, чтобы разбор команд уводить с сервера на устройство. Готовые сценарии для такой обвязки собраны в шаблонах автоматизаций AI SKILLS.
Моллик: нынешние модели уже способны на недели работы, и почти никто этим не пользуется
Итан Моллик в эссе «The Overhang» от 18 сентября 2026 года утверждает, что GPT-6 Astra и Fable 5.1 уже достаточны для преобразующего эффекта в больших секторах экономики, а используются едва. В подтверждение он приводит собственные прогоны: Astra превратила текстовую игру Zork 1977 года в полноценную трёхмерную приключенческую игру, самостоятельно решив, как выглядит белый дом и грю, которого в оригинале только упоминают. Fable 5.1 восстановила библиотеку Умберто Эко по десятку видео, фотографиям фонда и двум каталогам: прочитала корешки покадрово, вывела планировку и расставила около 5 000 опознанных книг среди 27 000 полочных мест, пометив каждую как «точно», «предположительно» или «неизвестно». Трейлер своей книги Моллик получил за 45 минут — модель сама освоила Blender, написала сценарий, собрала трёхмерную сцену и озвучила её.
Цифры и факты
- Laya — воспроизведение закрытой модели решений на 421 млн параметров: заявленные 38,4 мс задержки против примерно 400 мс у оригинала, архитектура — энкодер ModernBERT-large со скорящей головой; веса на Hugging Face.
- Factorio: Space Age — Vals AI заявила прохождение игры моделью GPT-6 Astra: более 165 игровых часов примерно за двое суток реального времени. В обсуждении 18 сентября 2026 года требуют запись прохождения: без неё непонятно, шла ли игра с ускорением (обсуждение).
- Cactus Needle 3, разворачиваемый размер — от 25 до 121 млн параметров при квантизации CQ2 и бинарях 8–29 МБ; модель англоязычная в первую очередь, на других языках токенизация менее эффективна (анонс).
- Наши данные: 20 сентября 2026 года в раздел Open Source на AI SKILLS добавлены четыре новых проекта с суммарными 7,5 тысячами звёзд — генератор субтитров, запуск Alpine Linux на Android без root, сканер открытых хостов и перехватывающий прокси. Цифры из нашей базы, в первоисточниках их нет.
Разные точки зрения: сколько качества переживает сжатие модели
Спор 18 сентября 2026 года идёт вокруг одной цифры — 98,2% сохранённого качества, заявленных для Ternary Bonsai 2 при девятикратном сокращении размера. Проверить её пока не на чем: независимого замера нет ни у кого.
За. Практический интерес очевиден: модель на 27 миллиардов параметров, помещающаяся в 6 ГБ и запускающаяся в браузере, доступна на железе, на котором фронтир недосягаем в принципе — и запускаемая модель полезнее недостижимой.
Нейтрально. Сообщество прямо говорит, что намерено проверять заявку самостоятельно: утверждение авторов о сохранении качества принимается как гипотеза, а не как результат, и до независимых прогонов ссылаться на 98,2% как на факт нельзя.
Против. Одно наблюдение уже есть: в браузерной демонстрации модель зацикливалась на вопросах по Rust. Это может быть дефектом исполнения в WebGPU, а может — следствием сжатия; различить эти два объяснения без замеров невозможно, и именно поэтому цифра остаётся заявкой.
Инструменты и приёмы
- Конвертируйте под свой рантайм, а не меняйте рантайм. Сообщество за считаные дни пересобрало Swift Qwen 3.8 27B под llama.cpp через GGUF и под NInfer V3 с квантизацией KV-кеша NVFP4 — полный контекст 262 тысячи токенов с обработкой изображений на одной RTX 5090. Прежде чем покупать железо под модель, проверьте, не пересобрал ли её кто-то под то, что у вас уже есть.
- Берите минимальную глубину, которая решает задачу. «Лестница интеллекта» Cactus Needle 3 — от 2 до 20 слоёв — позволяет подобрать слой под конкретный разбор команд, а не брать максимум по умолчанию; там же есть локальное дообучение LoRA и экспорт (описание).
- Сначала попробуйте то, что уже стоит. Тезис Моллика проверяется дёшево: возьмите задачу, на которую у команды уходит неделя, и отдайте её текущей модели целиком, не разбивая на шаги (эссе). Подобрать формулировку помогает генератор промптов AI SKILLS.
Коротко
- Губернатор Калифорнии Гэвин Ньюсом подписал указ о созыве экспертной панели по законам об ИИ-безопасности — среди обсуждаемых мер названы «рубильники», встроенные внешние наблюдатели и обязательные планы безопасности (сообщение The Rundown).
- Figure показала Helix 2.5 — очередное поколение своей гуманоидной платформы, которому Superhuman посвятил отдельный выпуск 19 сентября 2026 года.
- Claude Code получает Mods — механизм, меняющий внешний вид и поведение самого инструмента; рядом Artifacts обзаводятся отдельными продуктами для документов и слайдов (разбор Ben's Bites).
- Ternary Bonsai 2 держит исходную архитектуру Qwen3.8-27B без изменений — сокращение в 9 раз достигнуто только весами, а не обрезкой слоёв (карточка коллекции).