AI-дайджест 7 августа: открытые веса готовят рывок, а кодинг-агентам нужна иерархия
Qwen раскрыла контуры 3.8 на 2.4T параметров, llama.cpp учится держать «горячих» MoE-экспертов в видеопамяти и разгоняет 8 ГБ с 33 до 56 tok/s, а замер показал: ревью между кодинг-агентами работает только сверху вниз.
Главное сегодня
Открытые веса готовят следующий рывок: Qwen 3.8. На публичной сессии вопросов команда Qwen подтвердила работу над Qwen 3.8 и обещала «заметный скачок»: MoE-конфигурация на 2.4T параметров общих и 95B активных, архитектура близкая к 3.5, тяжёлое RL-дообучение и иерархическая память для видео длиннее 100 часов. Отдельно инженер команды сказал, что линейка размеров ещё не финализирована — «всё ещё прорабатываем больше размеров и архитектур». Сообщество восприняло ответы прохладно: конкретики по срокам и бенчмаркам не дали, а вопросы про модель на 122B, судя по треду, обошли стороной.
Инференс-экономика: MoE-эксперты переезжают в видеопамять. В llama.cpp предложен PR с кешированием «горячих» экспертов на GPU: рантайм ведёт «тепловую карту» того, какие эксперты выбираются чаще, и держит их в VRAM, оставляя холодные на процессоре. На Qwen3.6-35B-A3B с 8 ГБ видеопамяти замеры автора показали рост с 33.25 до 56.0 tok/s на Q2_M и с 17.34 до 35.93 tok/s на Q5_K_P. Важные оговорки: только CUDA, только стадия декодирования, а на Qwen3.5-122B-A10B выигрыш обернулся регрессом — всё упирается в то, насколько повторно используются одни и те же эксперты. Сам PR трогает 23 файла и добавляет 1347 строк, и в обсуждении сомневаются, что его примут без разбиения на части.
Локальный запуск дотянулся до телефона. В мейнлайн llama.cpp приняли клонирование голоса Qwen3-TTS — короткая референсная запись плюс текст, поддержка идёт для Qwen3-TTS-12Hz-1.7B-Base в GGUF. Параллельно обсуждают LFM2.5-2.6B: 2.69B параметров, контекст 128K, вызов инструментов и заявленные ~30 tok/s на телефоне, 113 tok/s на Ryzen AI Max+ 395 и 220 tok/s на Apple M5 Max при ~2.4 ГБ памяти. Практики в треде осторожны: синтаксис вызова инструментов стабильный, но на реальной задаче поиска по файлам модель ошибалась даже в Q8 и f16. Подборка проверенных открытых инструментов для таких сценариев — в каталоге open-source решений AI SKILLS.
Кодинг-агентам нужна иерархия, а не симметрия. Контролируемый замер, разобранный в LeadDev, прогнал Claude Opus 4.7 и Codex GPT-5.5 по 116 средним и сложным задачам LiveCodeBench на Python. Ревью оказалось несимметричным: Codex в одиночку дал 71.6%, а с ревью от Claude — 89.7%; Claude в одиночку дал 91.4%, но после ревью от Codex упал до 82.8%. Механика видна в правках: Claude починил 26 провалов Codex и сломал 5 рабочих решений, Codex починил 3 и сломал 13. Цена подхода — рост стоимости задачи с $0.19 до $0.44 и задержки с 38.5 до 112.4 секунды.
Цифры и факты
- Qwen 3.8 в MoE-конфигурации: 2.4T параметров всего, 95B активных (источник).
- Кеш «горячих» экспертов на 8 ГБ VRAM: 33.25 → 56.0 tok/s (Q2_M), 17.34 → 35.93 tok/s (Q5_K_P) (источник).
- LFM2.5-2.6B: 2.69B параметров, 128K контекста, ~2.4 ГБ памяти, ~30 tok/s на телефоне (источник).
- Перекрёстное ревью кодинг-агентов: 71.6% → 89.7% и 91.4% → 82.8%; $0.19 → $0.44 за задачу (источник).
- Самостоятельное ревью Codex по тому же замеру — 84.5% (обсуждение).
Разные точки зрения
Спор дня — как читать перестановки в руководстве Google DeepMind. Скорее катастрофа: отраслевые рассылки подают уход ключевых фигур как отток мозгов — The Rundown пишет о встряске в мозговом центре компании, а Superhuman прямо называет это исходом. Скорее оздоровление: выпуск The AI Daily Brief ставит вопрос ребром — катастрофа это или именно та организационная перезагрузка, которая нужна Gemini. Нейтрально: Ben's Bites ставит те же кадровые новости в один ряд с продуктовой повесткой недели, не делая из них приговора. Пока это спор об интерпретации: проверяемых последствий для моделей и релизов ни одна сторона не предъявила.
Второй сюжет с двумя лагерями — слух о первой модели SSI. В треде ссылаются на интервью инвестора Гэвина Бейкера, где говорится о релизе в августе; исходный пост — пересказ подкаста, а не анонс компании. Скептики в обсуждении отвечают, что без нового метода обучения или архитектуры это будет «ещё один трансформер», и предлагают дождаться бенчмарков.
Инструменты и приёмы
- Ревью между моделями — только в одну сторону. Из замера LeadDev следует практичное правило: подключайте более сильную модель как ревьюера слабой, а не наоборот — обратное направление в эксперименте ухудшило результат сильной модели. И закладывайте, что ревью удваивает цену и утраивает время.
- Песочница и гейт на разрушающие команды. История пользователя, у которого агент выполнил rm -rf и снёс домашний каталог вместе с ключами .ssh, закончилась одним и тем же советом в комментариях: запускать агента в контейнере с примонтированной только рабочей папкой и вешать хук, который требует явного подтверждения перед удалением. Готовые сценарии обвязки агентов — в шаблонах автоматизаций AI SKILLS.
- Квантование по частям, а не целиком. Команда Qwen советует либо QAT, либо смешанный режим: проекции внимания QKV и выход держать в 16 битах, а FFN квантовать в 4 бита — компромисс для тех, кто упирается в память (источник).
Коротко
- Формулировка запроса всё ещё меняет ответ: Claude Code отказался собирать пиратский стек, но собрал его после скриншота с той же архитектурой — политика срабатывает непоследовательно.
- Заявление о модели Mach-1 Additive — «95% от Qwen 3.6 35B при 1.7 бита на вес» — встретили требованием предъявить методику и таблицу бенчмарков; пока ни того, ни другого нет.
- Сообщество уже выложило расцензурированную сборку LFM2.5-2.6B в GGUF — типичный сценарий для свежих открытых весов.
- Разработчик audio.cpp опубликовал замеры Qwen3-TTS на RTX 5090: 7.67x реального времени, а укорачивание референсной записи до 2 секунд дало больше прироста, чем flash attention.