AI-дайджест 7 августа: открытые веса готовят рывок, а кодинг-агентам нужна иерархия

Qwen раскрыла контуры 3.8 на 2.4T параметров, llama.cpp учится держать «горячих» MoE-экспертов в видеопамяти и разгоняет 8 ГБ с 33 до 56 tok/s, а замер показал: ревью между кодинг-агентами работает только сверху вниз.

Главное сегодня

Открытые веса готовят следующий рывок: Qwen 3.8. На публичной сессии вопросов команда Qwen подтвердила работу над Qwen 3.8 и обещала «заметный скачок»: MoE-конфигурация на 2.4T параметров общих и 95B активных, архитектура близкая к 3.5, тяжёлое RL-дообучение и иерархическая память для видео длиннее 100 часов. Отдельно инженер команды сказал, что линейка размеров ещё не финализирована — «всё ещё прорабатываем больше размеров и архитектур». Сообщество восприняло ответы прохладно: конкретики по срокам и бенчмаркам не дали, а вопросы про модель на 122B, судя по треду, обошли стороной.

Инференс-экономика: MoE-эксперты переезжают в видеопамять. В llama.cpp предложен PR с кешированием «горячих» экспертов на GPU: рантайм ведёт «тепловую карту» того, какие эксперты выбираются чаще, и держит их в VRAM, оставляя холодные на процессоре. На Qwen3.6-35B-A3B с 8 ГБ видеопамяти замеры автора показали рост с 33.25 до 56.0 tok/s на Q2_M и с 17.34 до 35.93 tok/s на Q5_K_P. Важные оговорки: только CUDA, только стадия декодирования, а на Qwen3.5-122B-A10B выигрыш обернулся регрессом — всё упирается в то, насколько повторно используются одни и те же эксперты. Сам PR трогает 23 файла и добавляет 1347 строк, и в обсуждении сомневаются, что его примут без разбиения на части.

Локальный запуск дотянулся до телефона. В мейнлайн llama.cpp приняли клонирование голоса Qwen3-TTS — короткая референсная запись плюс текст, поддержка идёт для Qwen3-TTS-12Hz-1.7B-Base в GGUF. Параллельно обсуждают LFM2.5-2.6B: 2.69B параметров, контекст 128K, вызов инструментов и заявленные ~30 tok/s на телефоне, 113 tok/s на Ryzen AI Max+ 395 и 220 tok/s на Apple M5 Max при ~2.4 ГБ памяти. Практики в треде осторожны: синтаксис вызова инструментов стабильный, но на реальной задаче поиска по файлам модель ошибалась даже в Q8 и f16. Подборка проверенных открытых инструментов для таких сценариев — в каталоге open-source решений AI SKILLS.

Кодинг-агентам нужна иерархия, а не симметрия. Контролируемый замер, разобранный в LeadDev, прогнал Claude Opus 4.7 и Codex GPT-5.5 по 116 средним и сложным задачам LiveCodeBench на Python. Ревью оказалось несимметричным: Codex в одиночку дал 71.6%, а с ревью от Claude — 89.7%; Claude в одиночку дал 91.4%, но после ревью от Codex упал до 82.8%. Механика видна в правках: Claude починил 26 провалов Codex и сломал 5 рабочих решений, Codex починил 3 и сломал 13. Цена подхода — рост стоимости задачи с $0.19 до $0.44 и задержки с 38.5 до 112.4 секунды.

Цифры и факты

Разные точки зрения

Спор дня — как читать перестановки в руководстве Google DeepMind. Скорее катастрофа: отраслевые рассылки подают уход ключевых фигур как отток мозгов — The Rundown пишет о встряске в мозговом центре компании, а Superhuman прямо называет это исходом. Скорее оздоровление: выпуск The AI Daily Brief ставит вопрос ребром — катастрофа это или именно та организационная перезагрузка, которая нужна Gemini. Нейтрально: Ben's Bites ставит те же кадровые новости в один ряд с продуктовой повесткой недели, не делая из них приговора. Пока это спор об интерпретации: проверяемых последствий для моделей и релизов ни одна сторона не предъявила.

Второй сюжет с двумя лагерями — слух о первой модели SSI. В треде ссылаются на интервью инвестора Гэвина Бейкера, где говорится о релизе в августе; исходный пост — пересказ подкаста, а не анонс компании. Скептики в обсуждении отвечают, что без нового метода обучения или архитектуры это будет «ещё один трансформер», и предлагают дождаться бенчмарков.

Инструменты и приёмы

Коротко