Gemini 3.7 Flash подешевел вдвое — AI-дайджест

День скорости и разворота цен: Google выкатила Gemini 3.7 Flash вдвое дешевле обычного, OpenAI разогнала GPT-5.6 Sol до 750 токенов в секунду, а DeepSeek за один день открыла веса V4 Pro, выпустила собственный агентный харнес — и объявила резкое подорожание API.
Главное сегодня
Gemini 3.7 Flash: новая рабочая лошадка Google — за полцены. Всего через три недели после 3.6 Flash Google выпустила Gemini 3.7 Flash — модель среднего класса для кодинга, веб-разработки и агентных задач. До конца года действует вводная скидка 50%: $0.75 за миллион входных и $3.75 за миллион выходных токенов, потом $1.50/$7.50. Google приводит заметный рост на бенчмарках: DeepSWE 65.3% против 49.0% у предыдущей версии, AutomationBench 30.4% против 17.0% (DeepMind, Логан Килпатрик). Независимый замер Artificial Analysis подтвердил скачок: 56 баллов Intelligence Index (+4 к 3.6 Flash), около 340 токенов в секунду, контекст 1 млн — модель вышла на границу Парето и по цене, и по скорости. В рейтинге Arena новинка поднялась на #8 в WebDev, а раскатка прошла сразу по всей экосистеме — от AI Studio до VS Code и Cline.
Большой день DeepSeek: открытый V4 Pro, свой харнес — и подорожание. Компания выпустила DeepSeek-V4-Pro из превью с весами под MIT (Hugging Face); в обсуждениях отмечают прыжок DeepSWE с 12.8 до 62.7 у модели на 1.7 трлн параметров. Параллельно открыт DeepSeek Harness — агентная обвязка под MIT, где «всё является плагином», вплоть до горячей замены агентного цикла (репозиторий). Реакция сообщества: это заявка на роль операционной среды для длинных автономных задач, а не ещё один клон кодинг-агента. Третья новость дня менее приятная — новый прайс API с 16 августа: подробности в «Разных точках зрения».
OpenAI и Cerebras разогнали GPT-5.6 Sol до 750 токенов в секунду. Режим Ultrafast анонсирован для избранных API-клиентов: до 750 ток/с — в 14 раз быстрее стандартного режима, на железе Cerebras. Целевые сценарии — голос, поддержка, торговля, кодинг и безопасность, где задержка ответа решает всё. Показательная реакция рынка: обсуждение быстро свелось к тому, что узким местом агентных систем становится уже не модель, а латентность инструментов вокруг неё.
Харнесы стали отдельным слоем индустрии. За сутки — сразу несколько ходов: кроме DeepSeek Harness, Arcee открыла NAC (Apache 2.0) — внутреннюю обвязку для долгих автономных задач, которая, по словам команды, последние три месяца писала значимую часть кода их пайплайнов; Cursor ускорил старт облачных агентов втрое и добавил откат к последней рабочей сборке; Nous превратила профили агентов в постоянных ботов с собственными чатами, расписаниями и перепиской между ботами. Общий вектор один: конкуренция смещается с моделей на среду, в которой агенты живут и работают сутками.
Цифры и факты
- $0.75 / $3.75 за 1 млн токенов — вводная цена Gemini 3.7 Flash до конца года (дальше $1.50/$7.50); Intelligence Index 56 (+4), ~340 ток/с, контекст 1 млн (Google, Artificial Analysis).
- 750 ток/с и 14x к обычной скорости — GPT-5.6 Sol Ultrafast на Cerebras (OpenAI).
- Кэш-хиты DeepSeek дорожают с $0.003625 до $0.022/$0.044 (пик/непик, +507%/+1114%), выход V4 Pro — с $0.87 до $1.98/$3.96; в силе с 16 августа 16:00 UTC (прайс, обсуждение).
- 2.4 трлн параметров, 95 млрд активных, ~5 ТБ весов в bf16 — Qwen 3.8 добрался до Hugging Face, и локальный запуск полной версии называют фантастикой даже владельцы серьёзных домашних станций.
- 1390 баллов и отрыв +32 — MiniMax-H3 возглавила Video Edit Arena среди всех моделей (Arena).
- $40 млн при оценке $400 млн — раунд A компании Vals, строящей независимые бенчмарки (Vals AI).
Разные точки зрения: подорожание DeepSeek
Ещё вчера дешевизна DeepSeek была главным аргументом в спорах о цене токена — с 16 августа картина меняется: вход дорожает в полтора раза, выход более чем вдвое, кэш-хиты — до +1114%, плюс двойной тариф в пиковые часы (прайс).
- Критики говорят, что ценность DeepSeek держалась именно на цене: модель «прожорлива по токенам и небыстра», и при новых тарифах часть пользователей уже мигрирует к конкурентам или на собственное железо.
- Нейтральные наблюдатели замечают, что офф-пик остаётся вдвое дешевле пика, а для части часовых поясов дешёвое окно удачно накрывает рабочий день — вопрос планирования нагрузки, а не отказа.
- Оптимисты напоминают: веса V4 Pro открыты под MIT (Hugging Face), так что потолок цены теперь задают сторонние хостеры и собственные кластеры — обсуждение уже сместилось к тому, кто развернёт модель дешевле официального API.
Инструменты и приёмы
- Optima от Artificial Analysis — платформа кастомных бенчмарков: загружаете свои данные или трейсы агентов и меряете модели на собственных задачах, а не на чужих лидербордах (анонс).
- Muse Glimmer 30B локально и бесплатно: Unsloth выложила ноутбуки файнтюнинга с GRPO — в 1.5 раза быстрее и с половиной VRAM, обучение помещается в 24 ГБ (Unsloth).
- Vibe-кодинг игры на практике: Мэтт Вулф собрал продолжение своей игры связкой Claude Code для каркаса и Codex для доводки — честный разбор того, что уже работает, а что нет (видео).
Коротко
- DeepMind выпустила SL2T — перевод жестового языка в текст в реальном времени, распознавание позы работает на устройстве (блог, обсуждение).
- OpenAI показала Computer History: ChatGPT и Codex могут (с явного согласия) использовать историю приложений и сайтов как контекст (анонс).
- MiniMax открыла веса Music3 — 8B LLM + 2.7B DiT превращают промпт и текст песни в готовый трек на потребительском железе (MiniMax).
- Исследование: библиотеки скиллов могут вредить агентам — 307 сбоев списаны на подгруженные скиллы, из них 125 функциональных (разбор).
- Компакторы контекста удерживают лишь 17% постоянных ограничений сессии без отдельного экстрактора (DAIR.AI).
- Red Hat показала DSpark — спекулятивный декодер для Kimi-K3: примерно вчетверо быстрее, со 110 до ~435 ток/с на математических задачах (Red Hat AI).
- Anthropic, OpenAI, Google, Meta, Microsoft и Mistral подписали кодекс ЕС о прозрачности ИИ-контента — сообщество уже спорит, переживут ли водяные знаки простые атаки (обсуждение).
- Пользователи жалуются на многословность Claude Opus 5: простые правки превращаются в «проекты» с планами и списками задач (тред).