DeepSeek V4 Flash Vision и Ox Alpha — AI-дайджест

DeepSeek выпустила V4-Flash-Vision-Exp с 83,9 на Terminal Bench 2.1 и картинками по цене Flash. Стелс-модель Ox Alpha дала более 80% на задачах DeepSWE, а OpenAI срезала цену GPT-5.6 Sol более чем на 20% на три месяца.
Главное сегодня
DeepSeek выпустила V4-Flash-Vision-Exp: 83,9 на Terminal Bench 2.1 и мультимодальность по цене Flash
DeepSeek 21 августа 2026 года выпустила DeepSeek-V4-Flash-Vision-Exp — версию своей быстрой модели с поддержкой изображений, которая, по заявлению компании, сохраняет текстовые способности V4-Flash и приближается к Opus-4.8 на мультимодальных агентских задачах (анонс DeepSeek). Опубликованная таблица показывает 83,9 на Terminal Bench 2.1, 75,9 на Toolathlon-Verified и 64,3 на Chartography (разбор таблицы). Смешанный ввод текста и картинок работает через API: изображение стоит от 117 до 384 токенов и тарифицируется по цене Flash (детали API). Заодно DeepSeek открыла Files API — картинку можно загрузить один раз и дальше ссылаться на неё по идентификатору, не пересылая файл в каждом запросе (анонс Files API).
Стелс-модель Ox Alpha: более 80% на задачах DeepSWE против 65% у Fable
Модель без имени и без владельца, известная как Ox Alpha, показала более 80% на десяти задачах DeepSWE — против 65% у Fable и 52% у GPT-5.6 Sol (замер). Стелс-модель — это модель, которую лаборатория выкатывает в общий доступ анонимно, чтобы собрать честные отзывы до официального анонса. Разработчики описывали её как «разносящую» внутренние тесты, а один из них слил на её одобрении восемь пул-реквестов подряд (первая реакция, итог дня). Догадки быстро сошлись на семействе GLM от Zhipu: Тим Деттмерс указал на быструю выдачу и слабый частичный префилл как на признак меньшего числа активных параметров (разбор), а другие наблюдатели сузили версию до GLM-5.3/5.4 Vision (наблюдение). Раздача через сторонние клиенты пошла в тот же день (Hermes Agent и OpenRouter, Cline).
OpenAI снизила цену GPT-5.6 Sol более чем на 20% на три месяца
OpenAI 21 августа 2026 года срезала цену GPT-5.6 Sol более чем на 20% в API и кредитных продуктах — скидка действует три месяца (анонс OpenAI, детали для разработчиков). Скидки складываются: на Devin Sol после наложения акций выходит на 76% дешевле прайса до 3 октября 2026 года (расчёт Cognition), а редактор Code держит свои 50% до 3 сентября (акция Code). Параллельно OpenAI сообщила, что Codex дошёл до 20 млн активных пользователей, и обнулила счётчики лимитов всем пользователям Codex и ChatGPT Work (заявление OpenAI). Для команд добавили жёсткие потолки трат: расход теперь виден по каждому API-ключу, а месячный лимит ставится на организацию и проект (анонс).
NVIDIA AVO прошла все 183 уровня ARC-AGI-3 — но только на публичном наборе
Агент NVIDIA AVO закрыл 100% ARC-AGI-3: все 183 уровня в 25 средах, без инструкций, правил и заданных целей (заявление NVIDIA). Франсуа Шолле сразу уточнил, что речь о публичном демонстрационно-обучающем наборе, а не о полном бенчмарке (оговорка Шолле). Разбор в сообществе добавил ту же мысль: результат получен на открытых средах, приватный набор не проверялся, поэтому обобщение пока не доказано (обсуждение). ARC-AGI-3 — набор интерактивных сред, где агент должен сам догадаться о цели и правилах, поэтому именно на нём разрыв между «выучил» и «понял» виден лучше всего.
Nvidia заплатит Poolside около $6 млрд за лицензию на её фабрику моделей
Nvidia, по сообщению The Information, заплатит стартапу Poolside около $6 млрд за неисключительную лицензию на его систему разработки моделей и вложит ещё около $1 млрд при оценке $12 млрд до вложения (разбор сделки). Предмет сделки — «фабрика моделей» Poolside, на которой построена её кодовая модель Laguna; офферы получили 109 сотрудников, работавших над Laguna. Сообщество разошлось в оценке: одни ждут ускорения открытых моделей Nvidia, другие называют это скрытой покупкой команды, после которой самостоятельная линия Laguna остановится. Отдельный аргумент в пользу открытых весов в тот же день привёл Дэвид Сакс: юридический сервис Harvey получил лучший результат в своей области на открытой Kimi K3 и дешевле (реплика).
Цифры и факты
- Среда важнее промпта: EnvHarness и EnvRigger от Google подстраивают статичные среды через слой плагинов и диагностику политики — плюс до 9 пунктов на отложенных задачах при 9,8% меньше шагов выполнения (разбор работы).
- Бенчмарки ужесточились: SWE-bench Science — 119 научных задач, где Claude Code с Opus-5 не дотягивает до 50% pass@1 (анонс); CADBench даёт лучшим моделям 24,6% на реальных задачах Fusion 360 (анонс); AI4AI-Bench проверяет рекурсивное самоулучшение на 10 репозиториях, лучший результат — 0,288 (анонс); FACET собрал 6078 проверенных терминальных задач из навыков агентов (анонс).
- vLLM IsoExec убирает расхождение логвероятностей между роллаутом и обучением из-за неассоциативности плавающей точки: на Qwen3.5-35B-A3B с DAPO на 8×H100 расхождение упало с 1,6e-2 до 6,7e-7 ценой 25,3% накладных расходов (анонс).
- Recirculation от DeepMind возвращает активации глубоких слоёв в ранние прямо на инференсе, без дообучения: −60% ошибок контекстуализации, −23% перплексии, +21% на GSM8K (разбор).
- FreeToken из Беркли: GLM-5.2 на 753 млрд параметров выдаёт 14,9 токена в секунду на одной RTX PRO 6000, а Qwen3.6-35B — 39,3 токена в секунду на ноутбучной RTX 4060 с 8 ГБ, что заявлено как в 2–4 раза быстрее Ollama на потребительских картах (замер).
- Marin 535B-A23B начал обучение: 18,75 трлн токенов на 11 стойках GB200 NVL72 примерно за три месяца, прогон открыт публично (анонс).
- Наш каталог на 23 августа 2026 года: 10 128 активных скиллов для Claude Code, 595 open-source инструментов, 3276 шаблонов автоматизаций и 338 моделей генерации — цифры платформы AI SKILLS, а не внешних источников.
Разные точки зрения: доказывает ли 100% на ARC-AGI-3 общее рассуждение?
Спор идёт вокруг одного результата: агент NVIDIA AVO прошёл все 183 уровня в 25 средах ARC-AGI-3 без инструкций и заданных целей (заявление NVIDIA). Вопрос в том, что именно измерено — способность разбираться в незнакомой среде или подгонка под конкретный бенчмарк.
За. Среды ARC-AGI-3 интерактивные, и агент должен сам вывести правила и цель: пройти их подряд, ничего не зная заранее, — качественно иной результат, чем решить набор статичных задач. Именно на такие длинные автономные сценарии сейчас смещается вся исследовательская повестка — от подстройки сред у Google до бенчмарков вроде FACET (разбор EnvHarness).
Нейтрально. Франсуа Шолле, автор ARC, не оспаривает результат, а уточняет его границы: пройден публичный демонстрационно-обучающий набор, а не полный бенчмарк (оговорка Шолле). Это не опровержение, а напоминание, что у ARC-AGI приватная часть и существует ровно ради таких заявлений.
Против. Скептики в обсуждении указывают, что без проверки на закрытом наборе результат неотличим от оптимизации под бенчмарк, и предлагают простую проверку — запустить того же агента в посторонних интерактивных играх, к которым он не готовился (обсуждение). Тот же скепсис в этот день звучал и про открытые модели: пользователи находили у Qwen3.8-27B заметную просадку фактических знаний относительно версии 3.6 при выключенном веб-поиске (разбор).
Инструменты и приёмы
- Маршрутизация как поиск, а не как бесплатная оценка. Pandora's Router от Google DeepMind считает, что узнать пригодность модели само по себе стоит денег, и решает задачу как поиск с платной проверкой: заявлено качество исчерпывающего перебора при заметно более редких обращениях к дорогим оценщикам (разбор).
- Потолки трат на агентские нагрузки. У OpenAI появился расход по каждому API-ключу и жёсткий месячный лимит на организацию и проект — прямой ответ на непредсказуемость параллельных агентов (анонс).
- Агенты переезжают в рабочие чаты. GitHub раскатал совместные агентские сценарии в Slack и Teams: агент забирает задачу, открывает пул-реквест и подключает дизайн прямо в общем канале (Slack, Teams, пример работы). Готовые сценарии под свои задачи удобно брать в библиотеке шаблонов автоматизаций AI SKILLS.
- Локальный запуск подешевел. Ollama добавила Kimi K3 в подписки Pro и Max (анонс); что из открытых моделей вообще имеет смысл запускать у себя — разобрано в обзоре открытых LLM, а сами инструменты собраны в каталоге open-source AI SKILLS.
Коротко
- Мини-модель в стиле Kimi K3 на 1,02 млрд параметров со 145 млн активных обучена с нуля за $252,35 на одной H200 и обошла GPT-2 124M: 33,4% против 28% на HellaSwag (разбор прогона).
- Jim Fan показал T-Rex — стек тактильно-реактивной манипуляции с асинхронными зрительными и тактильными экспертами и, по заявлению авторов, крупнейшим открытым тактильным датасетом: 50 часов, около 5500 эпизодов, 22 степени свободы (анонс).
- Unitree вышла на биржу — выпуск о робототехнике разбирает размещение (Superhuman AI).
- HONOR показала Robot Phone: камера на 200 Мп на моторизованном титановом подвесе, поворот до 360° в секунду, цена от $1400 (Мэтт Вулф).
- Разбор GLM-5.3 объясняет прирост не размером, а обучением после базы: та же база на 743 млрд параметров, что у GLM-5.2, плюс масштабированные сэндбоксы и метод SAO для точного распределения заслуги в длинных агентских задачах (разбор).
- OpenHands переключил бесплатную модель по умолчанию на Kimi K3 (сообщение).
- Разреженное внимание для видеомодели H3 Minimax даёт на RTX 5090 сокращение прогона с 4 мин 13 с до 2 мин 56 с — около 1,4× вместо заявленных 2,5×, с заметными артефактами на анимации (замер и отзывы).
- OpenAI приостановила обучение новых моделей на две недели на время проверки мер безопасности (Hard Fork, NYT).