DeepSeek V4 Flash Vision и Ox Alpha — AI-дайджест

DeepSeek V4 Flash Vision и Ox Alpha — AI-дайджест

DeepSeek выпустила V4-Flash-Vision-Exp с 83,9 на Terminal Bench 2.1 и картинками по цене Flash. Стелс-модель Ox Alpha дала более 80% на задачах DeepSWE, а OpenAI срезала цену GPT-5.6 Sol более чем на 20% на три месяца.

Главное сегодня

DeepSeek выпустила V4-Flash-Vision-Exp: 83,9 на Terminal Bench 2.1 и мультимодальность по цене Flash

DeepSeek 21 августа 2026 года выпустила DeepSeek-V4-Flash-Vision-Exp — версию своей быстрой модели с поддержкой изображений, которая, по заявлению компании, сохраняет текстовые способности V4-Flash и приближается к Opus-4.8 на мультимодальных агентских задачах (анонс DeepSeek). Опубликованная таблица показывает 83,9 на Terminal Bench 2.1, 75,9 на Toolathlon-Verified и 64,3 на Chartography (разбор таблицы). Смешанный ввод текста и картинок работает через API: изображение стоит от 117 до 384 токенов и тарифицируется по цене Flash (детали API). Заодно DeepSeek открыла Files API — картинку можно загрузить один раз и дальше ссылаться на неё по идентификатору, не пересылая файл в каждом запросе (анонс Files API).

Стелс-модель Ox Alpha: более 80% на задачах DeepSWE против 65% у Fable

Модель без имени и без владельца, известная как Ox Alpha, показала более 80% на десяти задачах DeepSWE — против 65% у Fable и 52% у GPT-5.6 Sol (замер). Стелс-модель — это модель, которую лаборатория выкатывает в общий доступ анонимно, чтобы собрать честные отзывы до официального анонса. Разработчики описывали её как «разносящую» внутренние тесты, а один из них слил на её одобрении восемь пул-реквестов подряд (первая реакция, итог дня). Догадки быстро сошлись на семействе GLM от Zhipu: Тим Деттмерс указал на быструю выдачу и слабый частичный префилл как на признак меньшего числа активных параметров (разбор), а другие наблюдатели сузили версию до GLM-5.3/5.4 Vision (наблюдение). Раздача через сторонние клиенты пошла в тот же день (Hermes Agent и OpenRouter, Cline).

OpenAI снизила цену GPT-5.6 Sol более чем на 20% на три месяца

OpenAI 21 августа 2026 года срезала цену GPT-5.6 Sol более чем на 20% в API и кредитных продуктах — скидка действует три месяца (анонс OpenAI, детали для разработчиков). Скидки складываются: на Devin Sol после наложения акций выходит на 76% дешевле прайса до 3 октября 2026 года (расчёт Cognition), а редактор Code держит свои 50% до 3 сентября (акция Code). Параллельно OpenAI сообщила, что Codex дошёл до 20 млн активных пользователей, и обнулила счётчики лимитов всем пользователям Codex и ChatGPT Work (заявление OpenAI). Для команд добавили жёсткие потолки трат: расход теперь виден по каждому API-ключу, а месячный лимит ставится на организацию и проект (анонс).

NVIDIA AVO прошла все 183 уровня ARC-AGI-3 — но только на публичном наборе

Агент NVIDIA AVO закрыл 100% ARC-AGI-3: все 183 уровня в 25 средах, без инструкций, правил и заданных целей (заявление NVIDIA). Франсуа Шолле сразу уточнил, что речь о публичном демонстрационно-обучающем наборе, а не о полном бенчмарке (оговорка Шолле). Разбор в сообществе добавил ту же мысль: результат получен на открытых средах, приватный набор не проверялся, поэтому обобщение пока не доказано (обсуждение). ARC-AGI-3 — набор интерактивных сред, где агент должен сам догадаться о цели и правилах, поэтому именно на нём разрыв между «выучил» и «понял» виден лучше всего.

Nvidia заплатит Poolside около $6 млрд за лицензию на её фабрику моделей

Nvidia, по сообщению The Information, заплатит стартапу Poolside около $6 млрд за неисключительную лицензию на его систему разработки моделей и вложит ещё около $1 млрд при оценке $12 млрд до вложения (разбор сделки). Предмет сделки — «фабрика моделей» Poolside, на которой построена её кодовая модель Laguna; офферы получили 109 сотрудников, работавших над Laguna. Сообщество разошлось в оценке: одни ждут ускорения открытых моделей Nvidia, другие называют это скрытой покупкой команды, после которой самостоятельная линия Laguna остановится. Отдельный аргумент в пользу открытых весов в тот же день привёл Дэвид Сакс: юридический сервис Harvey получил лучший результат в своей области на открытой Kimi K3 и дешевле (реплика).

Цифры и факты

Разные точки зрения: доказывает ли 100% на ARC-AGI-3 общее рассуждение?

Спор идёт вокруг одного результата: агент NVIDIA AVO прошёл все 183 уровня в 25 средах ARC-AGI-3 без инструкций и заданных целей (заявление NVIDIA). Вопрос в том, что именно измерено — способность разбираться в незнакомой среде или подгонка под конкретный бенчмарк.

За. Среды ARC-AGI-3 интерактивные, и агент должен сам вывести правила и цель: пройти их подряд, ничего не зная заранее, — качественно иной результат, чем решить набор статичных задач. Именно на такие длинные автономные сценарии сейчас смещается вся исследовательская повестка — от подстройки сред у Google до бенчмарков вроде FACET (разбор EnvHarness).

Нейтрально. Франсуа Шолле, автор ARC, не оспаривает результат, а уточняет его границы: пройден публичный демонстрационно-обучающий набор, а не полный бенчмарк (оговорка Шолле). Это не опровержение, а напоминание, что у ARC-AGI приватная часть и существует ровно ради таких заявлений.

Против. Скептики в обсуждении указывают, что без проверки на закрытом наборе результат неотличим от оптимизации под бенчмарк, и предлагают простую проверку — запустить того же агента в посторонних интерактивных играх, к которым он не готовился (обсуждение). Тот же скепсис в этот день звучал и про открытые модели: пользователи находили у Qwen3.8-27B заметную просадку фактических знаний относительно версии 3.6 при выключенном веб-поиске (разбор).

Инструменты и приёмы

Коротко