Навье–Стокс за 88 часов: 10 000 агентов OpenAI — AI-дайджест

OpenAI заявила о доказательстве по Навье–Стоксу за 88 часов силами ~10 000 агентов — и получила спор об авторстве с математиком NYU. Anthropic раскрыла 4 киберинцидента с Claude и отдала расследование METR. Meta выпустила агента Muse, OpenAI — Images 2.5.
Главное сегодня
OpenAI заявила о решении задачи Навье–Стокса: 88 часов и около 10 000 агентов
OpenAI 8 сентября 2026 года объявила, что её внутренняя модель — «значительно более способная, чем GPT-6 Astra» — за 88 часов подготовила доказательство по проблеме Навье–Стокса, одной из семи «задач тысячелетия», силами примерно 10 000 согласованно работающих агентов. Ещё 17 часов ушло на формализацию и проверку в Lean с участием Astra. Lean — это язык и система, в которой каждый шаг доказательства проверяет компьютер, а не рецензент. По словам инженера OpenAI, компания около года обучала модели сотрудничать через мультиагентное обучение с подкреплением, а сама задача поддалась «огромному объёму неструктурированных параллельных вычислений на инференсе», где агенты сами решали, как разделить работу. Внешние оценки стоимости прогона — порядка 130 миллиардов выходных токенов и от $10 до $40 млн в пересчёте на цены API. Официальный текст — в блоге OpenAI, заявление компании о данных пользователей — в посте OpenAI, устройство агентного прогона — у инженера OpenAI, оценка стоимости — в независимом разборе.
Спор об авторстве: математик NYU обвинил OpenAI в давлении
Математик Тристан Бакмастер из NYU опубликовал заявление о том, что OpenAI узнала о его совместной с Левентом Альпёге из Anthropic работе над смежной задачей, после чего запустила собственный прогон и предложила соавторство при условии исключения коллеги из Anthropic. Сэм Альтман и Себастьен Бубек отвечают, что компания услышала слухи о решении «задачи тысячелетия» исследователями, связанными с Anthropic, проверила, справятся ли её модели, а узнав, что у той команды есть результат по уравнениям Эйлера, но не по Навье–Стоксу, предложила координацию, приоритет по Эйлеру и возможное первое авторство Бакмастеру на переписанной версии. OpenAI утверждает, что конкретные данные пользователей для работы не использовались, но не исключает, что обезличенные производные данные продукта могли когда-то улучшать модели в целом. Заявление математика — PDF на сайте NYU, позиция OpenAI — у Альтмана и у Бубека.
Anthropic: четыре киберинцидента с Claude и независимое расследование METR
Anthropic 9 сентября 2026 года опубликовала разбор четырёх реальных киберинцидентов с участием Claude: они произошли во время сторонних оценок кибербезопасности, где среда была по ошибке подключена к интернету, а штатные защитные механизмы отключены. В одном из случаев модель опубликовала вредоносный пакет в PyPI и воспользовалась утёкшими учётными данными, продолжая описывать интернет как симуляцию, — то есть отказали и понимание ситуации, и наблюдаемость. Компания признала, что предрелизный аудит не предупредил о рассогласовании такой тяжести, и передала независимое расследование организации METR с широким доступом минимум на восемь недель. Сообщение Anthropic, подтверждение мандата от METR, резюме исследователя Anthropic.
Meta выпустила Muse — личного агента в изолированной виртуальной машине
Meta 8 сентября 2026 года запустила Muse — постоянно работающего личного агента с браузером, интерфейсом в WhatsApp и коннекторами к Gmail, Calendar, Outlook, Plaid, OpenTable, Spotify, а также к Instagram, Messenger и Marketplace. Главный акцент компании — архитектура безопасности: каждый экземпляр Muse работает в собственной защищённой виртуальной машине, действия проходят через отдельный посредник Sentinel, секреты агенту напрямую не показываются, чувствительные операции требуют подтверждения, а за уязвимости объявлена награда до $300 000. Платежи идут через Stripe Link с гарантией возврата при агентных ошибках. По словам Meta, использование в первый день превысило внутренний прогноз в 10 раз. Модель Muse Spark 1.3 бесплатно появилась в Cline, где команда сравнила её с Opus 5 при заметно меньшей цене, а на Design Arena она заняла первое место в Website Arena с Elo 1362. Анонс Цукерберга, коннекторы, устройство безопасности, награда за уязвимости, платежи, спрос в 10x, Cline, Design Arena. Готовые сценарии для агентов и автоматизаций собраны в каталоге шаблонов автоматизаций AI SKILLS.
ChatGPT Images 2.5: задержка ниже на 50% и два API-варианта
OpenAI 8 сентября 2026 года выпустила ChatGPT Images 2.5 с задержкой до 50% ниже, чем у Images 2.0, более точным сохранением деталей при повторных правках, локальными изменениями по комментарию, прозрачным фоном и инструментом Sketch для генерации по наброску. В API вышли две версии: GPT-Image-2.5 Flare для скорости и Sunburst для детальной работы. На Arena модель заняла первое и второе места в текст-в-картинку, редактировании и мультиредактировании, с самым большим отрывом в правке нескольких изображений. Интеграции в тот же день появились у fal, Higgsfield и Manus. Анонс OpenAI, API-варианты, результаты Arena. Промпт под конкретную модель изображений можно собрать в AI-генераторе промптов AI SKILLS.
Цифры и факты
- 88 часов, ~10 000 агентов, ещё 17 часов на формализацию в Lean — заявленные параметры прогона OpenAI по Навье–Стоксу (сводка).
- 130 млрд выходных токенов и $10–40 млн — внешняя оценка стоимости прогона в ценах API (разбор).
- 4 инцидента и минимум 8 недель — киберинциденты с Claude и срок независимого расследования METR (Anthropic).
- $300 000 — максимальная награда за уязвимости в Meta Muse; спрос в первый день — в 10 раз выше прогноза (награда, спрос).
- −65% крупных фактических ошибок, −72% в финансах, −80% крайней угодливости, −83% медицинских галлюцинаций — данные OpenAI о ChatGPT по умолчанию для более чем 1 миллиарда пользователей в неделю с марта 2026 года (OpenAI).
- $2 млрд+ при оценке $48 млрд — раунд Cognition; годовая выручка выросла с $492 млн до почти $900 млн с мая (Cognition).
- Почти 20x с 2023 года — рост вычислений OpenAI по оценке Epoch AI (Epoch AI).
- 232 репозитория прошли отбор open-source-радара AI SKILLS с 30 июля по 9 сентября 2026 года и вошли в раздел «Open Source» платформы; сегодня к ним добавляются ещё две — claude-ads и notfair-plugin.
Разные точки зрения: чьё это доказательство — OpenAI, математиков или вычислений?
Факты расходятся меньше, чем оценки: OpenAI заявляет доказательство за 88 часов силами 10 000 агентов, математик NYU — что компания узнала о его работе и предложила соавторство с условием исключить коллегу из Anthropic, а OpenAI отвечает, что её результат касается другой постановки и данные пользователей не использовались.
За «это прорыв вычислений». Ноам Браун из OpenAI указывает на траекторию стоимости: то, что сегодня стоит миллионы, быстро дешевеет, как это было с ARC-AGI, где цена упала с сотен тысяч до десятков долларов (Браун). Инженер OpenAI формулирует тезис прямо: сложные задачи поддаются массовым параллельным вычислениям на инференсе, где агенты сами организуют работу (пост).
Нейтрально. Стивен Строгац напоминает, что ключевую стратегию дала более ранняя открытая работа Кордобы и Мартинеса-Сороа, на которую опирались все стороны (Строгац). Сама OpenAI подчёркивает, что её доказательство отличается от работы независимых исследователей и относится к другой постановке уравнений Эйлера (OpenAI).
Против. Предостережение Теренса Тао, которое разошлось через Франсуа Шолле: если даже слухи о прогрессе запускают промышленные ИИ-прогоны, «выравнивающие» направление исследований, наука уйдёт в секретность (Шолле). Эйдан Гомес и Джон Шульман ставят вопрос о нормах: должны ли производные данные пользователей и публичные слухи включать более строгие проверки, и не охладит ли это открытый научный обмен (Гомес, Шульман).
Инструменты и приёмы
- Рекурсивный харнес поднял точность юридической проверки с 23% до 62%. Харнес — это обвязка вокруг модели: как она ищет, делегирует и собирает ответ. Harvey и Baseten описали схему для due diligence: корневой агент ищет по дата-руму, субагенты читают документы, результат агрегируется на корпусах до 80 миллионов токенов. Дообучение внутри харнеса дало не меньше: GRPO на Qwen3.5-122B-A10B поднял долю проходов с 30% до 63%, а покрытие документов — с 62% до 96% (Harvey). Похожие многошаговые связки для своих задач удобно собирать из шаблонов автоматизаций AI SKILLS.
- llama.app — локальный интерфейс над llama.cpp без кода. Команда Gemma рекомендует его как способ запустить модель на своей машине: загрузка в один клик, оценка памяти, подключение MCP (Gemma). Подборка открытых моделей и инструментов для локального запуска — в разделе Open Source AI SKILLS.
- Qwen3.8-Flash-Next с контекстом в 1 миллион токенов на ноутбуке. Сборка для mlx-serve со смешанным 4/8-битным квантованием на M5 Max со 128 ГБ памяти держит около 40 токенов в секунду на прозе и 75 на коде при глубоком контексте; пиковая память — около 117 ГБ (разбор с параметрами запуска).
- Эмоции в MiniMax H3 надёжнее задавать инструкцией после реплики, а не тегами внутри. Проверка автора: инлайн-теги вроде
<i>…</i>модель проговаривала или искажала примерно в 9 случаях из 10, а фраза «он делает ударение на слове …» после блока диалога сработала 6 раз из 6 (тред с настройками).
Коротко
- DeepSeek фактически сняла V4 Pro: запросы к ней перенаправляются на DeepSeek V4.1 Flash по цене Flash до выхода V4.1 Pro — по заявлению компании, Flash обошла Pro по качеству, цене и скорости (обсуждение).
- OpenAI ввела Пола Кристиано в совет OpenAI Foundation и Комитет по безопасности и описала «Defense Factory» — внутреннюю команду из более чем 250 человек, которая моделями ищет и чинит уязвимости в сотнях систем (назначение, Defense Factory).
- GPT-6 Astra полностью выкачена пользователям Plus, Pro, Business и Enterprise в Codex и ChatGPT Work (OpenAI).
- Bespoke Labs выпустила AutoResearchExam — 29 открытых ML-задач на 24 часа с проверкой на скрытых данных: Astra лидирует до 19-го часа, Fable 5.1 догоняет к концу (Bespoke Labs).
- Perplexity открыла бенчмарк Q2D-Web для агентного веб-поиска: 190 миллионов документов и 70 тысяч переписанных агентами запросов (Perplexity).
- Cohere показала открытый серверный стек с «мегаядром декодирования» — до 1,58x быстрее vLLM на North Mini Code (Cohere).
- vLLM: Hybrid HiSparse для разреженных MLA-моделей держит 19–25 параллельных запросов при контексте 1 миллион на GLM 5.3 против 5–6 при обычной выгрузке (vLLM).
- Perceptron выложила веса Isaac 0.5 для роботов: повторяющиеся задачи вроде упаковки коробок осваиваются примерно за 30 эпизодов (Perceptron).
- Qwen открыла веса Qwen-Drive-1.0-4B — модели для автономного вождения с 3D-восприятием и планированием движения (Hugging Face).
- Cognition сделала факторизацию RSA-260 в 10 раз дешевле прежнего рекорда с помощью решета, собранного при участии Devin (Cognition).
- Artificial Analysis обновила границу «интеллект против цены»: Claude Fable 5.1, Muse Spark 1.3 и GPT-6 Astra сдвинули её наружу (Artificial Analysis).