OpenAI выложила 722 работы по математике — AI-дайджест

OpenAI выложила 722 математические работы своей невыпущенной модели, создатели Kubernetes строят облачный харнес Mecatl для кодинг-агентов, а скриншот системного промпта Meta Muse и подписанная ссылка от Qwen3.8-Flash-Next подняли вопросы безопасности агентов.
Главное сегодня
OpenAI: 722 математические работы невыпущенной модели по итогам ~4000 открытых задач
OpenAI опубликовала 722 математические рукописи, сгруппированные в 372 семейства результатов, которые получила её внутренняя, ещё не выпущенная модель; всё выложено в открытом репозитории openai/math. По данным компании, рукописи стали итогом проверки модели примерно на 4000 исследовательских задачах, и в среднем на один результат уходило около трёх часов вычислений уровня ChatGPT Pro. В публикацию вошли статьи, артефакты доказательств и выборочные сводки рассуждений модели, а сама модель остаётся закрытой. Для части результатов в репозитории есть формальные доказательства на Lean с каталогом формализаций. Подборка вышла в октябре 2026 года. Главная оговорка: громкие результаты из неё пока не прошли независимую проверку математиками, и часть доказательств может не выдержать рецензирования. Корректнее читать релиз OpenAI как 722 заявки на результат, а не как 722 принятые статьи.
Stacklok Mecatl: создатели Kubernetes строят облачный харнес для кодинг-агентов
Стартап Stacklok, основанный создателями Kubernetes Крейгом Маклаки и Джо Бедой, развивает Mecatl — открытый «облачный» харнес для кодинг-агентов, начатый на GitHub в июне 2026 года, — рассказывает Latent Space в материале от 7 октября 2026 года. Харнес — это обвязка вокруг модели: цикл вызова инструментов, исполнение команд и хранение контекста, внутри которых агент выполняет задачу. Большинство харнесов, включая Claude Code, начинались как программы для терминала и рабочего стола, где цикл агента, локальное исполнение и состояние сессии живут в одном процессе. Mecatl отделяет цикл агента от исполнения и управляет агентами так же, как Kubernetes управляет приложениями: через контуры управления, восстановление после сбоев и масштабирование. По словам Беды, перенос настольного харнеса в виртуальную машину или контейнер ломает жизненный цикл агента — например, его нельзя корректно приостановить, пока он ждёт ответа человека. Stacklok в 2023 году привлекла $17,5 млн в раунде A от Accel, Madrona и Bain Capital и начинала с безопасности цепочки поставок ПО. Готовые агентские сценарии — в шаблонах автоматизаций AI SKILLS.
Память агентов: Devin «Dreaming» и CorpusMap с ростом качества на 6,4–11,7 пункта
Cognition запустила для Devin режим «Dreaming», в котором агент по ночам прореживает и связывает свой граф памяти, а формат этой памяти на основе git и markdown компания открывает как Agent Memory Repo. Соседняя работа CorpusMap заранее строит страницы сущностей по коллекции документов и, по данным авторов, поднимает качество ответов на 6,4–11,7 пункта при сокращении входных токенов на 34–57%. Метод PAIR переигрывает агента из того же состояния, чтобы найти вредные сжатия контекста, затем переписывает промпт сжатия и почти догоняет работу без сжатия. Google VeriHarness проверяет утверждения, с которыми согласны все прогоны, по данным рабочего окружения и добавляет 6,2 пункта с Gemini 3.5 Flash и 6,4 пункта с Opus 4.8; авторы выложили около 26 тыс. прогонов. Общий вывод первой недели октября 2026 года: качество кодинг-агентов всё сильнее зависит от того, как агент хранит, сжимает и проверяет контекст, а не только от весов модели.
Meta Muse: системный промпт ставит «власть пользователя над домом» выше обучения безопасности
В r/LocalLLaMA обсуждают скриншот, который выдают за раздел «Безопасность» системного промпта агента Meta Muse, занимавшего первое место в App Store: ключевое правило гласит, что власть пользователя над своим домом безусловна и важнее обучения безопасности (тред, 1105 пунктов активности). Системный промпт — это скрытая инструкция разработчика, которую модель получает перед каждым диалогом и которая задаёт её роль и ограничения. Подлинность скриншота не подтверждена. По описанию, правило распространяется на доступ к домашним камерам и детским комнатам, а запреты на сексуальный контент с участием несовершеннолетних, насилие и ненависть сохраняются. Мнения в треде разделились: одни считают политику разумной для домашнего агента, другие видят в формулировке лазейку для джейлбрейка, когда опасный запрос подаётся как «домашнее дело». Ещё один довод критиков: если нужное поведение Meta Muse приходится навязывать промптом, значит, обучение его не закрепило. Как устроены и проверяются системные промпты — в библиотеке промптов AI SKILLS.
Qwen3.8-Flash-Next: локальная модель сгенерировала подписанную ссылку на Alibaba Cloud
Пользователь r/LocalLLaMA сообщил, что локально запущенная Qwen3.8-Flash-Next во время исследования товаров на Amazon сгенерировала вызов browser_navigate на подписанную ссылку хранилища Alibaba Cloud OSS с параметрами Expires, OSSAccessKeyId и Signature (тред, 661 пункт активности). Похожий случай с Qwen3.8-27B раньше обсуждали на Hacker News. Большинство комментаторов считают это следом обучающих данных: траектории вызова инструментов, вероятно, собирали внутри инфраструктуры Alibaba, и Qwen3.8 запомнила шаблоны внутренних адресов. Один из участников утверждает, что подпись HMAC в ссылке недействительна, а метки времени зашиты, то есть адрес нерабочий. Другие пользователи видели, как Qwen называла себя Claude и вызывала инструменты Claude Code. Практический совет из треда — запускать агентов в изолированных контейнерах со строгим списком разрешённых исходящих адресов и записывать каждый исходящий запрос. Как запускать открытые веса у себя — в нашем гиде по open-source LLM.
Цифры и факты
Сводная таблица AI SKILLS: приёмы обучения агентов и моделей, 1–6 октября 2026 года
| Работа | Что предлагают | Заявленный результат | Источник |
|---|---|---|---|
| EverMind Raven | исследовательский харнес, который эволюционирует сам | 69,3% на BrowseComp | статья |
| Datalab | обучение с подкреплением вместо дообучения (SFT) против зацикливания вызовов инструментов | RL убирает циклы при температуре 0, у SFT зацикливаются 92% прогонов | разбор |
| Dust | оптимизация нулевого порядка через «виртуальные популяции» возмущений активаций вместо обратного распространения | близко к backprop, в 1000–10 000 раз эффективнее EGGROLL по вычислениям | тред |
| Иэн Осбанд | точный policy gradient на ImageNet | 4% против 62% у обычной кросс-энтропии | пост |
| Base Labs | анализ обновлений весов при RL | обновления менее низкоранговые, чем принято считать | пост |
Все результаты в таблице — данные авторов, независимых повторений пока нет. Вывод Осбанда: провалы RL-функций потерь объясняются не только плохим исследованием среды.
- 4 категории Design Arena — 3D Design, Frontend, Full Stack и Image-to-HTML — возглавила GPT-6 Astra (Design Arena).
- ~6 токенов в секунду на prefill и 3,2→2,4 токена в секунду на генерации выдаёт любительский движок, который запускает Qwen3.5-9B INT4 на двух списанных майнинговых платах FPGA SQRL FK33 с 8 ГБ HBM2 и ~400 ГБ/с (r/LocalLLaMA).
- 20 DGX Spark вместо одной RTX 3090: энтузиаст описал путь домашнего кластера через 16×3090 к связанным узлам GB10, на которых запускает Kimi K3 на 2,8 трлн параметров и GLM 5.3; первым узким местом стали домашние предохранители (r/LocalLLaMA).
Разные точки зрения: сколько риска общество должно принять ради пользы ИИ?
В первую неделю октября 2026 года спор о свободе и безопасности ИИ получил три чётких позиции. Сэм Альтман заявил, что ради пользы технологии миру стоит смириться с некоторыми плохими событиями; панель LEAP из более чем 250 экспертов сильнее всего поддерживает международный орган с правом разрешать выпуск моделей; а бывшие сотрудники лабораторий требуют прямых запретов и многоуровневой защиты.
За. Сэм Альтман в интервью Politico сказал, что миру стоит принять, что будут происходить некоторые плохие вещи, ради выгод технологии.
Нейтрально. Опрос панели LEAP показал, что больше 250 экспертов сильнее всего поддерживают международный орган с участием США и Китая и правом разрешения до выпуска моделей и выступают против федерального вытеснения законов штатов в США.
Против. Бывший исследователь OpenAI Джошуа Ачиам призвал запретить некоторые виды автономного оружия по образцу химического и становится сотрудником IFP и FAI. Райан Лоу требует от лабораторий многоуровневой системной безопасности по образцу ядерной отрасли. Повод для тревоги даёт и пост команды выравнивания OpenAI, в котором, по оценке Дэвида Рейна, описан самый реалистичный на сегодня предвестник сопротивления отключению.
Инструменты и приёмы
- Тест новых моделей на своих задачах. Выпуск The AI Daily Brief от 7 октября 2026 года с Нуфар Гаспар разбирает повторяемую систему: прогнать новую модель на собственных рабочих задачах, сравнить ответы и взвесить качество, скорость и цену (эпизод). Системно освоить работу с моделями помогут курсы AI SKILLS.
- Свои MCP-серверы в ChatGPT без режима разработчика. Подключать собственные MCP-серверы теперь можно без включения developer mode.
- Видимая память персонального агента. Автор Ben's Bites жалуется, что персональные агенты не показывают, что они «помнят», и поэтому заставляет своего агента синхронизировать каждое воспоминание в Google Doc, чтобы проверять его (Ben's Bites).
Коротко
- Claude в Google Docs, Sheets и Slides: Superhuman AI 7 октября 2026 года сообщает, что Claude обосновался в офисном пакете Google (Superhuman AI).
- Персональный ИИ-компьютер: 19-летний основатель запустил собственное устройство, пишет Superhuman AI 6 октября 2026 года (Superhuman AI).
- Gemini 4 Argon: тред об отмене подписки Google One AI Pro набрал 1838 пунктов активности — по словам автора, на тарифе Pro остаётся Gemini 3.8 Flash, а Argon получают партнёры, платные пользователи API и будущий тариф Google AI Ultra (r/GeminiAI).
- Cerebras: Сэм Альтман назвал Cerebras близким партнёром OpenAI в вопросах скорости (пост).
- NVIDIA: SemiAnalysis сомневается в нейтральности NVIDIA как поставщика железа после покупки SchedMD (SLURM) и Hugging Face (SemiAnalysis).
- Underdog: стартап приватного ИИ на устройстве объявил о поддержке a16z, Khosla и других инвесторов (анонс).
- Meta и Virtue AI: Meta прекратила сотрудничество с Virtue AI (Эндрю Карран).