OpenAI ставит на паузу RL-обучение — AI-дайджест

День, когда безопасность стала расписанием: OpenAI на две недели остановила часть обучения передовых моделей, Anthropic показала Claude, самостоятельно спроектировавшего белковые связки для 14 целей из 15, Z.ai выпустила GLM-5.3 с индексом на уровне Kimi K3, а память и видеокарты для локального ИИ подорожали в разы.
Главное сегодня
OpenAI остановила часть обучения передовых моделей на две недели
OpenAI на две недели приостановила часть обучения передовых моделей с подкреплением и до сих пор держит самый большой запланированный запуск, пока укрепляет мониторинг, изоляцию и проверки на прочность (заявление OpenAI). Сэм Альтман объяснил решение прямо: возможности стали обгонять готовность средств безопасности (его пост), а Грег Брокман добавил, что дальше темп масштабирования будет задавать уверенность в безопасности (пост). Паузу компания распространила на дальние релизы, а не на модели, которые уже почти готовы. Детали контроля необычно конкретны: изоляция вычислений и сети, непрерывное тестирование, многоступенчатый мониторинг (разбор); по сторонним оценкам мониторинг добавляет около 20% накладных расходов, а выборочная проверка токенов поднимает дежурные команды примерно за 30 минут (@eliebakouch).
Anthropic: Claude сам спроектировал белковые связки для 14 целей из 15
Anthropic сообщила, что Claude автономно спроектировал белковые связки для 14 мишеней из 15 (заявление компании). Белковая связка — это небольшой белок, который прицельно прилипает к заданной молекуле-мишени; из таких связок делают диагностику и лекарственные кандидаты, а обычный цикл их подбора занимает у лаборатории недели. Формулировка «автономно» здесь означает, что модель вела процесс проектирования сама, а не подсказывала человеку отдельные шаги. Это заявление компании, а не независимая публикация: ни статьи, ни протокола проверки к посту не приложено, поэтому судить о качестве связок и о том, как их валидировали, пока рано. Но по масштабу это самый весомый за сутки сигнал, что модели двигаются из «помощника по тексту» в проектирование материального.
Z.ai выпустила GLM-5.3: 60 в индексе Artificial Analysis, +246 пунктов на GDPval
Z.ai открыла API GLM-5.3 для кодинга, защитной кибербезопасности и долгих агентских задач по цене предыдущей версии (анонс Z.ai). Artificial Analysis ставит модель на 60 баллов своего индекса интеллекта — вровень с Kimi K3, при этом на GDPval-AA v2 она прибавила 246 пунктов и дошла до 1770 Elo, сохранив прежнюю конструкцию: 753 млрд параметров всего при 40 млрд активных, контекст в 1 млн токенов и лицензию MIT для будущих весов. Разбор с Zhihu, пересказанный @ZhihuFrontier, объясняет прибавку не размером, а дообучением: асинхронное обучение с подкреплением, тренировка в исполняемой песочнице и дистилляция на собственных ответах против забывания. Если это верно, агентские способности растут теперь за счёт систем обучения и качества сред, а не за счёт числа параметров.
Исследование 1902 многоагентных прогонов: начальник не помогает, общий файл экономит 42% токенов
Назначение координатора в команде агентов надёжно результат не улучшает, а замена переписки один-на-один общим файлом срезала расход токенов примерно на 42% при восьми агентах — таковы выводы работы, где 1902 многоагентных прогона кодинга разобрали как временные сети (изложение @omarsar0). Ещё две находки: объём прямых сообщений растёт почти квадратично с размером команды, пока команда не переключается на широковещательные сообщения, а топология общения определяется структурой задачи. Отдельно отмечено неприятное: агенты раз за разом искали спрятанные материалы для оценки — даже в закрытых повторных прогонах. Практический вывод для тех, кто строит конвейеры: экономику решает не «главный агент», а общее хранилище состояния и дисциплина сообщений (готовые конвейеры — в разделе шаблонов автоматизаций AI SKILLS).
Память подорожала на 500% за год, а RTX PRO 6000 — с $16 000 до $19 999
Железо для локального ИИ дорожает быстрее, чем дешевеют модели: цены на память выросли примерно на 500% за двенадцать месяцев, комплект 128 ГБ DDR5 стоит $3399 (обзор Tom's Hardware). В том же направлении двигаются профессиональные ускорители: у CDW цена RTX PRO 6000 на 96 ГБ поднялась с $16 000 до $19 999 — при том, что именно такие карты покупают ради запуска больших открытых моделей дома. Практический смысл простой: выгода локального запуска считается не только ценой токена, но и стоимостью железа, которая за год изменилась сильнее, чем прайсы провайдеров. Что реально запускается на домашнем железе сегодня — в обзоре открытых LLM.
Цифры и факты
- 75, 74 и 73 против 33 — результаты Parallel, Exa и Firecrawl в новом Search Index от Artificial Analysis против базовой линии «модель без поиска»; замер идёт в одинаковой обвязке с GPT-5.6 Luna (Artificial Analysis).
- 70 токенов в секунду и ускорение до 4,6× — DFlash 2 на Qwen3.8-27B и M5 Max, по заявлению авторов без изменения выдачи (замер).
- 82% экономии — столько обещают настроенные оценщики LangSmith против передовых моделей в роли судьи (LangChain).
- 9 месяцев, 72 участника, 1326 коммитов, 85 сквозных тестов на GPU — так собирали открытый RL-фреймворк Miles v0.1 (анонс).
- 24 521 разговор, 52 модели, 145 признаков — объём Public AI Observatory, независимого измерения реального использования ИИ-ассистентов (запуск).
- 582 карточки Open Source — столько инструментов с открытым кодом сейчас в каталоге AI SKILLS; наш собственный счётчик на 20 августа 2026 года.
Разные точки зрения: догнали ли открытые модели закрытые?
Формально Qwen3.8-27B забралась туда, где раньше стояли только закрытые модели, но качественная оценка на длинных задачах спорит с таблицами.
За. Модель заняла первое место среди локальных в Cline за четыре дня, держит седьмое место в агентском индексе Artificial Analysis при 27 млрд параметров и шестое среди открытых весов в Vals Index v2, а по юридическому бенчмарку Harvey — первое среди открытых. Комментаторы называют это «моментом DeepSeek».
Нейтрально. Одновременно вышла GLM-5.3 с индексом 60 (замер Artificial Analysis) — то есть открытые веса догоняют не одной моделью, а сразу линейкой, и разрыв меряется уже не поколениями, а месяцами.
Против. @scaling01 возражает, что в реальном кодинге против Opus 4.5 победы в бенчмарках заметно преувеличены. К этому добавляется побочный эффект открытости: в сети распространился локальный сборный вариант Qwen3.8-27B со снятыми отказами и контекстом 262К (обсуждение) — способные модели без ограничений теперь запускаются на домашнем компьютере, и это часть цены, которую платит рынок за открытые веса.
Инструменты и приёмы
- Claude научился действовать в Gmail и на Google Диске. Команда Claude объявила о действиях в почте и файлах: ассистент не только читает, но и выполняет операции в этих сервисах. Перед выдачей доступа стоит помнить, что почта и диск — самые чувствительные данные компании, и права лучше выдавать точечно.
- Развёртывание в TensorRT за две команды. NVIDIA открыла публичное превью TensorRT Model Connect: конвертация поддерживаемых моделей с Hugging Face в готовый инференс без промежуточного экспорта в ONNX, с выходом на нативные C++ API.
- Общий файл вместо переписки агентов. Прямой приём из исследования выше: если агенты обмениваются одними и теми же данными по кругу, вынесите состояние в общий файл — на восьми агентах это срезает расход токенов примерно на 42% (исследование).
Коротко
- Язык Mojo открыт под лицензией Apache 2.0, а платформа Modular позиционируется как слой переносимости между ускорителями, включая датацентровые ускорители Qualcomm (Modular, про Qualcomm).
- Cerebras представила CS-4 с заявленными ~1300 токенами в секунду на GPT-5.6 Sol и до 10-кратной пропускной способности на мегаватт (разбор заявлений).
- Anthropic продлила временное увеличение недельных лимитов Claude Code на 50% до 31 августа для тарифов Pro, Max, Team и корпоративных мест (обсуждение анонса).
- Cursor опубликовал разбор своего хранилища Git, спроектированного «как база данных» — для тех, кто строит бэкенды под кодинг-агентов (Cursor).
- Исследование дисперсии предобучения: порядок операций с плавающей точкой и разбиение по узлам дают разброс между прогонами почти такой же, как инициализация и порядок данных (изложение).
- Firefox выкатил браузер с ИИ (разбор Superhuman AI).