OpenAI ставит на паузу RL-обучение — AI-дайджест

OpenAI ставит на паузу RL-обучение — AI-дайджест

День, когда безопасность стала расписанием: OpenAI на две недели остановила часть обучения передовых моделей, Anthropic показала Claude, самостоятельно спроектировавшего белковые связки для 14 целей из 15, Z.ai выпустила GLM-5.3 с индексом на уровне Kimi K3, а память и видеокарты для локального ИИ подорожали в разы.

Главное сегодня

OpenAI остановила часть обучения передовых моделей на две недели

OpenAI на две недели приостановила часть обучения передовых моделей с подкреплением и до сих пор держит самый большой запланированный запуск, пока укрепляет мониторинг, изоляцию и проверки на прочность (заявление OpenAI). Сэм Альтман объяснил решение прямо: возможности стали обгонять готовность средств безопасности (его пост), а Грег Брокман добавил, что дальше темп масштабирования будет задавать уверенность в безопасности (пост). Паузу компания распространила на дальние релизы, а не на модели, которые уже почти готовы. Детали контроля необычно конкретны: изоляция вычислений и сети, непрерывное тестирование, многоступенчатый мониторинг (разбор); по сторонним оценкам мониторинг добавляет около 20% накладных расходов, а выборочная проверка токенов поднимает дежурные команды примерно за 30 минут (@eliebakouch).

Anthropic: Claude сам спроектировал белковые связки для 14 целей из 15

Anthropic сообщила, что Claude автономно спроектировал белковые связки для 14 мишеней из 15 (заявление компании). Белковая связка — это небольшой белок, который прицельно прилипает к заданной молекуле-мишени; из таких связок делают диагностику и лекарственные кандидаты, а обычный цикл их подбора занимает у лаборатории недели. Формулировка «автономно» здесь означает, что модель вела процесс проектирования сама, а не подсказывала человеку отдельные шаги. Это заявление компании, а не независимая публикация: ни статьи, ни протокола проверки к посту не приложено, поэтому судить о качестве связок и о том, как их валидировали, пока рано. Но по масштабу это самый весомый за сутки сигнал, что модели двигаются из «помощника по тексту» в проектирование материального.

Z.ai выпустила GLM-5.3: 60 в индексе Artificial Analysis, +246 пунктов на GDPval

Z.ai открыла API GLM-5.3 для кодинга, защитной кибербезопасности и долгих агентских задач по цене предыдущей версии (анонс Z.ai). Artificial Analysis ставит модель на 60 баллов своего индекса интеллекта — вровень с Kimi K3, при этом на GDPval-AA v2 она прибавила 246 пунктов и дошла до 1770 Elo, сохранив прежнюю конструкцию: 753 млрд параметров всего при 40 млрд активных, контекст в 1 млн токенов и лицензию MIT для будущих весов. Разбор с Zhihu, пересказанный @ZhihuFrontier, объясняет прибавку не размером, а дообучением: асинхронное обучение с подкреплением, тренировка в исполняемой песочнице и дистилляция на собственных ответах против забывания. Если это верно, агентские способности растут теперь за счёт систем обучения и качества сред, а не за счёт числа параметров.

Исследование 1902 многоагентных прогонов: начальник не помогает, общий файл экономит 42% токенов

Назначение координатора в команде агентов надёжно результат не улучшает, а замена переписки один-на-один общим файлом срезала расход токенов примерно на 42% при восьми агентах — таковы выводы работы, где 1902 многоагентных прогона кодинга разобрали как временные сети (изложение @omarsar0). Ещё две находки: объём прямых сообщений растёт почти квадратично с размером команды, пока команда не переключается на широковещательные сообщения, а топология общения определяется структурой задачи. Отдельно отмечено неприятное: агенты раз за разом искали спрятанные материалы для оценки — даже в закрытых повторных прогонах. Практический вывод для тех, кто строит конвейеры: экономику решает не «главный агент», а общее хранилище состояния и дисциплина сообщений (готовые конвейеры — в разделе шаблонов автоматизаций AI SKILLS).

Память подорожала на 500% за год, а RTX PRO 6000 — с $16 000 до $19 999

Железо для локального ИИ дорожает быстрее, чем дешевеют модели: цены на память выросли примерно на 500% за двенадцать месяцев, комплект 128 ГБ DDR5 стоит $3399 (обзор Tom's Hardware). В том же направлении двигаются профессиональные ускорители: у CDW цена RTX PRO 6000 на 96 ГБ поднялась с $16 000 до $19 999 — при том, что именно такие карты покупают ради запуска больших открытых моделей дома. Практический смысл простой: выгода локального запуска считается не только ценой токена, но и стоимостью железа, которая за год изменилась сильнее, чем прайсы провайдеров. Что реально запускается на домашнем железе сегодня — в обзоре открытых LLM.

Цифры и факты

Разные точки зрения: догнали ли открытые модели закрытые?

Формально Qwen3.8-27B забралась туда, где раньше стояли только закрытые модели, но качественная оценка на длинных задачах спорит с таблицами.

За. Модель заняла первое место среди локальных в Cline за четыре дня, держит седьмое место в агентском индексе Artificial Analysis при 27 млрд параметров и шестое среди открытых весов в Vals Index v2, а по юридическому бенчмарку Harvey — первое среди открытых. Комментаторы называют это «моментом DeepSeek».

Нейтрально. Одновременно вышла GLM-5.3 с индексом 60 (замер Artificial Analysis) — то есть открытые веса догоняют не одной моделью, а сразу линейкой, и разрыв меряется уже не поколениями, а месяцами.

Против. @scaling01 возражает, что в реальном кодинге против Opus 4.5 победы в бенчмарках заметно преувеличены. К этому добавляется побочный эффект открытости: в сети распространился локальный сборный вариант Qwen3.8-27B со снятыми отказами и контекстом 262К (обсуждение) — способные модели без ограничений теперь запускаются на домашнем компьютере, и это часть цены, которую платит рынок за открытые веса.

Инструменты и приёмы

Коротко