AEF-1 подписали xAI, OpenAI и Anthropic — AI-дайджест

AEF-1 подписали xAI, OpenAI и Anthropic — AI-дайджест

xAI, OpenAI и Anthropic впервые подписали один стандарт независимых проверок — AEF-1. Спор о «замедлении фронтира» дошёл до ухода исследователя из DeepMind и обвинений в картеле, а DeepSeek-V4.1-Flash вышла в топ-3 открытых моделей при $0,06–0,07 за задачу.

Главное сегодня

AEF-1: xAI, OpenAI и Anthropic подписали общий стандарт независимых проверок

AI Evaluator Forum опубликовал AEF-1 — базовый стандарт для независимой оценки ИИ-систем сторонними организациями, и под ним подписались сразу xAI, OpenAI и Anthropic (AI Evaluator Forum, разбор Latent Space). Документ описывает пять вещей, вокруг которых обычно и ломается «независимость»: какой доступ к модели получает проверяющий, как раскрывается конфликт интересов, кто и как финансирует проверку, когда оценщик обязан самоотвестись и что из результатов публикуется. Независимая оценка (third-party evaluation) — это проверка возможностей и рисков модели не самой лабораторией-разработчиком, а внешней организацией по заранее оговорённым правилам доступа и раскрытия. Ценность стандарта в том, что до сих пор каждая лаборатория договаривалась с оценщиками по-своему, и спор «можно ли верить внешнему аудиту» упирался в непрозрачные частные соглашения. Согласие трёх конкурирующих лабораторий на один документ — первый общий знаменатель в этом споре за год.

Раскол вокруг «замедления фронтира»: уход из DeepMind против обвинений в картеле

Публичный спор о том, надо ли лабораториям притормозить рост возможностей моделей, 14–15 сентября 2026 года окончательно разделил отрасль на два лагеря с несовместимой логикой. На стороне паузы — исследователь Билал Чугтай, объявивший об уходе из Google DeepMind с аргументом, что прогресс обгоняет выравнивание, и потребовавший и темпового ограничения, и большей прозрачности (пост). Против — Айдан Гомес из Cohere, чей довод строится не на безопасности, а на власти: он не хочет мира, где несколько компаний Кремниевой долины становятся привратниками ИИ для правительств (пост); сама Cohere добавила, что публичная дискуссия о рисках вымирания сползает в научную фантастику (пост). Отдельным фронтом идёт реакция сообщества открытых весов: обсуждение в r/singularity собрало 2173 отклика вокруг тезиса, что «безопасное темпоуправление» — это картель западных лабораторий под предлогом безопасности (тред).

DeepSeek-V4.1-Flash: топ-3 среди открытых моделей при $0,06–0,07 за задачу

Agent Arena поставила DeepSeek-V4.1-Flash на третье место среди открытых моделей и на границу Парето: +4,87% чистого улучшения при медианной стоимости $0,06–0,07 за задачу (замер, развёрнутые данные). Для сравнения в том же замере: Hy4 preview даёт +4,96% за $0,22, а Kimi K3 (Max) — +6,39% за $0,77. То есть за качество, отличающееся на десятые доли процента, Hy4 берёт втрое дороже, а лидирующий K3 — в одиннадцать раз. Осторожность тоже прозвучала: в обсуждении на r/LocalLLaMA участники указали, что модель высоко стоит и в бенчмарке галлюцинаций, и что превосходство на одном частном тесте ещё не означает общего (тред). При запуске 10 сентября Artificial Analysis дала модели 40 баллов своего индекса при цене $0,30 за 1М входных и $1,20 за 1М выходных токенов (замер).

Обвязка агента экономит больше, чем смена модели

LangChain сменила формат чтения файлов в агенте и получила на 15% меньше ошибок edit_file и на 10% меньше входных токенов — без смены модели (отчёт). Это ровно та линия, которую на AI Engineer World's Fair вынесли в отдельный трек: когда агент падает в проде, виновата обычно не модель, а всё вокруг неё — харнес, права, маршрутизация инструментов, память, ретраи, аварийные выключатели и мониторинг (анонс трека). Харнес — это слой вокруг модели, который держит цикл работы агента: вызовы инструментов, память, повторы и остановку. Практический разбор сборки такого слоя с нуля выложил Омар Шорбаги: разделить инференс, инструменты и цикл; держать промпты минимальными; логировать агрессивно; тестировать на разнородных задачах и только потом добавлять память, скиллы и субагентов (гайд, продолжение про стоимость). Готовые сценарии такой обвязки для n8n и Make — в шаблонах автоматизаций AI SKILLS.

Цифры и факты

Разные точки зрения: кому выгодно «темпоуправление» фронтира?

Спор идёт не о том, опасны ли автономные агенты, а о том, кто получит право назначать скорость. Ниже три позиции, которые прозвучали 14–15 сентября 2026 года.

За. Билал Чугтай ушёл из Google DeepMind и заявил, что возможности обгоняют выравнивание, поэтому нужны и темповые ограничения, и прозрачность (пост). Дэниел Кокотайло опубликовал заявление Дэна Селсама, который идёт дальше и говорит о ситуационной остроте момента (пост).

Нейтрально. Публикация AEF-1 предлагает третий путь: не спорить о скорости, а сделать проверяемым то, что уже происходит, — доступ оценщиков, финансирование и раскрытие (AI Evaluator Forum). Трек по харнес-инженерии на AI Engineer World's Fair формулирует ту же мысль инженерно: управляемость достигается правами, ретраями и выключателями, а не декларациями (анонс).

Против. Айдан Гомез возражает против мира, где несколько компаний становятся привратниками ИИ для государств (пост). В обсуждении на r/singularity участники указали на практическую дыру: запрет на публикацию открытых весов не остановит распространение моделей, а сместит его в сторону извлечения и дистилляции закрытых систем через API (тред).

Инструменты и приёмы

Коротко