AEF-1 подписали xAI, OpenAI и Anthropic — AI-дайджест

xAI, OpenAI и Anthropic впервые подписали один стандарт независимых проверок — AEF-1. Спор о «замедлении фронтира» дошёл до ухода исследователя из DeepMind и обвинений в картеле, а DeepSeek-V4.1-Flash вышла в топ-3 открытых моделей при $0,06–0,07 за задачу.
Главное сегодня
AEF-1: xAI, OpenAI и Anthropic подписали общий стандарт независимых проверок
AI Evaluator Forum опубликовал AEF-1 — базовый стандарт для независимой оценки ИИ-систем сторонними организациями, и под ним подписались сразу xAI, OpenAI и Anthropic (AI Evaluator Forum, разбор Latent Space). Документ описывает пять вещей, вокруг которых обычно и ломается «независимость»: какой доступ к модели получает проверяющий, как раскрывается конфликт интересов, кто и как финансирует проверку, когда оценщик обязан самоотвестись и что из результатов публикуется. Независимая оценка (third-party evaluation) — это проверка возможностей и рисков модели не самой лабораторией-разработчиком, а внешней организацией по заранее оговорённым правилам доступа и раскрытия. Ценность стандарта в том, что до сих пор каждая лаборатория договаривалась с оценщиками по-своему, и спор «можно ли верить внешнему аудиту» упирался в непрозрачные частные соглашения. Согласие трёх конкурирующих лабораторий на один документ — первый общий знаменатель в этом споре за год.
Раскол вокруг «замедления фронтира»: уход из DeepMind против обвинений в картеле
Публичный спор о том, надо ли лабораториям притормозить рост возможностей моделей, 14–15 сентября 2026 года окончательно разделил отрасль на два лагеря с несовместимой логикой. На стороне паузы — исследователь Билал Чугтай, объявивший об уходе из Google DeepMind с аргументом, что прогресс обгоняет выравнивание, и потребовавший и темпового ограничения, и большей прозрачности (пост). Против — Айдан Гомес из Cohere, чей довод строится не на безопасности, а на власти: он не хочет мира, где несколько компаний Кремниевой долины становятся привратниками ИИ для правительств (пост); сама Cohere добавила, что публичная дискуссия о рисках вымирания сползает в научную фантастику (пост). Отдельным фронтом идёт реакция сообщества открытых весов: обсуждение в r/singularity собрало 2173 отклика вокруг тезиса, что «безопасное темпоуправление» — это картель западных лабораторий под предлогом безопасности (тред).
DeepSeek-V4.1-Flash: топ-3 среди открытых моделей при $0,06–0,07 за задачу
Agent Arena поставила DeepSeek-V4.1-Flash на третье место среди открытых моделей и на границу Парето: +4,87% чистого улучшения при медианной стоимости $0,06–0,07 за задачу (замер, развёрнутые данные). Для сравнения в том же замере: Hy4 preview даёт +4,96% за $0,22, а Kimi K3 (Max) — +6,39% за $0,77. То есть за качество, отличающееся на десятые доли процента, Hy4 берёт втрое дороже, а лидирующий K3 — в одиннадцать раз. Осторожность тоже прозвучала: в обсуждении на r/LocalLLaMA участники указали, что модель высоко стоит и в бенчмарке галлюцинаций, и что превосходство на одном частном тесте ещё не означает общего (тред). При запуске 10 сентября Artificial Analysis дала модели 40 баллов своего индекса при цене $0,30 за 1М входных и $1,20 за 1М выходных токенов (замер).
Обвязка агента экономит больше, чем смена модели
LangChain сменила формат чтения файлов в агенте и получила на 15% меньше ошибок edit_file и на 10% меньше входных токенов — без смены модели (отчёт). Это ровно та линия, которую на AI Engineer World's Fair вынесли в отдельный трек: когда агент падает в проде, виновата обычно не модель, а всё вокруг неё — харнес, права, маршрутизация инструментов, память, ретраи, аварийные выключатели и мониторинг (анонс трека). Харнес — это слой вокруг модели, который держит цикл работы агента: вызовы инструментов, память, повторы и остановку. Практический разбор сборки такого слоя с нуля выложил Омар Шорбаги: разделить инференс, инструменты и цикл; держать промпты минимальными; логировать агрессивно; тестировать на разнородных задачах и только потом добавлять память, скиллы и субагентов (гайд, продолжение про стоимость). Готовые сценарии такой обвязки для n8n и Make — в шаблонах автоматизаций AI SKILLS.
Цифры и факты
- AEF-1 покрывает пять областей: доступ к модели, конфликт интересов, финансирование, самоотвод оценщика и прозрачность результатов (источник).
- DeepSeek-V4.1-Flash: +4,87% при $0,06–0,07 за задачу против +6,39% при $0,77 у Kimi K3 (Max) (Agent Arena).
- OpenAI снизила цену голосового режима на десктопе примерно на 60% — использование выросло в 2,4 раза (сводка).
- MiniMax H3: 14,4 секунды видео 768p генерируются за 9,0 секунды (заявление MiniMax).
- Swift-Qwen3.8-27B от UkisAI: −58,3% «думающих» токенов и ускорение в 1,95 раза при сохранении точности режима xhigh (разбор).
- Cognichip ACI Enterprise: один инженер прошёл за 10 дней работу, которую компания сравнивает с 4–5 месяцами фронт-энд команды в проектировании чипов (пересказ).
- В нашем каталоге Open Source на утро 16 сентября 2026 года — 696 активных карточек, из них 23 добавлены за последние семь дней: поток открытых инструментов не замедляется ровно в те дни, когда идёт спор о том, не пора ли его притормозить.
Разные точки зрения: кому выгодно «темпоуправление» фронтира?
Спор идёт не о том, опасны ли автономные агенты, а о том, кто получит право назначать скорость. Ниже три позиции, которые прозвучали 14–15 сентября 2026 года.
За. Билал Чугтай ушёл из Google DeepMind и заявил, что возможности обгоняют выравнивание, поэтому нужны и темповые ограничения, и прозрачность (пост). Дэниел Кокотайло опубликовал заявление Дэна Селсама, который идёт дальше и говорит о ситуационной остроте момента (пост).
Нейтрально. Публикация AEF-1 предлагает третий путь: не спорить о скорости, а сделать проверяемым то, что уже происходит, — доступ оценщиков, финансирование и раскрытие (AI Evaluator Forum). Трек по харнес-инженерии на AI Engineer World's Fair формулирует ту же мысль инженерно: управляемость достигается правами, ретраями и выключателями, а не декларациями (анонс).
Против. Айдан Гомез возражает против мира, где несколько компаний становятся привратниками ИИ для государств (пост). В обсуждении на r/singularity участники указали на практическую дыру: запрет на публикацию открытых весов не остановит распространение моделей, а сместит его в сторону извлечения и дистилляции закрытых систем через API (тред).
Инструменты и приёмы
- Cline Desktop — отдельное приложение для работы с открытыми моделями по своему ключу, с переключением моделей прямо посреди проекта; из поддерживаемых названы DeepSeek-V4.1-Flash и Musespark-1.3 (анонс).
- Автовыбор уровня модели в GitHub Copilot — три режима (эффективность, баланс, интеллект) вместо ручного переключения (анонс); там же появился режим
/askпрямо во время работы агента (детали). - Deep Research в Gemini Live — голосовой запуск асинхронного исследования с последующим обсуждением готового отчёта в чате (анонс Google). Промпты под такие сценарии — в библиотеке промптов AI SKILLS.
Коротко
- Arcee запустила Forge вместе с Bolt: пользователи Bolt Pro получают в 50 раз больший лимит на открытых моделях в обмен на обезличенные данные сессий разработки, веса обещаны к публикации (анонс).
- Inferact и Google Cloud делают TPU полноценным гражданином vLLM: продакшн-сервинг, оптимизированные ядра и нативный путь через TorchTPU (анонс).
- RewardAI представила OM-1 — базовую модель робота, обученную на данных человеческих манипуляций, а не на телеоперации, с заявкой на zero-shot перенос между настольными, промышленными и человекоподобными роботами (анонс).
- Google DeepMind применила WeatherNext 3 к планированию возобновляемой энергетики: почасовые прогнозы ветра на высоте турбины и солнечной радиации (анонс).
- NVIDIA вывела RTX PRO 5500 Blackwell с 84 ГБ ECC GDDR7 и пропускной способностью памяти 1398 ГБ/с (обсуждение).
- Good Start Labs превращает игры в тренировочный материал для моделей — интервью основателя Алекса Даффи о том, почему игра оказалась удобной средой обучения (Latent Space).