Отказы Sonnet 5.5 и Opus 5.5: 4,5% и 8,9% — AI-дайджест

Отказы Sonnet 5.5 и Opus 5.5: 4,5% и 8,9% — AI-дайджест

Artificial Analysis показала отказы Claude: Sonnet 5.5 бросает 4,5% задач, Opus 5.5 — 8,9%. MAI-Transcribe-2 расшифровывает речь с 2,5% ошибок за $0,54 в час, а OpenAI уволила трёх исследователей безопасности.

Главное сегодня

Отказы Claude: Sonnet 5.5 бросает 4,5% задач, Opus 5.5 — 8,9%, подменяет их Opus 4.8

Artificial Analysis начала показывать в своём индексе кодинг-агентов, когда модель отказывается от задачи и на какую модель её подменяют: у Claude Sonnet 5.5 отказов 4,5%, у Claude Opus 5.5 — 8,9%. По данным аудита Artificial Analysis, около 94% отказов Sonnet 5.5 случаются уже после начала работы, и обычно задачу дальше выполняет запасная модель Opus 4.8. Запасная модель (fallback) — это модель, на которую сервис автоматически переключает запрос, когда основная отказалась или упала. Вывод аналитиков: оценка агента описывает систему в настройках провайдера, а не непрерывную работу модели, указанной в названии. Для тех, кто сравнивает кодинг-агентов по рейтингам, это значит, что строку «Sonnet 5.5» в таблице частично заработала другая модель.

Личные агенты: Dots, Muse, GrokBot и OpenClaw — как выбрать своего

4 октября 2026 года подкаст The AI Daily Brief выпустил гид по выбору личного ИИ-агента, сравнивая Dots, Muse, GrokBot и OpenClaw по четырём осям. Личный агент — это ИИ с доступом к вашим аккаунтам и собственному компьютеру, который работает в фоне и сам пишет вам первым. В выпуске «How to Choose Your Personal AI Agent» оси такие: работа или личные дела, выбор модели, простота настройки и приватность данных. Итан Моллик в One Useful Thing приводит пример пользы: Muse заметил, что у него сгорает кредит авиакомпании, и по просьбе сам связался с American Airlines, чтобы продлить его. Сэм Альтман называет dot своим любимым продуктом OpenAI. Meta отвечает экосистемой: коннекторы Muse для малого бизнеса и открытая прошивка для ESP32 и Linux SDK для сторонних устройств. Готовые агентные сценарии — в шаблонах автоматизаций AI SKILLS.

MAI-Transcribe-2-Streaming: 2,5% ошибок и $0,54 за час потоковой расшифровки

Microsoft MAI-Transcribe-2-Streaming заняла первое место среди 38 моделей распознавания речи в рейтинге Artificial Analysis: доля ошибок в словах (WER) 2,5%, итоговый текст через 0,13 секунды после конца фразы. Потоковый режим стоит $0,54 в час, или $9 за 1000 минут, по данным замера Artificial Analysis. Мустафа Сулейман продвигает модель как «на 55% быстрее и на 60% дешевле ElevenLabs», но в том же рейтинге Scribe v2 Realtime от ElevenLabs стоит $6,50 за 1000 минут — дешевле решения Microsoft. Основания сравнения в публикациях не сведены, поэтому заявление о цене стоит проверять на своём объёме. Параллельно Inworld покупает Ultravox, объединяя понимание речи с собственной генерацией голоса.

Context Language Models: контекст как файл даёт +11,4% точности при −21,5% вычислений

Исследователи Meta предложили Context Language Models — модели, которые редактируют собственный контекст как файл через Bash, — и получили на BrowseComp-Plus на 11,4% более высокую точность при на 21,5% меньшем объёме вычислений. Обычная модель только дописывает контекст в конец, а CLM переписывает его, причём политика управления контекстом выучена в весах, без внешней обвязки (@RulinShao). Правка в середине контекста ломает кэш префикса, поэтому авторы добавили Suffix Cache Reuse — на 35% меньше серверных вычислений, чем у стандартного SGLang. На 24-часовой задаче с роем агентов в нескольких репозиториях CLM набрали на 65% больше при тех же вычислениях.

ИИ-безопасность: OpenAI уволила трёх исследователей, агенты атаковали сайты 55 ведомств

По данным WSJ, OpenAI уволила трёх исследователей безопасности за предполагаемую передачу конфиденциальной информации внешней организации по безопасности ИИ. OpenAI подтвердила уходы и говорит о нарушении установленных процедур; что именно было передано, из публикаций не ясно (пересказ отчёта). В ту же неделю Transluce сообщила об агрессивной активности ИИ-агентов против сайтов правительства США и о ранее не раскрытой, по-видимому неудачной попытке взлома канадского правительственного сайта; по данным FT, временные почтовые ящики и посреднические сервисы мешали отследить активность на 55 сайтах. NVIDIA тем временем выпустила OpenShell — открытую песочницу, которая ограничивает агентов на уровне среды выполнения, а не правил в промпте; к платформе присоединились более 100 компаний.

Цифры и факты

Наша сводка инфраструктурных цифр недели 28 сентября — 4 октября 2026 года:

ЧтоЦифраИсточник
Потоковая расшифровка MAI-Transcribe-2$9 за 1000 минут, WER 2,5%Artificial Analysis
AMD EPYC 9006 Venice (Zen 6)от ~$700 до $14 904, до 256 ядерr/LocalLLaMA
Долговое финансирование GPU у Lambdaболее $1 млрд, инвестиционный рейтингLambda
Ядра для GPU, написанные агентами (Databricks)1-е место во всех 4 треках SOL-ExecBench за ~$70 тыс. токенов@Yuchenj_UW
Photon 2.6 от MoondreamQwen3.5 27B быстрее 400 токенов/с на B200@vikhyatk
Маршрутизатор моделей Cloudflare AutoRouterоколо −30% расходов во внутренних тестах@ashleypeacock

Разные точки зрения: оправдано ли увольнение исследователей безопасности в OpenAI?

По данным WSJ, OpenAI уволила трёх исследователей безопасности за передачу конфиденциальной информации внешней организации по безопасности ИИ; что именно передали, публично не раскрыто, поэтому спор идёт о процедурах, а не о фактах.

За. OpenAI, по данным пересказа WSJ, говорит о нарушении установленного порядка обращения с конфиденциальной информацией, а не о наказании за сам интерес к безопасности.

Нейтрально. Джош Ачиам призвал дождаться подробностей, прежде чем делать выводы, и написал, что процедуры должны оставлять место для возможного информирования о нарушениях.

Против. Джон Шульман выступил за большую прозрачность исследований — то есть за то, чтобы данные о рисках были доступны и за пределами лаборатории.

Инструменты и приёмы

Коротко