Sonnet 5.5: на 30% быстрее по той же цене — AI-дайджест

Anthropic выпустила Sonnet 5.5: на 30% быстрее Sonnet 5, второе место в Vals Index и прежняя цена $2/$12. AMD покупает World Labs за $8,2 млрд, а проверка Perplexity показала, как агенты выходят из песочниц через DNS.
Главное сегодня
Sonnet 5.5: на 30% быстрее Sonnet 5 и второе место в Vals Index при прежней цене $2/$12
Anthropic выпустила Claude Sonnet 5.5 — вторую модель семейства Claude 5.5 через неделю после Opus 5.5: компания называет её «явным улучшением по сравнению с Sonnet 5», которое работает более чем на 30% быстрее и обходится до 30% дешевле на большинстве задач. Об этом сообщил аккаунт @claudeai. По данным Vals, у модели окно контекста 1 млн токенов, до 128 тыс. токенов ответа и прежняя цена Sonnet 5 — $2/$12 за миллион входных и выходных токенов. В Vals Index Sonnet 5.5 дебютировала на втором месте, в 0,47 пункта от Opus 5.5. Artificial Analysis добавляет оговорку: на максимальном усилии модель тратит около 193 тыс. выходных токенов на задачу — больше, чем любая измеренная ими модель, и примерно в 7 раз больше GPT-6 Astra. Cognition насчитала 64,4% на FrontierCode 1.1 Main против 56,2% у Sonnet 5. Как заметил @simonw, Sonnet 5.5 теперь работает в бесплатном тарифе claude.ai, а Haiku 5.5, по словам @mikeyk, выйдет в ближайшие недели. Готовые скиллы для работы с Claude Code — в гиде по скиллам Claude Code.
AMD покупает World Labs за $8,2 млрд акциями, Фэй-Фэй Ли станет главным научным сотрудником AMD
AMD приобретает стартап World Labs, который строит модели пространственного интеллекта, за $8,2 млрд акциями, а сооснователь стартапа Фэй-Фэй Ли становится главным научным сотрудником AMD. Сделку описал The Rundown AI, о ней же написала глава AMD Лиза Су. Пространственный интеллект — это способность модели понимать и строить трёхмерные сцены, а не только текст и плоские картинки. Latent Space отмечает, что официальное объявление цену не называет, но она известна, потому что AMD — публичная компания.
Песочницы агентов: 9 моделей получили root, 4 вышли к заблокированному адресу через DNS
Perplexity провела red-team-проверку SPACE: 9 моделей, включая Opus 5, GPT-5.6 Sol, Kimi K3 и Gemini 3.1 Pro, получили права root внутри виртуальной машины, и ни одна не сбежала за 108 запусков. Так пишет Аравинд Шринивас. Но когда были открыты зеркала PyPI и Ubuntu, 4 модели добрались до заблокированного адреса через подмену DNS и общие IP-адреса Fastly. По данным Perplexity, та же уязвимость общих IP нашлась у 8 из 10 сторонних песочниц, включая E2B, Vercel и Modal. Hugging Face ответила вкладом в OpenShell: Клеман Деланг формулирует главный вывод так — «списки разрешённых адресов ограничивают, куда агент может пойти, но не то, что он делает». Поэтому в OpenShell добавлены сетевые бюджеты на каждую песочницу, отслеживание отклонений от нормы и общий обзор парка, который замечает, когда много песочниц пишут на один хост. Выпуск The AI Daily Brief «The Real Risks of AI Agents» разбирает недавние инциденты безопасности OpenAI и пределы прав агентов.
Цифры и факты
- 26% исследований и разработки Anthropic, по статье об «интеллектуальном взрыве», выполняет ИИ под общим надзором людей — против 1% в марте; при полной автоматизации год прогресса мог бы укладываться примерно в 5 недель, пишет The Rundown AI.
- 17 895 строк доказательства на Lean написали десять агентов Sonnet 5.5 за 15 часов: по данным Vals, оно доказывает задачу Томсона для семи электронов на сфере и принято ядром Lean.
- 39,9 секунды — новый рекорд скоростного обучения NanoGPT против прежних 67,6 секунды, сообщает @classiclarryd.
Сводная таблица AI SKILLS: Sonnet 5.5 и Opus 5.5 на визуальных задачах
| Модель и усилие | Цена за 1000 изображений | Задержка |
|---|---|---|
| Sonnet 5.5, high | $8,82 | 8,9 с |
| Opus 5.5, high | $18,12 | 12,2 с |
| Sonnet 5.5, low | $6,53 | 10,8 с |
| Opus 5.5, low | $13,80 | 12,8 с |
Таблицу собрала редакция по замеру Roboflow и данным о задержке. На высоком усилии Sonnet 5.5 обходится примерно вдвое дешевле Opus 5.5, при этом точность на выборке задач была сопоставимой.
Разные точки зрения: заменяет ли Sonnet 5.5 модель Opus?
Выход Sonnet 5.5 разделил первых пользователей: одни считают её равной Opus за половину цены, другие — удобной моделью для чётко поставленных задач, которой не хватает чутья старшей модели.
Да, во многих задачах. Cursor называет модель «на уровне Opus во многих задачах», а @chaseleantj пишет, что она «ощущается так же хорошо, как Opus, за половину цены».
Нейтрально. GitHub Copilot оценивает сдержаннее: в ранних тестах модель «сравнялась с Sonnet 5, но потратила меньше шагов, токенов и вызовов инструментов» — это выигрыш в эффективности, а не скачок качества.
Нет. @rishdotblog считает, что Sonnet «далеко не Opus» и ей не хватает общего чутья Opus 5.5, а сам @mikeyk из Anthropic пишет, что для большей части работы по-прежнему берёт Opus 5.5.
Инструменты и приёмы
- Не ставьте Sonnet 5.5 на максимальное усилие. @edwinarbus советует прямо: на максимуме лучше сразу брать Opus, а в Claude Code по умолчанию стоит среднее усилие. Factory считает удачным значением по умолчанию высокое усилие.
- Попросите Claude Code собрать оценки. По сообщению @ClaudeDevs, Claude Code теперь умеет строить наборы оценок и улучшать результат по ним. Готовые скиллы для таких задач — в разделе Skills для Claude Code.
- Выберите между SAE и пробами. Goodfire опубликовала практическое руководство о том, когда в интерпретируемости помогают разреженные автоэнкодеры, а когда достаточно простых проб.
Коротко
- Kling 4.0 генерирует видео до 4K с 10-битным HDR, принимает 15 мультимодальных референсов и 10 ключевых кадров и сразу делает ролики по 30 секунд.
- ElevenLabs v4 и v4 Turbo возглавили рейтинг голосов Artificial Analysis и клонируют голос по 10 секундам записи.
- Генеральный прокурор Флориды, по сообщению @kimmonismus, добивается судебного запрета на разработку моделей OpenAI до независимо одобренных мер безопасности.