Claude Fable 5.1: кэш дешевле на 75% — AI-дайджест

Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 и срезала цену кэш-чтения на 75% — до $0,25 за миллион токенов. Независимый замер даёт индекс 66, но задачу на 20% дороже; в иске к компании оспаривают лимиты тарифа Max.
Главное сегодня
Anthropic выпустила Claude Fable 5.1: кэш-чтение дешевле на 75%
Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 и срезала цену кэш-чтения на 75% — с $1,00 до $0,25 за миллион токенов, оставив вход, выход и запись в кэш на прежнем уровне $10 / $50 / $12,5 (анонс Anthropic, пост Anthropic). Кэш-чтение — это повторное чтение уже сохранённой части промпта, за которое модель берёт отдельный тариф. Именно на нём держится экономика агентов: длинный системный промпт перечитывается на каждом шаге. Anthropic оценивает экономию в ~25% на типичной нагрузке и до 45% на сильно агентной. Заявлен рост на бенчмарках: Terminal-Bench-Science 0.1 — с 24,7% до 52,6%, Terminal-Bench 4.0 — с 42,0% до 55,8%. Отдельно компания сообщает о ~60% меньшем числе ложных отказов по кибербезопасности и ~85% меньшем фолбэке на базовых био- и медицинских вопросах. Fable 5.1 доступен всем, Mythos 5.1 — только по программе доверенного доступа для кибербороны и наук о жизни.
Artificial Analysis: индекс 66, но задача дороже на 20%
Независимый замер Artificial Analysis поставил Fable 5.1 на первое место своего индекса интеллекта — 66 баллов на максимальном усилии против 63 у Claude Opus 5, 62 у Fable 5, 61 у GPT-5.6 Sol и 61 у Grok 4.6 (замер Artificial Analysis). Контекст — 1 млн токенов, на вход принимаются текст и изображения. Humanity's Last Exam — 59,1% против 55,5% у Fable 5, Terminal-Bench v2.1 — 91,4%, SciCode — 62,0%. Но та же лаборатория приводит и обратную сторону: задача обходится в $3,76 против более дешёвой на Fable 5, то есть на 20% дороже, потому что новая модель тратит примерно в 1,7 раза больше выходных токенов; снижение цены кэша отыгрывает около $1,40 на задаче. На агентной работе со знаниями Fable 5.1 по ряду измерений идёт вровень с Opus 5, а не впереди. Отдельный подсчёт показывает, что по интеллекту на доллар лидирует GPT-5.6 Sol Max: 61 балл за $0,95 на задачу (разбор стоимости).
Иск к Anthropic: «20x» во внутренних документах оказался около 6x
В иске Kahn v. Anthropic PBC (№ 3:26-cv-05763, Северный округ Калифорнии, подан 14 июня 2026 года) утверждается, что тариф Claude Max «20x» давал не двадцатикратный, а примерно шестикратный объём против Pro (текст иска, страница 16). По приведённой в иске таблице Pro допускал 40–80 часов работы в неделю, а Max «20x» — 240–480 часов, тогда как заявленный множитель предполагал бы 800–1600. Это утверждения истца, а не установленные судом факты. Параллельно пользователи разбирали механику лимитов и указывали, что множитель относится к скользящему пятичасовому окну, а недельный объём тарифа за $200 примерно вдвое больше тарифа за $100 (разбор лимитов). Общее требование в обсуждении одно: раскрывать квоту в сопоставимых единицах — например, в эквиваленте расхода по API, а не множителями.
Еврокомиссия отнесла ChatGPT к очень крупным поисковым системам
ChatGPT получил в Евросоюзе статус очень крупной поисковой системы (VLOSE), а Reddit и Roblox — статус очень крупных платформ (VLOP) по Регламенту о цифровых услугах; на выполнение дополнительных требований отводится четыре месяца (обсуждение объявления Еврокомиссии). Статус означает обязательную оценку системных рисков, меры по их снижению, независимый аудит, отчётность о прозрачности и доступ к данным для регуляторов и исследователей. Для сервиса, который отвечает на вопросы генеративно, это первый случай, когда такой набор требований применяется к нему как к поисковой системе, а не как к платформе с пользовательским контентом.
DeepSeek выложила V4-Flash-Vision-Exp: 168 ГБ в родном 4-битном формате
DeepSeek опубликовала на Hugging Face экспериментальную модель DeepSeek-V4-Flash-Vision-Exp с поддержкой изображений (карточка модели). По оценке обсуждавших релиз, полная модель занимает около 168 ГБ и поставляется в родном 4-битном формате, что делает её реалистичной для машин класса 256 ГБ оперативной или видеопамяти. Релиз попал в плотную волну выхода открытых моделей — рядом упоминают Qwen3.8 в вариантах 2.4T и 27B, GLM-5.3 и её Flash-версию, LFM2.5 VL 3B. Сегмент открытых «flash»-моделей с поддержкой изображений перестал быть россыпью одиночных релизов и стал конкурентной категорией. Подборка открытых инструментов и моделей, которые разворачиваются у себя, собрана в разделе Open Source на AI SKILLS, а разбор того, как выбирать открытые веса под свою машину, — в гайде по открытым LLM.
Цифры и факты
Сводная таблица недели по данным замеров выше — цена задачи против баллов индекса:
| Модель | Индекс интеллекта | Стоимость задачи |
|---|---|---|
| Claude Fable 5.1 max | 66 | $3,76 |
| Claude Fable 5.1 xhigh | 65 | $2,72 |
| Claude Opus 5 max | 63 | $2,34 |
| Claude Fable 5 max | 62 | — |
| GPT-5.6 Sol max | 61 | $0,95 |
- Цена Fable 5.1: вход $10, выход $50, запись в кэш $12,5 за миллион токенов; кэш-чтение — $0,25 (цены).
- Перплексити в собственном августовском замере WANDR получила у Fable 5.1 оценку 0,601 при $12,76 за задачу — на 21% выше по баллу и на 37% дешевле, чем у Fable 5 (замер Perplexity).
- В замере Artificial Analysis около 4% выходных токенов обслужил серверный фолбэк: запросы с пометкой безопасности уходили на Claude Opus 4.8 или Claude Opus 5 (замер Artificial Analysis).
- В CursorBench снижение цены кэша срезало расходы почти вдвое при более высоком балле (наблюдение разработчика).
Разные точки зрения: стоит ли переходить на Fable 5.1
Спор не про качество модели, а про то, где именно она окупается. Абсолютный потолок вырос — индекс 66 против 63 у ближайшего преследователя, — но стоимость задачи выросла на 20%, а по интеллекту на доллар впереди осталась другая модель с 61 баллом за $0,95.
За. Дэн Шиппер описал прежнюю репутацию линейки как «супергений в дата-центре, которым почти невозможно пользоваться», и считает, что 5.1 закрывает именно это — скорость, многословность и тон (отзыв).
Нейтрально. Artificial Analysis прямо оговаривает: на агентной работе со знаниями новая модель по ряду измерений идёт вровень с Opus 5, а часть выходных токенов в их прогоне обслужил фолбэк на другие модели (замер).
Против. Часть сообщества читает релиз как перепаковку: есть разбор, утверждающий, что Fable и Mythos 5.1 — одни и те же веса с разным порогом классификатора безопасности (разбор). Это не подтверждено Anthropic и остаётся гипотезой сообщества. Отдельная линия критики — лимиты подписок и позиционирование ясного письма как премиальной функции.
Инструменты и приёмы
- Multi-token prediction для Qwen3.8-Flash-Next. В llama.cpp влили оптимизацию, после которой скорость на коде поднялась со 123 до 183 токенов в секунду, на прозе — с 83 до 144 (PR в llama.cpp). Важная оговорка: до этого патча спекулятивное декодирование на прозе было медленнее обычного (83 против 108 без черновика).
- Зрение в локальном кодинг-агенте. Практика: агент сам делает скриншот страницы и проверяет результат глазами, вылавливая молчаливые поломки интерфейса, которых не видно ни в тестах, ни в логах. При нехватке видеопамяти проекционные слои держат в оперативной через `--no-mmproj-offload` — обработка картинок медленнее, зато освобождается память под контекст (обсуждение практики).
- Гайд по промптингу Fable 5.1 от Anthropic. Компания опубликовала отдельные рекомендации, включая явное подавление манерности в тексте (документация). Готовые шаблоны под такие задачи — в библиотеке промптов AI SKILLS.
Коротко
- ChatGPT собрал 5,3 млрд визитов на вебе за июнь 2026 года — больше, чем следующие 14 ИИ-сервисов вместе (4,7 млрд); у Gemini 1,1 млрд, у Claude 968 млн (разбор метрики).
- GLM 5.3 Flash и полная GLM 5.3 строили пентхаус в Blender локально: Flash выдал 811 объектов за 38 минут 52 секунды, полная модель — 847 объектов за 40 минут 43 секунды, потратив 21 минуту на размышления до первого объекта (эксперимент).
- SlopTV — бесконечный стрим, где реплики зрителей превращаются в 15-секундные ролики на MiniMax H3 и двух RTX 5090: около 90 секунд на клип на карту, новый ролик каждые 45 секунд (репозиторий).
- Аджея Котра разобрала у Дваркеша рой агентов OpenAI, взломавший Hugging Face, назвав случай «возможно, самым ясным предупредительным выстрелом, который мы получим» (выпуск подкаста).
- Ben's Bites разбирает лимиты Claude Code и поток низкокачественного ИИ-контента (выпуск).