Opus 5.5 собрал ролик из кода за $4 — AI-дайджест

Opus 5.5 собрал ролик из кода за $4 — AI-дайджест

Claude Opus 5.5 собирает ролики целиком из кода — один обошёлся примерно в $4. TypeSafe привлекает больше $1 млрд при оценке $10 млрд за модель-судью Jev, Gemini 3.8 Flash набрала 89,2% на ARC-AGI-2, а Perplexity снизила задержку поиска с 800 до 65 мс.

Главное сегодня

Claude Opus 5.5 собирает видео целиком из кода: ролик за $4 и остров за 8 часов

Claude Opus 5.5 за двое суток после релиза стал инструментом для видео: пользователи собирают ролики, где сценарий, графика, анимация и озвучка написаны кодом без единого кадра от видеомодели. Автор поста на r/ClaudeAI получил 30–60-секундный ролик за 1 час 20 минут: около $20 на Opus и $3,21 на внешние API через OpenRouter. Другой пользователь повторил тот же промпт для своего проекта и уложился примерно в $4 за 1,5–2 часа. Дэн Гринхек за 8 часов собрал интерактивный остров TideWater с птицами, рыбами и лодкой — и потратил $1874 в токенах, 59% недельного лимита Max. Самый популярный пост дня — ролик Claude о западной цивилизации (30,6 тыс. взаимодействий). Под такими примерами уже спорят, нужна ли вообще диффузия для роликов такого типа.

TypeSafe привлекает $1 млрд при оценке $10 млрд: Jev-судья в 277 раз дешевле GPT-6

Стартап TypeSafe, по данным журналистки Стефани Палаццоло, привлекает больше $1 млрд при оценке выше $10 млрд — через неделю после раунда на $200 млн. Jev — это модель «системы один»: она не пишет рассуждения, а возвращает типизированное решение с вероятностью. В статье Jev-as-a-Judge судья на Jev стоит $0,044 за 1000 оценок при медианной задержке 152 мс — примерно в 277 раз дешевле GPT-6. На RewardBench и HaluEval Jev отстаёт от GPT-6 не больше чем на 3 пункта, на JudgeBench — на 14,5. Каскад, который отдаёт неуверенные случаи GPT-6 Astra, сохраняет 99% точности при 57% стоимости. Ramp сообщает, что повторила точность переранжирования GPT-5.6 Luna с задержкой хвоста 300 мс, в 10 раз ниже, и втрое дешевле. The AI Daily Brief разобрал шесть категорий реальных сценариев Jev — от анализа рекламных кампаний до разбора входящей почты.

Gemini 3.8 Flash: 89,2% на ARC-AGI-2 по $0,40 за задачу

Google Gemini 3.8 Flash набрала 89,2% на ARC-AGI-2 при стоимости $0,40 за задачу и 98,5% на первой версии теста. На ARC-AGI-3 картина скромнее: 10,4% со стандартным харнесом и 35% с харнесом самой Google. Харнес — это обвязка вокруг модели: инструменты, подсказки и цикл выполнения агента; разница в 3,4 раза показывает, сколько результата на новых задачах даёт именно она. По индексу Artificial Analysis Gemini 3.8 Flash получила 41 балл при скорости 291 токен в секунду и контексте в 1 млн токенов, а в Cline модель сейчас доступна бесплатно.

Perplexity Photon: задержка p99 упала с 800 до 65 мс, движок написали сотни агентов

Perplexity выпустила Photon — движок поиска и ранжирования на Rust, который небольшая команда и сотни агентов собрали примерно за $300 тыс. в токенах. По данным компании, внутренняя задержка p99 упала с ~800 до ~65 мс на 20% меньшем числе машин при 2,5-кратном росте данных на документ. Поверх движка работает Fast Search API: 160 мс по медиане, 230 мс на 95-м перцентиле и на 68% ниже стоимость задачи. Nous Research сделала его бесплатным в Hermes Agent, а в Shopify, по словам Михаила Парахина, API стал основным поисковым. Отчёт Perplexity редкий тем, что называет и цену работы агентов, и измеренный выигрыш в продакшене.

Цифры и факты

Сводная таблица AI SKILLS: цена решения задачи, 24 сентября 2026 года

МодельЧто измереноЦена
Jev (TypeSafe)1000 оценок в роли судьи$0,044
Xiaomi MiMo-V2.6-Proзадача индекса AA$0,13
Gemini 3.8 Flashзадача ARC-AGI-2$0,40
GPT-6 Luna [Max]1 млн токенов, смешанная цена~$0,40
Grok 4.7задача Agent Arena$1,14

Таблицу собрала редакция по первоисточникам выше; единицы разные, поэтому сравнивать строки напрямую нельзя — они показывают порядок цен. Luna Max вошла в Code Arena WebDev на 24-е место (1593 балла), Grok 4.7 — на 16-е место Agent Arena.

Разные точки зрения: Jev — новый класс моделей или хорошо упакованный классификатор?

Jev действительно дешёвый и быстрый, но спор идёт о том, чем его считать: на задаче Banking77 простая связка BGE-small и логистической регрессии, по данным независимого замера, дала 93,3% против 83,2% у Jev. От ответа зависит, с чем Jev сравнивать — с LLM или с классическими классификаторами.

За. Инвесторы оценивают TypeSafe в $10 млрд, а Jev доказал 140 теорем Software Foundations меньше чем за $1 — примерно в 130 раз дешевле Astra. Jev — лучшая модель на OpenRouter для контекста 1–10 тыс. токенов.

Нейтрально. Сторонники CLM предлагают открытую замену: CLM примерно в 9 раз быстрее Jev как верификатор длинных задач, но уступает в «широких» задачах без обучения: 95,2% против 99,2% на BFCL v4.

Против. Автор разбора на r/LocalLLaMA считает Jev стандартной классификацией с выбором из фиксированных меток, а обещание «0% галлюцинаций» — гарантией только формата ответа, не его правильности. Сравнивать Jev, по его мнению, нужно с эмбеддинг-моделями и кросс-энкодерами, а не с генерацией JSON на LLM.

Инструменты и приёмы

Коротко