Открытый Jev за двое суток: 90% против 93% — AI-дайджест

Открытый Jev за двое суток: 90% против 93% — AI-дайджест

Решающая модель Jev получила открытые копии за двое суток: Bespoke Nimble на Qwen3.5-9B даёт 90% против 93% у оригинала. Claude Code начал читать AGENTS.md, а Anthropic и Accenture вкладывают от миллиарда долларов в независимую оценку моделей.

Главное сегодня

Открытые копии Jev вышли через двое суток после анонса

Решающая модель Jev, показанная 15 сентября 2026 года, получила открытые воспроизведения за двое суток. Bespoke Nimble — «открытый Jev», собранный дообучением LoRA поверх Qwen3.5-9B на синтетических контрастных данных с ограниченным декодированием: на кураторском наборе базовая Qwen выросла с 66% до 90% против 93% у самого Jev, при 100 мс на H100 и возможности запуска локально (анонс Bespoke). На другом конце — Kev-0.5B на базе Qwen2.5-0.5B, который работает на макбуке (анонс). Одновременно Jev появился как модель оценки в Braintrust с заявленной в 400 раз меньшей стоимостью скоринга (Анкур Гоял). Скорость воспроизведения показывает, что дело не в весах, а в постановке задачи: класс «дискриминативная модель вместо генеративной» повторяется на открытых базах почти сразу.

Claude Code начал читать AGENTS.md — конвенция стала стандартом

Claude Code версии 2.1.277 теперь ищет файл AGENTS.md, если в проекте нет CLAUDE.md, с переключателем на уровне конфигурации (анонс разработчиков). AGENTS.md — это файл с инструкцией для кодинг-агента в корне репозитория: что за проект, как его собирать, какие правила соблюдать. Значение шага не техническое, а отраслевое: формат, который до сих пор поддерживали одни инструменты и игнорировали другие, признан общим. Практическая выгода видна сразу — исчезает нужда в файлах-переходниках, которые просто ссылались с одного формата на другой (Саймон Уиллисон). Для команд, ведущих несколько агентов параллельно, это означает одну инструкцию вместо трёх копий с расхождениями.

Anthropic и Accenture вложат не меньше миллиарда долларов в независимую оценку моделей

Anthropic объявила партнёрство с Accenture по независимой оценке фронтир-моделей: стороны рассчитывают вложить не менее 1 млрд долларов за пять лет, чтобы построить мощности для такой проверки (анонс Anthropic). Это продолжение спора о внешнем надзоре, который идёт с 14 сентября, и первая заявка такого масштаба. Реакция оказалась от сдержанной до враждебной: критики сомневаются, что консалтинговая фирма — подходящий носитель для ред-тиминга моделей и оценки защитных мер, а Transluce напоминает, что вопрос не в объёме вложений, а в условиях независимости и реального доступа (позиция Transluce). Параллельно давление идёт и со стороны регулятора: губернатор Калифорнии подписал указ о созыве экспертной панели для подготовки более жёстких законов о безопасности ИИ, включая возможные аварийные выключатели и встроенных внешних наблюдателей (The Rundown).

Команды разносят модели по ролям: фронтир на план, дешёвая на исполнение

Практики описывают одну и ту же схему сборки: сильная модель планирует, дешёвая исполняет. Один из стеков — GPT 5.6 Sol XHigh на планирование, GLM 5.3 Flash на реализацию, DeepSeek V4.1 Flash на остальное (разбор Ахмада Османа). Экономика такого перехода измерима: внутренний конвейер базы знаний прошёл путь Opus → Sonnet → GLM 5.2 → GLM 5.3 Flash и урезал расходы примерно на два порядка с весны (Кайл Расселл). Цена верхней планки при этом видна на конкретных цифрах: у GPT-6 Astra режим повышенного усилия поднял детекцию с 82,1% до 83,6% mAP@50, но примерно удвоил стоимость кадра — с $0,050 до $0,101 — и поднял задержку с 11 до 32 секунд (замер Roboflow). Полтора пункта за двойную цену — ровно тот размен, из-за которого модели и разносят по ролям.

Цифры и факты

Разные точки зрения: Jev — новый примитив или переоткрытие классификаторов

Спор идёт не о цифрах, а о том, новое ли это вообще. Разброс за 18 сентября 2026 года уложился в три позиции, и он заметно разделил людей по стажу в машинном обучении.

Это архитектурный сдвиг. Ханьсяо Сяо считает, что Jev способен утянуть вызов инструментов, маршрутизацию и решения уровня MCP обратно от маленьких генеративных моделей к дискриминативным (позиция). Развитие той же мысли — слой суждений с почти нулевой предельной стоимостью прямо на устройстве: уведомления, адаптация интерфейса, решения по датчикам (продолжение).

Это зависит от того, откуда вы пришли. Михаил Парахин отметил раскол: пришедшие в тему после ChatGPT восприняли Jev как откровение, а те, кто занимался машинным обучением до него, скорее недоумевают по поводу ажиотажа (наблюдение).

Демонстрации пока про скорость, а не про качество. Самое существенное возражение: почти все показы упирают на быстродействие, а стандартного бенчмарка для этого класса моделей до сих пор нет — сравнивать не с чем (возражение).

Инструменты и приёмы

Коротко