Ornith-1.5 вышла под лицензией MIT — AI-дайджест

Ornith-1.5 вышла под лицензией MIT — AI-дайджест

День обвязок и открытых весов: вышла MIT-лицензированная линейка Ornith-1.5 с заявкой на самообучение, открытая обвязка TrueForge показала экономию 30% токенов против управляемых агентов на Opus 4.8, Gemini 3.7 Flash забрала первое место в аналитическом бенчмарке, а разбор десяти рабочих агентов показал: половина задержки живёт вне модели.

Главное сегодня

Вышла Ornith-1.5: MIT-лицензия, три размера и 86,1 на Terminal-Bench 2.1

Команда Ornith выпустила линейку Ornith-1.5 под лицензией MIT — плотную модель на 9 млрд параметров и две MoE на 35 и 397 млрд, сразу в форматах FP8, GGUF, MLX и NVFP4 (анонс). Заявленные результаты сосредоточены на агентских и кодовых задачах: 86,1 на Terminal-Bench 2.1, 86 на SWE-Bench Verified, 56 на DeepSWE, 44,6 на Humanity's Last Exam и 71,2 на Tool Decathlon. Главное же заявление — конвейер самоулучшения: модель сама придумывает задачи, собирает под них обвязку и генерирует прогоны обучения с подкреплением, из которых получается новый обучающий опыт. Проверить это утверждение по одному посту нельзя, а вот доступность проверяется сразу: поддержку добавили в vLLM и в Ollama в тот же день. Свежие открытые модели и способы их запуска мы собираем в разделе Open Source.

TrueForge: открытая обвязка агентов экономит 30% токенов, а маршрутизация — 75% денег

TrueFoundry открыла TrueForge — самохостируемую обвязку для боевых агентов под лицензией MIT, и подкрепила её цифрами: на бенчмарке из 14 корпоративных задач она повторила результат управляемых агентов Claude на Opus 4.8, потратив примерно на 30% меньше токенов, а перевод части задач на GLM-5.2 срезал стоимость ещё примерно на 75% без потери точности (анонс TrueFoundry, разбор @omarsar0). Обвязка — это слой вокруг модели: сессии, память, инструменты, песочницы, подтверждения человеком и трассировка. Там же виден и второй подход: DeepSeek Harness сделан нарочито тонким, где плагином является всё, включая сам цикл агента, — за неделю беты пользователи выпустили больше 100 плагинов. Вывод дня для тех, кто считает деньги: экономику агента определяет не только выбор модели, но и то, что происходит между её вызовами.

Gemini 3.7 Flash заняла первое место в AA-AnalystAgent при $0,54 за задачу

Gemini 3.7 Flash вышла на первое место в бенчмарке Artificial Analysis AA-AnalystAgent: 60,0% pass^5, 70,5% pass@1 и 77,5% pass@5 на 80 задачах с таблицами и документами, при 1,32 секунды и $0,54 в среднем на задачу (разбор @_philschmid, анонс Google). Метрика pass^5 строже привычной: она требует, чтобы модель решила задачу во всех пяти попытках, то есть меряет не удачу, а повторяемость — ровно то, что нужно для рабочих отчётов. Google в тот же день двинула модель в продукты: чат Gemini и Spark, интерактивные симуляции, собираемые на лету в поиске, и синхронизацию AI Studio с GitHub.

Половина задержки боевых агентов живёт вне модели

Исследование десяти работающих агентских приложений показало, что в половине из них основную задержку дают не вызовы модели, а всё остальное — песочницы, инструменты, хранение состояния (изложение DAIR.AI). Цифры измеримые: пиковая память песочницы доходит до 28 ГБ на сессию, разброс задержки между подсистемами достигает 32 раз, а состояние подолгу висит в памяти между шагами. Три приёма дают основной выигрыш: планирование обслуживания под тип задачи снимает 29–40% задержки, выгрузка состояния уменьшает потребление памяти в 4,6 раза, а кэш результатов инструментов убирает 35,2% повторных поисковых вызовов. Практический смысл: прежде чем менять модель на более быструю, стоит замерить, сколько времени агент вообще проводит внутри модели.

Anthropic: выручка $11,6 млрд и небольшая операционная прибыль

Выручка Anthropic более чем удвоилась и достигла $11,6 млрд, компания вышла в небольшую операционную прибыль — со ссылкой на WSJ это разошлось в обсуждениях 19–20 августа 2026 года. Цифра важна не сама по себе, а тем, что спорит с привычной картиной «ИИ-лаборатории жгут деньги»: у компании с платными разработчиками и корпоративными контрактами экономика может сходиться уже сейчас. Осторожность здесь уместна: это пересказ публикации деловой газеты, а не отчётность компании, и сравнение с квартальными цифрами конкурента в обсуждении сделано вольно. Отдельная линия в том же обсуждении — коммодитизация: открытые китайские веса давят на разницу между лабораториями, и конкуренция смещается в эффективность, интеграции и поддержку.

Цифры и факты

Разные точки зрения: заменит ли локальная модель облачного кодинг-агента?

Спор идёт не про баллы, а про то, считается ли победа, если ответа приходится ждать.

За. В обсуждении с 2485 голосами утверждают, что локальные модели объёмом около 22 ГБ обходят Claude Code на Opus 5 High на реальных задачах, опубликованных уже после даты обучения моделей, — то есть на том, что нельзя было выучить заранее.

Нейтрально. Свежий срез Agent Arena показывает расслоение: по качеству лидирует Claude Opus 5 (High), но границу «цена-качество» держат более дешёвые Kimi K3, GLM 5.2, Grok 4.5 и GPT-5.6 Luna. Среди открытых весов GLM-5.3 занимает второе место на Terminal Bench и третье на Legal Bench.

Против. Главное возражение в том же обсуждении — скорость: локальные модели дают приемлемую точность, но не приемлемое время ответа, а карта с 22 ГБ видеопамяти стоит денег, которые за год выросли. Отдельно там же звучит неподтверждённое утверждение о подмене модели у провайдера — доказательств не приводится, и мы его повторяем только как пример того, как в таких спорах смешиваются замеры и слухи.

Инструменты и приёмы

Коротко