Ornith-1.5 вышла под лицензией MIT — AI-дайджест

День обвязок и открытых весов: вышла MIT-лицензированная линейка Ornith-1.5 с заявкой на самообучение, открытая обвязка TrueForge показала экономию 30% токенов против управляемых агентов на Opus 4.8, Gemini 3.7 Flash забрала первое место в аналитическом бенчмарке, а разбор десяти рабочих агентов показал: половина задержки живёт вне модели.
Главное сегодня
Вышла Ornith-1.5: MIT-лицензия, три размера и 86,1 на Terminal-Bench 2.1
Команда Ornith выпустила линейку Ornith-1.5 под лицензией MIT — плотную модель на 9 млрд параметров и две MoE на 35 и 397 млрд, сразу в форматах FP8, GGUF, MLX и NVFP4 (анонс). Заявленные результаты сосредоточены на агентских и кодовых задачах: 86,1 на Terminal-Bench 2.1, 86 на SWE-Bench Verified, 56 на DeepSWE, 44,6 на Humanity's Last Exam и 71,2 на Tool Decathlon. Главное же заявление — конвейер самоулучшения: модель сама придумывает задачи, собирает под них обвязку и генерирует прогоны обучения с подкреплением, из которых получается новый обучающий опыт. Проверить это утверждение по одному посту нельзя, а вот доступность проверяется сразу: поддержку добавили в vLLM и в Ollama в тот же день. Свежие открытые модели и способы их запуска мы собираем в разделе Open Source.
TrueForge: открытая обвязка агентов экономит 30% токенов, а маршрутизация — 75% денег
TrueFoundry открыла TrueForge — самохостируемую обвязку для боевых агентов под лицензией MIT, и подкрепила её цифрами: на бенчмарке из 14 корпоративных задач она повторила результат управляемых агентов Claude на Opus 4.8, потратив примерно на 30% меньше токенов, а перевод части задач на GLM-5.2 срезал стоимость ещё примерно на 75% без потери точности (анонс TrueFoundry, разбор @omarsar0). Обвязка — это слой вокруг модели: сессии, память, инструменты, песочницы, подтверждения человеком и трассировка. Там же виден и второй подход: DeepSeek Harness сделан нарочито тонким, где плагином является всё, включая сам цикл агента, — за неделю беты пользователи выпустили больше 100 плагинов. Вывод дня для тех, кто считает деньги: экономику агента определяет не только выбор модели, но и то, что происходит между её вызовами.
Gemini 3.7 Flash заняла первое место в AA-AnalystAgent при $0,54 за задачу
Gemini 3.7 Flash вышла на первое место в бенчмарке Artificial Analysis AA-AnalystAgent: 60,0% pass^5, 70,5% pass@1 и 77,5% pass@5 на 80 задачах с таблицами и документами, при 1,32 секунды и $0,54 в среднем на задачу (разбор @_philschmid, анонс Google). Метрика pass^5 строже привычной: она требует, чтобы модель решила задачу во всех пяти попытках, то есть меряет не удачу, а повторяемость — ровно то, что нужно для рабочих отчётов. Google в тот же день двинула модель в продукты: чат Gemini и Spark, интерактивные симуляции, собираемые на лету в поиске, и синхронизацию AI Studio с GitHub.
Половина задержки боевых агентов живёт вне модели
Исследование десяти работающих агентских приложений показало, что в половине из них основную задержку дают не вызовы модели, а всё остальное — песочницы, инструменты, хранение состояния (изложение DAIR.AI). Цифры измеримые: пиковая память песочницы доходит до 28 ГБ на сессию, разброс задержки между подсистемами достигает 32 раз, а состояние подолгу висит в памяти между шагами. Три приёма дают основной выигрыш: планирование обслуживания под тип задачи снимает 29–40% задержки, выгрузка состояния уменьшает потребление памяти в 4,6 раза, а кэш результатов инструментов убирает 35,2% повторных поисковых вызовов. Практический смысл: прежде чем менять модель на более быструю, стоит замерить, сколько времени агент вообще проводит внутри модели.
Anthropic: выручка $11,6 млрд и небольшая операционная прибыль
Выручка Anthropic более чем удвоилась и достигла $11,6 млрд, компания вышла в небольшую операционную прибыль — со ссылкой на WSJ это разошлось в обсуждениях 19–20 августа 2026 года. Цифра важна не сама по себе, а тем, что спорит с привычной картиной «ИИ-лаборатории жгут деньги»: у компании с платными разработчиками и корпоративными контрактами экономика может сходиться уже сейчас. Осторожность здесь уместна: это пересказ публикации деловой газеты, а не отчётность компании, и сравнение с квартальными цифрами конкурента в обсуждении сделано вольно. Отдельная линия в том же обсуждении — коммодитизация: открытые китайские веса давят на разницу между лабораториями, и конкуренция смещается в эффективность, интеграции и поддержку.
Цифры и факты
- 77% точности BF16 на 8 ГБ ОЗУ — столько сохраняют однобитные кванты Qwen3.8-27B от Unsloth; свежие Dynamic V3 обещают около 10% прироста точности при том же размере файла (Unsloth, подробности).
- 218 токенов в секунду — Qwen3.8-27B на двух RTX 3090 с vLLM и черновой моделью DFlash2 (замер пользователя).
- 30 токенов в секунду и 1,9 секунды до первого токена — та же модель на 64-ядерном RISC-V процессоре Alibaba XuanTie C950 (обсуждение теста).
- 99,8% полноты за 1,0 мс против 67,7% за 4,7 мс — фильтруемый HNSW у Qdrant против ACORN на выборке 1% из миллиона векторов (замер Qdrant).
- С 41,8% до 56,4% на SWE-Bench Verified — прирост Qwen3.5-9B после обучения с подкреплением прямо через обвязку в Agent Lightning v1.0, примерно на 6 тысячах примеров (изложение).
- 35% успеха против 10–15% у людей — доля удачных белковых связок Claude, подтверждённых в лаборатории (обсуждение отчёта).
- 10 101 карточка скиллов — столько активных скиллов для Claude Code сейчас в каталоге AI SKILLS; наш собственный счётчик на 21 августа 2026 года.
Разные точки зрения: заменит ли локальная модель облачного кодинг-агента?
Спор идёт не про баллы, а про то, считается ли победа, если ответа приходится ждать.
За. В обсуждении с 2485 голосами утверждают, что локальные модели объёмом около 22 ГБ обходят Claude Code на Opus 5 High на реальных задачах, опубликованных уже после даты обучения моделей, — то есть на том, что нельзя было выучить заранее.
Нейтрально. Свежий срез Agent Arena показывает расслоение: по качеству лидирует Claude Opus 5 (High), но границу «цена-качество» держат более дешёвые Kimi K3, GLM 5.2, Grok 4.5 и GPT-5.6 Luna. Среди открытых весов GLM-5.3 занимает второе место на Terminal Bench и третье на Legal Bench.
Против. Главное возражение в том же обсуждении — скорость: локальные модели дают приемлемую точность, но не приемлемое время ответа, а карта с 22 ГБ видеопамяти стоит денег, которые за год выросли. Отдельно там же звучит неподтверждённое утверждение о подмене модели у провайдера — доказательств не приводится, и мы его повторяем только как пример того, как в таких спорах смешиваются замеры и слухи.
Инструменты и приёмы
- Claude Code стал короче и наблюдаемее. Команда Claude добавила лаконичный стиль ответа, а к управляемым агентам — память для собственных песочниц, списки разрешённых и запрещённых доменов для веб-инструментов и просмотрщик мультиагентных сессий со стоимостью каждой ветки. Стоимость по веткам — самое полезное: видно, какой агент съедает бюджет.
- Запуск 27B на бытовой видеокарте. Новые Dynamic V3 GGUF от Unsloth дают около 10% прироста точности при том же размере, а однобитные варианты запускаются на 8 ГБ памяти (Unsloth). Практическая сводка по локальному запуску — в обзоре открытых LLM.
- Кэш результатов инструментов. Из разбора боевых агентов: кэширование ответов инструментов убирает 35,2% повторных поисков (исследование). Приём дешёвый и почти всегда окупается на длинных сессиях.
Коротко
- OpenAI представила Private Safety Processing: обещает сохранить нулевое хранение данных для передовых моделей и при этом выявлять риски, не давая людям доступа к содержимому (OpenAI).
- Replit запустил бесплатный режим на GPT-5.6 Luna (Replit).
- Патрик Коллисон подтвердил, что OpenRouter присоединяется к Stripe (его пост).
- Sentence Transformers 6.0 закрепляет переход к мультивекторному поиску: вместо одного вектора на текст сохраняются векторы токенов и сравниваются с токенами запроса (разбор).
- Соавтор Qwen ответил на вопрос про модель 35B A3B словами «не ждите её», а сообщество ожидает среднеразмерную открытую модель на следующей неделе (обсуждение).
- В заголовках подкаста The AI Daily Brief за 20 августа 2026 года — персонализированная противораковая вакцина, созданная с помощью ИИ, прошла третью фазу испытаний (выпуск).