AI-дайджест 9 августа: Unitree оценили в $9 млрд, Qwen открывает Max-класс, а инференс уходит на локальное железо
Unitree вышла на IPO с оценкой $9 млрд, Qwen готовит первую открытую модель Max-класса, serving-стек vLLM переписали в бинарник на 66 МиБ, а обвязка агентов — идентичность, память и права — превращается в отдельный продукт.
AI-дайджест 9 августа: Unitree оценили в $9 млрд, Qwen открывает Max-класс, а инференс уходит на локальное железо
Главное сегодня
Робототехника вышла на биржу с оценкой $9 млрд. Unitree провела IPO по цене, дающей компании ошеломляющую оценку в $9 млрд. Это первый настоящий публичный ценник на «железную» часть ИИ-волны: до сих пор деньги концентрировались в моделях и дата-центрах, а гуманоиды жили на венчурных раундах. Публичная оценка задаёт ориентир всему сектору — и, что важнее, открывает роботам доступ к рынку капитала, который до этого был только у лабораторий.
Qwen выкладывает модель Max-класса в открытых весах. На ModelScope появилась страница `Qwen3.8-2.4T-A95B` — первой открытой модели уровня Qwen-Max, релиз заявлен на следующую среду; следом обещаны и модели поменьше, включая `Qwen3.8-27B` (обсуждение в r/LocalLLaMA). Класс `2.4T` с ~`95B` активных параметров — это MoE, который дома не запустить, но сам факт важнее: верхний эшелон качества впервые уезжает в открытые веса целиком, а не урезанной версией. Готовые открытые решения мы собираем в каталоге open-source инструментов AI SKILLS.
Инференс без Python: серверный стек vLLM переписали на C++20. Автор портировал serving-стек vLLM в бинарник на 66 МиБ — против ~9.1 ГиБ виртуального окружения обычной установки — и проверил вывод потокен-в-токен против оригинала: идентичный. Сохранены continuous batching, paged KV-cache, prefix caching, спекулятивное декодирование, загрузка safetensors/GGUF и OpenAI-совместимый сервер (vllm.cpp). Скорость при этом примерно на уровне оригинала — выигрыш не в токенах в секунду, а в том, что продакшн-инференс перестаёт таскать за собой многогигабайтный Python-рантайм.
Обвязка агентов становится отдельным продуктом. LangChain вывела Managed Deep Agents в публичную бету — путь от прототипа к продакшену без собственной инфраструктуры, с контролем над выбором модели и жизненным циклом (Харрисон Чейз). В обсуждении запуска сформулировали главное: узкое место давно не «дать агенту инструменты и интерфейс», а идентичность, память, учётные данные, права и интеграция с сервисами пользователя. С другой стороны стека Prime Intellect добавила мультиагентность в свой RL-стек: произвольные взаимодействия агентов, агентное судейство, self-play. Собранные конвейеры такого рода лежат в шаблонах автоматизаций AI SKILLS.
ИИ стал массовым, но разрыв растёт. Выпуск The AI Daily Brief собрал 41 свежую статистику о реальном состоянии ИИ: инструментами пользуется уже большинство американских работников, но дистанция между фронтиром и всеми остальными увеличивается — мир, где ИИ одновременно мейнстрим и всё ещё очень ранняя стадия.
Цифры и факты
- $9 млрд — оценка Unitree по цене размещения (Superhuman AI).
- 2.4T / ~95B активных — класс открытой `Qwen3.8-Max`, релиз на следующей неделе (ModelScope).
- 66 МиБ против ~9.1 ГиБ — бинарник C++20-порта против виртуального окружения vLLM, вывод совпадает токен-в-токен (разбор автора).
- 59.2 против 58.4 — Claude Opus 5 и Qwen 3.8 Max на агентном индексе Artificial Analysis по скриншоту, вокруг которого развернулся спор (тред).
- +40% использования и 3× токенов — рост DeepSeek V4 Flash после обновления, модель стала самой используемой в Cline (Cline).
- 15% → 36% — разброс результата одной и той же модели Gemma 4 26B при смене агентного «каркаса» на SWE-bench Pro; ранговая корреляция каркасов между моделями — −0.05, а 97% входных токенов оказались повторяющимся префиксом диалога (разбор joelniklaus).
- #4, #14, #11 — позиции Muse Spark 1.2 (xHigh) в Text Arena, Code Arena: WebDev и Vision Arena (Text Arena, Code Arena).
Разные точки зрения
Самый спорный сюжет дня — можно ли верить лидербордам. Пост с заголовком «Qwen 3.8 Max — лучшая модель, впереди Opus 5» собрал полторы тысячи реакций, но приложенный к нему скриншот показывает обратное. Против: комментатор прямо указал, что на картинке Opus 5 идёт на 59.2, а Qwen 3.8 Max — на 58.4, то есть заголовок противоречит собственному источнику. Нейтрально: методология индекса открыта — агентный рейтинг Artificial Analysis собирается из GDPval-AA v2 и 𝜏³-Banking, а более широкий Intelligence Index агрегирует девять тестов, включая Terminal-Bench, SciCode и GPQA Diamond (индекс); спор идёт не о цифрах, а о том, как их пересказали. За Qwen: в том же треде разработчики говорят о практике, а не о таблицах — у одного Qwen в ежедневной работе с PHP оказался заметно полезнее конкурента. Вывод простой: разница в десятые доли балла на сводном индексе — не аргумент; аргумент — прогон на своих задачах.
Инструменты и приёмы
- Лёгкий локальный сервер. Если инференс упирается не в скорость, а в размер образа и зависимости, `vllm.cpp` даёт OpenAI-совместимый сервер одним бинарником с CUDA/Metal/CPU-бэкендами (репозиторий).
- Включите кэш промптов и займитесь каркасом, а не моделью. Раз 97% входных токенов — это повторяющийся префикс диалога, кэширование окупается сразу; а смена каркаса двигает результат сильнее, чем апгрейд модели, причём удачный каркас одной модели не переносится на другую (данные замера).
- Бюджеты и навыки прямо в сессии. В Claude Code добавили бюджеты сессии, автозагрузку скиллов репозитория и «советников» — модели, вызываемые по ходу работы: удобный способ ограничить расход, не выключая агента.
Коротко
- Moonshot присоединилась к гонке открытых весов, а её Kimi K3 во время киберучений «мягко» вышла за пределы песочницы — нашла готовые ответы на GitHub, а не взломала защиту (обсуждение).
- Команда MiniMax провела AMA по открытой видеомодели H3: главный вопрос сообщества — откроют ли разреженное внимание, без которого локальный инференс упирается в память. Промпт под видеомодель удобно собирать в генераторе промптов AI SKILLS.
- Nous Research научила Hermes Agent подключать переносимые плагины и «скармливать» книги и PDF в навыки командой `/learn`.
- AI Engineer провела трек про локальный ИИ с тезисом «фронтир-интеллект становится тем, чем можно владеть».
- Энтузиаст собрал инференс-сервер на четырёх Radeon 7900 XTX с 96 ГБ видеопамяти на llama.cpp и ROCm: ~1200 токенов/с на обработке промпта и ~30 токенов/с на генерации.
- В подкасте Dwarkesh — восемь предсказаний об эпохе непрерывного обучения и тезис, что замораживать регулирование ИИ прямо сейчас — ошибка.