AI-дайджест 9 августа: Unitree оценили в $9 млрд, Qwen открывает Max-класс, а инференс уходит на локальное железо

Unitree вышла на IPO с оценкой $9 млрд, Qwen готовит первую открытую модель Max-класса, serving-стек vLLM переписали в бинарник на 66 МиБ, а обвязка агентов — идентичность, память и права — превращается в отдельный продукт.

AI-дайджест 9 августа: Unitree оценили в $9 млрд, Qwen открывает Max-класс, а инференс уходит на локальное железо

Главное сегодня

Робототехника вышла на биржу с оценкой $9 млрд. Unitree провела IPO по цене, дающей компании ошеломляющую оценку в $9 млрд. Это первый настоящий публичный ценник на «железную» часть ИИ-волны: до сих пор деньги концентрировались в моделях и дата-центрах, а гуманоиды жили на венчурных раундах. Публичная оценка задаёт ориентир всему сектору — и, что важнее, открывает роботам доступ к рынку капитала, который до этого был только у лабораторий.

Qwen выкладывает модель Max-класса в открытых весах. На ModelScope появилась страница `Qwen3.8-2.4T-A95B` — первой открытой модели уровня Qwen-Max, релиз заявлен на следующую среду; следом обещаны и модели поменьше, включая `Qwen3.8-27B` (обсуждение в r/LocalLLaMA). Класс `2.4T` с ~`95B` активных параметров — это MoE, который дома не запустить, но сам факт важнее: верхний эшелон качества впервые уезжает в открытые веса целиком, а не урезанной версией. Готовые открытые решения мы собираем в каталоге open-source инструментов AI SKILLS.

Инференс без Python: серверный стек vLLM переписали на C++20. Автор портировал serving-стек vLLM в бинарник на 66 МиБ — против ~9.1 ГиБ виртуального окружения обычной установки — и проверил вывод потокен-в-токен против оригинала: идентичный. Сохранены continuous batching, paged KV-cache, prefix caching, спекулятивное декодирование, загрузка safetensors/GGUF и OpenAI-совместимый сервер (vllm.cpp). Скорость при этом примерно на уровне оригинала — выигрыш не в токенах в секунду, а в том, что продакшн-инференс перестаёт таскать за собой многогигабайтный Python-рантайм.

Обвязка агентов становится отдельным продуктом. LangChain вывела Managed Deep Agents в публичную бету — путь от прототипа к продакшену без собственной инфраструктуры, с контролем над выбором модели и жизненным циклом (Харрисон Чейз). В обсуждении запуска сформулировали главное: узкое место давно не «дать агенту инструменты и интерфейс», а идентичность, память, учётные данные, права и интеграция с сервисами пользователя. С другой стороны стека Prime Intellect добавила мультиагентность в свой RL-стек: произвольные взаимодействия агентов, агентное судейство, self-play. Собранные конвейеры такого рода лежат в шаблонах автоматизаций AI SKILLS.

ИИ стал массовым, но разрыв растёт. Выпуск The AI Daily Brief собрал 41 свежую статистику о реальном состоянии ИИ: инструментами пользуется уже большинство американских работников, но дистанция между фронтиром и всеми остальными увеличивается — мир, где ИИ одновременно мейнстрим и всё ещё очень ранняя стадия.

Цифры и факты

Разные точки зрения

Самый спорный сюжет дня — можно ли верить лидербордам. Пост с заголовком «Qwen 3.8 Max — лучшая модель, впереди Opus 5» собрал полторы тысячи реакций, но приложенный к нему скриншот показывает обратное. Против: комментатор прямо указал, что на картинке Opus 5 идёт на 59.2, а Qwen 3.8 Max — на 58.4, то есть заголовок противоречит собственному источнику. Нейтрально: методология индекса открыта — агентный рейтинг Artificial Analysis собирается из GDPval-AA v2 и 𝜏³-Banking, а более широкий Intelligence Index агрегирует девять тестов, включая Terminal-Bench, SciCode и GPQA Diamond (индекс); спор идёт не о цифрах, а о том, как их пересказали. За Qwen: в том же треде разработчики говорят о практике, а не о таблицах — у одного Qwen в ежедневной работе с PHP оказался заметно полезнее конкурента. Вывод простой: разница в десятые доли балла на сводном индексе — не аргумент; аргумент — прогон на своих задачах.

Инструменты и приёмы

Коротко