Grok 4.6, Qwen3.8-Max и DeepSeek V4 Pro за сутки — AI-дайджест

За сутки вышли Grok 4.6, Qwen3.8-Max, DeepSeek V4 Pro и первая модель рассуждений Microsoft — и спорят они ценой, а не точностью. Плюс: утечка скрытых рассуждений вскрыла чужие API-ключи и пароли.
Главная тема дня — инференс-экономика: за сутки вышли четыре фронтир-модели, и спорят они не столько точностью, сколько ценой токена. Плюс: уязвимость фронтир-API вскрыла скрытые рассуждения вместе с чужими ключами и паролями, а xAI показала агентов, которые живут в собственных облачных компьютерах.
Главное сегодня
День фронтир-моделей: Grok 4.6, Qwen3.8-Max, DeepSeek V4 Pro и первая «думающая» модель Microsoft. xAI выпустила Grok 4.6 — по независимому замеру Artificial Analysis это 61 балл Intelligence Index, примерно вровень с GPT-5.6 Sol Max и позади Claude Opus/Fable, но с сильными агентными результатами: 88,4% на Terminal-Bench v2.1 (замер). Alibaba выложила Qwen3.8-Max с открытыми весами — MoE на 2,4 трлн параметров, из них 95 млрд активных; в первой выкладке модель только текстовая, без зрения (уточнение пользователей). DeepSeek вывела V4 Pro в общий доступ и ударила ценой: около $0,435 за миллион входных и $0,87 за миллион выходных токенов (разбор). Microsoft добавила MAI-Thinking-1 — свою первую модель рассуждений, собранную с нуля.
Уязвимость фронтир-API вскрыла скрытые рассуждения — вместе с чужими секретами. Исследователи сообщили, что в целом ряде фронтир-API удавалось извлекать «зашифрованные» скрытые рассуждения, причём число восстановленных токенов совпадало с оплаченными «думающими» токенами один в один. Хуже другое: сканирование около 7000 публично опубликованных трейсов нашло внутри 62 уникальных API-ключа, 33 адреса почты и 33 пароля (детали). Отдельный вывод исследователей — публиковать трейсы рассуждений опасно, а сами скрытые рассуждения плохо годятся на роль надёжного интерфейса контроля (контекст).
Grok Bot: агент как штатный сотрудник, а не как чат. xAI представила Grok Bot — ИИ-напарников с собственными облачными компьютерами, которые логинятся в рабочие инструменты и ведут постоянную работу. Ранние пользователи описывают не бенчмарки, а рабочие сценарии: боты следят за тредами в Slack и прогонами GitHub Actions, повторяют регулярные рутинные задачи и даже создают других ботов (наблюдения). Подкаст The AI Daily Brief вышел с тезисом, что именно такой формат наконец делает агентов массовыми — выпуск; рассылка Superhuman AI описывает продукт как «команду 24/7». Если собираете собственных агентов — свежие связки лежат в каталоге шаблонов автоматизаций.
Водяные знаки в текстах моделей вышли из теории. The Rundown AI пишет, что Anthropic встраивает невидимую подпись в ответы Claude. Параллельно в отрасли обсуждают, что лаборатории под давлением регуляторов добавляют вотермаркинг и API для детекции текста (тезис) — и спор идёт как раз о цене такого решения.
Надёжность агентов измеряют заново. Artificial Analysis выпустила AA-AnalystAgent — агентный бенчмарк на количественный анализ документов и таблиц с метрикой надёжности pass^5 на 80 задачах: лидирует Claude Opus 5 с 54%, дальше GPT-5.5 (50%) и Claude Fable 5 (49%), лучший открытый — Kimi K3 (39%). LlamaIndex показала ExtractBench на 370 документах и 4869 страницах: коммерческие визуальные модели держат точность, но полнота падает ниже 35% на документах длиннее 50 страниц — модели молча обрезают строки и списки.
Цифры и факты
- Grok 4.6 — 61 балл Intelligence Index, 88,4% Terminal-Bench v2.1, цена $2 / $6 за миллион входных/выходных токенов (Artificial Analysis).
- DeepSeek V4 Pro — примерно $0,435 / $0,87 за миллион токенов; Cline оценивает это как в 57 раз дешевле Fable 5 и фиксирует прирост 15,8% на Terminal Bench против превью (оценка).
- Qwen3.8-Max — 2,4 трлн параметров всего, 95 млрд активных (анонс).
- 7000 публичных трейсов рассуждений → 62 API-ключа, 33 почты, 33 пароля (сканирование).
- NVIDIA Nemotron 3.5 Lightning — 31,6 млрд параметров всего при 3,6 млрд активных, контекст 1 млн токенов, медианная скорость около 670 токенов/с (разбор).
Разные точки зрения
Спор дня — вокруг вотермаркинга и утечки скрытых рассуждений.
- Тревожно. Публичные трейсы оказались хранилищем чужих секретов, а скрытые рассуждения — плохой интерфейс контроля: расшифрованный поток часто обрывочный и многоязычный, читать его тяжело (аргумент).
- Нейтрально. Утечка не означает, что чужие рассуждения теперь можно массово воровать для обучения моделей: шифрование там было скорее оптимизацией распределённого инференса, чем настоящим барьером конфиденциальности (позиция).
- Скептично. У вотермаркинга своя цена: критики опасаются, что подпись раздует ответы и испортит краткость кода и документов (возражение). Ответ сторонников — запас энтропии достаточно велик, чтобы подпись оставалась незаметной, особенно на длинных ответах (контраргумент).
Инструменты и приёмы
- Unsloth Desktop — открытое десктопное приложение для запуска и обучения моделей локально на Mac, Windows и Linux: MLX и GGUF, генерация изображений и видео, аудио, вызов инструментов, песочница для кода, RAG и MCP (анонс). Там же показали, как сжали Qwen3.8 с 4,9 ТБ до 397 ГБ динамическим 1-битным квантованием — гигантская открытая модель становится запускаемой локально (детали). Подборка открытых моделей и инструментов — в разделе Open Source.
- GitHub Agent Plugins 1.0 — скиллы, MCP-серверы и расширения теперь пакуются вместе, одним артефактом (релиз).
- Cohere North Micro Vision — компактная визуальная модель под Apache-2.0, заточенная на разбор документов (анонс). Полезно как раз там, где ExtractBench показал провал полноты.
Коротко
- NVIDIA выпустила Nemotron 3.5 Lightning — MoE на 30 млрд параметров с ~3 млрд активных под постоянно работающих агентов.
- OpenAI выкатила десктопный ChatGPT для Linux в превью.
- Google DeepMind показала SL2T — перевод жестового языка в текст, ввод на ASL появился в Android и Pixel 11.
- Deepgram запустила Flux TTS — синтез речи с задержкой около 80 мс для голосовых агентов.
- Подкаст Dwarkesh вышел с дебатами о рекурсивном самоулучшении ИИ — что будет, когда ИИ начнёт автоматизировать исследования самого ИИ.
- Отдельный выпуск The AI Daily Brief разбирает манифест Марка Цукерберга об оптимистичном будущем ИИ, открытую модель Meta и фонд сообщества на $1 млрд.
Разобраться, как собирать на этих инструментах рабочие процессы, а не разовые эксперименты, помогут курсы и разборы.