Grok 4.6, Qwen3.8-Max и DeepSeek V4 Pro за сутки — AI-дайджест

Grok 4.6, Qwen3.8-Max и DeepSeek V4 Pro за сутки — AI-дайджест

За сутки вышли Grok 4.6, Qwen3.8-Max, DeepSeek V4 Pro и первая модель рассуждений Microsoft — и спорят они ценой, а не точностью. Плюс: утечка скрытых рассуждений вскрыла чужие API-ключи и пароли.

Главная тема дня — инференс-экономика: за сутки вышли четыре фронтир-модели, и спорят они не столько точностью, сколько ценой токена. Плюс: уязвимость фронтир-API вскрыла скрытые рассуждения вместе с чужими ключами и паролями, а xAI показала агентов, которые живут в собственных облачных компьютерах.

Главное сегодня

День фронтир-моделей: Grok 4.6, Qwen3.8-Max, DeepSeek V4 Pro и первая «думающая» модель Microsoft. xAI выпустила Grok 4.6 — по независимому замеру Artificial Analysis это 61 балл Intelligence Index, примерно вровень с GPT-5.6 Sol Max и позади Claude Opus/Fable, но с сильными агентными результатами: 88,4% на Terminal-Bench v2.1 (замер). Alibaba выложила Qwen3.8-Max с открытыми весами — MoE на 2,4 трлн параметров, из них 95 млрд активных; в первой выкладке модель только текстовая, без зрения (уточнение пользователей). DeepSeek вывела V4 Pro в общий доступ и ударила ценой: около $0,435 за миллион входных и $0,87 за миллион выходных токенов (разбор). Microsoft добавила MAI-Thinking-1 — свою первую модель рассуждений, собранную с нуля.

Уязвимость фронтир-API вскрыла скрытые рассуждения — вместе с чужими секретами. Исследователи сообщили, что в целом ряде фронтир-API удавалось извлекать «зашифрованные» скрытые рассуждения, причём число восстановленных токенов совпадало с оплаченными «думающими» токенами один в один. Хуже другое: сканирование около 7000 публично опубликованных трейсов нашло внутри 62 уникальных API-ключа, 33 адреса почты и 33 пароля (детали). Отдельный вывод исследователей — публиковать трейсы рассуждений опасно, а сами скрытые рассуждения плохо годятся на роль надёжного интерфейса контроля (контекст).

Grok Bot: агент как штатный сотрудник, а не как чат. xAI представила Grok Bot — ИИ-напарников с собственными облачными компьютерами, которые логинятся в рабочие инструменты и ведут постоянную работу. Ранние пользователи описывают не бенчмарки, а рабочие сценарии: боты следят за тредами в Slack и прогонами GitHub Actions, повторяют регулярные рутинные задачи и даже создают других ботов (наблюдения). Подкаст The AI Daily Brief вышел с тезисом, что именно такой формат наконец делает агентов массовыми — выпуск; рассылка Superhuman AI описывает продукт как «команду 24/7». Если собираете собственных агентов — свежие связки лежат в каталоге шаблонов автоматизаций.

Водяные знаки в текстах моделей вышли из теории. The Rundown AI пишет, что Anthropic встраивает невидимую подпись в ответы Claude. Параллельно в отрасли обсуждают, что лаборатории под давлением регуляторов добавляют вотермаркинг и API для детекции текста (тезис) — и спор идёт как раз о цене такого решения.

Надёжность агентов измеряют заново. Artificial Analysis выпустила AA-AnalystAgent — агентный бенчмарк на количественный анализ документов и таблиц с метрикой надёжности pass^5 на 80 задачах: лидирует Claude Opus 5 с 54%, дальше GPT-5.5 (50%) и Claude Fable 5 (49%), лучший открытый — Kimi K3 (39%). LlamaIndex показала ExtractBench на 370 документах и 4869 страницах: коммерческие визуальные модели держат точность, но полнота падает ниже 35% на документах длиннее 50 страниц — модели молча обрезают строки и списки.

Цифры и факты

Разные точки зрения

Спор дня — вокруг вотермаркинга и утечки скрытых рассуждений.

Инструменты и приёмы

Коротко

Разобраться, как собирать на этих инструментах рабочие процессы, а не разовые эксперименты, помогут курсы и разборы.