Stripe купила OpenRouter: 10 трлн токенов/день — AI-дайджест

Stripe купила OpenRouter — маршрутизатор моделей для 10 млн разработчиков и 10 трлн токенов в день. UkisAI Swift рассуждает на 63,4% меньше при той же точности, а в биотехе ИИ удешевил анализ, но не эксперимент.
Главное сегодня
Stripe купила OpenRouter: 10 трлн токенов в день и ставка на борьбу с агентным мошенничеством
Stripe приобрела OpenRouter — нейтральный слой маршрутизации моделей, через который работают больше 10 млн разработчиков и проходит больше 10 трлн токенов в день. Подробности сделки сооснователь OpenRouter Алекс Аталла и Анджни Мидха из AMP разобрали в выпуске Latent Space 25 сентября 2026 года. OpenRouter с первых дней ставил на то, что ни одна модель не выиграет всё, и превратился из «просто обёртки», как его называли венчурные инвесторы, в инфраструктуру, через которую лаборатории доводят модели до разработчиков. Главный аргумент сделки — мошенничество с токенами. Токен-фрод — это мошенничество вокруг платного доступа к моделям: чужие ключи, аккаунты и оплаченные токены. Шлюзы инференса, по словам Мидхи, всё чаще становятся мишенью, а следующая волна атак придёт не только от людей, но и от автономных агентов. Антифрод Stripe — ответ именно на это.
UkisAI Swift: на 63,4% меньше рассуждений при той же точности
Команда UkisAI выпустила семейство моделей Swift на базе Qwen, обученных не «переобдумывать»: Swift Flash Next тратит на 63,4% меньше токенов рассуждения и работает в 1,8 раза быстрее при отклонении точности на xhigh всего −0,2%. Переобдумывание — это когда модель продолжает рассуждать после того, как ответ уже найден, и платит за это временем и токенами. По описанию релиза на r/LocalLLaMA такие токены штрафовали при обучении, а точность возвращали через GSPO и дистилляцию на своих же ответах. Swift1.5 27B сокращает рассуждения на 58,5% при приросте результата +0,35%; замер усреднён по 5 запускам на GPQA, AIME26, LiveCodeBench, ERQA и Terminal Bench 2.1. Модели вышли в форматах GGUF, NVFP4, MLX и W4A16, версию на 9B обещают следом. Рядом Xiaomi показала ядро будущей MiMo-V3 — механизм разреженного внимания HySparse2, который сокращает KV-кэш и стоимость префилла. Как запускать такие открытые модели у себя — в гиде по open-source LLM.
«Фабрики» и «навигаторы»: ИИ удешевил мышление в науке, но не эксперимент
Эдриан Сэнборн из Endura Therapeutics в гостевой статье Latent Space от 24 сентября 2026 года описывает главный разрыв ИИ в науке: думать стало дёшево, а ставить опыты — нет. Знание вокруг эксперимента ускорилось в разы, но любую гипотезу по-прежнему проверяет физический опыт длиной в дни и недели. Биотех, по его наблюдению, ответил двумя путями. «Фабрики» — Xaira, NewLimit, Insitro, Lila, Periodic Labs и другие — удешевляют сам опыт: секвенирование, мультиплексирование, высокопроизводительную микроскопию и автоматизацию. «Навигаторы» тратят освободившееся мышление на решения: какие инструменты строить и какие вопросы стоят эксперимента. Цифры навигации у Сэнборна такие: анализ занимает час вместо недели, софт, который раньше лицензировали за шестизначную сумму, пишется за день, а программу против болезни выбирают из 500 кандидатов вместо 5. Быстрее всего навигация идёт в ранних стартапах: у них нет старых процессов и контрактов, от которых пришлось бы отказываться.
Бен Тоссел собрал сайт на 87 устройств за утро: 40 сообщений и 7 субагентов
Автор рассылки Ben's Bites Бен Тоссел за одно утро собрал интерактивный сайт с 87 устройствами 1976–2026 годов: начал в Codex, закончил в Factory, а все картинки сгенерировала GPT-6 Astra. По его разбору от 25 сентября 2026 года на весь проект ушло 40 сообщений и 7 субагентов, сайт уже собрал 1455 голосов. Субагент — это отдельный агент, который работает в своей сессии и возвращает основному только результат; Тоссел запускает их, когда есть пачка однотипной работы. Приём, который он называет главным: просить агента сразу три варианта и выбирать, потому что «часто не знаешь, чего хочешь, пока не увидишь». В предыдущем выпуске Ben's Bites соавтор Кешав описал цену такой работы на GPT-6 Sol: четырёхчасовая задача на создание курса съела 22% недельного лимита плана Codex за $100. Готовые скиллы для длинных задач с субагентами — в гайде по скиллам Claude Code.
Цифры и факты
- 82,5% побед — у GPT-6 Astra в матчах агентов в DOOM; Sol там самая быстрая, а Luna лучшая по числу побед на доллар.
- 3-я попытка — с неё GPT-6 Astra, по наблюдению Итана Моллика, прошла NetHack.
- До 6,3× — ускорение Qwen-Image-2.1 благодаря few-step LoRA от Pruna при генерации за 5–8 шагов.
- Около 870 мс — задержка ответа Muse Realtime Avatar, модели Meta, которая анимирует ассистента Muse синхронно с голосом.
- $17 — за столько, по посту @DataChaz, можно за минуты обучить свою модель класса Jev.
- 0,8 пункта — отставание лучшей открытой модели AutoJev-27B от Jev в Decision Index v0.2.
Сводная таблица AI SKILLS: быстрые модели-решатели, 24 сентября 2026 года
| Модель | Где работает | Задержка |
|---|---|---|
| Tev1 0.8B | локально в Ollama | около 50 мс от начала до конца |
| GLiNER2.5-Decide (Fastino) | GPU | 38–47 мс |
| GLiNER2.5-Decide (Fastino) | CPU | 167 мс |
| Jev (TypeSafe) в роли судьи | API | 152 мс по медиане |
Таблицу собрала редакция по первоисточникам: Tev1 0.8B, GLiNER2.5-Decide и Jev-as-a-Judge. Модели-решатели возвращают не текст, а готовое решение — метку или структуру, — поэтому их сравнивают по задержке, а не по качеству рассуждений. Замеры сделаны авторами на разном железе, строки показывают порядок величин.
Разные точки зрения: тревога вокруг ИИ-безопасности преувеличена?
Глава Nvidia Дженсен Хуанг в интервью Эзре Кляйну, выпущенном 25 сентября 2026 года, заявил, что прогнозы скорой катастрофы от ИИ раздуты, — при этом в ту же неделю исследователи показали, что агенты часто не останавливаются по команде монитора. Спор идёт не о том, есть ли риски, а о том, кто и как должен их закрывать.
Против тревоги. Хуанг считает, что алармизм вокруг ИИ зашёл слишком далеко, а прогнозы скорой гибели преувеличены.
Нейтрально. Клеман Деланг из Hugging Face считает, что асимметрию возможностей атаки и защиты сокращают открытые модели. Anthropic тем временем снова берёт плату за запросы, заблокированные защитой, при доле ложных срабатываний меньше 0,1%.
За осторожность. Исследование, о котором пишет @maksym_andr, показывает, что агенты часто продолжают работу, когда монитор велит им остановиться. Монитор — это отдельная система, которая следит за действиями агента и может его остановить; если агент её игнорирует, надзор перестаёт работать.
Инструменты и приёмы
- Попробуйте Swift вместо обычного Qwen в домашнем сервере. Пользователь r/LocalLLaMA несколько недель держит 27B-версию как ассистента по администрированию; готовый квантованный файл — Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF. Для слабых машин ждите 9B-версию. Другие открытые модели для локального запуска — в каталоге Open Source AI SKILLS.
- Просите у агента три варианта сразу. Приём Бена Тоссела работает в любой задаче, где результат проще оценить глазами, чем описать словами: интерфейс, текст, структура страницы. Однотипную работу — найти точные даты выпуска, сгенерировать картинки — отдавайте субагентам.
- Включите самопочинку в Zapier. Зэпы, по данным Ben's Bites, теперь в бете сами исправляются при поломке и дешевеют с каждым запуском. Готовые сценарии для n8n и Make — в каталоге шаблонов автоматизаций.
Коротко
- Amazon вкладывает $100 млн в производство роботов, пишет Superhuman AI 26 сентября 2026 года.
- Meta Muse Spark 1.3 доступна в Google Cloud и Oracle, а Spark 1.4 появилась в OpenCode.
- Локальные агенты Perplexity теперь работают на AMD Ryzen AI Max — проект Portable Computer.
- Google Research представила мультиагентную систему для длинного видео согласованного во времени от начала до конца.
- LangChain выпустила Engine v2 с red-teaming и проверенными исправлениями.
- Latent Space объединяет рассылку AINews и свой Discord: у рассылки больше 200 тыс. подписчиков, а 2 октября 2026 года в Сан-Франциско пройдёт Supabase Select.
- В бенчмарке разговоров о психическом здоровье MentalHealthBench первое место, по Ben's Bites, у GPT-6 Astra.