Чип OpenAI Jalapeño обгоняет NVIDIA — AI-дайджест

OpenAI опубликовала первые бенчмарки чипа Jalapeño и заявила превосходство над NVIDIA в инференсе, Perplexity выпустила полностью локальный агентный компьютер, Apple показала Mac Studio с 512 ГБ единой памяти, а Figure готова потратить на данные для роботов миллиард долларов за год.
OpenAI опубликовала первые бенчмарки собственного чипа Jalapeño и заявила превосходство над системами NVIDIA в инференсе, Perplexity выпустила полностью локальный агентный компьютер на DGX Spark, Apple показала Mac Studio с 512 ГБ единой памяти, а Figure собрала крупнейший датасет для роботов и готова потратить на данные миллиард долларов за год.
Главное сегодня
Jalapeño: чип OpenAI даёт в 1,5–1,9 раза больше работы на ватт, чем NVIDIA GB200/GB300
OpenAI впервые опубликовала бенчмарки своего инференс-чипа Jalapeño: в 1,5–1,9 раза больше работы на ватт на пике нагрузки и в 1,7–3,6 раза ниже сквозная задержка, чем у систем NVIDIA GB200/GB300 (анонс OpenAI). Инференс — это выполнение уже обученной модели, то есть та работа, за которую платит каждый пользователь при каждом запросе. На интерактивных нагрузках компания заявляет преимущество в 2,1–4,1 раза; чип рассчитан на 700 Вт, но в тестах держался в пределах 550 Вт. Развёртывание в собственной инфраструктуре OpenAI начнётся до конца 2026 года, второе поколение в глубокой разработке, третье начато (план развёртывания, Сэм Альтман). Аналитики SemiAnalysis называют результат необычно сильным для чипа первого поколения (разбор SemiAnalysis), но напоминают об узком месте: упаковка и мощности TSMC остаются общим дефицитом отрасли (оговорка). Отдельная деталь: кернелы для чипа помогали писать GPT-Astra и Codex — на отдельных блоках их код оказался в 1,5–1,8 раза быстрее написанного инженерами (сводка). Что это меняет для пользователя, считаем в хабе цены API нейросетей и токен-экономика: себестоимость инференса — главная переменная всех тарифов.
Perplexity Portable Computer: агент целиком на локальном железе
Perplexity выпустила Portable Computer — версию своего агентного компьютера, где модель-оркестратор, субагенты и вся обвязка работают локально на NVIDIA DGX Spark, без облака (запуск, NVIDIA). В стартовом наборе — дообученная PPLX 27B и Qwen 3.8 27B, поддержка Nemotron 3.5 Lightning обещана следом (состав моделей). Глава компании Арав Шринивас описывает целевую картину: постоянно работающий фоновый агент, который сам собирает контекст из подключённых сервисов и крутит многошаговые рассуждения на вашем железе (запуск по словам Шриниваса, его картина будущего). Чем агент отличается от чата и из чего он собран — разбираем в хабе ИИ-агенты.
Mac Studio M5 Ultra: до 512 ГБ единой памяти для локальных моделей
Apple представила новые Mac Studio на M5 Max и M5 Ultra с единой памятью до 512 ГБ и пропускной способностью 1,2 ТБ/с у старшего чипа — обсуждение на r/LocalLLaMA называет цены от $9 499 за конфигурацию с 256 ГБ, а вариант на 512 ГБ ожидается в октябре 2026 года (тред r/LocalLLaMA). Единая память — это общий пул для процессора и видеоядер: модель не надо резать под отдельную видеопамять, поэтому большие открытые модели помещаются целиком. Команда exo сообщает, что Apple показала их софт на страницах новых Mac: кластер из четырёх M5 Ultra через Thunderbolt 5 даёт суммарно около 4,8 ТБ/с и запускает Kimi K3 и GLM-5.3 на скоростях уровня облачных API (exo). Какие открытые модели сейчас стоят внимания — в хабе лучшие открытые LLM 2026.
Figure Index: $15 млн уже выплачено за данные для роботов, план — $1 млрд за год
Figure представила Index — по заявлению компании, крупнейший датасет для обучения роботов: 16 млн загруженных видео, приём по 30 минут видео каждую секунду и $15 млн, уже выплаченных поставщикам данных (анонс Бретта Эдкока). Датасет скачали 264 тысячи раз, а на данные и вычисления компания планирует потратить миллиард долларов за ближайшие 12 месяцев (продолжение). Ставка прозрачная: многие лаборатории робототехники упираются не в архитектуры, а в нехватку демонстраций движений — и Figure продаёт рынку именно их.
SWE Refactor Bench: агенты выживают в 5,4% миграций целых репозиториев
Новый бенчмарк SWE Refactor Bench проверяет кодинг-агентов на миграциях целых репозиториев — C в Rust, Maven в Gradle, POSIX в WebAssembly на реальных проектах вроде SQLite, zlib и libsodium: из 520 прогонов все три стадии пережили только 28, то есть 5,4% (EinsiaAI). Тринадцать задач из двадцати не решил никто. Это отрезвляющая поправка к высоким цифрам на локальных баг-фиксах: короткую правку агенты давно делают уверенно, а перестройку проекта целиком — почти никогда.
Цифры и факты
- В 1,5–1,9 раза больше работы на ватт — заявленное преимущество Jalapeño над NVIDIA GB200/GB300 (OpenAI).
- $9 499 — стартовая цена Mac Studio M5 Ultra с 256 ГБ единой памяти по обсуждению на Reddit (тред).
- В 8,3 раза — разрыв в отдаче между средними и самыми продвинутыми пользователями ИИ по данным OpenAI, которые разбирает подкаст The AI Daily Brief; ещё недавно было 2,6 (выпуск).
- $0,40 и $3 за миллион входных и выходных токенов — цена Qwen3.8-27B, занявшей первое место среди открытых моделей в Image-to-WebDev Arena и седьмое в общем зачёте (arena).
- 606 проектов — столько карточек open-source инструментов было в каталоге AI SKILLS на 25 августа 2026 года; сегодняшняя порция радара пополнит раздел Open Source.
Разные точки зрения: локальный ИИ-агент — это приватность или игрушка за $5 000?
Запуск Perplexity Portable Computer упирается в цену железа: DGX Spark стоит около пяти тысяч долларов, и спор идёт о том, кому такая локальность нужна. Проверяемых замеров спроса ни одна сторона не приводит — это спор о трактовке.
За. Шринивас описывает постоянного фонового агента на своём железе как следующую платформу: данные не покидают дом, агент работает без подписки на облако (его тезис). Кластеры Mac от exo с Kimi K3 на скорости облака — аргумент, что железо уже дозрело (exo).
Нейтрально. Инструментальный слой действительно взрослеет быстрее споров: Ollama 0.33 одним переключателем отдаёт локальные модели в Claude Desktop (Ollama).
Против. Разработчик theo возражает: локальность ради приватности не должна начинаться с покупки DGX Spark за $5 000 — «локальным» стоит называть то, что бежит на обычном ноутбуке (критика, продолжение).
Инструменты и приёмы
- Локальные модели в Claude Desktop. Ollama v0.33 добавила переключатель, который отдаёт локальные и облачные модели Ollama в Claude Desktop как стороннего провайдера (анонс).
- Дообучение Qwen3.8-27B бесплатно. Unsloth показала полное QLoRA-дообучение 27-миллиардной модели на бесплатной паре Tesla T4 в Kaggle — раньше такой размер требовал платного железа (Unsloth).
- Запуск моделей без настройки. Мэтт Вулф показывает связку LM Studio + Qwen 3.8 27B на обычном компьютере: выбираете модель, LM Studio сам говорит, потянет ли её ваша машина (ролик); что ставить первым — в хабе лучшие открытые LLM 2026.
Коротко
- IBM выложила семейство рассуждающих моделей Granite 4.2 — 30B, 8B и 3B под Apache 2.0 с контекстом 512K (тред, технический разбор IBM).
- OpenAI объявила WebMCP Challenge и поддержку WebMCP в десктопном ChatGPT — сайты подталкивают к явным интерфейсам для агентов (анонс).
- Аналитик Дилан Пател в подкасте Dwarkesh прогнозирует, что к 2028 году большая часть мировых вычислений для ИИ окажется у Anthropic и OpenAI (выпуск).
- История дня с r/ClaudeAI: разработчик собрал на Claude Code конкурента job-борда после увольнения беременной жены — 4 300 пользователей за четыре месяца, 91 платящий и первые три найма (тред).
- Пользователи Reddit сообщают о возврате 5-часового лимита для подписчиков ChatGPT Plus; тарифы за $100 и $200 от лимита пока освобождены (обсуждение).
- Рассылка Superhuman сообщает: ChatGPT Work получает доступ к логинам на сайтах — агент сможет работать под учёткой пользователя (материал).
- Xiaomi анонсировала прототип AI Cube с заявленной пропускной способностью памяти 1,22 ТБ/с (тред).
- Две работы о харнесах: AutoSaddler чинит обвязку агента по следам ошибок (+9,0 на GAIA2, +10,0 на Terminal-Bench 2.0), а «There Is No Neutral Harness» показывает, что смена обвязки двигает результат сильнее смены модели (AutoSaddler, разбор) — тот же вывод, что в нашем хабе ИИ-агенты.