Чип OpenAI Jalapeño обгоняет NVIDIA — AI-дайджест

Чип OpenAI Jalapeño обгоняет NVIDIA — AI-дайджест

OpenAI опубликовала первые бенчмарки чипа Jalapeño и заявила превосходство над NVIDIA в инференсе, Perplexity выпустила полностью локальный агентный компьютер, Apple показала Mac Studio с 512 ГБ единой памяти, а Figure готова потратить на данные для роботов миллиард долларов за год.

OpenAI опубликовала первые бенчмарки собственного чипа Jalapeño и заявила превосходство над системами NVIDIA в инференсе, Perplexity выпустила полностью локальный агентный компьютер на DGX Spark, Apple показала Mac Studio с 512 ГБ единой памяти, а Figure собрала крупнейший датасет для роботов и готова потратить на данные миллиард долларов за год.

Главное сегодня

Jalapeño: чип OpenAI даёт в 1,5–1,9 раза больше работы на ватт, чем NVIDIA GB200/GB300

OpenAI впервые опубликовала бенчмарки своего инференс-чипа Jalapeño: в 1,5–1,9 раза больше работы на ватт на пике нагрузки и в 1,7–3,6 раза ниже сквозная задержка, чем у систем NVIDIA GB200/GB300 (анонс OpenAI). Инференс — это выполнение уже обученной модели, то есть та работа, за которую платит каждый пользователь при каждом запросе. На интерактивных нагрузках компания заявляет преимущество в 2,1–4,1 раза; чип рассчитан на 700 Вт, но в тестах держался в пределах 550 Вт. Развёртывание в собственной инфраструктуре OpenAI начнётся до конца 2026 года, второе поколение в глубокой разработке, третье начато (план развёртывания, Сэм Альтман). Аналитики SemiAnalysis называют результат необычно сильным для чипа первого поколения (разбор SemiAnalysis), но напоминают об узком месте: упаковка и мощности TSMC остаются общим дефицитом отрасли (оговорка). Отдельная деталь: кернелы для чипа помогали писать GPT-Astra и Codex — на отдельных блоках их код оказался в 1,5–1,8 раза быстрее написанного инженерами (сводка). Что это меняет для пользователя, считаем в хабе цены API нейросетей и токен-экономика: себестоимость инференса — главная переменная всех тарифов.

Perplexity Portable Computer: агент целиком на локальном железе

Perplexity выпустила Portable Computer — версию своего агентного компьютера, где модель-оркестратор, субагенты и вся обвязка работают локально на NVIDIA DGX Spark, без облака (запуск, NVIDIA). В стартовом наборе — дообученная PPLX 27B и Qwen 3.8 27B, поддержка Nemotron 3.5 Lightning обещана следом (состав моделей). Глава компании Арав Шринивас описывает целевую картину: постоянно работающий фоновый агент, который сам собирает контекст из подключённых сервисов и крутит многошаговые рассуждения на вашем железе (запуск по словам Шриниваса, его картина будущего). Чем агент отличается от чата и из чего он собран — разбираем в хабе ИИ-агенты.

Mac Studio M5 Ultra: до 512 ГБ единой памяти для локальных моделей

Apple представила новые Mac Studio на M5 Max и M5 Ultra с единой памятью до 512 ГБ и пропускной способностью 1,2 ТБ/с у старшего чипа — обсуждение на r/LocalLLaMA называет цены от $9 499 за конфигурацию с 256 ГБ, а вариант на 512 ГБ ожидается в октябре 2026 года (тред r/LocalLLaMA). Единая память — это общий пул для процессора и видеоядер: модель не надо резать под отдельную видеопамять, поэтому большие открытые модели помещаются целиком. Команда exo сообщает, что Apple показала их софт на страницах новых Mac: кластер из четырёх M5 Ultra через Thunderbolt 5 даёт суммарно около 4,8 ТБ/с и запускает Kimi K3 и GLM-5.3 на скоростях уровня облачных API (exo). Какие открытые модели сейчас стоят внимания — в хабе лучшие открытые LLM 2026.

Figure Index: $15 млн уже выплачено за данные для роботов, план — $1 млрд за год

Figure представила Index — по заявлению компании, крупнейший датасет для обучения роботов: 16 млн загруженных видео, приём по 30 минут видео каждую секунду и $15 млн, уже выплаченных поставщикам данных (анонс Бретта Эдкока). Датасет скачали 264 тысячи раз, а на данные и вычисления компания планирует потратить миллиард долларов за ближайшие 12 месяцев (продолжение). Ставка прозрачная: многие лаборатории робототехники упираются не в архитектуры, а в нехватку демонстраций движений — и Figure продаёт рынку именно их.

SWE Refactor Bench: агенты выживают в 5,4% миграций целых репозиториев

Новый бенчмарк SWE Refactor Bench проверяет кодинг-агентов на миграциях целых репозиториев — C в Rust, Maven в Gradle, POSIX в WebAssembly на реальных проектах вроде SQLite, zlib и libsodium: из 520 прогонов все три стадии пережили только 28, то есть 5,4% (EinsiaAI). Тринадцать задач из двадцати не решил никто. Это отрезвляющая поправка к высоким цифрам на локальных баг-фиксах: короткую правку агенты давно делают уверенно, а перестройку проекта целиком — почти никогда.

Цифры и факты

Разные точки зрения: локальный ИИ-агент — это приватность или игрушка за $5 000?

Запуск Perplexity Portable Computer упирается в цену железа: DGX Spark стоит около пяти тысяч долларов, и спор идёт о том, кому такая локальность нужна. Проверяемых замеров спроса ни одна сторона не приводит — это спор о трактовке.

За. Шринивас описывает постоянного фонового агента на своём железе как следующую платформу: данные не покидают дом, агент работает без подписки на облако (его тезис). Кластеры Mac от exo с Kimi K3 на скорости облака — аргумент, что железо уже дозрело (exo).

Нейтрально. Инструментальный слой действительно взрослеет быстрее споров: Ollama 0.33 одним переключателем отдаёт локальные модели в Claude Desktop (Ollama).

Против. Разработчик theo возражает: локальность ради приватности не должна начинаться с покупки DGX Spark за $5 000 — «локальным» стоит называть то, что бежит на обычном ноутбуке (критика, продолжение).

Инструменты и приёмы

Коротко