DeepSeek V4.1-Flash: 552, 748 или 763 млрд — AI-дайджест

DeepSeek V4.1-Flash: 552, 748 или 763 млрд — AI-дайджест

Разбор весов DeepSeek V4.1-Flash дал 748,5 млрд параметров против 552 млрд по объявлению: счётчики путали байты с параметрами в формате FP4. Отсюда практический вывод — 128 и 256 ГБ памяти для полного локального запуска не хватает.

Главное сегодня

Сколько параметров у DeepSeek V4.1-Flash: 552 миллиарда, 748 или 763

Разбор файлов весов на Hugging Face дал цифру, которая расходится с официальной: сама DeepSeek объявила модель как 552 миллиарда параметров, а подсчёт по файлам даёт 748,5 миллиарда на основную часть с памятью-энграммой и около 763,2 миллиарда на всё хранимое целиком. Расхождение не в честности, а в том, что именно считать. Автор разбора перечисляет ходившие по сети варианты — 284, 305, 485 и 522 миллиарда — и объясняет происхождение самого частого: веса лежат в четырёхбитном формате FP4, где в одном байте упакованы два параметра, и часть счётчиков приняла байты за параметры. Тот же промах виден у соседней раскладки GLM-5.3-Flash-NVFP4. Состав важнее итога: 543,58 миллиарда параметров основной части — это эксперты MoE в FP4, и лишь около 8 миллиардов приходится на внимание, эмбеддинги и общие слои. Разбор файлов весов, объявление DeepSeek и веса, сами веса.

Полный локальный запуск: 128–256 ГБ памяти не хватает

Из того же разбора следует практический вывод, который стоит знать до покупки железа: для полного локального использования V4.1-Flash 128 и даже 256 гигабайт оперативной или видеопамяти недостаточно — хранимая модель занимает около 511,8 гигабайта. Это уточняет вчерашние сообщения об удачных запусках: те конфигурации работали за счёт выгрузки основной массы весов на SSD, а не потому, что модель помещается в память целиком. Обсуждающие на форуме разработчиков сходятся в том же: при 552 миллиардах параметров в сумме локальный инференс остаётся непрактичным даже для связок из нескольких настольных ускорителей, и для агентных задач на своей машине разумнее брать модели поменьше. Отдельно отмечают, что «Flash» в названии — про задержку: на этапе чтения запроса активны лишь около 9 миллиардов параметров. Разбор файлов весов, обсуждение локального запуска.

DeepSeek заявила сокращение KV-кэша в 437 раз против первого поколения

В объявлении DeepSeek приводит собственные цифры экономии памяти: KV-кэш и хранение сокращены вчетверо по HBM и в восемь раз по SSD относительно прошлого поколения, а относительно модели первого поколения — в 437 раз. Абсолютная величина, которая ходит по разборам, — около 890 байт кэша на токен. HBM — это быстрая память, впаянная рядом с вычислителем видеокарты; именно она обычно кончается первой на длинном контексте. Пользователям API компания одновременно объявила миграцию: обращения к устаревшим именам моделей переводятся на deepseek-flash с новыми ценами в пик и вне пика. Технический отчёт выложен рядом с весами. Объявление и миграция API, цифра про 890 байт на токен, технический отчёт.

98% от результата Astra за 1,4% стоимости — на одном дизайнерском тесте

OpenDesign Arena опубликовала замер на задачах генерации прототипов и дизайна: DeepSeek V4.1-Flash набрала 81,2 балла из 100 против 82,7 у лидирующей GPT-6 Astra — это около 98% её результата — при оценочной стоимости $0,023 за артефакт и среднем времени работы 5,3 минуты. Методика узкая, и это важно для чтения цифры: артефакт оценивается только по двум осям — выполнение требований (30 баллов) и качество дизайна (70), — а нерабочий результат получает ноль; «годным» считается результат от 80 баллов. Скорость, расход токенов и стоимость считаются отдельно и в общий балл не входят. Реакция сдержанная: комментаторы указывают, что до независимой проверки — например, замера Artificial Analysis — заявку о «98% за 1% цены» принимать за установленный факт нельзя. Замер OpenDesign Arena, обсуждение заявки.

«Инженер на выезде»: как лаборатории сажают разработчиков внутрь клиента

Лаборатории, стартапы и фонды прямых инвестиций нанимают инженеров, которые работают внутри операций заказчика, — и почти никто не сошёлся в том, что эти люди должны делать. Вину Ганеш, глава компании Kepler и участник программы a16z для таких инженеров, описывает ужин, на котором за одним столом собрались специалисты из Snowflake, Anthropic и нескольких стартапов — и выяснилось, что одним словом они называют разные работы: для одного это пресейл-инженер со второго звонка, для другого — продавец с планом, умеющий писать на Python, для третьего — консультант с ноутбуком и техзаданием. Он же описывает исходный образец: в Palantir через ротацию Project Frontline прошло около 250 человек, и многие из них сегодня руководят такими командами в OpenAI, Anthropic, xAI и Anduril. Для нанимающих вывод практический: договариваться нужно не о названии роли, а о том, кому она подчиняется и за какой результат отвечает. Разбор практики.

Цифры и факты

Разные точки зрения: можно ли считать «98% от Astra» установленным фактом?

Замер существует и у него есть методика: 81,2 против 82,7 балла, $0,023 за артефакт. Спор идёт не о самих числах, а о том, что они означают за пределами этого теста.

За. У площадки открыто описан способ оценки: артефакт получает до 30 баллов за выполнение требований и до 70 за качество дизайна, нерабочий результат — ноль, порог «годного» — 80 баллов. При таком раскладе разрыв в 1,5 балла действительно мал, а разница в стоимости велика (замер).

Нейтрально. Тест узкий: он про генерацию прототипов и дизайна, а не про программирование, рассуждения или работу с инструментами. Практики в обсуждении отмечают, что Astra выглядит основательнее, но склонна к многословию и перегруженным макетам — то есть балл и удобство в работе расходятся (обсуждение).

Против. Более громкая версия той же новости — «98% результата за 1% стоимости» — подаётся без методики, набора задач и исходных баллов. Комментаторы прямо требуют независимого замера, прежде чем принимать её всерьёз (обсуждение заявки).

Инструменты и приёмы

Коротко