Лучшие открытые LLM 2026: Qwen 3.8, DeepSeek V4, Kimi K3, GLM-5.3 и Muse Glimmer

Открытые веса — это когда компания публикует саму модель: её можно скачать и запустить у себя, не обращаясь к чужому сервису.
Открытые веса — это когда компания публикует саму модель: её можно скачать и запустить у себя, не обращаясь к чужому сервису.
Зачем это нужно на практике: данные не уходят наружу, за каждый запрос никто не берёт денег, и модель нельзя «отозвать» — она уже у вас.
Ниже — чем открытые веса отличаются от open source, сравнение пяти флагманов по размеру и лицензии, что выбрать под код, тексты и слабое железо, как уменьшить модель под своё оборудование, где на этом зарабатывают и как запустить локально.
Числа — из карточек моделей и официальных блогов. Это живой гайд: ежедневные AI-дайджесты держат его в актуальном состоянии, а рядом работает каталог открытых инструментов Open Source.
---
Коротко, если нет времени
«Открытые веса» и «open source» — разные вещи. Модель можно скачать, но повторить её обучение с нуля обычно нельзя.
Главная причина брать открытую модель — не экономия, а данные. Для компаний с требованиями к информации это условие работы, а не преимущество.
Лицензия важнее рейтинга. Свободнее всего сейчас Muse Glimmer (Apache 2.0), DeepSeek V4 и GLM-5.2 (MIT).
Размер решает, что вы вообще сможете запустить. Модель на 27–30 миллиардов в сжатом виде требует около 16–20 ГБ видеопамяти, на 7–8 миллиардов — укладывается в 8 ГБ.
Рейтингам верить нельзя вслепую. Флагманы меняются почти еженедельно, а бенчмарк меряет свою задачу, а не вашу.
Деньги здесь есть. Локальная модель — входной билет к заказчикам, которым нельзя выносить данные наружу. Такие проекты идут в вилке $490–1 460.
---
Часть 1. Что такое открытые веса
Открытые веса — это доступ к самой модели, но не обязательно ко всему, из чего её сделали.
Open source в классическом смысле означает открытость всего: кода обучения, данных и лицензии, разрешающей любое использование.
У большинства открытых моделей опубликованы сама модель и код для её запуска, а обучающие данные и полный процесс — нет. Лицензия иногда содержит ограничения.
Поэтому корректный термин — «open-weight»: скачать и запустить можно, повторить обучение с нуля — как правило, нет.
Разница видна по лицензиям
Часть моделей выходит под по-настоящему свободными лицензиями — Apache 2.0, MIT. Их можно использовать коммерчески почти без условий.
Другие идут под «общинными» с оговорками: требование указывать автора, порог по числу пользователей, региональные пункты. Это не делает их закрытыми, но юридически это не то же самое, и для бизнеса разница важна.
Показательно, что текущее поколение сместилось в сторону свободы: Meta впервые выпустила открытую модель Muse Glimmer 30B под Apache 2.0, а DeepSeek публикует V4 под MIT. Самые заметные релизы 2026 года стали не только сильнее, но и юридически чище.
Зачем это вместо удобного API
Три причины.
Приватность и контроль. Данные не уходят стороннему сервису, модель работает в вашем контуре, поведение не меняется без вашего ведома при очередном обновлении.
Экономика. За большие объёмы собственный запуск часто выходит дешевле поштучной оплаты, а цена предсказуема — особенно на фоне того, что даже недорогие API дорожают: DeepSeek поднял тарифы с 16 августа 2026 года.
Независимость. Открытые веса нельзя отозвать или снять с продажи, поэтому продукт не остановится из-за чужого решения.
Плата за это — вы сами держите оборудование и обслуживание. Именно поэтому выбор упирается в размер модели и лицензию.
---
Часть 2. Сравнение флагманов
Актуальные модели пяти семейств. «Активные параметры» указаны для тех, где модель разбита на части — что это значит, объясню сразу под таблицей.
| Семейство | Флагман 2026 | Размер | Лицензия |
|---|---|---|---|
| Qwen (Alibaba) | Qwen 3.8 Max | 2,4 трлн всего / 95 млрд активных | читать карточку — были вопросы по региональным оговоркам |
| DeepSeek | DeepSeek V4 Pro | ~1,7 трлн | MIT |
| Kimi (Moonshot AI) | Kimi K3 | 2,8 трлн всего / ~104 млрд активных | читать карточку |
| GLM (Z.ai) | GLM-5.2, веса 5.3 на подходе | — | MIT (5.2) |
| Meta (Muse) | Muse Glimmer 30B | 29,6 млрд, обычная | Apache 2.0 |
Источники: Qwen 3.8 Max — ModelScope и карточка Qwen3.8-27B; DeepSeek V4 Pro — карточка на Hugging Face; Kimi K3 — организация moonshotai; GLM-5.3 — блог Z.ai; Muse Glimmer 30B — карточка модели и разбор NVIDIA.
Прежние поколения — Qwen3 под Apache 2.0, DeepSeek-V3, Kimi K2, GLM-4.6, Llama — остаются рабочими, но уступают текущим.
Два числа вместо одного: почему
У части моделей в таблице стоит два размера. Объясню, потому что от этого зависит, запустится ли она у вас.
Такие модели разбиты на много частей-«специалистов», и на каждое слово включается только небольшая их доля.
Отсюда две цифры:
Общий размер — сколько модель весит и сколько памяти требует, чтобы просто лежать наготове.
Активная часть — сколько реально считается на каждое слово, от чего зависят скорость и стоимость работы.
Пример: DeepSeek V4-Flash — 284 миллиарда всего, но только 13 миллиардов активных. Qwen 3.8 Max — 2,4 триллиона при 95 миллиардах активных.
Большое общее число даёт запас знаний, малое активное — приемлемую скорость. Но памяти всё равно нужно под общий размер.
Второе, что смотрят после размера
Сколько текста модель удерживает за раз — свой запрос плюс ответ.
Для работы с длинными документами, большими проектами и цепочками из многих шагов это критично: маленький объём заставит резать вход на куски и терять связность.
Текущее поколение подняло планку: у DeepSeek V4-Flash — миллион слов, у облачной версии Qwen 3.8 27B — примерно столько же. Но за это платят памятью, поэтому подбирайте под задачу, а не берите максимум про запас.
---
Часть 3. Что выбрать под задачу
Выбор определяется тремя вещами: задачей, вашим оборудованием и допустимой лицензией.
Для кода и агентов
Берут крупные модели с сильными результатами на инженерных тестах: DeepSeek V4 Pro, Qwen 3.8 Max, GLM-5.3, Kimi K3.
Ключевой практический критерий здесь не только качество, но и лицензия. DeepSeek публикует V4 Pro под MIT, GLM-5.2 тоже под MIT — это снимает большинство юридических вопросов для продукта.
Свежие замеры: у DeepSeek V4 Pro результат на DeepSWE вырос с 12,8 до 62,7; GLM-5.3 на Terminal-Bench 3.0 подняла балл с 4,6 до 28,3, а на DeepSWE v1.1 — с 46,2 до 66,9.
Рядом с моделью обычно нужны инструменты и оболочка — готовые процессы удобно брать в разделе шаблоны автоматизаций, а знание «как вести агента по шагам» — в хабе Skills для Claude Code.
И отдельно про то, чего не хватает большинству. Сама по себе развёрнутая модель ничего не делает — она отвечает на запросы. Чтобы она начала работать в процессе, нужна связка: что её запускает, куда идёт результат, что происходит при сбое.
Для тех, кто разворачивает своё, это обычно и есть недостающая часть: модель поставили, а процесса вокруг неё нет.
Экспресс-курс «AI-Агенты: эпоха электрификации рутины» закрывает ровно это: от первого автоматического агента до связок, работающих круглосуточно. Внутри 20 готовых проектов и четыре платформы — Make, n8n, Relevance и Lindy.
n8n здесь особенно к месту: это единственная из четырёх, которую можно поднять на своём сервере рядом с локальной моделью — и тогда весь контур, от запуска до результата, остаётся внутри вашего периметра.
$9, входит в тарифы Make и Team. В три бесплатных дня Basic не входит.
Для текстов на разных языках
Qwen 3.8 и DeepSeek V4: обе обучены на больших многоязычных наборах и уверенно работают с десятками языков, включая русский. Это важно для локализации, поддержки клиентов на разных рынках, перевода.
Обе доступны в разных размерах — от флагманов до компактных, — поэтому под каждый сценарий можно подобрать по оборудованию.
Для помощника, который держит контекст прямо на устройстве, подходит Muse Glimmer 30B: 29,6 миллиарда, в сжатом виде меньше 20 ГБ, объём контекста 131 тысяча слов.
Рядом полезны готовые GPT-ассистенты и библиотека промптов.
Для слабого железа
Берут не флагман, а компактную обычную модель — ту, где нет разбиения на части.
Удобных вариантов сейчас несколько: Muse Glimmer 30B (в сжатом виде меньше 20 ГБ) и Qwen 3.8 27B, которая умеет работать с изображениями и имеет отдельную сборку под экономию памяти.
Ориентир по памяти:
- Модель на 27–30 млрд в сжатии — около 16–20 ГБ видеопамяти
- Модель на 7–8 млрд — укладывается в 8 ГБ
- Для совсем слабых устройств есть отдельный класс: LFM2.5 на 2,69 млрд запускается на телефоне со скоростью около 30 слов в секунду при ~2,4 ГБ памяти
Точные требования зависят от степени сжатия и длины контекста — проверяйте по карточке конкретной сборки.
---
Часть 4. Семейства подробно
Qwen 3.8 (Alibaba)
Текущее поколение открытых моделей Alibaba, пришедшее на смену Qwen3.
Флагман Qwen 3.8 Max — 2,4 триллиона всего при 95 миллиардах активных. В первой публикации веса открыты, модель пока только текстовая, без работы с изображениями. Полная версия весит около 5 ТБ — дома не запустить, но сам факт важен: верхний эшелон качества уехал в открытые веса целиком, а не урезанной версией.
Следом Alibaba выложила Qwen 3.8 27B — обычную модель, которая умеет работать с изображениями, с отдельной облегчённой сборкой. Именно её ждали для локального запуска.
Линейка размеров ещё дорабатывается: команда публично говорила, что «прорабатывает больше размеров и архитектур». Сообщество ждёт вариант на 122 миллиарда, но официально он не подтверждён.
По лицензии будьте внимательны. Прежний Qwen3 выходил под свободной Apache 2.0, а к тексту лицензии Qwen 3.8 Max в первой публикации были вопросы по региональным оговоркам. Перед коммерческим внедрением читайте актуальную редакцию на карточке, а не полагайтесь на «раньше было Apache».
DeepSeek V4
Текущее поколение DeepSeek. Два заметных релиза с открытыми весами.
DeepSeek V4-Flash 0731 — 284 миллиарда с 13 миллиардами активных, 256 частей-специалистов (6 включаются на каждое слово), встроенное ускорение генерации. Контекст — миллион слов, лицензия MIT. Цены API стартовали от $0,14 за миллион входных и $0,28 за миллион выходных слов, со скидкой 98% на повторяющийся текст.
DeepSeek V4 Pro вышел из превью с весами под MIT (карточка): около 1,7 триллиона, результат DeepSWE прыгнул с 12,8 до 62,7.
Одновременно DeepSeek открыла свою агентную оболочку под MIT — сигнал, что вокруг модели строится ещё и среда для долгих автономных задач.
Практический смысл разбиения на части — в стоимости работы: при огромном запасе знаний на каждое слово реально считаются единицы процентов модели. Это делает работу флагманского качества доступнее по оборудованию, чем у равной по силе обычной модели.
Kimi K3 (Moonshot AI)
Текущий флагман Moonshot AI и на момент выхода — крупнейшая открытая модель в истории: 2,8 триллиона с ~104 миллиардами активных.
Огромное общее число при скромной активной доле — почерк семейства: запас под сложные многошаговые задачи без пропорционального роста стоимости каждого шага.
По независимым замерам надёжности Kimi K3 — сильнейшая среди открытых.
Экосистема подхватила релиз мгновенно: энтузиасты ужали модель с 1,56 ТБ до 594 ГБ с сохранением около 79% точности и запустили на домашних станциях, а серверные сборки показали сотни слов в секунду.
Лицензию читайте по карточке: у прошлого Kimi K2 это была Modified MIT с оговоркой об указании автора для очень крупных продуктов.
GLM-5.3 (Z.ai)
Развитие линейки GLM-5.2 и GLM-4.6.
Особенность в том, что улучшения получены не сменой базовой модели, а дообучением на длинных агентных задачах: Terminal-Bench 3.0 вырос с 4,6 до 28,3, DeepSWE v1.1 — с 46,2 до 66,9.
Главный сюрприз релиза — неожиданно сильная кибербезопасность: 84,5% на бенчмарке CyberGym и 2436 найденных уязвимостей в 269 открытых проектах, из них 1097 критичных и высоких.
Важная оговорка по доступности: на момент выхода этого гайда открыты веса GLM-5.2 под MIT, а веса 5.3 обещаны примерно через две недели после проверки безопасности. Нужна открытая модель прямо сейчас — отталкивайтесь от 5.2.
MIT-лицензия делает GLM привлекательной там, где юридическая чистота критична: никаких порогов по пользователям и обязательного указания автора.
Meta (Muse Glimmer)
Открытая модель Meta текущего поколения, пришедшая на смену линейке Llama. И это не только смена имени.
Llama распространялась под общинной лицензией с оговорками: указание «Built with Llama» и порог в 700 миллионов активных пользователей. Muse Glimmer 30B вышла под свободной Apache 2.0 — важный поворот для команд, которым нужна юридически чистая база.
Это обычная модель на 29,6 миллиарда, в сжатом виде меньше 20 ГБ, с контекстом 131 тысяча слов, заточенная под локальные постоянно работающие сценарии.
По разбору NVIDIA её сильная сторона — устойчивая работа агентом на обычном железе, а не рекорды на сводных таблицах.
---
Часть 5. Как уменьшить модель под своё железо
Сжатие — это уменьшение точности чисел, которыми записана модель: например, с 16 бит до 4 бит на параметр. Практически это уменьшает размер в памяти в несколько раз почти без потери качества.
Именно сжатие делает возможным локальный запуск на бюджетном оборудовании.
Ходовой формат — 4 бита: лучший баланс размера и качества для дома.
Ориентир простой: в 4 битах каждый миллиард параметров занимает примерно 0,5–0,6 ГБ. Отсюда: 7–8 миллиардов укладываются в 8 ГБ, 27–30 миллиардов требуют 16–20 ГБ.
Для гигантских моделей сжатие тоже помогает: Kimi K3 ужимали до 594 ГБ с 1,56 ТБ, Qwen 3.8 — с 4,9 ТБ до 397 ГБ. Это переводит серверную модель в разряд запускаемых на мощной домашней станции.
Но общий размер флагманов всё равно требует много памяти, поэтому для дома практичнее компактные обычные модели, а не флагманы с разбиением на части.
---
Часть 6. Почему рейтингам нельзя верить вслепую
Бенчмарк — это стандартный тест, по которому модели сравнивают на общей задаче: код, рассуждения, знания.
Опираться только на верхние строчки рискованно по трём причинам.
Заголовки быстро устаревают. Открытые модели обновляются почти еженедельно: за август 2026 года сменилось сразу несколько флагманов.
Бенчмарк меряет свою задачу, а не вашу. Высокий балл на инженерном тесте не гарантирует, что модель хорошо пишет именно ваш код на вашем стеке.
Часть рейтингов смешивает открытые и закрытые модели — легко принять недоступную для скачивания за «открытую».
И отдельная ловушка: оболочка важнее модели. По ряду замеров смена программы-обвязки вокруг модели двигала результат сильнее, чем апгрейд самой модели.
Практичный подход: сузьте список по лицензии и размеру, затем прогоните две-три модели на своих реальных задачах. Свежие замеры под конкретные сценарии собираем в ежедневных дайджестах.
---
Часть 7. Как запустить локально
Проще всего через готовые программы-запускалки — Ollama, LM Studio или llama.cpp. Они скрывают возню со сжатием и файлами модели.
Общий маршрут: выберите модель по размеру под своё оборудование → скачайте сжатую версию → запустите → обращайтесь к ней локально.
Для компактной модели вроде Muse Glimmer 30B или Qwen 3.8 27B ориентир — 16–20 ГБ видеопамяти в 4-битном сжатии. Для флагманов нужен сервер или мощная станция.
Сопутствующие инструменты и запускалки собраны в разделе Open Source.
Где это разбирают по шагам
Общий маршрут выше отвечает на вопрос «что делать». На вопрос «как именно» отвечает отдельный блок программы — «Работа с AI софтом».
Там разбирается работа с локальными генеративными моделями предметно: развёртывание, подбор сборки под ваше железо, сжатие, запуск и то, что обычно узнают методом проб — где модель упрётся в память, какие настройки реально влияют на скорость, что ломается при обновлении.
Это не экспресс-курс, а часть основной программы, тариф Full. Туда же входит доступ к самим локальным нейросетям.
Почему это Full, а не младший тариф. Локальное развёртывание — не начальный уровень: оно требует железа, готовности обслуживать и понимания, зачем вам это вместо готового решения. Если сомневаетесь — сначала пройдите проверку из конца этой статьи.
---
Часть 8. Где на этом зарабатывают
Раздел, которого в подобных обзорах обычно нет: они заканчиваются на «выберите модель».
Аргумент, который пугает заказчика сильнее цены
Когда вы продаёте компании систему, работающую постоянно, заказчик задаёт два вопроса. Сколько стоит внедрение — и сколько это будет стоить каждый месяц.
Второй пугает сильнее. Разовые деньги он готов потратить, а подписаться на бессрочный платёж, размер которого зависит от нагрузки, — нет.
Фраза «часть нагрузки идёт на модель, развёрнутую у вас, и не тарифицируется» снимает это возражение целиком.
Аргумент, который весит больше денег
Данные.
Для клиники, юридической фирмы или финансовой компании локальное развёртывание — условие сделки, а не преимущество. Без него разговор не начинается.
Если вы работаете с такими заказчиками, это ваш входной билет — и одновременно то, что отсекает конкурентов с обычными решениями.
Как формулировать в предложении
Не «мы используем открытые модели» — заказчику это ничего не говорит.
А так: «чувствительные данные обрабатываются на вашем сервере и не покидают контур; сложные задачи уходят во внешние модели, и это отдельная небольшая статья расходов, которую вы видите в панели».
Прозрачно, проверяемо и снимает оба страха сразу.
Гибридная схема
Почти никто не работает только локально, и это правильно.
Локально держат: всё чувствительное, накопленный контекст, регулярные однотипные задачи, работу с внутренними документами.
Наружу отдают: сложные творческие задачи, генерацию изображений и видео, поиск свежей информации, всё, где качество топовых моделей заметно выше.
Правило: есть данные, которые нельзя выносить — локально, независимо от качества. Данных нет, нужен лучший результат — наружу.
И один формат, который стоит знать отдельно. Обычные помощники живут во вкладке браузера: закрыли — забыли вас, каждое обращение тарифицируется. Есть другой — фоновый сервис на вашем железе, который работает постоянно, помнит вас между сессиями и не выставляет счёт за запрос.
Плюс два свойства, которых у вкладки нет в принципе: он сам инициирует контакт при наступлении события и живёт в мессенджерах, а не в отдельном окне.
Экспресс-курс «OpenClaw: не помощник в браузере, а свой AI-оператор» — про развёртывание такого сервиса. На выходе: работающий оператор на вашем железе с подключением к WhatsApp, Telegram, Discord, iMessage и Slack, библиотека из 50+ навыков и настроенная система памяти.
Для человека, который уже поднял локальную модель, это логичное продолжение: модель отвечает, а оператор превращает её в постоянно работающего помощника.
$9, входит в тарифы Make и Team.
Порядок цен
По выгрузке на 848 объявлений о заказах за 24 дня: система или конвейер — $490–1 460, при медиане разовой работы $30–75.
Честная оговорка: явный бюджет указан в 6% объявлений, по категориям от двух до пятнадцати наблюдений.
Реальный пример: система для стоматологической клиники — $1 900 в год, оплата получена полностью. Сравнение шло не с нулём, а со штатной командой примерно за $720 в месяц плюс налоги и отпуска.
Сегмент узкий, но чек выше и клиенты долгосрочные: систему, встроенную в контур организации, не меняют каждый год. Искать таких заказчиков надо не в ленте общих заказов, а через отрасль — там, где требования к данным есть по определению.
---
Часть 9. Что открывать под свою задачу
Прежде чем разворачивать своё — проверьте, не решается ли задача проще.
Готовые ассистенты. Больше 140 в 14 категориях. Если задача звучит как «нужен помощник по такой-то теме», ответ, скорее всего, здесь. Тариф Basic.
Шаблоны автоматизаций. Более 3 000 сценариев. Если задача механическая, локальная модель для неё избыточна. Тариф Plus.
Энциклопедия из более 190 проверенных сервисов — чтобы понять, что чем делается, до выбора инструмента. Входит в Basic.
Open Source. Готовые проекты, которые разворачиваются у себя: раннеры, векторные базы, агентные оболочки, инструменты. Каталог открыт всем, ссылки на файлы — после бесплатной регистрации.
Лестница для тех, кто идёт в своё
Четыре ступени, от дешёвой к серьёзной.
1. Экспресс-курс «AI-Агенты». Связки вокруг модели: 20 готовых проектов, четыре платформы, среди них n8n — единственная, которую можно поднять рядом с локальной моделью на своём сервере. $9, тарифы Make и Team.
2. Экспресс-курс «OpenClaw». Фоновый оператор на своём железе: локальная память, проактивность, мессенджеры, 50+ навыков. $9, тарифы Make и Team.
3. Блок программы «Работа с AI софтом». Локальные генеративные модели по шагам: развёртывание, подбор сборки под железо, сжатие, запуск. Плюс доступ к самим локальным нейросетям. Тариф Full.
4. Блок «Enterprise-автоматизация: Make и n8n». Верхний уровень: приватные контуры и архивы готовых связок Make и n8n. Тариф Full.
Оба экспресс-курса в три бесплатных дня Basic не входят — разовая покупка, соответствующий тариф или 1 000 очков опыта.
Порядок имеет значение. Первые две ступени стоят по $9 и отвечают на вопрос «нужно ли мне это вообще». Full берут те, кто на первых двух убедился, что нужно.
---
Чек-лист: что учесть до скачивания
Пять вопросов, которые лучше задать до, а не после.
- Лицензия под ваш сценарий. Для коммерческого продукта надёжнее Apache 2.0 (Muse Glimmer) или MIT (DeepSeek V4, GLM-5.2). Лицензии Qwen 3.8 и Kimi K3 читайте на карточке.
- Задача. Код и агенты — крупные DeepSeek V4 Pro, Qwen 3.8 Max, GLM-5.3, Kimi K3. Многоязычные тексты — Qwen 3.8 и DeepSeek V4. Слабое железо — компактные Muse Glimmer 30B и Qwen 3.8 27B.
- Память. Прикиньте бюджет с учётом сжатия: 0,5–0,6 ГБ на миллиард параметров в 4 битах. Это отсекает половину вариантов сразу.
- Свежесть. Проверьте, не вышла ли новая версия: часть весов, как у GLM-5.3, открывается с задержкой после анонса.
- Проверка на своих данных. Финальное решение — по прогону двух-трёх кандидатов на реальной задаче, а не по строчке рейтинга.
---
Хроника релизов
Открытые модели обновляются почти еженедельно, поэтому месячные рейтинги устаревают.
Только за август 2026 года вышли открытые веса Qwen 3.8 Max и Qwen 3.8 27B, DeepSeek V4 Pro, Meta открыла Muse Glimmer 30B, а Z.ai показала GLM-5.3.
Мы отслеживаем релизы в ежедневных AI-дайджестах — там свежие цифры, лицензии и практические замеры сообщества появляются раньше, чем в помесячных обзорах.
---
FAQ
Можно ли использовать открытые модели коммерчески?
Зависит от лицензии, и это главный вопрос перед внедрением.
Muse Glimmer 30B (Apache 2.0), DeepSeek V4 (MIT) и GLM-5.2 (MIT) разрешают коммерческое использование почти без условий. Лицензии Qwen 3.8 и Kimi K3 нужно читать по карточке: у Qwen 3.8 Max были вопросы по региональным оговоркам, у прошлого Kimi K2 действовала Modified MIT с требованием указывать автора для очень крупных продуктов.
Перед продакшеном всегда сверяйтесь с актуальным текстом лицензии конкретной модели.
Что значат два числа в размере модели?
Часть современных моделей разбита на много частей-«специалистов», и на каждое слово включается лишь малая их доля.
Общее число показывает, сколько модель весит и требует памяти; активное — сколько реально вычисляется, от чего зависят скорость и стоимость. Большое общее даёт запас знаний, малое активное — приемлемую скорость.
Но памяти нужно под общий размер, а не под активный, — это главное, что стоит запомнить при выборе под своё железо.
Догнали ли открытые модели закрытые?
По ряду задач разрыв заметно сократился: открытые флагманы показывают конкурентные результаты на инженерных и агентных тестах. А важнее всего то, что их можно запустить у себя и не зависеть от чужого сервиса.
Сравнивать при этом надо осторожно: заголовки быстро устаревают, а тесты не всегда отражают вашу задачу. Практичнее проверять модель на своих данных.
Чем открытые веса отличаются от локального запуска?
Это разные вещи, которые часто путают.
Открытые веса — свойство модели: её параметры опубликованы и их можно скачать.
Локальный запуск — способ использования: вы крутите модель на своём железе.
Открытую модель можно запускать и локально, и в облаке, и через чужой хостинг. А локально можно запускать только те, чьи веса открыты.
Стоит ли мне вообще этим заниматься?
Простая проверка. Выпишите задачи, которые вы не отдаёте нейросетям из-за чувствительности данных. Не те, что решаете, а те, что не решаете вообще.
Пустой список — тема локальных моделей вам пока не нужна, и это нормальный ответ. Обычные инструменты закроют то же самое дешевле.
Три-четыре регулярные задачи в списке — вот ваше обоснование. И тот же список вы покажете руководителю или заказчику: он убеждает лучше любого рассказа о технологии.
---
Попробуйте
Регистрация бесплатная и открывает три дня доступа к тарифу Basic целиком — Open Source, все 140+ ассистентов, энциклопедия из более 190 проверенных сервисов, тексты промптов, файлы скиллов и шесть базовых курсов.
Трёх дней хватает, чтобы проверить главное: решается ли ваша задача готовым решением — до того, как вы потратите выходные на настройку оборудования.
Что почитать дальше
Локальные нейросети для чувствительных данных — что держат внутри контура и как это продавать.
Локальный ИИ-оператор с памятью — фоновый сервис вместо вкладки в браузере.
База знаний компании как услуга — RAG на приватных документах.
Как выбрать нейросеть под задачу — пять критериев в порядке применения.
Сколько стоит попробовать — оплата по факту вместо подписок.
Автоматизация без программиста — что строят вокруг развёрнутой модели.
Нейросети для инженера — где нельзя доверять расчётам.
Нейросети в медицине — отрасль, где локальность — условие работы.
Как принести ИИ в отдел — если в компании требования к данным.
Шаблоны автоматизаций n8n и Make — что строят вокруг модели.