llama.cpp — локальный инференс LLM без GPU

★ 65k

llama.cpp — это высокопроизводительный движок инференса больших языковых моделей на C/C++, оптимизированный для запуска на обычном железе, в том числе без мощной видеокарты. Берут, когда нужно запускать открытые LLM локально быстро и экономно: гонять модели на CPU или GPU, на ноутбуке, сервере или даже слабом устройстве, используя квантованные модели формата GGUF ради компактности и скорости. Это фундамент, на котором построены многие пользовательские инструменты (Ollama, LM Studio и др.); есть примеры серверов и привязки к разным языкам. Направление — низкоуровневый быстрый движок локального инференса LLM с квантизацией, а не готовое приложение-чат (для этого Jan/LM Studio/Ollama) и не высоконагруженный прод-сервер с батчингом на GPU (для этого vLLM): ценность — эффективный запуск моделей на разном, в том числе скромном, железе. Подойдёт разработчикам и энтузиастам, которым нужен контроль и производительность локального инференса; формат GGUF — стандарт де-факто для квантованных весов.