llama.cpp — локальный инференс LLM без GPU

★ 7.7 · orchestration

llama-cpp — это скилл для Claude Code, который запускает инференс LLM на CPU, Apple Silicon (M1/M2/M3/M4) и потребительских GPU без NVIDIA, используя чистую реализацию на C/C++ с минимальными зависимостями. Скилл поддерживает GGUF-квантизацию от 1.5 до 8 бит — рекомендуемый формат Q4_K_M даёт 4.1 ГБ для 7B-модели и ускорение до 4–10× по сравнению с PyTorch на CPU. Встроен запуск через llama-cli, серверный режим с OpenAI-совместимым API (llama-server), пакетная обработка, грамматически ограниченная генерация (GBNF) и гибридный режим CPU+GPU для больших моделей (70B, 405B). Поддерживаются Llama 2/3, Mistral, Mixtral, Phi-3, Gemma, Qwen, LLaVA и другие модели в формате GGUF. Идеален для edge-развёртывания на Raspberry Pi и встраиваемых системах, локальной работы на Mac без CUDA и сценариев, где нужна экономия памяти без потери качества.