Конвертация и квантизация моделей в GGUF

★ 7.7 · ai-tooling

gguf — это скилл для Claude Code, который помогает конвертировать и квантизировать языковые модели в формат GGUF для эффективного инференса через llama.cpp на CPU, Apple Silicon и потребительском оборудовании. Скилл охватывает полный цикл: конвертацию модели из HuggingFace в GGUF, квантизацию от Q2_K до Q8_0 с K-quant методами, генерацию матрицы важности (imatrix) для улучшения качества при низкобитных квантах и запуск через CLI или Python-биндинги llama-cpp-python. Рекомендуемый по умолчанию формат Q4_K_M даёт хороший баланс качества и размера; Q8_0 сохраняет максимальное качество. Подходит разработчикам, которым нужен локальный деплой LLM без GPU: готовые GGUF-файлы совместимы с LM Studio, Ollama, koboldcpp и text-generation-webui.