GPTQ — 4-битная квантизация LLM для потребительских GPU

★ 7.7 · ai-tooling

gptq — это скилл для Claude Code, который выполняет постобучающую 4-битную квантизацию больших языковых моделей с минимальными потерями точности (менее 2% деградации перплексии) с помощью групповой квантизации. Скилл позволяет развёртывать модели размером 70B и 405B на потребительских видеокартах (RTX 4090, 3090), обеспечивая четырёхкратное сокращение памяти и ускорение инференса в 3–4 раза относительно FP16. Под капотом — зависимости auto-gptq, transformers, optimum и peft; поддерживаются бэкенды ExLlamaV2 и Marlin, группировка весов с размером группы 128 (рекомендуемый вариант), а также QLoRA-файнтюнинг через PEFT. Подходит ML-инженерам, которым нужно уместить крупные модели в ограниченную GPU-память или ускорить инференс без переобучения: скилл охватывает как загрузку уже квантизированных моделей с Hugging Face, так и квантизацию собственных чекпоинтов с калибровочными данными.