AWQ — 4-битное сжатие языковых моделей
★ 7.7 · ai-tooling
awq — это скилл для Claude Code, который реализует активационно-осведомлённую квантизацию (Activation-aware Weight Quantization) для сжатия больших языковых моделей до 4 бит с ускорением инференса в 2,5–3 раза и потерей точности менее 5% (лауреат Best Paper Award на MLSys 2024). Скилл работает через библиотеку autoawq с зависимостями transformers ≥ 4.45.0 и torch ≥ 2.0.0, поддерживает ядра GEMM, GEMV и Marlin (для GPU Ampere+: A100, H100, RTX 40xx), а также нативную интеграцию с vLLM и HuggingFace Transformers. Ключевая идея: защищаются ~1% «значимых» весов, определённых по паттернам активаций, что снижает ошибку квантизации без накладных расходов смешанной точности. Подходит для развёртывания инструктивных и мультимодальных моделей размером 7B–70B на видеокартах с ограниченной памятью: Mistral 7B занимает 5,5 ГБ вместо 14 ГБ, Llama 2-70B — 35 ГБ вместо 140 ГБ. Квантизация 7B-модели занимает 10–15 минут, 70B — около часа.
- #quantization
- #llm-compression
- #gpu-optimization
- #4-bit
- #inference
- #model-deployment
- #awq