HQQ — квантование LLM без калибровочных данных
★ 7.7 · ai-tooling
hqq — это скилл для Claude Code, который реализует Half-Quadratic Quantization (HQQ): быстрое квантование весов LLM без калибровочных данных с поддержкой точности 8/4/3/2/1-бит. Квантование выполняется за минуты — в отличие от GPTQ и AWQ, не требует обучающих датасетов, что позволяет сжимать любую модель мгновенно. Скилл поддерживает несколько бэкендов: PyTorch, ATEN, TorchAO, Marlin, BitBlas, GemLite — с нативной интеграцией в HuggingFace Transformers и vLLM, а также совместим с дообучением через LoRA/PEFT. Подходит для задач сжатия и ускорения инференса больших языковых моделей, особенно когда калибровочные данные недоступны или нужно быстро экспериментировать с экстремальными режимами сжатия (2-бит, 1-бит).
- #hqq-quantization
- #calibration-free
- #model-compression
- #4-bit-precision
- #vllm-integration
- #huggingface
- #inference-optimization