HQQ — квантование LLM без калибровочных данных

★ 7.7 · ai-tooling

hqq — это скилл для Claude Code, который реализует Half-Quadratic Quantization (HQQ): быстрое квантование весов LLM без калибровочных данных с поддержкой точности 8/4/3/2/1-бит. Квантование выполняется за минуты — в отличие от GPTQ и AWQ, не требует обучающих датасетов, что позволяет сжимать любую модель мгновенно. Скилл поддерживает несколько бэкендов: PyTorch, ATEN, TorchAO, Marlin, BitBlas, GemLite — с нативной интеграцией в HuggingFace Transformers и vLLM, а также совместим с дообучением через LoRA/PEFT. Подходит для задач сжатия и ускорения инференса больших языковых моделей, особенно когда калибровочные данные недоступны или нужно быстро экспериментировать с экстремальными режимами сжатия (2-бит, 1-бит).