bitsandbytes — квантизация LLM до 4 и 8 бит
★ 7.7 · ai-tooling
bitsandbytes — это скилл для Claude Code, который квантизует большие языковые модели до 8-бит или 4-бит с сокращением потребления памяти на 50–75% и потерями точности менее 1%. Скилл поддерживает форматы INT8, NF4 и FP4, обучение QLoRA на потребительских видеокартах, а также 8-битные оптимизаторы Adam/AdamW для экономии памяти при файн-тюнинге. Работает через HuggingFace Transformers и зависимости bitsandbytes, accelerate, torch — загрузка модели занимает одну строку с BitsAndBytesConfig. Подходит тем, кто хочет запустить Llama-2-7B на GPU с 8–12 ГБ VRAM или дообучить 7B-модель через QLoRA, не выходя за рамки памяти одной карты.
- #quantization
- #llm-compression
- #qlora
- #bitsandbytes
- #memory-optimization
- #gpu-inference
- #huggingface