quant.cpp — локальный запуск LLM со сжатием KV-кэша

vibe-coding

quant.cpp — это открытая C/Python-библиотека для запуска LLM на потребительском железе с 6.4× сжатием KV-кэша без потери качества. Инструмент содержит 17 600 строк кода на C, не имеет внешних зависимостей и устанавливается командой `pip install quantcpp`. Поддерживаются контексты до 128K токенов на MacBook с 16 ГБ RAM: Llama 3.2 3B укладывается в 9.5 ГБ там, где FP32 вызывает OOM. CLI позволяет скачивать модели, запускать интерактивный чат и поднимать OpenAI-совместимый HTTP-сервер (`quantcpp serve`), а Python API требует всего трёх строк кода. Подход «полный документ вместо RAG» показал точность 7/7 против 0/7 у chunk-RAG на синтетическом тесте с мультихоповыми вопросами.