quant.cpp — локальный запуск LLM со сжатием KV-кэша
vibe-coding
quant.cpp — это открытая C/Python-библиотека для запуска LLM на потребительском железе с 6.4× сжатием KV-кэша без потери качества. Инструмент содержит 17 600 строк кода на C, не имеет внешних зависимостей и устанавливается командой `pip install quantcpp`. Поддерживаются контексты до 128K токенов на MacBook с 16 ГБ RAM: Llama 3.2 3B укладывается в 9.5 ГБ там, где FP32 вызывает OOM. CLI позволяет скачивать модели, запускать интерактивный чат и поднимать OpenAI-совместимый HTTP-сервер (`quantcpp serve`), а Python API требует всего трёх строк кода. Подход «полный документ вместо RAG» показал точность 7/7 против 0/7 у chunk-RAG на синтетическом тесте с мультихоповыми вопросами.
- #develop
- #grow
- #orchestrate
- #qa
- #score