CrisperWhisper — точная расшифровка речи с таймстемпами
CrisperWhisper — это открытый инструмент для автоматической расшифровки речи с точным дословным или «чистым» режимом, пословными таймстемпами и поддержкой многих языков. Берут, когда нужно зафиксировать буквально всё сказанное — слова-паразиты, запинки, смех и обрывы — для клинического анализа речи, датасетов TTS или аналитики переговоров; или наоборот, когда нужен аккуратный читаемый текст без лишнего шума. Также берут, когда уже есть чистая транскрипция, но требуется добавить к ней реальные дисфлюенции из аудио без полной перерасшифровки. Внутри — модели на базе Whisper, рантайм CTranslate2 со спекулятивным декодированием для GPU (NVIDIA), режим PyTorch для macOS, Windows и CPU; устанавливается через pip, модели загружаются с Hugging Face. Два режима — verbatim и intended — переключаются параметром; функция verbatimize вставляет дисфлюенции в готовую транскрипцию. Погрешность пословных таймстемпов — около 30 мс на чтении вслух. Направление — расшифровка речи в текст, а не синтез речи из текста. В каталоге есть WhisperX, но CrisperWhisper превосходит его по точности таймстемпов и дословной передаче. Подойдёт для исследовательских и производственных задач с длинными аудио; не подходит, если нужна потоковая расшифровка в реальном времени с минимальной задержкой.