FireRedVAD — детектор голосовой активности
★ 491
FireRedVAD — это промышленного уровня детектор голосовой активности (VAD) и звуковых событий (AED): он определяет, где в аудио есть речь (а также пение и музыку), в потоковом и непотоковом режиме, на 100+ языках. Берут как служебный компонент в аудио-конвейерах: нарезать длинную запись на сегменты с речью перед расшифровкой, отсекать тишину и шум, экономить на распознавании, детектировать пение/музыку. По заявленным метрикам обгоняет Silero-VAD, TEN-VAD, FunASR-VAD и WebRTC-VAD (F1 97.57% на FLEURS-VAD-102); есть веса и код инференса. Направление — точно находить границы речи и типы звука в аудио, а не расшифровывать речь в текст (это делает ASR вроде whisperX) и не генерировать звук: это предобработчик, который ставят перед ASR или аналитикой звука. Полезен разработчикам голосовых пайплайнов для повышения точности и скорости последующих шагов.
- #Speech