VibeVoice — распознавание и синтез речи

★ 52.8K

VibeVoice — это открытый голосовой фреймворк Microsoft, который закрывает обе стороны работы со звуком: распознавание речи и её синтез. Модель распознавания VibeVoice-ASR-7B обрабатывает до 60 минут аудио за один проход и сразу отдаёт расшифровку с разделением по говорящим — удобно для записей созвонов, интервью и подкастов, где важно понимать, кто что сказал. Синтезирующая часть, наоборот, озвучивает текст и держит характер голоса на длинных фрагментах, что нужно для аудиокниг и многоголосых диалогов. Берут его, когда обе задачи нужны в одном стеке и не хочется собирать связку из разных проектов, а также когда обработка должна идти на своём оборудовании без отправки записей наружу. Запускается локально; требуется видеокарта, объём памяти зависит от выбранной модели.