Voice-Pro — синтез, клонирование и перевод речи

★ 12.7K

Voice-Pro — это открытый инструмент для работы с речью и звуком, объединяющий распознавание, перевод, синтез и клонирование голоса в одном Gradio-интерфейсе. Берут, когда нужно расшифровать видео с YouTube и сразу переозвучить его на другом языке, когда требуется отделить вокал от музыки перед монтажом, когда делают подкаст или аудиокнигу и нужен синтезированный голос без записи в студии, или когда надо сгенерировать субтитры для ролика без ручной правки. Написан на Python; стек — faster-whisper 1.2.1 и openai-whisper для распознавания, Edge-TTS и kokoro для синтеза, F5-TTS / E2-TTS / CosyVoice для zero-shot клонирования голоса, Demucs и MDX-Net для разделения дорожек, yt-dlp для скачивания исходников. Перевод через Deep-Translator покрывает 100+ языков, опционально подключается Azure TTS и Azure Translator. Запускается на Windows через start.bat, требует NVIDIA GPU; Linux и Mac официально не проверены. Направление конвейера — от видео/аудио к готовой озвучке, а не распознавание в реальном времени. Клонирование чужого голоса допустимо только с согласия человека и в рамках закона. Не подходит для потокового распознавания и для систем без дискретной видеокарты NVIDIA.