Coqui TTS — синтез и клонирование голоса

★ 33k

Coqui TTS — это открытая библиотека синтеза речи: она превращает написанный текст в звучащий голос. Направление важно не перепутать — это озвучка, а не расшифровка; чтобы, наоборот, получить текст из записи, нужны инструменты распознавания вроде Whisper. Её берут, когда надо озвучить видео, статью или рассылку, сделать голос для бота и ассистента, наговорить курс без микрофона и студии, а также клонировать собственный голос по короткому образцу и потом «читать» им любой текст. В наборе больше 1100 предобученных моделей на разных языках; флагманская XTTSv2 работает с 16 языками, умеет клонирование голоса и отдаёт звук потоком с задержкой меньше 200 мс, что годится для живого диалога. Есть интеграции с Bark и Tortoise и инструменты для дообучения на своих записях. Работает локально на своём компьютере или сервере, файлы никуда не уходят.