VoiceStudio — локальный клон голоса и синтез речи

VoiceStudio — это открытый инструмент для клонирования голоса, синтеза речи, диктовки, дублирования видео и создания аудиокниг, работающий полностью локально на своём железе. Берут, когда нужно озвучить видео своим голосом без облачных сервисов, когда хочется создать аудиокнигу или подкаст с клонированным голосом, когда сканы и записи нельзя отдавать в облако, или когда надоело платить за подписку на TTS-сервисы. Внутри — 16 TTS-движков и 11 ASR-движков с каталогом из 646 языков, десктопное приложение (macOS 13.3+, Windows 10/11, Linux x86_64), локальный REST/SSE/WebSocket API, совместимый с OpenAI Audio API, и MCP Server. Поддерживает CUDA, Apple Silicon MPS/MLX, ROCm и CPU. Голоса, проекты и выходные файлы остаются на машине — аккаунт, API-ключ и подписка не нужны. Устанавливается через готовые пакеты для каждой платформы. Направление — синтез и клонирование голоса, озвучка и дублирование, а не только транскрипция речи в текст. Клонирование голоса и дипфейки голоса — применять только законно, на своих материалах и с согласия людей. Подойдёт для локальной работы без интернета; активная бета, для стабильной работы используется последний релиз.