Whisper — распознавание речи в текст

★ 70k+

Whisper — это открытая модель распознавания речи от OpenAI, переводящая аудио в текст с высокой точностью на многих языках, а также умеющая перевод речи. Берут, когда нужно расшифровать аудио или видео в текст локально: транскрибировать интервью, лекции, подкасты и записи встреч, получать субтитры, работать с многоязычным аудио — на своём железе, по открытым весам. Это эталонная модель ASR, на которой построены многие ускоренные и прикладные инструменты. Направление — базовая открытая модель распознавания речи (speech → text) для запуска и встраивания, а не готовое приложение с интерфейсом (buzz) и не быстрый прод-движок (faster-whisper) и не транскрипция с диаризацией (whisperX): ценность — точная многоязычная расшифровка как основа. Крупные модели точнее, но требовательнее к ресурсам. Подойдёт разработчикам и исследователям, которым нужна опорная модель ASR для своих задач.