Airword

Распознавание речи: как работает преобразование речи в текст

Команда Airword6 мин

Технология, которая слушает ваш голос и отдаёт готовые буквы, называется распознаванием речи. Именно на ней держатся набор голосом, расшифровка аудио и умные ассистенты. Ниже — что творится у неё под капотом, почему она иногда мажет и чем «голос в буквы» отличается от зеркальной задачи «буквы в голос».

Если объяснять на пальцах

За рубежом это зовут speech-to-text или коротко ASR. Суть простая: на вход подаётся звуковая дорожка, на выходе получается набранный текст. Машина дробит поток на мельчайшие звуковые кусочки и складывает из них слова, а из слов — фразы.

Для вас это выглядит как магия: сказали вслух — увидели написанное, которое дальше можно отправить, сохранить или подправить.

Что крутится внутри

Работают, по сути, два эксперта разом. Один — «слухач» — сопоставляет звуковую волну с крохотными единицами произношения. Второй — «грамотей» — прикидывает, какая цепочка слов вообще имеет смысл, чтобы «плот» ненароком не стал «плодом».

Сегодня обе роли исполняют нейросети, натасканные на тысячах часов живых записей. И вот ключевое: чем гуще в этом обучении именно русская речь, тем аккуратнее итог на русском.

Не спутайте с озвучкой

«Голос в буквы» и «буквы в голос» смотрят в разные стороны. Первое — это наша тема: услышать и записать. Второе, синтез (text-to-speech), наоборот берёт готовый текст и проговаривает его вслух.

Набор голосом и расшифровка совещаний — это распознавание. Озвученные аудиокниги и реплики ассистента — это уже синтез.

Где это встречается каждый день

  • Диктовка — вы наговариваете, вместо того чтобы стучать по клавишам.

  • Расшифровка — интервью, лекция или созвон превращаются в читаемый текст.

  • Ассистенты — колонка или телефон улавливают команду и вопрос.

  • Субтитры — подписи под роликом появляются автоматически.

Отчего зависит, попадёт ли машина в слова

На аккуратность влияет сразу несколько вещей:

  • Язык и его проработка в модели — под русский нужна модель, обученная на русском.

  • Фоновый шум — в тишине разбирается лучше, чем в гуле кофейни.

  • Микрофон — чем чище звук на входе, тем ровнее буквы на выходе.

  • Манера говорить — внятная речь даётся легче, чем зачастую невнятная скороговорка.

Как пощупать вживую

Проще всего почувствовать технологию через диктовку. Airword слышит русскую речь и роняет готовый текст в любую программу на Windows и Mac по одной горячей клавише — сам расставляет знаки препинания и вычищает «эээ» и оговорки. Стартовый тариф бесплатный.

Частые вопросы

Чем распознавание речи отличается от синтеза речи?

Распознавание слушает голос и отдаёт текст, синтез берёт текст и проговаривает его вслух. Это зеркальные, противоположные задачи.

Почему распознавание речи иногда ошибается?

Мешают фоновый шум, слабый микрофон, невнятная речь или плохо проработанный в модели язык. На русском точнее те системы, что учились именно на русской речи.

Как превратить речь в текст на компьютере?

Нужна программа диктовки: она слышит голос и подставляет текст в поле. Например, Airword срабатывает по горячей клавише в любом приложении на Windows и Mac.

Диктуйте вместо того, чтобы печатать

Airword превращает русскую речь в готовый текст в любом приложении. Бесплатно попробовать — минута.

Читайте также