Распознавание речи: как работает преобразование речи в текст
Технология, которая слушает ваш голос и отдаёт готовые буквы, называется распознаванием речи. Именно на ней держатся набор голосом, расшифровка аудио и умные ассистенты. Ниже — что творится у неё под капотом, почему она иногда мажет и чем «голос в буквы» отличается от зеркальной задачи «буквы в голос».
Если объяснять на пальцах
За рубежом это зовут speech-to-text или коротко ASR. Суть простая: на вход подаётся звуковая дорожка, на выходе получается набранный текст. Машина дробит поток на мельчайшие звуковые кусочки и складывает из них слова, а из слов — фразы.
Для вас это выглядит как магия: сказали вслух — увидели написанное, которое дальше можно отправить, сохранить или подправить.
Что крутится внутри
Работают, по сути, два эксперта разом. Один — «слухач» — сопоставляет звуковую волну с крохотными единицами произношения. Второй — «грамотей» — прикидывает, какая цепочка слов вообще имеет смысл, чтобы «плот» ненароком не стал «плодом».
Сегодня обе роли исполняют нейросети, натасканные на тысячах часов живых записей. И вот ключевое: чем гуще в этом обучении именно русская речь, тем аккуратнее итог на русском.
Не спутайте с озвучкой
«Голос в буквы» и «буквы в голос» смотрят в разные стороны. Первое — это наша тема: услышать и записать. Второе, синтез (text-to-speech), наоборот берёт готовый текст и проговаривает его вслух.
Набор голосом и расшифровка совещаний — это распознавание. Озвученные аудиокниги и реплики ассистента — это уже синтез.
Где это встречается каждый день
Диктовка — вы наговариваете, вместо того чтобы стучать по клавишам.
Расшифровка — интервью, лекция или созвон превращаются в читаемый текст.
Ассистенты — колонка или телефон улавливают команду и вопрос.
Субтитры — подписи под роликом появляются автоматически.
Отчего зависит, попадёт ли машина в слова
На аккуратность влияет сразу несколько вещей:
Язык и его проработка в модели — под русский нужна модель, обученная на русском.
Фоновый шум — в тишине разбирается лучше, чем в гуле кофейни.
Микрофон — чем чище звук на входе, тем ровнее буквы на выходе.
Манера говорить — внятная речь даётся легче, чем зачастую невнятная скороговорка.
Как пощупать вживую
Проще всего почувствовать технологию через диктовку. Airword слышит русскую речь и роняет готовый текст в любую программу на Windows и Mac по одной горячей клавише — сам расставляет знаки препинания и вычищает «эээ» и оговорки. Стартовый тариф бесплатный.
Частые вопросы
Чем распознавание речи отличается от синтеза речи?
Распознавание слушает голос и отдаёт текст, синтез берёт текст и проговаривает его вслух. Это зеркальные, противоположные задачи.
Почему распознавание речи иногда ошибается?
Мешают фоновый шум, слабый микрофон, невнятная речь или плохо проработанный в модели язык. На русском точнее те системы, что учились именно на русской речи.
Как превратить речь в текст на компьютере?
Нужна программа диктовки: она слышит голос и подставляет текст в поле. Например, Airword срабатывает по горячей клавише в любом приложении на Windows и Mac.