На танцполе павуки-павлины
Maratus volans — вид пауков-скакунов рода Maratus из подсемейства Euophryinae. Эндемик Австралии. Один из пауков, чьи ярко окрашенные самцы «танцуют» перед самками.
Источник: Википедия
Это Москва, но Марьино
Часть 2 #этомосквано
Продолжаем делиться нашим архивом. Ролик изначально опубликован в августе 2025.
То, что в ролике упоминается ТЯК Москва – это известная нам ошибка, но вы все равно можете нам об этом написать :)
История голосовых помощников, часть II: как распознать звуки, если ты машина
Путь к голосовым помощникам занял в общей сложности три с лишним века. Если предельно упростить этапы, то для создания голосовых помощников нужно было
Научить машины «говорить»,
Научить машины распознавать слова и команды,
Соединить эти умения, добавить понимание смысла и навык выполнения требуемого действия.
В первой части мы уже рассказали, какими были первые машины, которые издавали звуки, слова и целые предложения. Один из наших читателей оставил довольно емкую характеристику в комментариях:
Пристегивайтесь — ныряем в XX век!
Аппарат Мясникова, 1940-е
Во время войны, в 1942, Лев Леонидович Мясников защитил кандидатскую диссертацию «Техническая фонетика» — это была первая в мире работа по объективному распознаванию звуков речи, направлению, которым сейчас занимаются десятки лабораторий мира. Его аппарат умел распознавать гласные — физическим прототипом или его фото порадовать вас не можем, поскольку разработка и демонстрация пришлись на годы блокады Ленинграда, но зато у нас остался патент.
Лев Леонидович прожил долгую жизнь, полную исследований, изобретений (их было, суммарно, 15), книг (их 6, возможно, кто-то из наших читателей даже встречался с ними во время обучения на физфаке) и создал научную школу по судовой акустике и электронике.
Audrey, 1952
Исследователи Bell Labs Стивен Балашек, Р. Биддалф и К. Х. Дэвис создали систему Audrey для распознавания речи. Название расшифровывалось как Automatic Digit Recognizer — автоматический распознаватель цифр.
Выглядело это так:
человек произносил в микрофон, условно, «два»;
Audrey превращала колебания голоса в электрический сигнал;
Audrey смотрела, какие частоты в нём сильнее и как они меняются во времени;
на экране машины появлялась «2».


«Опять двойка»
Может возникнуть вопрос, распознавала ли машина что-то кроме цифр — к сожалению, нет; более того, Audrey работала с изолированными словами (после каждой цифры нужно было сделать заметную паузу). А еще она сильно зависела от диктора, ориентируясь на свою «память» — у одного человека «пять» имеет один звуковой рисунок; у другого — другой. Audrey лучше всего работала с голосом её разработчика Кингсбери Дэвиса: источники приводят точность свыше 90%, а для нескольких других знакомых системе говорящих — примерно 70–80%. Если перед машиной поставить ребенка трех лет, человека с сильным акцентом и пожилого человека с замедленной речью, то результаты распознавания будут куда ниже.
Однако нельзя не признать, что начало было положено — обычно именно Audrey считается первой системой, способной по-настоящему «слушать» человека.
IBM Shoebox, 1962
В 1962 году IBM публично показала на Всемирной выставке в Сиэтле систему Shoebox («обувная коробка»), разработанную Уильямом Дёршем: она понимала 16 английских слов, включая цифры и арифметические команды «плюс», «минус», «итог», позволяя оператору выполнять простые вычисления голосом. Это был первый пример именно голосового управления командами, а не просто распознавания цифр.
Название намекало на то, что прибор небольшой — по сравнению с Audrey это особенно заметно.
Получился первый пример устройства с именно голосовым управлением командами, а не просто распознаванием цифр — сегодня мы можем сказать: «Алиса, сложи два и два» и получить ответ в том числе благодаря тому, что шестьдесят с лишним лет назад была изобретена Shoebox.
Harpy, 1970-е
Гарпия (а именно так переводится название машины, созданной Carnegie Mellon в 1970-х) имела больший лексикон — система работала со словарём из 1011 слов и была рассчитана на конкретные типы запросов, например, на поиск информации в базе данных. Что немаловажно, она умела распознавать не отдельные слова, а связную речь — то есть фразы, произнесённые подряд. Сравните с предыдущими машинами — они были гораздо более чувствительны к паузам и говорящему.
Harpy не понимала речь так гибко, как современные нейросети. Ей заранее давали:
список известных слов;
возможные произношения;
правила, по которым эти слова можно соединять в фразы;
акустические образцы — как примерно должны звучать части речи.
Затем она представляла все допустимые фразы как большую схему с развилками. Услышав голос, система шла по этой схеме и искала маршрут, который лучше всего совпадает со звуком.
Чтобы не проверять сразу сотни вариантов, Harpy сохраняла лишь несколько наиболее правдоподобных догадок на каждом шаге. Этот принцип известен как beam search, или поиск лучом: плохие версии быстро отбрасываются, а вычисления тратятся на перспективные. Именно это сделало систему практически работоспособной при тогдашней вычислительной мощности.
А вот как работает beam search
В одном из испытаний Harpy показывала около 93,77% правильного распознавания слов и около 89,87% правильно распознанных фраз для одного говорящего. В отчётах программы также приводится примерно 3% ошибок по словам и 5% ошибок, меняющих смысл, в задаче со словарём 1 011 слов. Напомним, что все это — в середине 1970-х: не правда ли, впечатляет?
Но при всей грандиозности технического прорыва, выпускать «Гарпию» на волю было рано: это все еще был исследовательский прототип, который не обладал достаточным объемом знаний для встречи с живыми людьми. Зато к августу–сентябрю 1976 года Harpy была настроена на задачу поиска документов в базе данных!
Общение с системой выглядело примерно так:
человек говорил фразу в микрофон — без пауз между отдельными словами;
Harpy сопоставляла звучание с известными ей словами и допустимыми конструкциями фраз;
если фраза была успешно распознана, система могла автоматически сформировать устный ответ; такую возможность демонстрировали уже в феврале 1976 года;
пользователь получал озвученный результат запроса, а не просто строку расшифрованного текста.
Скрытая марковская модель и ее роль в распознавании речи (1980-е, 1990-е)
Скрытая марковская модель, она же CMM (не путать с сммщиками :)) — это способ для компьютера угадывать невидимый процесс по его следам. В распознавании речи она помогает восстановить последовательность звуков и слов по меняющемуся аудиосигналу.
Речь делилась на короткие временные фрагменты, а СММ моделировала вероятности перехода между скрытыми фонетическими состояниями. Сверху работала языковая модель: она оценивала, какая последовательность слов наиболее правдоподобна. В классическом конвейере использовались:
аудио → акустические признаки → СMM → языковая модель → текст
Как это работало
Представьте, что компьютер услышал нечто похожее на: «поставь… бу… дильник… на семь». Шум, дикция и скорость речи делают отдельные участки неоднозначными. СММ может колебаться: это «будильник», «будильники» или вообще другой набор звуков. Но вероятности переходов подсказывают, что после звукового начала «бу-» очень вероятно продолжение «-диль-», а языковая модель добавляет: после слов «поставь» и «на семь» слово «будильник» встречается гораздо правдоподобнее, чем случайная альтернатива, например, «бульон» или «бультерьер». Так акустика и контекст вместе дают итоговую расшифровку.
Мое лицо, когда я пытаюсь расшифровать собственную диктофонную запись лекции. С 1 сентября — во всех ВУЗах страны
Почему это важно для распознавания речи? Потому что это дало возможность отойти от жестких звуковых шаблонов к анализу живой естественной речи. Именно такая архитектура открыла дорогу массовой диктовке, телефонным IVR-меню, голосовому набору. Принцип работы скрытой марковской модели — не делать вид, что машина слышит всё идеально, а выбирать наиболее вероятное объяснение неясного сигнала. Эта идея лежит в основе всей современной вероятностной обработки речи; и пусть сегодня чаще используются нейросети и другие методы, переоценить скрытые марковские модели невозможно.
К слову, с IVR вы наверняка встречаетесь минимум раз в месяц при звонке в банк или ресторан — это интерактивное голосовое меню, то самое, которое предлагает вам нажать 1 для связи с отделом продаж и 2 для соединения с техподдержкой. Узнать о возможностях современного IVR на примере голосового меню MANGO OFFICE и заказать разработку для своего бизнеса можно тут.
DragonDictate
Это одна из ранних коммерческих программ голосовой диктовки для ПК, созданная компанией Dragon Systems. Она превращала произнесённые слова в печатный текст и позволяла управлять компьютером голосом. Первая версия, DragonDictate 30K, вышла в 1990 году с активным словарём около 30 000 английских слов (!!!).
Главное ограничение: нужно было говорить по одному слову с паузами. Например: «Создать… [пауза] новый… [пауза] документ».
Ничего не напоминает? Да, паузы, как и в случае Shoebox, все еще были очень важны, иначе слова «слипались».
Система стоила примерно 9000 долларов (это примерно 23 000 долларов 2026 года по индексу потребительских цен США или три мобильных телефона Motorola MicroTAC), требовала мощного по тем временам ПК с процессором Intel 80386, 8 МБ памяти (не смеяться! Для 1990 года это серьезные цифры), отдельной платы распознавания речи и гарнитуры. Опытный пользователь мог управлять DragonDictate так, что система печатала более 40 слов в минуту.
DragonDictate была важна прежде всего как средство бесклавиатурного ввода: ею пользовались для диктовки документов, а также люди с двигательными ограничениями. В 1997 году её сменила Dragon NaturallySpeaking — программа, которая уже позволяла диктовать фразами в более естественном темпе, без обязательных пауз между словами. Опыт Dragon показал, что голосовой интерфейс нужен не только для телефонного меню IVR и коротких команд, но и для полноценной работы с текстом, а также для управления ПК голосом.
Пройдет еще 20-30 лет с момента создания DragonDictate, и управлять ПК, смартфоном, планшетом, автомобилем при помощи голоса станет обыденностью, а голосовые помощники будут читать сказки детям. Об этом — в одной из наших следующих публикаций!
Подписывайтесь на блог MANGO OFFICE на Пикабу — обещаем, дальше будет еще интереснее :)



