История голосовых помощников, часть I: говорящие машины и имитация голоса. От «А» и mama до фонографа
Перед тем, как появились полноценные голосовые помощники — Сири, Кортана, Алекса, Алиса и другие в XXI веке — была проделана гигантская работа, позволившая мечтам стать реальностью.
Которобот, Япония, 1963. Тоже, своего рода, говорящая машина для распугивания мышей, которые быстро привыкли к «чучелу», его сверкающим глазам и мяуканию
Задолго до ИИ, цифровой эры и даже электричества изобретатели начали свой путь к говорящим машинам, которые стали первым серьезным шагом к воплощению проектов полноценных помощников; в XX веке исследователи перешли к другой важной задаче — распознаванию голоса и команд, а уже в цифровую эпоху стало возможным создать первые варианты голосовых ассистентов. Сегодня — о том, как в XVIII веке ученые заставили неживые машины имитировать человеческие голоса.
Перед прочтением скромно напомним, кто мы: MANGO OFFICE, лидер IP-телефонии и виртуальных АТС в России по версии CNews (2021-2024), разработчик 200+ функций для бизнес-коммуникаций. А еще у нас есть Голосовые роботы — в отличие от героев сегодняшней статьи, они самостоятельные, современные, умеют поддерживать разговор и не пугают собеседника потусторонним тоном☺
Дед Чарльза Дарвина
Где-то в 1771 году Эразм Дарвин, врач по специальности и изобретатель в душе, построил свою говорящую машину — раньше, чем другие герои этой статьи, независимо от их ранних разработок. Что интересно, это произошло из-за азарта Эразма — промышленник Мэттью Болтон, друг Дарвина и участник знаменитого Лунного общества (Lunar Society), заключил с ним пари на 1000 фунтов — колоссальную по тем временам сумму — что тот не сможет построить инструмент, способный произносить «Отче наш», Символ веры и Десять заповедей на английском языке. Формальная письменная расписка от 3 сентября 1777 года сохранилась до наших дней и подтверждает условия ставки.


Эразм (1) и Чарльз (2) Дарвины
Эразм описал получившееся (и не дошедшее до нас) устройство сам. Машина представляла собой деревянный рот с губами из мягкой кожи, а с задней стороны — клапан, имитирующий носовые полости; оба элемента быстро открывались и закрывались нажатием пальцев. «Голосовой» звук создавала шёлковая лента длиной около 2,5 см и 6 мм шириной, натянутая между двумя кусочками слегка вогнутого гладкого дерева: когда лёгкий поток воздуха от мехов обдувал край ленты, она вибрировала между деревянными сторонами, издавая приятный тон, напоминающий человеческий голос. По собственным словам Дарвина, для расширения возможностей машины требовалось не более 13 движений, которые теоретически можно было бы связать с клавишами клавесина или фортепиано.
Christophe Veaux of Edinburgh University (реконструкция с 42 секунды)
Машина умела произносить mama, papa, map и pam, но до «Отче наш» и десяти заповедей было еще далеко, а с набором из p, b, m и a далеко не уйдешь. Поэтому пари он все-таки проиграл и 1000 фунтов не получил (сегодня это были бы 272 000 долларов). Интересна позиция самого Эразма — он себя позиционировал в первую очередь как врач, поэтому «побочные квесты» занимали меньше его внимания и времени, чем хотелось бы.
5 звуков Христиана Кратценштейна
В 1779 году датчанин Христиан Кратценштейн, действительный член Российской академии наук, создал модель речевого тракта — она могла произносить 5 гласных звуков при помощи вибрирующих язычков, задеваемых воздушным потоком.
К сожалению, само устройство до нас не дошло, но по описаниям его смогли восстановить — реконструкция выглядит вот так:
Реконструкция выполнена Serge Durin, за что мы очень ему благодарны
Славься, король: лесть аббата Микаля
Аббат Микаль в 1783 году представил королю свое собственное изобретение — говорящие головы на роликовом приводе, которые могли произносить заранее определенное количество фраз, имитируя человеческий голос. Несмотря на то, что имитация была весьма несовершенной, изобретение было новаторским, что было признано Академией наук.
Управление осуществлялось двумя разными клавиатурами: одна была связана с цилиндром (как в музыкальной шкатулке) и позволяла произносить лишь фиксированный набор фраз, но с правильно расставленными паузами между словами и правильной просодией; вторая клавиатура давала доступ ко всем звукам французского языка, сведённым изобретателем к небольшому числу комбинаций, и теоретически позволяла «набирать» пальцами любую фразу — как на пишущей машинке.
Финансовой поддержки, правда, Микаль не получил — и остался должен скульптору, который изготовил головы. К сожалению, до нас дошли только очень скудные описания устройства, которое, тем не менее, считается первым заранее программируемым голосовым симулятором некоторыми историками.
Странно, что Людовик XVI не смилостивился и не проспонсировал аббата — головы вели буквально следующий диалог (на французском):
— Король дарует Европе мир.
— Мир венчает короля славой.
— И мир делает народ счастливым.
— О обожаемый король, отец своего народа, их счастье являет Европе славу твоего трона.
Правда, комиссия, которой демонстрировалось изобретение, и не включала короля. Возьмем на себя дерзость предположить, что на фоне другого объекта оценки той же комиссии 1783 года — полет монгольфьера — невнятно говорящие головы действительно меркли.
20 лет разработки Вольфганга фон Кемпелена
Параллельно с Кратценштейном Вольфганг фон Кемпелен, венгеро-австрийский изобретатель, разрабатывал свою говорящую машину. Потратив 20 с лишним лет, в 1791 году он представил свое произведение инженерной мысли — с сегментами, функционально имитирующими рот, голосовые связки, легкие для забора воздуха и нос для носовых согласных (если любопытно, можно увидеть первоисточник тут). В первой версии роль легких взяли на себя кухонные меха, а само оно издавало только гласные.
Чертеж деталей говорящей машины 1791 года. Мехи действуют как легкие, подавая воздух в голосовую камеру, где находится вибрирующая язычковая мембрана. Звуки образуются за счет клапанов.
Интонацию эта машина не передавала, но издавать звуки и целые слова вполне могла — особенно легко ей давались латынь, французский или итальянский, а вот о немецкий устройство спотыкалось из-за нагромождения согласных.
Реконструкция Alexander Steinbeißer. Не ищите внешнее сходство с человеческим речевым аппаратом — оригинал тоже выглядел весьма не антропоморфно, судя по чертежам
Кстати, вы вполне могли слышать о Вольфганге фон Кемпелене раньше — это он придумал шахматный аппарат «Механический турок», снаружи которого была восковая фигура усача в экзотическом наряде, а внутри — сидел сильный шахматист. Видел доску он благодаря системе зеркал.
К сожалению, оригинал почил в XIX веке при пожаре в музее Филадельфии, но вот наиболее близкая реплика
Кемпелен катался со своим механическим детищем по Европе, давая туры, а после его смерти достался инженеру Мельцелю, при котором и играл с Наполеоном в 1809 году. Только в 1834 году шахматист Муре, один из живых «резидентов» механического турка, раскрыл секрет автомата, опубликовав статью в журнале, а в 1836 году об этом написал эссе Эдгар По (тот самый, вот перевод на русский). Впрочем, Мельцель даже после разоблачения кататься с гастролями не перестал…
XIX век представляет
Если XVIII и первая половина XIX века пытались буквально воссоздать анатомию речи (гортань, язык, губы), то вторая половина XIX века нашла обходной путь — фиксацию и повторное воспроизведение уже существующего звука.
Йозеф Фабер превзошел по «долгострою» даже Кемпелена — он потратил около 25 лет на Euphonia, что с греческого можно перевести как «красиво звучащая». Euphonia, она же Евфония, была представлена в 1845 году, хотя первую версию он презентовал пятью годами ранее — тогда же Йозеф и уничтожил свое «черновое» изобретение, разочаровавшись в результате. По легенде, Фаберу потребовалось семь лет только на то, чтобы добиться правильного произношения звука [e].
Конструкция была самой сложной среди всех говорящих машин своего времени: механическая копия человеческого горла и голосовых органов приводилась в движение клавиатурой из 16–17 клавиш, как у фортепиано, а меха под ножной педалью выполняли роль лёгких. Искусственная гортань была сделана из резины с подвижной голосовой щелью из тонких пластинок слоновой кости для регулировки натяжения, верхняя челюсть с кожаной губой оставалась неподвижной, а нижняя из гуттаперчи двигалась; язык, тоже резиновый, мог прижиматься к нёбу или отводиться назад к горлу. Заметьте, как имитирует строение человеческого речевого аппарата Евфония — у предыдущих машин «языка» и «губ» не было.


Иногда Эвфония выставлялась не только с женской маской (1), закрывавшей механический рот, язык и челюсть, но и с платьем. 2: Рисунок из The London Journal, 1870
Евфония могла говорить на английском, французском и немецком — правда, во всех языках с заметным немецким акцентом, поскольку оператором обычно выступала жена изобретателя, госпожа Фабер, немка по происхождению — судя по всему, фрау и машину заставляла звучать близко к своему родному языку.
Машина была наиболее продвинутой среди перечисленных нами — умела петь, включая исполнение гимна «God Save the Queen», на демонстрациях произносила вступительную фразу: «Простите за медленное произношение… Доброе утро, дамы и господа… Сегодня тёплый день… Сегодня дождливый день…». Несмотря на техническое совершенство, публика находила голос машины пугающим, «загробным» и монотонным — коммерческого успеха «Евфония» так и не добилась.
Записывай, а не имитируй: кукла Эдисона
В 1877 году, когда Томас Эдисон работал над телеграфом и телефоном, он попутно изобрёл фонограф — устройство фиксировало звуковые колебания через мембрану с иглой на вращающемся цилиндре, обёрнутом оловянной фольгой. Проверяя изобретение, Эдисон продекламировал в микрофон детский стишок «У Мэри был ягнёнок» и, к своему изумлению, услышал воспроизведённые собственные слова. Это уже не было синтезом речи в духе Кемпелена или Фабера — фонограф записывал и воспроизводил реальный голос, минуя всю проблему механической имитации артикуляции. Никаких попыток имитировать человеческие легкие, рот и голосовые связки — просто запись, фундаментально иной подход.





Тогда же у Томаса Эдисона возникла идея замысел создать говорящую куклу на основе фонографа, однако практический образец разработал его коллега Уильям Джейкс, запатентовавший в 1888 году миниатюрный воспроизводящий механизм специально для игрушек. Куклу высотой 55 сантиметров выпустила основанная в 1887 году Edison Phonograph Toy Manufacturing Company; внутрь помещался крошечный восковой цилиндр с записью — покупатель мог выбрать из 12 разных стишков длительностью 13–22 секунды.
Записи делали работницы фабрики Эдисона — они должны были громко декламировать детские стишки в фонограф, и эти записи стали первыми в истории коммерческими аудиозаписями, а также самыми ранними известными записями женских голосов в США. Правда, куклы были встречены невероятно холодно, несмотря на «У Мэри был ягнёнок» и «Джек и Джилл». Из 2500 выпущенных кукол продали лишь около 500, а через месяц производство остановили — механизм оказался слишком хрупким, воск легко трескался, а многие дети (и даже взрослые) находили искажённые, «призрачные» голоса куклы откровенно пугающими.
Сегодня сохранившиеся куклы — крайне редкие музейные экспонаты, а Служба национальных парков США оцифровала восемь из известных записей. Послушайте их — некоторые из записей действительно пугают, например, Twinkle, twinkle little star вполне тянет на саундтрек фильма ужасов.
В следующей части мы обязательно расскажем о втором шаге на пути к голосовым помощникам — о распознавании речи. Подписывайтесь на наш блог, чтобы не пропустить следующую статью — и до скорой встречи!
ЪГЪЛ. Рассказываем, как читается это болгарское слово. И почему именно так
Сегодня мы займемся лингвистической археологией и разберем одну занимательную историю, спрятанную в болгарском алфавите. Речь пойдет о букве, которая нам, русскоязычным, хорошо знакома. О твердом знаке.
Вот только в болгарском языке у буквы Ъ совершенно иная, куда более звучная роль.
Первый путь
Начнем с самого начала. В древних славянских языках существовали так называемые редуцированные, или сверхкраткие, гласные. Это были звуки-призраки, которые произносились очень слабо и кратко. Их обозначали буквами “Ъ” (ер) и “Ь” (ерь).
Со временем в восточнославянских языках (в том числе и в русском) эти звуки в большинстве позиций сократились настолько, что просто исчезли – этот процесс историки называют падением редуцированных. А в сильных позициях, например, под ударением, они прояснились и стали звучать полноценно – О, Е.
Так у нас, кстати, появились беглые гласные. Допустим, день – дня. Вот эта беглая “е” на самом деле когда-то была звуком “Ь”. Писалось: дьнь – дьня. В первом случае “Ь” был под ударением и развился в полногласный “Е”, а во втором сократился до нуля и выпал.
А вот в болгарском языке редуцированный “Ъ” никуда не пропал. Он остался в словах, и произносится теперь как некий неразборчивый звук – то ли “ы”, то ли “о”. Очень похоже на то, как мы произносим первый гласный в слове “молоко”, когда не стараемся четко выговаривать все слоги.
В болгарском алфавите “Ъ” получил название “ер голям” (большой ер) и является полноценной гласной буквой.
Второй путь
В праславянском существовали носовые гласные, которых в современном русском уже нет. В процессе развития славянских языков этот звук в разных славянских диалектах пошел разными путями. В древнерусском языке их наследником был юс большой – буква Ѫ, обозначавшая носовой звук, средний между “о” и “у”. В русском языке он благополучно перешел в обычный, чистый звук “У”.
В болгарском этот носовой звук пережил несколько иную эволюцию. Он тоже утратил свой призвук, но превратился в итоге не в “у”, а в… некий неразборчивый звук – то ли “ы”, то ли “о”. То есть по факту совершенно совпал в произношении с тем же “ер голям”, сохранив при этом свое изначальное начертание – Ѫ.
В итоге у болгар образовались две буквы, означающие практически один и тот же звук: Ѫ и Ъ. Весь XIX век выдвигались проекты реформы, ликвидирующей этот казус. Например, предлагалось сохранять букву Ѫ только там, где было ясно видно ее этимологию. Проектов было много, но буква Ѫ все-таки дожила аж до 1945 года.
А теперь главный нюанс. В 1945 году в Болгарии прошла орфографическая реформа, одним из ключевых пунктов которой было следующее: буква Ѫ упразднена и заменена на Ъ во всех случаях, кроме слова “сѫ”, где она заменена на “а”. То есть вопрос решили радикально.
Разбираем слово “ъгъл”
Теперь давайте применим наши знания на практике и разберем тот самый пример, который и навел нас на эту тему. Возьмем болгарское слово “ъгъл”. Буквы “Ъ” в нем – разного происхождения.
Первый “Ъ” (в начале слова) – это как раз наследник юса большого (Ѫ). В праславянском это слово звучало с носовым звуком. В русском этот звук превратился в “У”.
Второй “Ъ” (в конце слова) – это классический пример развития из древнего редуцированного гласного. В русском языке этот сверхкраткий звук в сильной позиции развился в “О”.
Что будет, если заменить первый “Ъ на “у”, а второй – на “о”? Правильно, получится “угол”. Именно так и переводится болгарское слово “ъгъл”.
Таким образом, в одном слове мы видим наглядный результат двух независимых исторических процессов, которые привели к одному графическому и фонетическому итогу.
Источник: Литинтерес (канал в ТГ, группа в ВК)
Непроизносимые согласные
Непроизносимый звук согласный
Можно встретить где чаще всего?
Между "с" и "н", конечно, ясно.
Между "з" и "н" бывает он.
"Сн", "зн" в середине слова
Звуков сочетанье - присмотрись.
Подбираем родственное слово -
И расставит на места все жизнь.
Подбираем слово, чтоб согласный
Звук у нас отчетливо звучал,
На конце бы слова перед гласным -
Чтоб на нужном месте пребывал.
"Местный" - как писать? Есть слово "место",
Где мы ясно слышим букву "т".
"Вестник" - подбираем слово "вести",
И понятно станет все тебе.
Правил мало есть без исключений.
Пишем мы "блеснуть", хотя "блестеть".
"Склянка", хоть "стекло", писать без "т" мы
Будем, чтоб быть грамотней хотеть.
Мы "плеснуть" без буквы "к" напишем,
Несмотря, что слово есть "плескать",
А хоть в "лоске" букву "к" и слышим,
Но в "лосКниться" станем ли писать?
Нет, не станем. В "лесенке" "т" нет, но
В "лестнице" появится она.
Дать теперь вы сможете советы,
Как писать подобное сполна.
Если вдруг проверочное слово
Будет невозможно подобрать,
То запоминать всегда готовы
Быть должны вы, как же записать.
Пусть примером вам послужит "чувство".
После "у" стоит там буква "в".
Грамотность есть точное искусство -
При себе имейте в рукаве!
29.03.26
Свинтики
Запись №4. Буква Ч: история и смыслы...
Данная запись относится к фонетике, историческим чередованиям, законам палатализации и истории славянской письменности.
Свое очертание буква Ч, по одной из версий, заимствовала от греческого Y (ипсилон). Но в греческом языке звука [Ч] нет, и создателям кириллической азбуки пришлось придумать для [Ч] свой знак.
В древнерусском письме буква Ч очень похожа на Ц. Такая схожесть неудивительна, ведь звук [Ц] по своим свойствам похож на [Ч]: тоже аффриката, только твердая. В говорах русского языка эти два звука иногда меняются местами или вытесняют друг друга. Так, в России есть регионы, где вместо «церковь» произносят «черква».
Многие слова на Ч в русском языке восходят к древнему индоевропейскому языку. Например, слово «черта» происходит от праславянского *čьrtа (отсюда и церковнославянское «чьрта», «чрътати», и русское «чертить») и далее от древнего индоевропейского kŕ̥tā — «расселина, трещина» (отсюда и древнегреч. κεραία). В древнечешском črtadlo «приспособление, орудие, которым режут». Черноризец Храбр в своём «Сказании о писменех» пишет о «чертах и резах» (черточках и насечках), которые существовали у славян-язычников для письма, счета и гадания («черты и резы»).
«Прѣжде ѹбо словѣне не имѣхѫ книгъ. нѫ чрътами и рѣзами чьтѣхѫ и гатаахѫ погани сѫще. кръстивше же сѧ. римьсками и гръчьскыми писмены. нѫждаахѫ сѧ словѣнскы рѣчь безъ устроениа…» (см. страницу из «рассказа…» Черноризца Храбра в редакции «Острожского букваря» Ивана Фёдорова).
Слово «чадо» тоже восходит к древнему индоевропейскому корню — -ken-, который перешел в праславянское čędо (от корня čȩtì со значением «начинать »). Звук [k], стоящий перед [е] и [i], еще в общеславянском (праславянском) языке дал звук [Ч], а [en] перешло в [ę] (Э носовое), а потом из носового Э перешло в [А], так из индоевропейского -ken- и получилось наше «чадо». По смыслу получается, что ребенок — это тот, кто только начинается. От индоевропейского корня -ken- произошло и польское czędo «дитя», а также греческое καινός «новый», древнеиндийское kanī́nas «молодой», kánīyān «меньше, моложе», ирландское сеnél «род», галльское cintos «первый, начальный»...
О том, как из К получалось Ч и Ц читайте здесь:
Откуда в русском языке столько разных чередований в словах:
С этим же корнем -ken- связана еще одна история: от него происходят слова «начало» и «конец». Да, это однокоренные слова. Время — это петля, всякий конец означает начало, а начало приводит к концу. Древний индоевропейский корень -ken- имел значение времени. Один его вариант привел к появлению слова «на-ЧА-ло» (здесь то же самое изменение звуков [Ч] и [Э] носового), а другой вариант — к возникновению слова «КОН-ец».
В русском языке [Ч] может восходить к разным звукам. Во-первых, к звуку [K] там, где несколько тысяч лет назад перед ним были звуки [е] и [i], как в слове «начало». Во-вторых, [Ч] происходит от [tj] и [kj]. Именно поэтому мы говорим «свеЧа» — она «свеТит», и «плаЧу» — от «плаКать».
Кстати, иностранца легко распознать по тому, как он произносит слова со звуком [Ч]: чудо, ночной... В германских языках нет мягкого глухого звука [Ч] (как в русском), но есть похожие аффрикаты, только твердые, что-то вроде [тш] и [дж], поэтому у иностранца получается [тшудо], [натшной] или даже [джудо], [наджной].
Запись №1. Фонетическая система русского языка
В данной записи расскажу, как и почему я увлеклась фонетикой, а затем и всей лексико-грамматической структурой русского языка.
Величайший русский ученый Андрей Анатольевич Зализняк был награжден премией Александра Солженицына (2007) — «за фундаментальные достижения в изучении русского языка, дешифровку древнерусских текстов; за филигранное лингвистическое исследование первоисточника русской поэзии „Слова о полку Игореве“, убедительно доказывающее его подлинность». Как можно изучать тексты на папирусах, бересте, пергаменте, которые написаны на древнем и непонятном языке? Изучение и дешифровка возможна благодаря тому, что язык -- это система чётко работающих закономерностей на уровне фонетики, морфологии, синтаксиса.
Как я увлеклась структурой языка и фонетикой? Когда я была чадом малым, то в 4 года поступила в балетную школу. Я занималась чуть больше года, а потом заболела, и уже с моими обмороками, судорогами, быстрой утомляемостью, всеми капельницами и инъекциями, с полным нарушением АТФ... балет стал невозможен.
И тогда я стала выражать красоту языка танца и языка музыки языком, то есть занялась описанием. И конечно, я бы не могла понимать балет, не имея музыкального слуха. Поэтому я занималась и фонетикой, мелодикой русской речи. А одна из любимейших моих книг — "Основы фонологии" князя Николая Трубецкого, нашего выдающегося лингвиста 20 века. И я являюсь приверженцем именно пражской фонетической школы.
Немного о фонетических школах схематично описано здесь:
Т.к. я тяжело больна, не могу гулять, путешествовать тоже уже не могу, то гуляю по книгам, по структуре текста, выявляя и интересные языковые конструкции. Благодаря языковым путешествиям каждый день для меня — чудо. И пока я дышу, то делаю свои книги, игры, дизайны на основе грамматической семантики именно русского языка. По-моему, самого удивительного по своей глубине языка в мире!
Лексико-грамматическая структура русского языка -- это живой фрактал, как бы Виноградная лоза с плодами смыслов. По взаимосвязанным ветвям грамматических законов текут морфологические и синтаксические смысловые связи. О структуре языка подробно здесь:
Фонетическая система русского языка уходит в глубины индоевропейского языка! Вот откуда эта чудесная музыкальность русской народной речи. Как об этом рассказывал Андрей Зализняк:
Т.к. у меня музыкальный слух, а балет был невозможной мечтой, то я много слушала не только речь, фонетику, на осциллографы смотрела, но и слушала много оперной, классической музыки. И вот что важно. На русском языке очень уродливо звучат силовые ударные приёмы, английские ритмы, потому что в английском языке силовое ударение. А в русском нет! В русском тональные переливы, да, с силовыми ритмами, но важнее именно тоны. Русская речь не силовая, а мелодичная. Как реченька журчит.
И в дореволюционной России фонетику русского языка при обучении пению учитывали:
Дерзкими и чОткими бывают и видеокарты
Обратил внимание на приписку "RX" в названии видюхи.
Буква "R" имеет "рычащее" звучание.
Буква "X" - "резкая и чёткая". Похожа на перекрестье цели, два росчерка шпаги Зорро. Ну, вы поняли.
Вот и получается, что AMD используют намёк на "дерзкий и чёткий". Такова универсальность понятий и смыслов во всём мире.











