Материал: Попов А.А. Эргономика пользовательских интерфейсов в информационных системах

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

по качеству распознавания (приемлемым считается процент ошибки распознавания не более 5 процентов);

по способу обработки входного сообщения; по степени зависимости от диктора.

Размер словаря системы распознавания голоса влияет на степень сложности, требования к процедурам обработки и точность системы. Одним системам для работы необходимо всего несколько слов (например, голосовые команды), а другим требуется большой словарь (например, диктофонные системы). Если единицей словаря является слово, то по объему словаря системы делятся обычно делятся:

на системы с очень большим словарем – десятки тысяч слов; на системы с большим словарем – тысячи слов; на системы со средним словарем – сотни слов; системы с маленьким словарем – до сотни слов.

Качество распознавания также предполагает независимость распознавания от пользователя и способность обрабатывать непрерывную речь. Для распознавания речи пользователю может предоставляться возможность говорить слитно, то есть, когда между словами нет пауз. Распознавание речи, зависимое от диктора подразумевает, что пользователь должен сначала научить систему распознавания своему голосу и только после этого система сможет функционировать. Такие системы проще разрабатывать, они дешевле и работают более точно, но менее гибки, чем независимые от диктора программы. Независимое от диктора распознавание речи означает, что система способна распознать любую речь, независимо от того, кто говорит. Такие программные приложения способны работать с широким кругом пользователей, обладают более высокой гибкостью, но при этом они дороже стоят, а качество распознавания хуже.

При распознавании речи сначала производится фиксация речевого сигнала с использованием помощи оцифровывающего устройства (например, звуковой карты компьютера) и микрофона. Затем полученный цифровой сигнал разбивается на неделимые интервалы. В качестве таких интервалов могут рассматриваться слоги, слова и фонемы (элементарные звуки речи). Далее производится объединение неделимых интервалов в логические единицы (фразы и предложения). Объединение интервалов производится на основе имеющихся шаблонов речи, а также акустических признаков. Затем происходит анализ логических единиц и их трансформация в команды или сообщения, которые может распознать программное приложение.

36

Системы синтеза речи, кроме сложности и величины словаря, обычно классифицируются следующим образом:

по уровню кодирования (по тому, что является единицей, хранимой в словаре: слово, слог или фонема);

методу кодирования.

Существуют два метода кодирования: непосредственное хранение фрагмента речевого сигнала (слова, слога или звука-фонемы) словаря (волновой метод) и хранение параметров речевого сигнала вместо него самого (параметрический метод). Второй метод позволяет гибко регулировать параметры выходящего речевого сигнала и значительно снижать необходимое для хранения словаря и самого сигнала количество памяти, но в некоторой степени снижает качество синтезируемой речи.

В качестве примера дикторозависимого программного приложения, предназначенного для распознавания речи, а также для выдачи речевых команд компьютеру можно привести «Горыныч Проф», пользовательский интерфейс которого приведен на рис. 19. На пользовательском интерфейсе расположено главное окно программы, а также вспомогательные окна мониторинга, которые предназначены для наблюдения за сигналом с микрофона во время произнесения слов. В верхнем окне название сигнала отображается в виде слова. В нижнее окно выводится графическое отображение сказанного слова. Перед работой с программой следует настроить микрофон (рис. 19, правый рисунок верхний ряд) и настроить произношение слов словаря для конкретного пользователя.

Сначала выбирается нужный словарь. В левую часть окна программы выводятся все слова из выбранного и загруженного словаря. Затем необходимо двойным щелчком мыши укажите в списке слов нужную команду. Затем необходимо пользователь должен несколько раз произнести выбранное слово так, как он собирается произносить его в дальнейшем при работе с программой. Отображение записанного слова будет выведено на экран. Для контроля записанное слово можно прослушать, щелкнув мышью по соответствующей кнопке. Если результат не устраивает пользователя слово можно записать снова. Когда результат записи устроит пользователя, он должен кликнуть по кнопке «Заменить». По работе с таким речевым интерфейсом видно, что для настройки произношения всего словаря (а он может достигать 300 слов для «облегченной» версии программы) может потребоваться много времени (как показывает практика, по 10-15 минут на репетиции произношения одного слова). Кроме этого, для работы такой программы

37

требуется качественная звуковая карта и качественная гарнитура с микрофоном.

Для распознавания речи и перевода ее в текст необходимо совместно с «Горынычем» включить какой-либо текстовый редактор. По мере распознавания слов в текстовом редакторе будут добавляться слова.

Рисунок 19 Речевой интерфейс программы «Горыныч Проф»

Другим примером такой программы с речевыми интерфейсами первого типа является Dragon Systems.

Большинство программных приложений для Windows используют для синтеза и распознавания речи Microsoft Speech Application Interface (SAPI) - библиотеку программ для Windows, позволяющую распознавать и синтезировать голос. Библиотека Speech API активно используется в программах по преобразованию текста в голос («читалках»), а также для голосового управления операционной системой и отдельными

38

программами. Версия SAPI 4.0 разработана в 1998 году. Интерфейс SAPI входил в состав пакета SDK, содержащего инструменты для распознавания и синтеза речи. Также он входил в операционную систему Windows 2000 (только с возможностью синтеза речи). Версия SAPI 5.1 разработана в 2001 году как составная часть Speech SDK 5.1. Эта версия входила в состав ОС Windows XP. В операционной системе

Windows Vista установлена версия SAPI 5.3, а в Windows 7 - SAPI 5.4.

Библиотека SAPI представляет собой набор компонентов, относящихся к различным логическим уровням. Группы объектов «Голосовые команды», «Голосовая диктовка» и «Голосовой текст» занимают верхний уровень. Разделяемые объекты, которые позволяют совместно использовать движки, занимают следующий уровень. «Прямое распознавание речи» и «Прямое преобразование текста в речь» занимают следующий уровень. Аудио-объекты занимают нижний уровень (рис.20).

Рисунок 20 Логические уровни SAPI

В Windows 8.1 появился программный интерфейс API Windows.Media.SpeechSynthesis [99], который поддерживает функцию синтеза речи. В Windows 8.1 входит несколько модулей синтеза речи, называемых голосами. Для каждого голоса задано имя, например

Microsoft David (мужской голос, язык en-US), Microsoft Zira (женский голос, язык en-US) и Microsoft Hazel (женский голос, язык en-UK).

Пользователь может выбирать голос на панели управления в разделе Язык. Синтез речи в Windows 8.1 дает следующие возможности:

настраивать для синтезатора речи пол, голос и язык;

39

преобразовывать обычный текст в речь с использованием характеристик и свойств по умолчанию для текущего голоса;

создавать речь из строки, содержащей код на SSML, для настройки характеристик голоса, произношения, громкости, высоты, скорости, акцента и т. п.;

считывать звуковые данные, созданные модулем синтеза речи, из потока с произвольным доступом и записывать их в поток.

ВWindows 10 предоставлены два компонента речи, которые вы можно интегрировать в программное приложение: распознавание речи и преобразование текста в речь (TTS или синтез речи) [36]. При проектировании взаимодействия программного приложения с пользователем посредством голосовых команд необходимо ответить на следующие вопросы:

1.Какие действия в программном приложении может выполнять пользователь с помощью голосовых команд? Может ли пользователь с помощью голосовых команд перемещаться между страницами, вызывать команды или вводить данные (например, для заполнения текстовых полей, создания кратких заметок или диктовки длинных сообщений)?

2.Является ли голосовой ввод способом для запуска выполнения

задач?

3.Каким образом пользователь узнает о возможности голосового

ввода?

4.Программное приложение автоматически включает прослушивание пользователя или пользователю нужно активизировать режим прослушивания?

5.Какие фразы пользователя инициируют действия программного приложения? Следует ли отображать фразы и действия, выполняемые программным приложением, на экране?

6.Должны ли отображаться экраны подсказок, подтверждений и уточнений для пользователя? Требуется ли преобразование текста в речь

(TTS)?

7.Каким должно быть диалоговое окно для взаимодействия между программным приложением и пользователем?

8.Какой нужен словарь для работы с голосовыми командами с точки зрения работы программного приложения (настраиваемый пользователем словарь, уже готовый не настраиваемый ограниченный словарь)?

9.Необходимо ли подключение к сети?

ВWindows 10 применяется программа Cortana для обработки голосовых команд и запуска требуемого программного приложения для выполнения нужного пользователю действия [79].

40

Источник: https://studfile.net/preview/16548242/