Статья: Экспрессивность как маркер гендерных различий компьютерной коммуникации (к проблеме автоматической гендерной атрибуции текста)

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Прагматические компоненты семантики характеризуются как максимально контекстно зависимая величина, поэтому формирование групп маркеров проходило в два этапа. На первом группы выделялись по наличию маркирующего семантического и / или формально-семантического признака.

1. По наличию формально-семантического признака была выделена группа диминутивов - лексем, содержащих морфемные маркеры деривационных диминутивных суффиксов - очк(а), - еньк(а), - ик, - ок, - к(а), - еньк(ий), - - енок, - еныш и др., например погодка, тетрадка, телефончик, пяточек, шапочка, ягодка и т.д. Прагматическая направленность дими - нутивов - выражение синкретичного единства смыслов эмоциональной и рациональной оценки с весьма широким спектром варьирования, от уменьшительноласкательного до уничижительного и пренебрежительного с доминированием положительного ядра и эмоциональности (см., например, [12]). Далее данный класс единиц мы называем «лексемы-диминутивы».

2. Вторую группу составили единицы, содержащие компоненты рациональной и эмоциональной оценки, при этом при формировании группы мы на данном этапе не противопоставляли единицы с положительной и отрицательной оценочностью, например бесполезный, большой, бяка, гадость, дельный, дерьмовый, красавец, околоумный, опупенный, славный, урод, фигня и под. Так как при выделении группы в качестве инварианта был избран компонент лексической семантики, в ее состав вошли единицы разных частей речи: например классно, круто, кошмар, мощный и т.д. При формировании единиц данной группы мы в случаях неоднозначности смыслов основывались на данных толковых словарей2 и, при необходимости, возвращались к тексту для определения контекстуального значения. Эту группу называем «оценочные лексемы».

3. Третью группу маркеров составили слова, содержащие в структуре экспрессивного макрокомпонента компонент «интенсивность», т.е. актуализирующие в семантике смысл «очень, в большой степени» как актуальный коммуникативный компонент, например грандиозный, бестолочь, офигенный, адский, бредятина, крутатецкий, опупенный. Данная актуализация может быть реализована как узуальный компонент семантики, не маркированный формально (единица с таким смыслом всегда является синонимом нейтрального в данном отношении элемента) либо маркированный морфологически (жердина, большуший), графически (большооооой), морфологически и графически (жердииииина, большууууущий) [36]. Эта группа далее обозначается «лексемы- интенсивы».

4. Четвертую группу составили единицы, содержащие графическое маркирование выражения эмоционального отношения - повторение графем, например этоооо, хааааа, фууу, ужааас, ураа и т.д. Данную группу обозначаем как лексемы с графическими маркерами.

Как можно видеть, данные группы единиц выделяются нами на основании не взаимоисключающих признаков, т.е. одна лексическая единица может входить в более чем одну группу: оценочных лексем, лексем интенсивов, лексем с графическими маркерами. При необходимости подсчета всего состава маркеров, повторяющиеся лексемы устранялись. Объединение четырех групп маркеров обозначаем «маркеры экспрессивности».

На основе лингвистического анализа были составлены словари для проведения статистического анализа и автоматического анализа текстов.

На втором этапе анализа применялись методы статистического анализа и машинного обучения. Основные задачи, решаемые на данном этапе: 1) составление матрицы частот по выбранным признакам; выявление статистически значимых различий в использовании мужчинами и женщинами единиц выделенных четырех групп лексики (групп маркеров); 2) проведение машинного обучения, т.е. создание системы автематического, машинного распределения текстов на мужские и женские на основании выявленных статистических различий в использовании лексических маркеров рассматриваемых классов.

Для подсчета частот лексических маркеров по выбранным признакам и их объединения в группы для последующего определения степени статистической значимости выявленных количественных различий в использовании данных маркеров применялась формула веса Суть ее заключается в подсчете веса некоторого слова пропорционально количеству употреблений этого слова в группе текстов и обратно пропорциональному частоте употребления слова в других. Например, если слово молодец чаще встречается в женских текстах, а реже в мужских, тогда вес этого слова в женских текстах будет стремиться к 1, а в мужских к 0. Итогом работы алгоритма стала частотная матрица (1Г-Ш) суммы относительных величин использования лексических единиц мужчинами и женщинами, которые были сгруппированы нами по вышеуказанным признакам. Результаты данного анализа представлены в таблице.

Фрагмент матрицы сумм весов групп маркеров экспрессивности текста

Текст

Лексемы-интенсивы

Оценочные лексемы

Лексемы-диминутивы

Лексемы с графическими маркерами

а^1 f.txt

42,77

165,76

31,95

319,89

а^2 f.txt

0,00

0,84

1,08

3,32

Шй4 f.txt

0,78

6,84

0,60

2,54

а^3 f.txt

2,84

40,28

6,95

23,91

а^5 f.txt

56,42

273,64

48,84

58,48

а^6 f.txt

1,56

23,37

3,24

7,47

а^7 f.txt

8,62

44,15

10,67

20,49

а^8 f.txt

7,25

21,31

15,59

28,64

Шй9 f.txt

16,43

57,61

10,84

18,95

f.txt

0,00

10,70

0,00

2,89

Шй11 f.txt

7,54

45,32

7,18

64,76

а1й12 f.txt

0,60

4,51

0,00

1,86

Шй12 m.txt

54,93

208,20

41,18

219,61

dlg1 m.txt

0,00

3,27

0,00

2,16

а^2 m.txt

0,00

5,44

0,00

0,00

а1й3 m.txt

14,16

54,36

5,22

32,11

а1§ 4 m.txt

51,53

195,96

36,74

51,31

dlg5 m.txt

6,11

23,49

2,51

15,60

dlg6 m.txt

12,52

56,20

10,67

15,06

а^7 m.txt

7,68

19,74

12,65

29,04

а1й8 m1.txt

10,88

63,89

9,29

12,02

а1й9 m.txt

5,24

16,56

4,02

3,06

Шй10 m2.txt

11,26

85,47

28,31

12,20

а1й11 m2.txt

0,48

4,77

0,00

3,92

Данная матрица является исходным материалом для дальнейшего анализа текстов с применением других формально-количественных методов.

На следующем этапе была подсчитана сумма весов лексических единиц всех групп мужских и женских реплик. Отметим, что при этом мы объединили единицы всех четырех групп маркеров, удалив повторяющиеся лексемы, т.е. лексемы, имеющие болем чем один компонент. Например, текстовая единица ужаааас, входящая в три класса слов с семантикой оценочности, интенсивности, которые содержали графические маркеры интенсивности, в данном подсчете учитывалась один раз. Сумма весов лексических единиц оставила 1 529,3 в женских репликах, а в мужских - 458,8. Результат анализа представлен в диаграмме на рис. 1.

Рис. 1. Соотношение сумм весов экспрессивных единиц в мужских и женских репликах

Как видно из данных диаграммы, мужская и женская речь отличается экспрессивных единиц, женские реплики содержат в количестве используемых больше экспрессивных и эмоциональных лексических единиц (сегмент 1^ на диаграмме), чем мужские (сегмент т). Однако проверка статистической значимости данных различий показала, что выявленный результат не является значимым: анализ на основании критерия Манна - Уитни выявляет уровень значимости р = 0,72 (р > 0,05), что свидетельствует о случайном характере выявленного распределения.

На следующем этапе исследования были подсчитаны в мужских и женских репликах суммы весов лексических единиц выделенных групп, выявлено преобладание маркеров экспрессивности в женских репликах (наблюдается в трех группах: лексемы- интенсивы, лексемы-диминутивы, оценочные лексемы и отсутствует в группе лексем с графическими маркерами экспрессивности). Однако проверка статистической значимости выявленных количественных различий показала, что только относительно группы единиц-диминутивов уровень значимости составил p = 0,04 (р > 0,05). В использовании остальных групп лексических единиц в репликах мужчин и женщин статистическая значимость не была выявлена (р > 0,05), а следовательно, все различия случайны.

Так как полученный уровень значимости для лек - сем-диминутивов близок к пороговому уровню значимости 0,05, мы провели дополнительный статистический анализ сравнения дисперсий критерием Фридмана.

Цель дисперсионного анализа заключалась в проверке гипотезы о равенстве средних значений использования экспрессивов в зависимости от гендерной принадлежности участника коммуникации. Дисперсия характеризует разброс значений относительных частот использования анализируемых групп лексических единиц в текстах, противопоставленных по гендерной принадлежности автора. Результат анализа показан на рис. 2: как можно видеть, дисперсия различает группы лексем, но не различает гендерно противопоставленные тексты (уровень значимости составил 0,88, т.е. значительно больше 0,05).

Рис. 2. Дисперсии относительных частот использования групп экспрессивных единиц

Полученные данные явились основанием предположения, что подобный результат вызван различиями внтуригрупповых диссперсий: вероятно, частоты использования экспрессивных единиц могут отличатся в каждом диалоге. Чтобы проверить данное утверждение, мы провели дисперсионный анализ одной из групп лексем - лексем с графическими маркерами. Результат анализа представлен на рис. 3.

Как видно из рис. 3, во-первых, для дисперсий характерен большой размах, во-вторых, в то время как дисперсии по всем лексемам словаря с графическими маркерами отличаются, медианы единиц данного словаря почти равны как для мужчин, так и для женщин.

Результат анализа дисперсий по каждому из текстов позволяет сделать предположение о том, что различия в использовании экспрессивов определяются не только гендерной принадлежностью авторов, но и другими признаками коммуникациии. Такое предположение коррелирует с идеями гендерной лингвистики о том, что гендер как социокультурная характеристика коммуникантов не может не вступать во взаимодействие с другими социально значимыми ролями коммуникантов [18], а также с классическими положениями теории дискурса о множественности факторов дискурсообразования (см., например, [39. С. 205-210]).

лексема гендерный лингвистический семантика

Для проверки этой гипотезы мы провели кластерный анализ «Уорда» [40. С. 298].

Под «кластерами» понимаются однородные (схожие) подгруппы, в которых дисперсия минимизирована внутри групп и максимизирована между группами. На вход подавалась матрица экспрессивных лексических единиц с относительными величинами без маркирования класса, результате тексты распределились на два основных кластера.

Как было отмечено, в первом кластере наблюдается преобладание экспрессивных лексических единиц всех четырех классов в сравнении со вторым. Дискурсивный анализ текстов, вошедших в первый класс, выявил, что тексты первого кластера противопоставляются второму по двум дискурсивным признакам - тема коммуникации и личностные отношения коммуникантов. Реплики, вошедшие в первый кластер, при надлежат мужчинам и женщинам, имеющим длительный опыт личного общения, темой коммуникации являются по преимуществу межличностные эмоционально наполненные отношения. Так, в диалоге й1% 0 участники коммуникации (/1 и т2), судя по репликам, знают друг друга продолжительное время, имеют общие интересы в спорте и учебе, они обсуждают личные отношения, отношения общих друзей, рассуждают о жизни, совместном времяпровождевом кластере (й1% 0 /1, й1% 0 т2, ё1^2 /2, ё1^2 т1) наблюдается превалирование экспрессивных лексических единиц в сравнении со вторым. Что касается второго кластера, то он противопоставляется первому кластеру (за счет максимизирования дисперсии между группами) и одновременно распадается на два подкласса, имеющие менее значительные различия в характере использования экспрессивных единиц (рис. 4).

Рис. 4. Кластерная дендрограмма распределения текстов компьютерной коммуникации по признаку использования экспрессивных лексем

Ж: Напьешься поди, а мне тебя домой тащить?, М: «Красава))).)))». Или реплики из 2: 1) М: «Идешь завтра гулять?». Ж: «Ааа, блин я завтра только в часов в 7 освобожусь». 2) М: «Скучаю По тебе Скорее бы завтра услышать твой голос»; Ж: «Нуу) Я тоже скучаю по тебе»). Объединяющей характеристикой диалогов второго кластера является тема деловых отношений, учебы, не исключающая выражения эмоционального отношения к данным темам, например, типичный диалог: ё1у 1: Ж: «Какими способами? Или как учится?) Аааа, английский и испанский;)»; М: «Ого) Испанский охренеть) А почему Испанский?)».

Или Ж: «А ты не мог бы сфотать свою тетрадь тему и прислать через вк?»; М: «прости я тогда не писал мы с сашкой сидели»).

Таким образом, сочетание методов лингвистического и статистического анализа позволило нам сделать вывод о том, что различия в использовании экспрессивных единиц в текстах компьютерной коммуникации, противопоставленных по признаку гендерной принадлежности авторов, отмечаются, но не являются статистически значимыми, т.е. признак гендерного противопоставления не обнаруживается как устойчивый и во-производимый. Применение кластерного анализа позволило выявить взаимодействие гендерного признака авторов коммуникации с другими социально значимыми параметрами компьютерной коммуникации - темой текста, ролевыми и социальными позициями коммуникантов в диалоге, которые оказываются более значимыми факторами, определяющими характер использования экспрессивных единиц.

Примечания

1 Извлечение диалогов из социальных сетей осуществлялось с согласия их авторов, которые, в соответствии с нормами регламента Этического комитета междисциплинарных исследований ТГУ (http://lab.tsu.ru/cognitivestudies/node/14) и в соответствии с Федеральным законом №152 РФ «О персональных данных», были проинформированы о целях проводимого исследования и о гарантиях анонимности предоставленных персональных данных, после чего были заполнены «Формы информированного согласия», в структуру которых были включены метаданные участников диалогов: пол, возраст, социальный статус.

2 Дискурсивно-жанровая специфика анализируемых текстов обусловила наличие значительного количества просторечной, сленговой, в том числе ненормативной лексики. Для уточнения значения данных единиц наряду со словарем литературного языка [37] мы использовали словарь Т.Г. Никитиной [38].

Источник: https://otherreferats.allbest.ru/download/1258154/