КОРПУСНЫЕ ИССЛЕДОВАНИЯ ПИСЬМЕННОЙ РЕЧИ В РЕШЕНИИ ЗАДАЧ СУДЕБНОГО АВТОРОВЕДЕНИЯ
Литвинова Татьяна Александровна
к. филол. н.,
Литвинова Ольга Александровна
Воронежский государственный педагогический университет,
Диброва Елена Владимировна
Южный федеральный университет,
Рыжкова Екатерина Сергеевна
Воронежский государственный университет инженерных технологий
Обосновывается необходимость использования специальным образом составленных корпусов текстов при разработке методик проведения идентификационной и диагностической автороведческой экспертизы. Приводится краткий анализ существующих корпусов текстов, используемых для построения методик идентификации и диагностирования личности автора текста. Описывается структура корпуса текстов на русском языке Personality, содержащего метаразметку в виде информации об их авторах, и анализируются возможности его применения для решения задач судебного автороведения.
Ключевые слова и фразы: автороведение; лингвистическая экспертиза; автороведческая экспертиза; корпус текстов; лингвистическая статистика; диагностирование личности автора текста; естественная письменная речь; атрибуция текста.
CORPUS STUDY OF WRITTEN SPEECH IN SOLVING PROBLEMS OF JUDICIAL AUTHORSHIP
Litvinova Tat'yana Aleksandrovna, Ph. D. in Philology, Litvinova Ol'ga Aleksandrovna, Dibrova Elena Vladimirovna, Ryzhkova Ekaterina Sergeevna
автороведческая экспертиза текст идентификация
The article substantiates the necessity of using in a special way the corpus of texts in the development of techniques for the identificatory and diagnostic authorship examination. A brief analysis of the existing corpus of texts used to create the methods of identification and diagnosis of the text author's personality is presented. The paper describes the corpus of texts in the Russian language Personality, containing meta-marking in the form of information about their authors, and analyzes the possibility of its application for solving problems of the judicial authorship.
Key words and phrases: authorship; linguistic examination; authorship examination; corpus of texts; linguistic statistics; diagnosing of text author's personality; natural written speech; attribution of text.
Установление личности человека является одной из главнейших задач, которым посвящена судебно-экспертная деятельность [6]. Хорошо известным видом криминалистической идентификации человека является идентификация личности по речи, проводимая в рамках почерковедческой и автороведческой экспертиз.
Как показал анализ оперативно-розыскной и следственной практики, проведенный в работе [30], ситуации, связанные с необходимостью решения автороведческих задач на основе исследования произведений речи, чаще всего возникают в ходе расследования таких серьезных преступлений, как убийство, похищение человека, похищение несовершеннолетних, похищение человека с целью вымогательства и др.
Следует отметить, что в настоящее время наблюдается рост числа назначаемых автороведческих экспертиз, что, по мнению исследователей, объясняется «не только усовершенствованием законодательства и изменением правоприменительной практики, но и тем, что вопрос установления авторства либо его отрицание может стать актуальным при рассмотрении любого уголовного и гражданского дела» [8, с. 756].
В качестве непосредственного объекта автороведческой экспертизы выступает письменный текст как единство формально-языковых и содержательно-смысловых параметров, отражающих авторскую индивидуальность [12]. При этом исследователи исходят из того, что устойчивость и уникальность признаков письменной речи конкретного человека обусловлены нейробиологическими механизмами его врожденной языковой способности [Там же].
Автороведческая экспертиза традиционно решает разнообразные задачи: идентификация автора текста, диагностирование его индивидуально-личностных характеристик (определение пола, возраста, родного языка, психологических особенностей и др.), установление эмоционального состояния автора в момент создания текста и др. [13; 16; 28]. На практике идентификационные и диагностические задачи нередко решаются в рамках единого комплексного исследования: первая фаза - диагностическая, в ходе которой происходит сужение круга лиц, которые могут быть авторами текста путем моделирования личности автора спорного текста (определяются данные о степени владения языковыми навыками, данные об образовании, родном языке, половозрастной принадлежности автора письменного текста и т.п. характеристиках); вторая фаза - сравнительная, в ходе которой сравниваются речевые образцы лиц, которые могут быть авторами текста, со спорным текстом; вывод же экспертизы является идентификационным [1].
Идентификационные задачи ранее активно решались в рамках почерковедческой экспертизы, которая, однако, теряет сейчас свою значимость (за исключением графологического исследования подписей). Как справедливо отмечается исследователями, «в условиях современной действительности тексты, выполненные от руки, не утратили актуальности только в образовательной сфере, являясь частью индивидуального процесса обучения, и лишь в незначительной степени сохраняются в рамках бытового общения» [24, с. 387].
Важной проблемой современного автороведения является проблема установления автора текста интернет-коммуникации [13; 28], поскольку «преступный мир активно использует виртуальный мир в своих целях» [8, с. 758]. Так, в Сети публикуются тексты, содержащие клевету, оскорбления, призывы к разжиганию розни, экстремистские призывы, призывы к терроризму и т.д. Особенно актуальными автороведческие исследования текстов интернет-коммуникации становятся в свете последних изменений в законодательстве. Если прежде следственная практика сталкивалась только с фигурой распространителя конфликтогенного текста, то отныне в поле профессионального зрения оперативных работников должна войти совершенно новая фигура - автор [1].
Таким образом, в настоящее время ни у кого не вызывает сомнений тот факт, что атрибуция текста и составление портрета его автора относятся к числу важнейших задач криминалистического исследования текста.
Однако, несмотря на то, что задача атрибуции текста разрабатывается в отечественной науке на протяжении как минимум последнего столетия (см., например, [23]), многие исследователи отмечают субъективность имеющихся методик атрибуции [25, с. 17], в то время как «...юридическая строгость предполагает, прежде всего, максимальную (насколько это возможно) правовую однозначность ответа» [9, с. 5]. Кроме того, методология автороведческой экспертизы текстов на русском языке разрабатывалась преимущественно на материале художественных текстов и малоприменима к текстам малого объема, которые нередко становятся объектом автороведческой экспертизы. Как справедливо отмечают исследователи, вовлечение в сферу автороведческой экспертизы текстов разных жанров и функциональных стилей объективно требует комплексного подхода и выработки новых правил принятия идентификационных решений при установлении авторства спорного, анонимного или псевдонимного текста [8, с. 760].
В частности, особенно остро встает вопрос о составе максимально контекстно устойчивых признаков текста и признаков, релевантных при анализе текстов определенного типа [26]. До настоящего времени значимость каждого лингвистического признака и его вклад в решаемую задачу (идентификации автора текста) количественно не определены, и оценка лингвистических признаков проводится в основном на качественном уровне без учета частоты встречаемости в речи конкретного языкового явления [7].
Кроме того, единицы далеко не всех языковых уровней подвергаются анализу в автороведческих исследованиях. Так, насколько нам известно, отсутствуют работы, в которых бы производился лингвистический анализ целостности и связности письменного текста с целью установления его авторства, хотя, как совершенно справедливо указывает Е. И. Галяшина, такой анализ крайне важен при разрешении сомнений в подлинности и письменных текстов, используемых как судебные доказательства [Там же].
Еще одной проблемой идентификационных автороведческих исследований является отсутствие работ, посвященных определению пределов интериндивидуальной и межиндивидуальной вариативности каждого конкретного лингвистического признака методами статистического анализа [Там же].
Как отмечают исследователи [2], теоретическое и практическое обеспечение портретных (диагностических) экспертиз также оставляет желать лучшего. Методики комплексного решения вопросов установления пола, возраста и профессиональной принадлежности лица, составившего текст, являются неразработанными [16]. Как подчеркивает А. Н. Баранов, существенную проблему, кроме чисто теоретических аспектов портретных экспертиз, представляет их лингвистическое обеспечение, в том числе корпусная поддержка [2]. Кроме того, совершенно очевидна необходимость привлечения данных и методов широкого круга дисциплин: психологии, психолингвистики, социолингвистики, нейролингвистики и пр. для разработки подобного рода методик.
При проведении автороведческого исследования также необходимо помнить о том, что автор текста может прибегать к искажению признаков письменной речи путем маскировки или имитации с целью затруднения идентификации авторства. Проблема выявления факта искажения признаков письменной речи является слабо разработанной в мировой науке (см. обзор в [31]), несмотря на то, что такое речевое поведение представляет собой распространенную в преступной среде практику, в том числе и при коммуникации в Интернете [13]. Исследования данной проблемы на материале русского языка также единичны [11]. Одной из самых значительных работ по данной проблематике является диссертационное исследование Т. В. Гомон 1990 года [10], где предпринимаются попытки составить список признаков письменной речи, которые можно имитировать, и список глубинных признаков, с трудом поддающихся имитации. В целом же следует отметить, что измененная или искаженная речь не выделена в качестве самостоятельного объекта автороведческой экспертизы, нет научно-методических разработок, касающихся сообщений с измененной речью, что выводит искаженную речь из поля зрения эксперта-автороведа [12].
Таким образом, рост числа назначаемых автороведческих экспертиз и многообразие материалов, поступающих на экспертизу, с одной стороны, и наличие ряда неразрешенных проблем в области теории, методологии и методики судебной экспертизы письменной речи - с другой требуют разработки «принципиально новых подходов к автороведческому исследованию с учетом современных реалий создания письменных текстов и современных возможностей осуществления коммуникации» [24, с. 387]. На наш взгляд, создание таких подходов предполагает обязательное использование методов статистического анализа языкового материала и применение современных средств автоматической обработки языка. В настоящее время на материале русского языка ведутся разработки методик идентификации автора текста с применением методов математического анализа и предпринимаются попытки создания программных средств для такого анализа (см. их обзор в [27]). Однако большинство этих программ предназначено для анализа текстов большого объема и разрабатывалось на основе анализа художественных произведений. Методики же, предназначенные для решения диагностических задач автороведческого исследования, практически не подкреплены статистическими исследованиями.
Таким образом, проблема разработки автороведческих методик, основанных на количественном анализе письменных текстов, продолжает оставаться крайне актуальной и требует своего дальнейшего развития [7]. Однако разработка данных методик невозможна без соответствующего корпусного материала. При этом под корпусом языка мы, вслед за создателями Национального корпуса русского языка, понимаем информационно-справочную систему, основанную на собрании текстов на некотором языке в электронной форме [29].
Как отмечается в [3], к проблемам, затрудняющим исследования в области идентификации автора текста, относится проблема составления выборки эталонных текстов, обязательным критерием пригодности которых для автороведческого исследования является «отсутствие элементов корректуры, редактирования, дописывания другим лицом (другими лицами)» [24, с. 387]. Исследования в области диагностического автороведения, в свою очередь, значительно страдают от ограниченности корпусного материала, поскольку сбор корпусов текстов с метаразметкой в виде информации об их авторах требует значительных усилий.
Между тем, в мировой науке приобрел большую популярность подход к разработке методик диагностирования личности по тексту, состоящий в создании специальных корпусов текстов, содержащих, помимо собственно текстов, метаразметку в виде информации о личности их авторов (поле, возрасте, баллах) по шкалам психологических тестов и пр.), разметку корпусов средствами автоматической обработки языка, извлечении численных значений поддающихся квантификации параметров текста, вычислении корреляций между этими значениями и характеристиками личности автора текста и построении на их основе математических моделей для диагностирования тех или иных характеристик автора текста [19].
Кратко охарактеризуем корпуса текстов, на материале которых проводятся подобные исследования. Как показывает анализ, такие корпуса делятся на две группы - составленные из текстов, уже существовавших до момента создания корпуса, и составленные из текстов, специально написанных респондентами по заданию исследователя.
К первой группе относятся, прежде всего, корпуса текстов интернет-коммуникации (блоги, чаты, твиты, сообщения в соцсетях и др.), собранные при помощи специальных программ. Помимо самих текстов, такие программы также собирают информацию об их авторах, указанную ими самими в своих профилях (обычно - пол, возраст). Таковы корпуса, используемые для тестирования методик на проводимой ежегодно международной конференции PAN, посвященной апробации методик идентификации и диагностирования личности по тексту [33]. Подобные корпуса имеют много «шума» из-за автоматического метода сбора: собранные тексты могут содержать неавторские фрагменты (различного рода цитирования, ссылки и пр.), что может снижать точность классификации авторов по полу и возрасту почти вдвое. Кроме того, информация об авторе, указанная в авторском профиле, может быть недостоверной, что снижает ценность такого рода корпусов. К несомненным достоинствам такого метода сбора материала относится, однако, большой объем таких корпусов, а также малое время, затраченное на их составление. Так, один из самых больших корпусов блогов на английском языке с метаразметкой в виде информации о поле и возрасте авторов содержит 140 миллионов слов [34].