Дипломная работа: Корпусно-ориентированный анализ перевода русских синтаксических конструкций на китайский язык с использованием показателя (на примере произведений Л. Улицкой)

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Тексты, составляющие корпус в данной работе, были получены в виде изображений, в связи с чем к ним была применена процедура распознавания.

На первом этапе распознавание текстов осуществлялось автоматически с использованием специальных компьютерных программ, допускающих определенный процент ошибок; на втором этапе - ошибки распознавания исправлялись вручную.

В процессе создания корпуса тексты были распознаны при помощи компьютерной программы российской компании-разработчика программного обеспечения в области интеллектуальной обработки информации, распознавания текстов и лингвистики ABBYY - ABBYY Finereader 14 (см. Рис. 2).

Рис. 2. Распознавание текстов при помощи компьютерной программы ABBYY Finereader 14

После завершения трудоемкого процесса распознавания текстов, последние были выровнены по предложениям.

На первом этапе выравнивание производилось автоматически по знакам препинания с использованием программы той же компании-разработчика ABBYY - ABBYY Aligner 2.0 (см. Рис. 3); на втором этапе - ошибки выравнивания исправлялись вручную.

Рис. 3. Выравнивание текстов при помощи компьютерной программы ABBYY Aligner 2.0

При ручном выравнивании использовались шесть возможных соответствий между предложениями Зубов А.В., Зубова И.И. Информационные технологии в лингвистике: Учеб. пособие. - М.: Издательский центр «Академия», 2004. С. 172. :

1. Одно предложение переводит одно исходное предложение;

2. Одно предложение переводит два исходных предложения;

3. Два предложения переводят одно исходное предложение;

4. Два предложения переводят два исходных предложения, но их внутренние границы в двух текстах не совпадают;

5. Исходное предложение не переводится;

6. Переводное предложение не переводит исходное предложение, т.е. не имеет исходного эквивалента.

I.4 Загрузка текстов

После завершения процесса выравнивания тексты прошли процедуру загрузки, которая включала в себя словоделение и лингвоспецифичную разметку.

Загрузка была осуществлена на платформе Русско-китайского параллельного корпуса в составе Национального корпуса русского языка (НКРЯ) - единственного параллельного корпуса текстов на русском и китайском языках, который имеется в свободном доступе в Интернете (https://linghub.ru/rnc_parallel_chinese/search). В его разработке участвуют коллектив сотрудников и учащихся НИУ ВШЭ, МГУ, РГГУ, РАНХиГС, Алтайского государственного университета, а также Института лексикографии Хэйлунцзянского университета и Института иностранных языков Чжэцзянского университета.

На данный момент в поиске Русско-китайского корпуса представлено 26 художественных произведения как русских (Н.В. Гоголь, Максим Горький, Ф.М. Достоевский, Н.А. Островский, А.С. Пушкин, И.С. Тургенев, А.П. Чехов, Л.Е. Улицкая), так и китайских авторов (Мо Янь, Лу Синь, Лю Чжэньюнь, Юй Хуа).

Для выравнивания текстов используется коммерческая утилита Skuuper, а также упомянутая выше компьютерная программа ABBYY Aligner 2.0.

Для словоделения в китайских текстах применяется так называемый «жадный» алгоритм, при котором отделение слов осуществляется слева направо автоматически на основании более длинной цепочки иероглифов, доступной в электронном словаре, загруженном в алгоритм.

Для лингвоспецифической разметки китайские отделенные друг от друга слова делятся на «лексические» и «грамматические». «Лексические» сегменты состоят из одного или нескольких иероглифов и получают разметку с помощью электронного китайско-английского словаря CEdict, который представляет для того или иного сегмента толкование, варианты чтения и показатель класса слова (например, счетное слово). «Грамматические» сегменты состоят из одного иероглифа и размечаются в соответствии со списком, а также получают специфические грамматические пометы.

Перечисленные выше алгоритмы были также применены к текстам, которые вошли в корпус, использующийся в данной работе, и составили один из подкорпусов Русско-китайского параллельного корпуса НКРЯ.

После загрузки текстов на доступную в Интернете платформу Русско-китайского параллельного корпуса НКРЯ в поисковой системе последнего был сформирован поисковой запрос показателя ЧЕ.

Поиск был осуществлен в указанном выше подкорпусе через поисковое окно веб-интерфейса платформы по слову и с использованием формы ввода иероглифами.

Результаты поиска показали, что всего в корпусе найдено 1651 показателейЧЕ, из них 878 - в параллельном русско-китайском корпусе, 773 - в сопоставимом.

Результаты поиска были отображены в виде списка строк, которые содержали искомое слово - показатель ЧЕ, и контекст, в котором оно было употреблено, т.е. отрывок из произведения на русском и китайском языках (см. Рис.3). Каждая строка также содержала название оригинального произведения, имя его автора и год создания (Рис. 4).

Рис. 4. Поисковой запрос показателя ЧЕ в подкорпусе Русско-китайского параллельного корпуса НКРЯ

Итак, в рамках корпусного метода, применяемого в данной работе, был создан корпус, состоящий из двух частей (см. Рис. 1) - параллельного русско-китайского корпуса и сопоставимого корпуса на китайском языке.

В процессе создания корпуса были пройдены последовательные этапы отбора текстов, выполнения их метаописания, а также обработки текстов и их загрузки на доступную в Интернете платформу Русско-китайского параллельного корпуса в составе Национального корпуса русского языка (НКРЯ).

Отбор текстов был произведен в соответствии с четырьмя критериями - стиля, языка, качества и даты создания - вследствие чего в параллельный русско-китайский корпус вошли три произведения Л. Е. Улицкой и их переводы на китайский язык (см. Приложение 1), в сопоставимый корпус - два произведения китайского писателя Лю Чжэньюня (см. Приложение 2).

Метаописание текстов было выполнено путем внесения в паспорт последних информации об их названиях, авторах, переводчиках, о датах создания и перевода и т.д.

Обработка текстов была осуществлена в два этапа, которые представляли собой распознавание и выравнивание. Распознавание было произведено при помощи компьютерной программы ABBYY Finereader 14 и вручную, выравнивание - при помощи компьютерной программы ABBYY Aligner 2.0 и вручную.

Загрузка текстов была выполнена на доступной в Интернете платформе Русско-китайского параллельного корпуса НКРЯ. Она состояла из двух этапов, которые были представлены словоделением и лингвоспецифической разметкой. Для словоделения был применен «жадный алгоритм», а для лингвистической разметки - деление отделенных друг от друга слов на «лексические» и «грамматические».

После загрузки при помощи поисковой системы был осуществлен запрос показателя ЧЕ, результаты которого показали, всего в корпусе найдено 1651 показателейЧЕ, из них 878 - в параллельном русско-китайском корпусе, 773 - в сопоставимом.

Получение результатов позволило перейти ко второму этапу исследования.

II.Использование корпуса в качестве материала для анализа универсалий перевода

II.1 Анализ универсалии «преувеличение»

Рассуждая о глаголе, оформленном показателем ЧЕ, в функции определения как об объекте анализа универсалии «преувеличение», представляется возможным выдвинуть следующую гипотезу: глагол, оформленный показателем ЧЕ, в функции определения в переводном китайском языке используется чаще, чем в целевом китайском языке.

Для подтверждения данной гипотезы на основе корпуса был проведен количественный анализ глаголов, оформленных показателем ЧЕ, в функции определения. По запросу «ЧЕ» в переводных текстах параллельного русско-китайского корпуса было найдено 878 вхождений, из которых 47 - оформляли глагол в функции определения.

Количественный анализ глаголов, оформленных показателем ЧЕ, в функции определения показал, что их доля в процентном соотношении среди всех вхождений с глаголом, оформленным показателем ЧЕ, составляет 5,3% (см. Табл.2).

В то же самое время доля глаголов, оформленных показателем ЧЕ, в функции определения в непереведенных текстах сопоставимого корпуса составляет 1,2% (см. Табл. 2).

Важно отметить, что непереведенные тексты сопоставимого корпуса, будучи написанными на целевом китайском языке его носителями, соответствуют нормам китайского языка, а значит, данные, содержащиеся в них, являются достоверными.

Таблица 2

Количество глаголов, оформленных показателем ЧЕ, в функции определения

Глаголы, оформленные показателем ЧЕ

Глаголы, оформленные показателем ЧЕ, в функции определения

Доля в процентном соотношении, %

Переводные тексты русско-китайского параллельного корпуса

878

47

5,3

Непереводные тексты сопоставимого корпуса

773

9

1,2

На основании количественных данных и при учете соблюденного баланса между объемом переводных текстов параллельного корпуса и объемом непереводных текстов сопоставимого корпуса (см. Табл. 1), можно сделать вывод, что глагол, оформленный показателем ЧЕ, в функции определения используется чаще в переводном китайском языке, чем в целевом, что подтверждает выдвинутую ранее гипотезу.

II.2 Анализ универсалии «смешанность соответствия» при переводе русских синтаксических конструкций глаголом, оформленным показателем ЧЕ, в функции определения

Рассуждая о глаголе, оформленном показателем ЧЕ в функции определения как об объекте анализа универсалии «смешанность соответствия», представляется возможным выдвинуть следующую гипотезу: соответствие глагола, оформленного показателем ЧЕ, в функции определения характеризуется смешанностью.

Для подтверждения данной гипотезы на основе корпуса был проведен количественный анализ глаголов, оформленных показателем ЧЕ, в функции определения. По запросу «ЧЕ» в переводных текстах параллельного русско-китайского корпуса было найдено 878 вхождений, из которых 47 - оформляли глагол в функции определения.

Количественный глаголов, оформленных показателем ЧЕ, в функции определения показал, что 17 из них можно рассматривать в качестве соответствия, а 30 - в качестве отсутствия соответствия (см. Табл. 3).

Таблица 3

Соответствие конструкций с глаголом, оформленным показателем ЧЕ, в функции определения

Количество

Доля в процентном соотношении, %

Соответствие

17

36,2

Отсутствие соответствия

30

63,8

На основании количественных данных можно сделать вывод, что соответствия глагола, оформленного показателем ЧЕ, в функции определения различны: доля глаголов, рассматриваемых в качестве соответствия в процентном соотношении, составляет 36,2% а доля глаголов, рассматриваемых в качестве отсутствия соответствия, составляет 63,8% (см. Табл. 3).

Исходя из этого, можно заключить, что соответствие глагола, оформленного показателем ЧЕ, в функции определения характеризуется смешанностью, что подтверждает выдвинутую ранее гипотезу.

II.2.1 Соответствие

Несмотря на тот факт, что соответствие на различных языковых уровнях представляет собой «явление очень редкое» Основные понятия переводоведения (Отечественный опыт). Терминологических словарь-справочник / Отд. языкознания; Отв. Редактор канд. филол. наук Раренко М.Б. - М, 2010. С. 189., чье существование в лингвистической теории принципиально отрицается, в языках существуют схожие по определенным признакам слова и конструкции, которые могут использоваться при переводе с одного языка на другой.

В качестве соответствия в данном случае рассматривается перевод слов или конструкции исходного языка схожим словом или конструкцией переводного языка по следующим признакам: морфологической общности, синтаксической функции и семантике.

Примером такого соответствия можно считать русское причастие и китайский глагол, оформленный показателем ЧЕ, в функции определения.

В русском языке причастие, так же как и глагол, оформленный показателем ЧЕ, в функции определения представляет собой форму глагола, имеющую синкретический характер, что подтверждает их соответствие по признаку морфологической общности.

Причастие, будучи формой глагола, обладает признаками прилагательного, которые выражаются его морфологическими и синтаксическими характеристиками.

Что касается морфологических характеристик, то от прилагательного причастие имеет мужской и женский род, единственное и множественное число, а также падежные формы. Синтаксическая характеристика представлена возможностью причастия выполнять функцию определения.

Источник: https://otherreferats.allbest.ru/download/1226644/