Литература
1.Seismic Phenomena in the Area of Chernobyl Nuclear Power Plant / V.N. Strakhov, V.I. Starostenko, O.F. Kharitonov at all. // Geophys. J., (OPA) - 1998. - №17. - P. 389-409.
2.Національний атлас України / Гол. ред. Руденко Л.Г. – К.: ДНВП «Картографія», 2007. – 640 с.
3.Вивчення активізації природної сейсмічності в умовах техногенно-навантажених територій (на прикладі Кривбасу) / [А.Г. Шапар, П.Г. Пігулевський, В.К. Свистун та ін.] // Екологія і природокористування: Зб. наук. праць Інституту проблем природокористування та екології НАН України. – Вип.18. – Дніпропетровськ, 2014. – С. 43-53.
4.Tiapkin O.K. Research of the increased induced seismicity of central part of Ukrainian shield / O.K. Tiapkin, O.V. Kendzera, P.H. Pihulevskii // Неделя эколога – 2017: Доклады международного научного симпозиума. – Каменское: ДГТУ. – 2017. – С. 297-301.
1Институт геофизики НАН Украины, г. Киев, Украина 2Национальный горный университет, г. Днепр, Украина
P.I. Pigulevskiy1, O.V. Kendzera1, O.K. Tiapkin2
RESEARCH OF INDUCED SEISMICITY OF MINING REGIONS ON UKRAINIAN SHIELD
Intensive long-term development of the mining industry in the old industrial regions caused the disturbance of the geodynamic equilibrium, the unstable state of the upper crust (to a depth of 20 km), which led to an increase of the induced seismicity on the Ukrainian Shield. In the Krivoy Rog region, with the existing intensity of mining operations with powerful explosions, the local earthquakes with a magnitude up to 5 along Richter can be occur. It is necessary to create a local seismic monitoring system to localize areas of modern activation of tectonic structures with induced seismicity
Key words: hydrogeodynamic monitoring, induced seismicity, local earthquake, powerful mining explosions, mines and
open pits
1Institute of Geophysics of NAS of Ukraine, Kyiv, Ukraine
2National Mining University, Dnipro, Ukraine
УДК 57.087.1
И.В. Климук, А.С. Свидрицкий, Н.Н. Яцков
АЛГОРИТМ K БЛИЖАЙШИХ СОСЕДЕЙ ДЛЯ КЛАССИФИКАЦИИ ЭКСПРЕССИИ ГЕНОВ С УЧЕТОМ ВЕСОВЫХ ФАКТОРОВ КАЧЕСТВА СПОТОВ БИОЧИПОВ ДНК
В работе представлена имитационная модель биочипа ДНК, а также 3 модификации алгоритма k-ближайших соседей для классификации экспрессии генов с учетом параметра качества спотов биочипов ДНК, проведен сравнительный анализ эффективности алгоритмов на смоделированных данных
Ключевые слова: атмосфера, мутация, биочип ДНК, биоинформатика, имитационное моделирование, алгоритм классификации, параметр качества спота
Введение. Исследования микроорганизмов в различных экосистемах играют важную роль в изучении глобального состояния атмосферы. Последние десятилетия характеризуются бурным развитием промышленности, сельского хозяйства и иных видов деятельности человека. Как результат, в окружающей среде накапливаются различные вредные для живых организмов вещества, происходит быстрое изменение климатических показателей. Данные факторы напрямую влияют на мутацию (ненаследственное изменение генотипа) живых организмов. Поэтому отдельный блок исследований посвящен анализу генетической информации организмов. Для этого широко используются биочипы ДНК [1-4].
Биочипы или микрочипы ДНК – это микроматрицы с нанесенными на них образцами биологического вещества [5]. Особенностью микрочипов является возможность одновременно исследовать экспрессии множества генов [1]. С помощью технологии биочипов ДНК
16
можно за короткое время обнаружить различные мутации и заболевания, например, онкологические [6, 7]. Для более эффективного использования микрочипов требуется постоянное улучшение алгоритмов их анализа. Однако зачастую анализ данных биочипа затруднен вследствие их низкого качества и высокого уровня экспериментального шума. Повысить эффективность алгоритмов анализа можно, если учесть параметр качества изображения каждого спота биочипа [3, 6]. Возможность вычисления параметров или факторов качества спотов предоставляют некоторые программные пакеты цифровой обработки изображений биочипов, например MAIA [4].
Цель работы: реализация и исследование имитационной модели биочипа ДНК и алгоритма, k-ближайших соседейдля классификации экспрессии генов с учетом весовых факторов качества спотабиочипов ДНК.
Вработе приведены результаты сравнения алгоритмаk-ближайших соседей без учета параметра качества спотови трех модификаций этого алгоритма с учетом параметра качества спотов.
Имитационная модель биочипа.
Вработе использовалась разработанная модельэкспрессии двухканального биочипа ДНК. За основу взята модель [2]. Алгоритм моделирования:
Шаг 1. Задание параметров модели: N – число генов, m – число репликантов, p –доля невыраженных генов в выборке.
Шаг 2. Создание и заполнение матрицы M размером N*m: первые N*p строк – значением 0, следующие N*(1-p)/2 строк – значением -1, последние N*(1-p)/2 строк – значением
1.
Шаг 3. Генерация вектора параметров качества спотов Q размером Nс использованием бета-распределения с параметрами a = 2,5, b = 3,5. Данное распределение позволяет добиться генерации значений параметров качества спотов, наиболее близко имитирующих значения реальных экспериментов [6].
Шаг 4. Добавление нормального шума к данным (1):
, |
(1) |
где rnorm – реализация стандартной нормальной случайной величины.
Строки полученной матрицы M– объекты, которые требуется классифицировать, вектор Q – вектор параметров качества каждого объекта.
На рис. 1 и 2 изображены визуальное представление смоделированных объектов и гистограмма параметров качества этих объектов.
Рис. 1. Визуальное представление смоделированных данных
17
Рис. 2. Гистограмма распределения параметров качества смоделированных данных
Метод ближайших соседей и его модификации
В общем случае задача классификации представляет разбиение конечного множества объектов (тестируемая выборка) на классы, имея некоторое эталонное множество с уже известными значениями классов каждого объекта (обучающая выборка). В случае с двухканальнымимикрочипами ДНК на этапе количественного анализа нужно классифицировать гены как невыраженные, выраженные или подавленные. В идеальном случае каждый ген имел бы значение относительной экспрессии 0, 1 и -1 соответственно. Однако в связи с высоким экспериментальным шумом задача классификации становится более трудной. В данной работе для исследования выбран и программно реализован метод k-ближайших соседей (сокращенно kNN). Его преимущества: простота реализации, достаточно хорошие результаты при работе с данными различного типа, возможность модифицировать и подстроить алгоритм под конкретную задачу. Недостатки: большая трудоемкость в вычислениях, неопределенность выбора числа k.
Разработаны и программно реализованы 3 модификации метода с учетом весовых факторов качества спотов:
kNN с учетом параметра качества спота при расчете дистанции. Расстояния между объектами обучающей и тестируемой выборки считаются по формуле (2):
, |
(2) |
где
– параметр качества j-го объекта обучающей выборки.
kNN с учетом параметра качества спота при голосовании. Параметр качества учитывается при назначении метки класса объекту тестируемой выборки. Класс-победитель выбирается по максимальной сумме их параметров качества (3):
Class(
) = arg , (3) kNN с учетом параметра качества спота при расчете дистанций и при голосовании.
Алгоритм включает оба изменения, описанные в п. 1 и 2.
Сравнительный анализ работы алгоритмов.
Эффективность работы каждого алгоритма вычислялась как процент ошибки при классификации всех генов, невыраженных и выраженных генов (представляющих наиболь-
18
ший интерес при анализе биочипов).
Выполнено сравнение эффективности алгоритмов в зависимости от различных значений параметров обучающей и тестируемой выборок, а именно:
– размер обучающей выборки, менялся от 100 до 2000;
– относительная доля невыраженных генов в обучающей выборке, менялась от 0.05
до 0,95;
<
> и<
>– средние значения параметров качества тестируемой и обучающей выборки соответственно, менялись от 0,1 до 0,9.
Зависимость ошибки классификации от параметров модели для разработанных алгоритмов представлены на рис. 3- 6. Видно, что модифицированные алгоритмы имеют меньшую ошибку классификации, чем классический алгоритм (в среднем разница достигает 7 %). На графиках, изображенных на рис. 3 - 5, кривая 1 - kNN, 2 - kNN с измененным голосованием, 3 - kNN с пересчетом расстояний и кривая 4 - kNN с измененным голосованием и пересчетом расстояний.
Рис. 3. Зависимость ошибки классификации выраженных генов от размера обучающей Выборки
Рис. 4. Зависимость ошибки классификации выраженных генов от среднего качества тестируемой выборки
19
Рис. 5. Зависимость ошибки классификации выраженных генов от среднего качества обучающей выборки
Рис. 6. Зависимость ошибки классификации от доли невыраженных генов в обучающей выборке: 1 – невыраженных генов для kNN; 2 – невыраженных генов для kNN
с измененным голосованием и пересчетом расстояний; 3 – выраженных генов для kNN; 4 – выраженных генов для kNNс измененным голосованием и пересчетом расстояний
На рис. 3 видно, что при размере обучающей выборки 500 и более ошибка классификации для всех алгоритмов не меняется. Зависимости на рис. 4 и 5 показывают, что чем хуже качество данных (как обучающей выборки, так и тестируемой), тем лучше с задачей классификации справляются модифицированные алгоритмы в сравнении с базовым алгоритмом. На рис. 6 видно, что наилучшие результаты все алгоритмы показывают при относительной доле невыраженных генов в обучающей выборке pLearn [0,5, 0,6].
Выводы. Разработаны и реализованы имитационная модель биочипа ДНК для анализа экспрессии генов с учетом параметра качества спотов, метод k-ближайших соседей и три его модификации с учетом параметра качества спотов. Сравнительный анализ эффективности работы алгоритмов позволяет сделать следующие выводы:
-при размере обучающей выборки 500 и более ошибка классификации для всех алгоритмов не меняется;
-чем хуже качество данных (как обучающей выборки, так и тестируемой), тем лучше
сзадачей классификации справляются модифицированные алгоритмы в сравнении с базовым алгоритмом;
-наиболее эффективная модификация алгоритма- k-ближайших соседей с учетом параметра качества для расчета расстояний и при голосовании: в среднем ошибка классифика-
20