Все же, почему метод ансамблей превосходит отдельно стоящие прогнозные модели?
§ Он минимизирует влияние случайностей. Агрегированный классификатор «усредняет» ошибку каждого из базовых классификаторов -- соответственно, влияние случайностей на усредненную гипотезу существенно уменьшается.
§ Он снижает дисперсию. Совокупное мнение целого множества моделей лучше, чем мнение отдельно взятой модели. В экономике это называется диверсификацией -- расширение ассортимента выпускаемой продукции повышает эффективность производства и предотвращает банкротство. Ансамбль моделей имеет больший шанс найти глобальный оптимум, поскольку поиск идет из разных точек исходного множества гипотез.
§ Он предотвращает выход за пределы множества. Вероятен следующий случай: агрегированная гипотеза находится за пределами множества базовых гипотез. При построении комбинированной гипотезы любым путем (логистическая регрессия, усредненное значение, голосование), множество гипотез расширяется, следовательно, полученный результат не выходит за его рамки.
2.1.2 Неконтролируемое обучение
2.1.2.1 Алгоритмы кластеризации
Задача кластеризации состоит в группировании множества объектов таким образом, чтобы поместить максимально похожие между собой элементы в одну группу (рис.5).
Рисунок 4
Алгоритмов кластеризации существует довольно много, и все они отличаются друг от друга. Самые популярные из них:
§ алгоритмы на базе центра тяжести треугольника;
§ алгоритмы на основе подключения;
§ алгоритмы плотности на основе пространственной кластеризации;
§ вероятностный алгоритм;
§ алгоритм уменьшения размерности;
§ нейронные сети и машинное обучение.
Алгоритмы кластеризации используются в биологии, социологии и информационных технологиях. Например, в биоинформатике с помощью кластеризации анализируются сложные сети взаимодействующих генов, состоящие порой из сотен или даже тысяч элементов. А при анализе результатов социологических исследований рекомендуется осуществлять анализ методом Уорда, при котором внутри кластеров оптимизируется минимальная дисперсия, в итоге создаются группы приблизительно равных размеров.
2.1.2.2 Метод главных компонент
Метод главных компонент (PCA) -- это статистическая процедура, которая использует ортогональное преобразование с целью конвертации набора наблюдений за возможно коррелированными переменными в набор значений линейно некоррелированных переменных, называемых главными компонентами(рис.6).
Рисунок 5
Отдельные области применения PCA включают в себя сжатие и упрощение данных для облегчения обучения, а также визуализацию. Решение об использовании метода главных компонент зависит от уровня познания предметной области. PCA не подходит для применения в случаях с плохо упорядоченными данными (все компоненты метода имеют довольно высокую дисперсию).
2.1.2.3 Сингулярное разложение
В линейной алгебре под сингулярным разложением (SVD) понимают разложение прямоугольной вещественной или комплексной матрицы. Для матрицы M размерностью [m*n] существует такое разложение, что M = UУV, где U и V -- унитарные матрицы, а У - диагональная матрица.
Метод главных компонент является простым применением сингулярного разложения. Первые алгоритмы компьютерного виденья использовали PCA и SVD, чтобы представить лица в виде суммы базисных компонент, выполнить уменьшение размерности, а затем сопоставить их с изображениями из обучающей выборки. И хотя современные методы характеризуются более сложной реализацией, многие из них по-прежнему работают на базе подобных алгоритмов.
2.1.2.4 Анализ независимых компонент
Анализ независимых компонент (ICA) представляет собой статистический метод выявления скрытых факторов, которые лежат в основе множества случайных величин, сигналов и прочих измерений. ICA определяет порождающую модель для исследуемых многофакторных данных, которые обычно подаются в виде большой базы данных образцов. В модели переменные подаются как линейная смесь некоторых скрытых переменных, а любая информация о законах смешивания отсутствует. Предполагается, что скрытые переменные независимы друг от друга и представляются как негауссовские сигналы, поэтому они называются независимыми компонентами исследуемых данных. Анализ независимых компонент непосредственно связан с методом главных компонент, но это гораздо более мощная техника, способная найти скрытые факторы источников, когда классические методы в лице PCA дают сбой. Алгоритм ICA применяется в телекоммуникациях, астрономии, медицине, распознавании речи и изображений, диагностировании и тестировании сложных электронных систем и, наконец, поиске скрытых факторов и источников движения финансовых показателей.
2.2 Возможности машинного обучения
· Кредитный скоринг
· Принятие решений
· Извлечение информации
· Защита от мошенничества
· Алгоритмические стратегии для торговли
При написании курсовой работы по теме исследования мною была изучена специальная литература, включающая научные статьи по информационным технологиям, учебники по машинному обучению, рассмотрено практическое применение машинного обучения на производстве и бизнесе.
В результате анализа возможностей машинного обучения, мною было выявлено, что сфера применений машинного обучения постоянно расширяется. Повсеместная информатизация приводит к накоплению огромных объёмов данных в науке, производстве, бизнесе, транспорте, здравоохранении. Возникающие при этом задачи прогнозирования, управления и принятия решений часто сводятся к обучению по прецедентам. Раньше, когда таких данных не было, эти задачи либо вообще не ставились, либо решались совершенно другими методами.
С каждым годом большие данные становятся все более сложными и человеку становится уже недостаточно аналитических способностей. Некоторые задачи перейдут к искусственному интеллекту, который справится с ними лучше и быстрее, чем человек.
Прогнозируется, что в ближайшее десятилетие искусственный интеллект займет около 7% рабочих мест в России. Часть процессов в организациях автоматизируют и управлять этими процессами поручат самообучающимся алгоритмам.
Огромное место займет ИИ в интернете вещей. Интернет вещей требует обработки большого потока информации в реальном времени.
Устройства, подключенные к сети, генерируют гигантские массивы данных, которые необходимо будет обрабатывать, анализировать и хранить. Как пример, зубные щетки с функцией bluetooth, которые будут отправлять информацию о состоянии зубов стоматологу или дроны, которые станут незаменимы в сельском хозяйстве. Они будут собирать информацию о зрелости урожая, о состоянии почвы, о вредителях и болезнях растений. И во всех технологиях будет использовать машинное обучение. Поэтому машинное обучение готовит для нас перспективное будущее и массу интересных инноваций.
Список использованных источников
1.Педро Домингос Верховный алгоритм. Как машинное обучение изменит наш мир.-М.: Манн, Иванов и Фербер,2016.-336 с.
2. Флах Питер Машинное обучение.-М.: ДМК-Пресс, 2015 г.-400 с.
3. Бринк Хенрик, Ричардс Джозеф, Феверолф Марк Машинное обучение.-М.: Питер, 2017 г.-336 с.
Размещено на Allbest