10
Перспективность использования технологий Big Data в современной потребкооперации
Л.Г. Кудрявцева, А.А. Шурупов
Аннотация
В статье рассмотрено понятие термина Большие Данные, приведены возможные источники получения Больших Данных, изложены основные принципы работы с ними. Рассмотрена возможность их использования в кооперативном секторе экономики.
Актуальность данного исследования. В связи с тем, что кооперативный сектор экономики играет существенную роль в структуре национальной экономики, важно понять, как наиболее эффективно использовать применительно к нему методы и технологии системы обработки больших данных. Объективной основой для такого использования является существующая структура первичных поставщиков продукции и услуг в систему кооперации.
Ключевые слова: информационные технологии, большие данные, BIG DATA.
Abstract
Perspectives of using Big Data technologies in modern consumer cooperation
The article give voice about the concept of the term Big Data, the possible sources of Big Data, the basic principles of working with them. The possibility of their use in the cooperative sector of the economy is considered.
The relevance of this study. Since the cooperative sector of the economy plays a significant role in the structure of the national economy, it is important to understand how best to use the methods and technologies of the big data processing system in relation to it. The objective basis for such use is the existing structure of primary suppliers of products and services in the system of cooperation.
Keywords: information technologies, big data, BIG DATA.
Современная экономика вступила в принципиально новый этап своего развития - этап цифровизации, то есть этап перехода к цифровой экономике. Ключевым фактором цифровой экономики [1] является обработка цифровых данных большого объема и обработка результатов их анализа. Она позволяет повысить эффективность деятельности в таких сферах как производство, хранения, торговля, доставка и обслуживание. Это чрезвычайно важно для предприятий потребкооперации в условиях конкурентной борьбы.
Из документа Минфина, определяющего актуальность и цель национального проекта РФ «Цифровая экономика» на период с 2019 по 2021 гг. следует, что создание устойчивой и безопасной информационно-телекоммуникационной инфраструктуры высокоскоростной передачи, обработки и хранения больших объемов данных, доступной для всех организаций и домохозяйств является приоритетным и основополагающим [2]. экономика кооперация big data цифровизация
Рассмотрим подробнее, что понимают под большими данными и какова их роль.
В настоящее время сложилось общепринятое понятие BIG DATA (с англ. Большие данные).
Это понятие включает в себя определенные подходы и различные методы, предназначенные для обработки больших объемов данных, как структурированных, так и неструктурированных. Эти данные, как правило, очень разнятся по содержанию. В результате использования методов обработки BIG DATA человек получает результаты достаточно эффективные при постоянном росте поступающих данных, которые могут имеют свойство распределенности по многочисленным узлам компьютерной сети [3].
Такая компьютерная среда рассматривается как более эффективная альтернатива давно эксплуатируемым базам данных, системам управления, а также используемым инструментам и методам для перевода необработанной информации в удобную, осмысленную форму. Эта альтернатива сформировалась к началу двадцать первого века.
В русскоязычной среде помимо термина BIG DATA используется понятие «большие данные». К настоящему времени существует общепринятое суждение, что большие данные представляют из себя совокупность нескольких технологий, применяющихся для совершения трех операций.
Первая операция служит для обработки объемов данных, которые по размеру превосходят «стандартные» сценарии. Вторая операция предназначена для работы с большими объемами быстро поступающих данных. И третья операция применима для работы со структурированными и слабо структурированными данными, которые ориентированы на разный уровень потребления в узлах электронно-вычислительной сети. Другими словами, в больших данных предполагается ориентация алгоритмов на обработку информации плохо структурированной.
Иначе говоря, понятие BIG DATA включает в себя не только большой объем самих данных, но и их возможности по совместимости с разными способами переработки информации.
Понятие «большие данные» может быть отнесено как к небольшого размера наборам данных (например, статья в журнале), так и к огромным массивам данных, которые присутствуют в глобальных сетях.
Средства работы с большими данными могут быть использованы, например, в транспортных организациях для приема и переработки GPS сигналов, или в торговых организациях для переработки данных о перемещении товаров и покупках, или в библиотечных фондах для оцифровывания книг, а также в банковском деле для получения информации о действиях клиентов, или обработки информации от датчиков приборов.
Несомненно, что число источников информации стремительно растет, поэтому требуются все новые технологии их обработки.
Однако несмотря на то, что такого рода задачи уже давно решаются, востребованными технологии «больших данных» стали только тогда, когда число пользователей Интернета резко выросло, появилось множество сообществ пользователей, соответственно, резко увеличилось и количество создаваемых ими сообщений. И когда их количество превысило 1000000, остро встала необходимость в обработке невероятно огромного количества совершаемых ими операций [4]. Действия пользователей превратились в непрерывный поток данных, и эти данные, правильно интерпретированные и переработанные системой «больших данных», должны быть доступны каждому пользователю оперативно по мере поступления запросов.
Под термином Big Data подразумевается не только большой объем информации, ее разнообразность и потребность в быстрой обработке, но кроме того определенный набор методов и процессов, необходимых для решения этих задач.
Один из методов использует кластер высокопроизводительных машин, который обрабатывает большие объемы данных с помощью системы распределенных вычислений.
Имеющимися в настоящее время традиционными инструментами невозможно обработать все объемы неоднородной и быстро поступающей цифровой информации. Анализ больших данных делает возможным видеть явные и скрытые закономерности, чего не может сделать человек, что позволяет оптимизировать все сферы жизни: от производства и телекоммуникаций до государственного управления. Фактически, BIG DATA - это альтернатива традиционным системам управления данными.
Изначально идея «больших данных» зародилась в 1970-е годы в век больших машин. В это время появились очень сложные научные вычисления, и в обработке нуждались большие объемы данных. Однако технические характеристики компьютеров были ограничены и не позволяли проводить необходимые вычисления.
Непосредственно термин «Большие данные» впервые появился в британском научном журнале «Nature» в 2008 году. Специальный номер журнала был посвящен рассмотрению роли данных в электронной науке. В статьях этого номера была предпринята попытка ответить на вопрос «Как технологии работы с большими объемами данных могут повлиять на будущее науки?» [5].
Рост интереса к большим данным был вызван резким увеличением объемов информации, причем, в основном, неструктурированных данных. Объемы росли по экспоненциальному закону. Поэтому, все более актуальными становились вопросы корректной интерпретации информационных потоков. Практическое решение этих вопросов сплошь и рядом сталкивалось с проблематикой обработки количественно и структурно качественно увеличивающегося потока информации.
Если до начала нового века большие данные были интересны только крупным компаниям и специальным научно-исследовательским центрам, то с его наступлением средний и малый бизнес также получил доступ к анализу
Одновременно с этим развиваются технологии хранения данных и растут вычислительные мощности машин. В 2008 большие данные - это петабайты (1 петабайт приблизительно равен 1000 терабайт), но предполагалось, что вскоре придется оперировать с эксабайтами (1 эксабайт приблизительно равен 1000 000 терабайт).
Появилось опасение, что возможностей для работы с этими гигантскими массивами данных просто не будет из-за дороговизны и сложного вычислительного аппарата.
И действительно, к 2010 году на домашних ПК хранилось уже 6 эксабайтов данных, а у корпораций было 7 эксабайтов данных [5].
Таким образом человечество путем накопления данных в формате «все обо всем» шаг за шагом приближается к ликвидации информационного вакуума. После чего, возможно, наступит эра тотального контроля.
Генерация больших данных в современном мире давно и успешно производится в следующих отраслях:
- сбор данных метеонаблюдений в масштабах Земли;
- архивация непрерывно поступающих данных с измерительных устройств промышленных объектов;
- в сетях сотовой связи информация о местонахождении абонентов;
- для заинтересованных потребителей производится сбор информации с устройств аудио регистрации и видео регистрации;
- систематизация информации о движении денежных потоков в банковском и биржевом секторах;
- сбор данных сканирования земли с помощью летательных аппаратов и из космоса;
- массивы сообщений из социальных сетей.
BIG DATA начали проявлять себя во все возрастающем количестве сфер деятельности человека. Это, в первую очередь, государственное управление, научно-исследовательская деятельность и коммерческий сектор.
Например, большие данные и геолокация [6]. Основные вызовы для геоиндустрии в настоящее время - полнота и богатство контента, качество, точность данных и, пожалуй, наиболее сложный из всех - актуальность информации. А именно, обновление карты в режиме реального времени пока не под силу ни одному из игроков на рынке.
В ближайшем будущем геолокационную индустрию ждут большие перемены, и эти перемены будут связаны в первую очередь с достижениями в области BIG DATA.
Современные технологии уже позволяют собирать информацию о ситуациях на дорогах при помощи десятков тысяч автомобилей, снабженных сенсорами, и передавать ее в облако для дальнейшего транслирования пользователям. Чем больше автомобилей - тем больше охват и детализация области сбора данных.
К настоящему времени выделяют три основных подхода, имеющих принципиальное значение, к работе с большими данными.
Масштабируемость по горизонтали. Она открывает возможность иметь в системе сколько угодно данных. И, таким образом, система для обработки Big Data будет меть свойство расширяемой совокупности данных. Если вырастает объем данных, то соответственно увеличивается и количество средств обработки в кластере, при этом система продолжает устойчиво функционировать.
Устойчивость к возможному отказу Hardware или сбою программного обеспечения. Из принципа масштабируемости по горизонталиследует, что в одном кластере может быть очень много машин. Какая-то часть всех машинпостепенно начнет ломаться. Такие ситуации должны учитываться при работе с большими данными, и их надо без последствий преодолевать.
Локальность данных. Этот принцип является важнейшим в деле разработки решений Big Data. Большое количество информации в децентрализованных системах расположено на огромном количестве машин. При этом физически определенные данные находятся на одном сервере, но обрабатываются на другом. Непосредственно обработка информации требует б'ольших расходов, чем необходимо для передачи данных. Следовательно, и хранение, и обработку данных надо производить на одной и той же машине [4]. Все современные разработки для действий с большими данными имеют в основе рассмотренные выше подходы. Практическая же реализация возможна с помощью специально разработанных средств и методов обработки данных.
Классическим методом является MapReduce [7]. Парадигма Парадигма (с греч., пример, модель, образец) - совокупность фундаментальных научных установок, представлений и терминов, принимаемая и разделяемая научным сообществом и объединяющая большинство его членов. MapReduce была представлена компанией Google в 2004 году в статье «MapReduce: Simplified Data Processing on Large Clusters».
Она представляет собой модель децентрализованной обработки данных и предназначена для обработки больших объемов информации на компьютерных кластерах. Для этого данные нужно представить в виде записей, сделанных определенным образом.
Рис. 1. Модель MapReduce
На рис. 1 представлена взятая из [7] иллюстрация модели MapReduce.
Существует три стадии обработка данных в модели MapReduce [4]:
Первая стадия: Map. Эту функцию определяет пользователь Предварительная обработка входных данных осуществляется функцией map(). На один из компьютеров (главный узел) поступают входные данные задачи, затем данные делятся на части и передаются рабочим узлам (другим компьютерам) для подготовительной обработки.
Аналогичная операция используется в функциональных языках программирования. Собственно функция Map() применяется только к одной входной записи, в результате чего появляется большое количество пар ключей со значениями. Пользователь сам определяет содержимое ключа и значения. Далее данные с одинаковыми ключами попадают в один и тот же экземпляр функции Reduce.
Следующая стадия обработки - Shuffle. Как правило, она проходит незаметно для пользователя. На этой стадии выходные данные функции Map разбиваются на группы. Каждая группа соотносится с одним ключом выхода стадии Map и является входом на стадию Reduce.
В практических задачах эта стадия - самая тяжелая, поскольку именно здесь происходит сортировка данных. К счастью, в некоторых задачах можно опустить стадию Shuffle.