Сравнительный анализ инструментов обработки больших данных на платформе Hadoop
https://doi.org/10.21822/2073-6185-2026-53-2-110-123
Аннотация
Цель. В статье представлен всесторонний сравнительный обзор ведущих инструментов, используемых для обработки больших данных в экосистеме Apache Hadoop, с целью обеспечения организаций критериями выбора оптимального решения для различных типов рабочих нагрузок. Актуальность исследования обусловлена тем, что современный бизнес требует анализа данных всех форм и размеров, включая структурированные и неструктурированные, чтобы лучше понимать свою продукцию, клиентов и рынки. Рост объемов, скорости и разнообразия данных (Big Data) привел к необходимости разработки специализированных платформ для их обработки. Проблема нестабильности Apache Hive является ключевым архитектурным вызовом, поскольку Hive, является наиболее ресурсоемким в выполнении идентичных задач со Spark, так как начинает обработку входных данных без их предварительного анализа.
Метод. Проведен обзор источников, охватывающих широкий спектр инструментов и архитектурных решений для обработки больших данных в экосистеме Apache Hadoop и за ее пределами. Предложенная методология сочетает сравнительный анализ существующих подходов и комплексную методику выбора оптимальных инструментов и архитектурных решений для обработки больших данных.
Результат. Проанализированные характеристики Cloudera Impala и Apache Hive позволяют сделать вывод, что данные SQL-инструменты для аналитической обработки данных в экосистеме Hadoop дополняют друг друга.
Вывод. Полностью заменять Apache Spark на Flink преждевременно из-за потенциальной потребности в дополнительной инфраструктуре, но Flink является жизнеспособным решением для задач, требующих минимального времени отклика.
Об авторах
С. А. РезниченкоРоссия
Алексеева Анна Николаевна, студент, кафедра информационной безопасности
125167, г. Москва, Ленинградский пр-т, 49/2
А. Н. Алексеева
Россия
Резниченко Сергей Анатольевич, кандидат технических наук, доцент, кафедра информационной безопасности
125167, г. Москва, Ленинградский пр-т, 49
Список литературы
1. Шейк А.С. Достижения В Обработке Потоков В Реальном Времени: Сравнительное Исследование Apache Flink, Spark Streaming И Kafka Streams //Международный Журнал Компьютерной Инженерии И Технологий (IJCET). – 2024. – Т. 15. – №. 6. – Дата обращения: 10.11.2025.
2. Лакшмипати С. Apache Flink vs Apache Kafka Streams vs Apache Spark Structured Streaming — Сравнение движков обработки потоков [Электронный ресурс] // Onehouse Blog. – Рекомендации по кибербезопасности AA23-059A. – 2025. – Режим доступа: https://www.onehouse.ai/blog/apache-spark-structured-streaming-vs-apache-flink-vs-apache-kafka-streams-comparing-stream-processing-engines?, свободный. – Дата обращения: 10.11.2025.
3. Кевалрамани С. Impala против Hive против Spark SQL: Выбор SQL-движка для совместной работы в хранилище данных Cloudera [Электронный ресурс] / Пер. с англ. английский. mongohtotech // 29 января 2020. Режим доступа: https://habr.com/ru/articles/486124/. – Дата обращения: 10.11.2025.
4. ProjectPro. Impala vs Hive: разница между Sql и компонентами Hadoop [Электронный ресурс] // Блог ProjectPro. Обновлено 28 октября 2024 г. Режим доступа: https://www.projectpro.io/article/impala-vshive-difference-between-sql-on-hadoop-components/180. – Дата обращения: 11.11.2025.
5. Мааян Г. Д. Spark vs. Flink: ключевые отличия и как выбрать [Электронный ресурс] // Dataversity. 8 мая 2023 г. Режим доступа: https://www.dataversity.net/articles/spark-vs-flink-key-differences-and-howto-choose/?. – Дата обращения: 11.11.2025.
6. Потоковая обработка с помощью Apache Flink: Руководство для начинающих 2025 [Электронный ресурс] // Ververica. [Электронный ресурс]. Режим доступа: https://www.ververica.com/streamprocessing-with-apache-flink-beginners-guide. – Дата обращения: 11.11.2025.
7. Венер К. Основные тенденции в области потоковой передачи данных с помощью Apache Kafka и Flink в 2025 году [Электронный ресурс] // Блог Кая Венера. 2 декабря 2024 г. Режим доступа: https://www.kai-waehner.de/blog/2024/12/02/top-trends-for-data-streaming-with-apache-kafka-and-flinkin-2025/?. – Дата обращения: 11.11.2025.
8. Ашырова Ю. Управление данными и их анализ в BIG DATA // Символ науки. 2025. № 1-1-2. URL: https://cyberleninka.ru/article/n/data-management-and-analysis-in-big-data. - Дата обращения: 12.11.2025.
9. Белов В.А., Никульчев Е.В. Экспериментальная оценка временной эффективности обработки больших данных в заданных форматах хранения // International Journal of Open Information Technologies. 2021. № 9. URL: https://cyberleninka.ru/article/n/eksperimentalnaya-otsenka-vremennoy-effektivnostiobrabotki-bolshih-dannyh-v-zadannyh-formatah-hraneniya. – Дата обращения: 10.11.2025.
10. Алтыев Аганазар, Бекдурдыев Гурбанназар, Атаев Аллаберди, Тачев Юсуп Компьютерные технологии для обработки больших данных // Наука и мировоззрение. 2025. № 41. URL: https://cyberleninka.ru/article/n/kompyuternye-tehnologii-dlya-obrabotki-bolshih-dannyh. – Дата обращения: 12.11.2025.
11. Смайлов Н.К. Методы и технологии оценки и управления качеством данных // Экономика и социум. 2025. № 8 (135). URL: https://cyberleninka.ru/article/n/metody-i-tehnologii-otsenki-i-upravleniyakachestvom-dannyh. – Дата обращения: 12.11.2025.
12. Упаева П.В. Оптимизация ETL-процессов: обзор отечественного рынка // Вестник науки. 2024. № 6 (75). URL: https://cyberleninka.ru/article/n/optimizatsiya-etl-protsessov-obzor-otechestvennogo-rynka. – Дата обращения: 12.11.2025.
13. С.Г. Ермаков, М.М. Халил, А.Д. Хомоненко, В.А. Гончаренко, В.А. Ходаковский, Р. Абу Хасан Переход от хранилища данных университета к озеру: модели и методы обработки больших данных // ИВД. 2024. № 12 (120). URL: https://cyberleninka.ru/article/n/perehod-ot-hranilischa-dannyh-universitetak-ozeru-modeli-i-metody-obrabotki-bolshih-dannyh. – Дата обращения: 12.11.2025.
14. Almeida, A., Brás, S., Sargento, S. et al. Time series big data: a survey on data stream frameworks, analysis and algorithms. J Big Data 10, 83. URL:https://doi.org/10.1186/s40537-023-00760-1. – Дата обращения: 12.11.2025.
15. Овездурдыева Ирина Курбангельдыевна, Мырадов Максат Тачмухаммедович. Технологии работы с большими данными “big data”: сбор, хранение и обработка больших данных // Наука и мировоззрение. 2024. № 29. URL: https://cyberleninka.ru/article/n/tehnologii-raboty-s-bolshimi-dannymi-big-datasbor-hranenie-i-obrabotka-bolshih-dannyh. – Дата обращения: 12.11.2025.
16. Кузина Е. Обзор архитектуры Impala ADH Arenadata Docs [Электронный ресурс]. – Режим доступа: https://docs.arenadata.io/ru/ADH/current/concept/impala/impala.html. – Дата обращения: 12.11.2025.
17. Егорцев В. Работа с большими данными: введение в Apache Hadoop и Spark [Электронный ресурс] // Tproger. [Б.г.]. Режим доступа: https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apachehadoop-i-spark. – Дата обращения: 12.11.2025.
Рецензия
Для цитирования:
Резниченко С.А., Алексеева А.Н. Сравнительный анализ инструментов обработки больших данных на платформе Hadoop. Вестник Дагестанского государственного технического университета. Технические науки. 2026;53(2):110-123. https://doi.org/10.21822/2073-6185-2026-53-2-110-123
For citation:
Reznichenko S.A., Alexeeva A.N. Comparative analysis of big data processing tools on the Hadoop platform. Herald of Dagestan State Technical University. Technical Sciences. 2026;53(2):110-123. (In Russ.) https://doi.org/10.21822/2073-6185-2026-53-2-110-123
JATS XML































