Preview

Вестник Дагестанского государственного технического университета. Технические науки

Расширенный поиск

Сравнительный анализ инструментов обработки больших данных на платформе Hadoop

https://doi.org/10.21822/2073-6185-2026-53-2-110-123

Аннотация

Цель. В статье представлен всесторонний сравнительный обзор ведущих инструментов, используемых для обработки больших данных в экосистеме Apache Hadoop, с целью обеспечения организаций критериями выбора оптимального решения для различных типов рабочих нагрузок. Актуальность исследования обусловлена тем, что современный бизнес требует анализа данных всех форм и размеров, включая структурированные и неструктурированные, чтобы лучше понимать свою продукцию, клиентов и рынки. Рост объемов, скорости и разнообразия данных (Big Data) привел к необходимости разработки специализированных платформ для их обработки. Проблема нестабильности Apache Hive является ключевым архитектурным вызовом, поскольку Hive, является наиболее ресурсоемким в выполнении идентичных задач со Spark, так как начинает обработку входных данных без их предварительного анализа.
Метод. Проведен обзор источников, охватывающих широкий спектр инструментов и архитектурных решений для обработки больших данных в экосистеме Apache Hadoop и за ее пределами. Предложенная методология сочетает сравнительный анализ существующих подходов и комплексную методику выбора оптимальных инструментов и архитектурных решений для обработки больших данных.
Результат. Проанализированные характеристики Cloudera Impala и Apache Hive позволяют сделать вывод, что данные SQL-инструменты для аналитической обработки данных в экосистеме Hadoop дополняют друг друга.
Вывод. Полностью заменять Apache Spark на Flink преждевременно из-за потенциальной потребности в дополнительной инфраструктуре, но Flink является жизнеспособным решением для задач, требующих минимального времени отклика.

Об авторах

С. А. Резниченко
Финансовый университет при Правительстве Российской Федерации
Россия

Алексеева Анна Николаевна, студент, кафедра информационной безопасности

125167, г. Москва, Ленинградский пр-т, 49/2



А. Н. Алексеева
Финансовый университет при Правительстве Российской Федерации
Россия

Резниченко Сергей Анатольевич, кандидат технических наук, доцент, кафедра информационной безопасности

125167, г. Москва, Ленинградский пр-т, 49



Список литературы

1. Шейк А.С. Достижения В Обработке Потоков В Реальном Времени: Сравнительное Исследование Apache Flink, Spark Streaming И Kafka Streams //Международный Журнал Компьютерной Инженерии И Технологий (IJCET). – 2024. – Т. 15. – №. 6. – Дата обращения: 10.11.2025.

2. Лакшмипати С. Apache Flink vs Apache Kafka Streams vs Apache Spark Structured Streaming — Сравнение движков обработки потоков [Электронный ресурс] // Onehouse Blog. – Рекомендации по кибербезопасности AA23-059A. – 2025. – Режим доступа: https://www.onehouse.ai/blog/apache-spark-structured-streaming-vs-apache-flink-vs-apache-kafka-streams-comparing-stream-processing-engines?, свободный. – Дата обращения: 10.11.2025.

3. Кевалрамани С. Impala против Hive против Spark SQL: Выбор SQL-движка для совместной работы в хранилище данных Cloudera [Электронный ресурс] / Пер. с англ. английский. mongohtotech // 29 января 2020. Режим доступа: https://habr.com/ru/articles/486124/. – Дата обращения: 10.11.2025.

4. ProjectPro. Impala vs Hive: разница между Sql и компонентами Hadoop [Электронный ресурс] // Блог ProjectPro. Обновлено 28 октября 2024 г. Режим доступа: https://www.projectpro.io/article/impala-vshive-difference-between-sql-on-hadoop-components/180. – Дата обращения: 11.11.2025.

5. Мааян Г. Д. Spark vs. Flink: ключевые отличия и как выбрать [Электронный ресурс] // Dataversity. 8 мая 2023 г. Режим доступа: https://www.dataversity.net/articles/spark-vs-flink-key-differences-and-howto-choose/?. – Дата обращения: 11.11.2025.

6. Потоковая обработка с помощью Apache Flink: Руководство для начинающих 2025 [Электронный ресурс] // Ververica. [Электронный ресурс]. Режим доступа: https://www.ververica.com/streamprocessing-with-apache-flink-beginners-guide. – Дата обращения: 11.11.2025.

7. Венер К. Основные тенденции в области потоковой передачи данных с помощью Apache Kafka и Flink в 2025 году [Электронный ресурс] // Блог Кая Венера. 2 декабря 2024 г. Режим доступа: https://www.kai-waehner.de/blog/2024/12/02/top-trends-for-data-streaming-with-apache-kafka-and-flinkin-2025/?. – Дата обращения: 11.11.2025.

8. Ашырова Ю. Управление данными и их анализ в BIG DATA // Символ науки. 2025. № 1-1-2. URL: https://cyberleninka.ru/article/n/data-management-and-analysis-in-big-data. - Дата обращения: 12.11.2025.

9. Белов В.А., Никульчев Е.В. Экспериментальная оценка временной эффективности обработки больших данных в заданных форматах хранения // International Journal of Open Information Technologies. 2021. № 9. URL: https://cyberleninka.ru/article/n/eksperimentalnaya-otsenka-vremennoy-effektivnostiobrabotki-bolshih-dannyh-v-zadannyh-formatah-hraneniya. – Дата обращения: 10.11.2025.

10. Алтыев Аганазар, Бекдурдыев Гурбанназар, Атаев Аллаберди, Тачев Юсуп Компьютерные технологии для обработки больших данных // Наука и мировоззрение. 2025. № 41. URL: https://cyberleninka.ru/article/n/kompyuternye-tehnologii-dlya-obrabotki-bolshih-dannyh. – Дата обращения: 12.11.2025.

11. Смайлов Н.К. Методы и технологии оценки и управления качеством данных // Экономика и социум. 2025. № 8 (135). URL: https://cyberleninka.ru/article/n/metody-i-tehnologii-otsenki-i-upravleniyakachestvom-dannyh. – Дата обращения: 12.11.2025.

12. Упаева П.В. Оптимизация ETL-процессов: обзор отечественного рынка // Вестник науки. 2024. № 6 (75). URL: https://cyberleninka.ru/article/n/optimizatsiya-etl-protsessov-obzor-otechestvennogo-rynka. – Дата обращения: 12.11.2025.

13. С.Г. Ермаков, М.М. Халил, А.Д. Хомоненко, В.А. Гончаренко, В.А. Ходаковский, Р. Абу Хасан Переход от хранилища данных университета к озеру: модели и методы обработки больших данных // ИВД. 2024. № 12 (120). URL: https://cyberleninka.ru/article/n/perehod-ot-hranilischa-dannyh-universitetak-ozeru-modeli-i-metody-obrabotki-bolshih-dannyh. – Дата обращения: 12.11.2025.

14. Almeida, A., Brás, S., Sargento, S. et al. Time series big data: a survey on data stream frameworks, analysis and algorithms. J Big Data 10, 83. URL:https://doi.org/10.1186/s40537-023-00760-1. – Дата обращения: 12.11.2025.

15. Овездурдыева Ирина Курбангельдыевна, Мырадов Максат Тачмухаммедович. Технологии работы с большими данными “big data”: сбор, хранение и обработка больших данных // Наука и мировоззрение. 2024. № 29. URL: https://cyberleninka.ru/article/n/tehnologii-raboty-s-bolshimi-dannymi-big-datasbor-hranenie-i-obrabotka-bolshih-dannyh. – Дата обращения: 12.11.2025.

16. Кузина Е. Обзор архитектуры Impala ADH Arenadata Docs [Электронный ресурс]. – Режим доступа: https://docs.arenadata.io/ru/ADH/current/concept/impala/impala.html. – Дата обращения: 12.11.2025.

17. Егорцев В. Работа с большими данными: введение в Apache Hadoop и Spark [Электронный ресурс] // Tproger. [Б.г.]. Режим доступа: https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apachehadoop-i-spark. – Дата обращения: 12.11.2025.


Рецензия

Для цитирования:


Резниченко С.А., Алексеева А.Н. Сравнительный анализ инструментов обработки больших данных на платформе Hadoop. Вестник Дагестанского государственного технического университета. Технические науки. 2026;53(2):110-123. https://doi.org/10.21822/2073-6185-2026-53-2-110-123

For citation:


Reznichenko S.A., Alexeeva A.N. Comparative analysis of big data processing tools on the Hadoop platform. Herald of Dagestan State Technical University. Technical Sciences. 2026;53(2):110-123. (In Russ.) https://doi.org/10.21822/2073-6185-2026-53-2-110-123

Просмотров: 13

JATS XML


Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 2073-6185 (Print)
ISSN 2542-095X (Online)