<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.3 20210610//EN" "JATS-journalpublishing1-3.dtd">
<article article-type="research-article" dtd-version="1.3" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xml:lang="ru"><front><journal-meta><journal-id journal-id-type="publisher-id">vdgtu</journal-id><journal-title-group><journal-title xml:lang="ru">Вестник Дагестанского государственного технического университета. Технические науки</journal-title><trans-title-group xml:lang="en"><trans-title>Herald of Dagestan State Technical University. Technical Sciences</trans-title></trans-title-group></journal-title-group><issn pub-type="ppub">2073-6185</issn><issn pub-type="epub">2542-095X</issn><publisher><publisher-name>Daghestan State Technical University</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.21822/2073-6185-2026-53-2-110-123</article-id><article-id custom-type="elpub" pub-id-type="custom">vdgtu-2098</article-id><article-categories><subj-group subj-group-type="heading"><subject>Research Article</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="ru"><subject>ИНФОРМАЦИОННЫЕ ТЕХНОЛОГИИ И ТЕЛЕКОММУНИКАЦИИ</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="en"><subject>INFORMATION TECHNOLOGY AND TELECOMMUNICATIONS</subject></subj-group></article-categories><title-group><article-title>Сравнительный анализ инструментов обработки больших данных на платформе Hadoop</article-title><trans-title-group xml:lang="en"><trans-title>Comparative analysis of big data processing tools on the Hadoop platform</trans-title></trans-title-group></title-group><contrib-group><contrib contrib-type="author" corresp="yes"><contrib-id contrib-id-type="orcid">https://orcid.org/0009-0004-1417-7779</contrib-id><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Резниченко</surname><given-names>С. А.</given-names></name><name name-style="western" xml:lang="en"><surname>Reznichenko</surname><given-names>S. A.</given-names></name></name-alternatives><bio xml:lang="ru"><p>Алексеева Анна Николаевна, студент, кафедра информационной безопасности</p><p>125167, г. Москва, Ленинградский пр-т, 49/2</p></bio><bio xml:lang="en"><p>Anna N. Alexeeva, Student, Department of Information Security</p><p>49, Leningradsky Ave., Moscow 125167</p></bio><email xlink:type="simple">241266@edu.fa.ru</email><xref ref-type="aff" rid="aff-1"/></contrib><contrib contrib-type="author" corresp="yes"><contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-1539-0457</contrib-id><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Алексеева</surname><given-names>А. Н.</given-names></name><name name-style="western" xml:lang="en"><surname>Alexeeva</surname><given-names>A. N.</given-names></name></name-alternatives><bio xml:lang="ru"><p>Резниченко Сергей Анатольевич, кандидат технических наук, доцент, кафедра информационной безопасности</p><p>125167, г. Москва, Ленинградский пр-т, 49</p></bio><bio xml:lang="en"><p>Sergey A. Reznichenko, Cand.Sci. (Eng.), Assoc. Prof., Department of Information Security</p><p>49, Leningradsky Ave., Moscow 125167</p></bio><email xlink:type="simple">rsa_5@bk.ru</email><xref ref-type="aff" rid="aff-1"/></contrib></contrib-group><aff-alternatives id="aff-1"><aff xml:lang="ru"><institution>Финансовый университет при Правительстве Российской Федерации</institution><country>Россия</country></aff><aff xml:lang="en"><institution>Financial University under the Government of the Russian Federation</institution><country>Russian Federation</country></aff></aff-alternatives><pub-date pub-type="collection"><year>2026</year></pub-date><pub-date pub-type="epub"><day>10</day><month>08</month><year>2026</year></pub-date><volume>53</volume><issue>2</issue><fpage>110</fpage><lpage>123</lpage><permissions><copyright-statement>Copyright &amp;#x00A9; Резниченко С.А., Алексеева А.Н., 2026</copyright-statement><copyright-year>2026</copyright-year><copyright-holder xml:lang="ru">Резниченко С.А., Алексеева А.Н.</copyright-holder><copyright-holder xml:lang="en">Reznichenko S.A., Alexeeva A.N.</copyright-holder><license xml:lang="ru" license-type="creative-commons-attribution" xlink:href="https://creativecommons.org/licenses/by/4.0/" xlink:type="simple"><license-p>Данная работа распространяется под лицензией Creative Commons Attribution 4.0.</license-p></license><license xml:lang="en" license-type="creative-commons-attribution" xlink:href="https://creativecommons.org/licenses/by/4.0/" xlink:type="simple"><license-p>This work is licensed under a Creative Commons Attribution 4.0 License.</license-p></license></permissions><self-uri xlink:href="https://vestnik.dgtu.ru/jour/article/view/2098">https://vestnik.dgtu.ru/jour/article/view/2098</self-uri><abstract><p>Цель. В статье представлен всесторонний сравнительный обзор ведущих инструментов, используемых для обработки больших данных в экосистеме Apache Hadoop, с целью обеспечения организаций критериями выбора оптимального решения для различных типов рабочих нагрузок. Актуальность исследования обусловлена тем, что современный бизнес требует анализа данных всех форм и размеров, включая структурированные и неструктурированные, чтобы лучше понимать свою продукцию, клиентов и рынки. Рост объемов, скорости и разнообразия данных (Big Data) привел к необходимости разработки специализированных платформ для их обработки. Проблема нестабильности Apache Hive является ключевым архитектурным вызовом, поскольку Hive, является наиболее ресурсоемким в выполнении идентичных задач со Spark, так как начинает обработку входных данных без их предварительного анализа.Метод. Проведен обзор источников, охватывающих широкий спектр инструментов и архитектурных решений для обработки больших данных в экосистеме Apache Hadoop и за ее пределами. Предложенная методология сочетает сравнительный анализ существующих подходов и комплексную методику выбора оптимальных инструментов и архитектурных решений для обработки больших данных.Результат. Проанализированные характеристики Cloudera Impala и Apache Hive позволяют сделать вывод, что данные SQL-инструменты для аналитической обработки данных в экосистеме Hadoop дополняют друг друга.Вывод. Полностью заменять Apache Spark на Flink преждевременно из-за потенциальной потребности в дополнительной инфраструктуре, но Flink является жизнеспособным решением для задач, требующих минимального времени отклика.</p></abstract><trans-abstract xml:lang="en"><p>Objective. This article provides a comprehensive comparative review of the leading tools used for processing big data in the Apache Hadoop ecosystem, with the aim of providing organizations with criteria for selecting the optimal solution for different types of workloads. The relevance of this research is driven by the fact that modern businesses require the analysis of data of all shapes and sizes, including structured and unstructured data, in order to gain a better understanding of their products, customers, and markets. The increasing volume, velocity, and variety of data (Big Data) has led to the need for specialized platforms to handle it. The Apache Hive instability issue is a key architectural challenge, as Hive is the most resource-intensive when performing identical tasks with Spark, as it starts processing input data without pre-analyzing it.Method. A review of sources covering a wide range of tools and architectural solutions for processing big data in the Apache Hadoop ecosystem and beyond. The review included specialized scientific articles, technical guides, experimental research results, and industry analysis reports. The proposed methodology combines a comparative analysis of existing approaches and a comprehensive methodology for choosing optimal tools and architectural solutions for processing big data.Result. The analyzed characteristics of Cloudera Impala and Apache Hive allow us to conclude that these SQL tools for analytical data processing, in the Hadoop ecosystem, complement each other.Conclusion. It is premature to completely replace Apache Spark with Flink due to the potential need for additional infrastructure, but Flink is a viable solution for tasks that require minimal response time.</p></trans-abstract><kwd-group xml:lang="ru"><kwd>информационная безопасность</kwd><kwd>большие данные</kwd><kwd>Apache Hadoop</kwd><kwd>Apache Hive (Hive)</kwd><kwd>Cloudera Impala (Impala)</kwd><kwd>Apache Flink (Flink)</kwd><kwd>Spark Structured Streaming</kwd><kwd>Kafka Streams</kwd><kwd>OLAP</kwd><kwd>ETL</kwd><kwd>OLTP</kwd><kwd>MPP</kwd></kwd-group><kwd-group xml:lang="en"><kwd>information security</kwd><kwd>big data</kwd><kwd>Apache Hadoop</kwd><kwd>Apache Hive (Hive)</kwd><kwd>Cloudera Impala (Impala)</kwd><kwd>Apache Flink (Flink)</kwd><kwd>Spark Structured Streaming</kwd><kwd>Kafka Streams</kwd><kwd>OLAP</kwd><kwd>ETL</kwd><kwd>OLTP</kwd><kwd>MPP</kwd></kwd-group></article-meta></front><back><ref-list><title>References</title><ref id="cit1"><label>1</label><citation-alternatives><mixed-citation xml:lang="ru">Шейк А.С. Достижения В Обработке Потоков В Реальном Времени: Сравнительное Исследование Apache Flink, Spark Streaming И Kafka Streams //Международный Журнал Компьютерной Инженерии И Технологий (IJCET). – 2024. – Т. 15. – №. 6. – Дата обращения: 10.11.2025.</mixed-citation><mixed-citation xml:lang="en">Shaik A.S. Advancements In Real-Time Stream Processing: A Comparative Study Of Apache Flink, Spark Streaming, And Kafka Streams. International Journal Of Computer Engineering And Technology (IJCET). 2024;15(6). Accessed: 10.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit2"><label>2</label><citation-alternatives><mixed-citation xml:lang="ru">Лакшмипати С. Apache Flink vs Apache Kafka Streams vs Apache Spark Structured Streaming — Сравнение движков обработки потоков [Электронный ресурс] // Onehouse Blog. – Рекомендации по кибербезопасности AA23-059A. – 2025. – Режим доступа: https://www.onehouse.ai/blog/apache-spark-structured-streaming-vs-apache-flink-vs-apache-kafka-streams-comparing-stream-processing-engines?, свободный. – Дата обращения: 10.11.2025.</mixed-citation><mixed-citation xml:lang="en">Lakshmipathy S. Apache Flink vs Apache Kafka Streams vs Apache Spark Structured Streaming — Comparing Stream Processing Engines [Электронный ресурс]. Onehouse Blog. – Cybersecurity Advisory AA23-059A. – 2025. – Режим доступа: https://www.onehouse.ai/blog/apache-spark-structured-streamingvs-apache-flink-vs-apache-kafka-streams-comparing-stream-processing-engines?, Accessed: 10.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit3"><label>3</label><citation-alternatives><mixed-citation xml:lang="ru">Кевалрамани С. Impala против Hive против Spark SQL: Выбор SQL-движка для совместной работы в хранилище данных Cloudera [Электронный ресурс] / Пер. с англ. английский. mongohtotech // 29 января 2020. Режим доступа: https://habr.com/ru/articles/486124/. – Дата обращения: 10.11.2025.</mixed-citation><mixed-citation xml:lang="en">Kewalramani S. Impala vs Hive vs Spark SQL: Выбор правильного SQL движка для правильной работы в Cloudera Data Warehouse [Электронный ресурс] / Пер. с англ. mongohtotech // Хабр. 29 янв. 2020. Режим доступа: https://habr.com/ru/articles/486124/ Accessed: 10.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit4"><label>4</label><citation-alternatives><mixed-citation xml:lang="ru">ProjectPro. Impala vs Hive: разница между Sql и компонентами Hadoop [Электронный ресурс] // Блог ProjectPro. Обновлено 28 октября 2024 г. Режим доступа: https://www.projectpro.io/article/impala-vshive-difference-between-sql-on-hadoop-components/180. – Дата обращения: 11.11.2025.</mixed-citation><mixed-citation xml:lang="en">ProjectPro. Impala vs Hive: Difference between Sql on Hadoop components [Электронный ресурс] // ProjectPro Blog. Обновлено 28 окт. 2024. Режим доступа: https://www.projectpro.io/article/impala-vs-hivedifference-between-sql-on-hadoop-components/180. Accessed: 11.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit5"><label>5</label><citation-alternatives><mixed-citation xml:lang="ru">Мааян Г. Д. Spark vs. Flink: ключевые отличия и как выбрать [Электронный ресурс] // Dataversity. 8 мая 2023 г. Режим доступа: https://www.dataversity.net/articles/spark-vs-flink-key-differences-and-howto-choose/?. – Дата обращения: 11.11.2025.</mixed-citation><mixed-citation xml:lang="en">Maayan G.D. Spark vs. Flink: Key Differences and How to Choose [Электронный ресурс] // Dataversity. 8 мая 2023. Режим доступа: https://www.dataversity.net/articles/spark-vs-flink-key-differences-and-howto-choose/?. Accessed: 11.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit6"><label>6</label><citation-alternatives><mixed-citation xml:lang="ru">Потоковая обработка с помощью Apache Flink: Руководство для начинающих 2025 [Электронный ресурс] // Ververica. [Электронный ресурс]. Режим доступа: https://www.ververica.com/streamprocessing-with-apache-flink-beginners-guide. – Дата обращения: 11.11.2025.</mixed-citation><mixed-citation xml:lang="en">Stream Processing with Apache Flink: Beginner's Guide 2025 [Электронный ресурс] // Ververica. [Б.г.]. Режим доступа: https://www.ververica.com/stream-processing-with-apache-flink-beginners-guide. Accessed: 11.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit7"><label>7</label><citation-alternatives><mixed-citation xml:lang="ru">Венер К. Основные тенденции в области потоковой передачи данных с помощью Apache Kafka и Flink в 2025 году [Электронный ресурс] // Блог Кая Венера. 2 декабря 2024 г. Режим доступа: https://www.kai-waehner.de/blog/2024/12/02/top-trends-for-data-streaming-with-apache-kafka-and-flinkin-2025/?. – Дата обращения: 11.11.2025.</mixed-citation><mixed-citation xml:lang="en">Waehner K. Top Trends for Data Streaming with Apache Kafka and Flink in 2025 [Электронный ресурс] // Kai Waehner Blog. 2 дек. 2024. Режим доступа: https://www.kai-waehner.de/blog/2024/12/02/toptrends-for-data-streaming-with-apache-kafka-and-flink-in-2025/?. Accessed: 11.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit8"><label>8</label><citation-alternatives><mixed-citation xml:lang="ru">Ашырова Ю. Управление данными и их анализ в BIG DATA // Символ науки. 2025. № 1-1-2. URL: https://cyberleninka.ru/article/n/data-management-and-analysis-in-big-data. - Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Ashyrova Y. Data management and analysis in BIG DATA. Symbol of Science. 2025. №1-1-2. URL: https://cyberleninka.ru/article/n/data-management-and-analysis-in-big-data. Accessed: 12.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit9"><label>9</label><citation-alternatives><mixed-citation xml:lang="ru">Белов В.А., Никульчев Е.В. Экспериментальная оценка временной эффективности обработки больших данных в заданных форматах хранения // International Journal of Open Information Technologies. 2021. № 9. URL: https://cyberleninka.ru/article/n/eksperimentalnaya-otsenka-vremennoy-effektivnostiobrabotki-bolshih-dannyh-v-zadannyh-formatah-hraneniya. – Дата обращения: 10.11.2025.</mixed-citation><mixed-citation xml:lang="en">Belov V.A., Nikulchev E.V. Experimental Evaluation of the Time Efficiency of Processing Large Data in Specified Storage Formats. International Journal of Open Information Technologies. 2021; 9. URL: https://cyberleninka.ru/article/n/eksperimentalnaya-otsenka-vremennoy-effektivnosti-obrabotki-bolshihdannyh-v-zadannyh-formatah-hraneniya. – Accessed: 10.11.2025. (In Russ)</mixed-citation></citation-alternatives></ref><ref id="cit10"><label>10</label><citation-alternatives><mixed-citation xml:lang="ru">Алтыев Аганазар, Бекдурдыев Гурбанназар, Атаев Аллаберди, Тачев Юсуп Компьютерные технологии для обработки больших данных // Наука и мировоззрение. 2025. № 41. URL: https://cyberleninka.ru/article/n/kompyuternye-tehnologii-dlya-obrabotki-bolshih-dannyh. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Altiev Aganazar, Bekdurdyev Gurbannazar, Ataev Allaberdi, Tachev Yusup Computer Technologies for Processing Big Data. Science and Worldview. 2025; 41. URL: https://cyberleninka.ru/article/n/kompyuternye-tehnologii-dlya-obrabotki-bolshih-dannyh. – Accessed: 12.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit11"><label>11</label><citation-alternatives><mixed-citation xml:lang="ru">Смайлов Н.К. Методы и технологии оценки и управления качеством данных // Экономика и социум. 2025. № 8 (135). URL: https://cyberleninka.ru/article/n/metody-i-tehnologii-otsenki-i-upravleniyakachestvom-dannyh. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Smilov N.K. Methods and Technologies of Data Quality Assessment and Management. Economics and Sociology. 2025;8(135). https://cyberleninka.ru/article/n/metody-i-tehnologii-otsenki-i-upravleniyakachestvom-dannyh. – Accessed: 12.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit12"><label>12</label><citation-alternatives><mixed-citation xml:lang="ru">Упаева П.В. Оптимизация ETL-процессов: обзор отечественного рынка // Вестник науки. 2024. № 6 (75). URL: https://cyberleninka.ru/article/n/optimizatsiya-etl-protsessov-obzor-otechestvennogo-rynka. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Upaeva P.V. Optimization of ETL Processes: A Review of the Domestic Market. Bulletin of Science. 2024; 6 (75). URL: https://cyberleninka.ru/article/n/optimizatsiya-etl-protsessov-obzor-otechestvennogo-rynka. – Accessed: 11/12/2025.</mixed-citation></citation-alternatives></ref><ref id="cit13"><label>13</label><citation-alternatives><mixed-citation xml:lang="ru">С.Г. Ермаков, М.М. Халил, А.Д. Хомоненко, В.А. Гончаренко, В.А. Ходаковский, Р. Абу Хасан Переход от хранилища данных университета к озеру: модели и методы обработки больших данных // ИВД. 2024. № 12 (120). URL: https://cyberleninka.ru/article/n/perehod-ot-hranilischa-dannyh-universitetak-ozeru-modeli-i-metody-obrabotki-bolshih-dannyh. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">S.G. Ermakov, M.M. Khalil, A.D. Khomonenko, V.A. Goncharenko, V.A. Khodakovsky, R. Abu Hassan The transition from the university data warehouse to the lake: models and methods of big data processing. IVD. 2024; 2(120). URL: https://cyberleninka.ru/article/n/perehod-ot-hranilischa-dannyh-universiteta-kozeru-modeli-i-metody-obrabotki-bolshih-dannyh. – Date of appeal: 12.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit14"><label>14</label><citation-alternatives><mixed-citation xml:lang="ru">Almeida, A., Brás, S., Sargento, S. et al. Time series big data: a survey on data stream frameworks, analysis and algorithms. J Big Data 10, 83. URL:https://doi.org/10.1186/s40537-023-00760-1. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Almeida, A., Brás, S., Sargento, S. et al. Time series big data: a survey on data stream frameworks, analysis and algorithms. J Big Data 10, 83. URL:https://doi.org/10.1186/s40537-023-00760-1. – Date of access: 12.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit15"><label>15</label><citation-alternatives><mixed-citation xml:lang="ru">Овездурдыева Ирина Курбангельдыевна, Мырадов Максат Тачмухаммедович. Технологии работы с большими данными “big data”: сбор, хранение и обработка больших данных // Наука и мировоззрение. 2024. № 29. URL: https://cyberleninka.ru/article/n/tehnologii-raboty-s-bolshimi-dannymi-big-datasbor-hranenie-i-obrabotka-bolshih-dannyh. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Ovezdurdyeva Irina Kurbangeldievna, Myradov Maksat Tachmukhammedovich Technologies of working with big data “big data”: collection, storage and processing of big data // Science and worldview. 2024. No. 29. https://cyberleninka.ru/article/n/tehnologii-raboty-s-bolshimi-dannymi-big-data-sbor-hranenie-iobrabotka-bolshih-dannyh. – Accessed: 12.11.2025.</mixed-citation></citation-alternatives></ref><ref id="cit16"><label>16</label><citation-alternatives><mixed-citation xml:lang="ru">Кузина Е. Обзор архитектуры Impala ADH Arenadata Docs [Электронный ресурс]. – Режим доступа: https://docs.arenadata.io/ru/ADH/current/concept/impala/impala.html. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Kuzina E. Overview of Impala Architecture ADH Arenadata Docs [Electronic resource]. – Access mode: https://docs.arenadata.io/ru/ADH/current/concept/impala/impala.html. – Date of access: 12.11.2025. (In Russ)</mixed-citation></citation-alternatives></ref><ref id="cit17"><label>17</label><citation-alternatives><mixed-citation xml:lang="ru">Егорцев В. Работа с большими данными: введение в Apache Hadoop и Spark [Электронный ресурс] // Tproger. [Б.г.]. Режим доступа: https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apachehadoop-i-spark. – Дата обращения: 12.11.2025.</mixed-citation><mixed-citation xml:lang="en">Egorzev V. Working with Big Data: Introduction to Apache Hadoop and Spark [Electronic resource] // Tproger. [B.g.]. Access mode: https://tproger.ru/articles/rabota-s-bolwimi-dannymi--vvedenie-v-apache-hadoop-i-spark. – Accessed: 12.11.2025. (In Russ)</mixed-citation></citation-alternatives></ref></ref-list><fn-group><fn fn-type="conflict"><p>The authors declare that there are no conflicts of interest present.</p></fn></fn-group></back></article>
