Логотип
Знания для вашего роста
Бесплатный вводный курс магистратуры
Узнать о профессии инженера по данным
4 сентября 2026

Что такое ETL-процессы и как инженеры данных строят конвейеры для big data

По прогнозу аналитической компании IDC, объём данных в мире утроится к 2029 году. Но сами по себе они бесполезны, пока их не собрали и не очистили: в сыром виде данные разрозненны и лежат в несовместимых форматах. За то, чтобы из этого хаоса получилась аналитика, отвечают ETL-процессы. Разбираемся, что это такое, как из них строят конвейеры для big data и чем занят дата-инженер.

Редакция Медиа Нетологии

По прогнозу аналитической компании IDC, объём данных в мире утроится к 2029 году. Но сами по себе они бесполезны, пока их не собрали и не очистили: в сыром виде данные разрозненны и лежат в несовместимых форматах. За то, чтобы из этого хаоса получилась аналитика, отвечают ETL-процессы. Разбираемся, что это такое, как из них строят конвейеры для big data и чем занят дата-инженер.

  • ETL — подготовка данных в три шага: извлечь из источников (Extract), преобразовать (Transform), загрузить в хранилище (Load). На нём держится вся работа с большими данными.

  • Конвейер данных, или пайплайн, — связанная цепочка таких шагов, которая работает по расписанию и без ручного вмешательства.

  • Дата-инженер строит и поддерживает эти конвейеры, а аналитик и дата-сайентист берут уже готовое.

  • Базовые инструменты: Apache Airflow оркестрирует пайплайн, Apache Spark обрабатывает большие объёмы, dbt отвечает за трансформацию, SQL нужен на всех этапах.

  • ELT — вариант ETL, где данные сначала грузят сырыми, а преобразуют внутри хранилища.

  • Медиана дохода дата-инженера в России — около 247 тыс. рублей во втором полугодии 2026 года, спрос на профессию высокий.
В материале

Что такое ETL и почему без него не собрать данные для big data

ETL — сокращение от трёх английских слов: extract, transform, load, то есть «извлечь, преобразовать, загрузить». Это способ собрать данные из разных мест, привести их к единому виду и сложить туда, где с ними удобно работать.

Проще всего представить ETL как конвейер. С одного конца заезжает сырьё — разрозненные данные из десятков систем, с другого выходит готовый продукт: чистая таблица, по которой можно строить отчёты и обучать модели. Такую цепочку шагов и называют конвейером данных, или пайплайном.
Стандартный ETL-конвейер: данные проходят путь от разрозненных источников до хранилища, откуда их берут аналитика и модели
Отдельные цифры и записи есть у любой компании и без всякого ETL. Проблема — в масштабе. Данные о пользователях лежат в CRM — системе управления клиентами, покупки — в биллинге, поведение в приложении — в логах, платежи — в банковских системах.

Таких данных много, они постоянно меняются и хранятся в несовместимых форматах — эти три свойства и делают данные «большими». Свести их вручную в один отчёт невозможно: пока соберёшь, они устареют. ETL-процесс делает это автоматически и регулярно — в этом и смысл: без него большие данные так и остаются набором несвязанных кусков.

Чем дата-инженер отличается от аналитика и дата-сайентиста

Данные проходят через руки нескольких специалистов, и роли легко перепутать — тем более что называются они похоже. Различие простое: дата-инженер отвечает за то, чтобы информация вообще появилась в пригодном виде, а аналитик и дата-сайентист уже пользуются готовым. Он строит и чинит трубу, по которой всё доезжает до хранилища, — остальные берут воду из крана.
Дальше разберём три шага, из которых состоит работа дата-инженера, — те самые Extract, Transform и Load.
Понять, ваша ли это профессия — на бесплатной встрече с дата-инженером ↓

Разберётесь, чем занят инженер данных и из каких сфер проще перейти

Узнаете, какие навыки нужны для старта и как выстроить обучение

Спикер — практикующий дата-инженер из Ozon

Посмотреть

Разберётесь, чем занят инженер данных и из каких сфер проще перейти

Узнаете, какие навыки нужны для старта и как выстроить обучение

Спикер — практикующий дата-инженер из Ozon

Посмотреть

Шаг 1: Извлечение данных (Extract) из разрозненных источников

Первый шаг — вытащить данные оттуда, где они лежат. Источников обычно много: реляционные базы данных (те самые таблицы со строками и столбцами, как в Excel, только больше и строже), интерфейсы, через которые отдают данные внешние сервисы (их называют API), логи серверов (автоматические записи о том, что происходило в системе), файлы в форматах CSV и Excel, CRM, потоки событий от приложения вроде кликов и просмотров. У каждого свой формат и свой способ их отдавать.

На этом шаге данные называют сырыми: они как есть, без обработки, часто с ошибками и пропусками. Задача инженера — настроить подключения к источникам и выгрузку так, чтобы ничего не потерялось и не задвоилось. Обычно тянут не всё подряд каждый раз, а только новые записи с прошлой выгрузки — так называемая инкрементальная загрузка, она экономит время и ресурсы.
  • Маркетплейс каждую ночь собирает данные о заказах из биллинга, о клиентах — из CRM, о доставке — из отдельного сервиса и выгрузок партнёров в CSV. Пока это три несогласованных потока, толку от них мало — их ещё предстоит свести воедино.

Шаг 2: Трансформация данных (Transform) и очистка информации

Извлечённые данные почти всегда грязные, поэтому второй шаг — привести их в порядок. Трансформация включает несколько типовых операций: очистку от дублей, пропусков и ошибок, приведение к единому формату, обогащение (когда запись дополняют данными из других источников) и агрегацию — подсчёт сумм, средних и других показателей.

Приведение форматов звучит скучно, но именно на нём чаще всего рассыпается аналитика: пока данные из разных систем не сведены к единым правилам, любой отчёт поверх них будет врать. Инженер описывает правила преобразования — как чистить, что с чем сопоставлять, как считать агрегаты. Это самый трудоёмкий шаг конвейера: на трансформацию и очистку информации обычно уходит больше всего усилий.
  • В ночной выгрузке заказов маркетплейса дата приходит в трёх видах: 02.09.2026, 2026−09−02 и «2 сентября». Город записан как «Москва», «мск» и «г. Москва». Сумма где-то в рублях, где-то в копейках. Трансформация сводит это к единым правилам: одна дата в формате ГГГГ-ММ-ДД, один справочник городов, сумма всегда в рублях. А заодно считает агрегаты — сколько заказов и на какую сумму пришлось на каждый город за день.

Шаг 3: Загрузка (Load) в хранилище данных (DWH)

Последний шаг — сложить готовое туда, откуда его будут брать аналитики и модели. Чаще всего это DWH (от английского data warehouse — хранилище данных): база, устроенная так, чтобы быстро отвечать на аналитические вопросы по огромным объёмам. Всё в ней структурировано и разложено по полкам — как товары на складе.

Альтернатива складу — озеро данных (data lake). В него сырьё сливают в исходном виде и разбирают уже потом, по мере надобности. Хранилище отвечает на вопрос «дай посчитанное быстро», озеро — «сохрани всё, вдруг пригодится».

В России их всё чаще строят на отечественных платформах. По оценке консалтинговой компании Strategy Partners, в 2025 году рынок российских СУБД и хранилищ данных вырос на 18%, до 53 млрд рублей. Место ушедших зарубежных вендоров занимают российские решения — например, Arenadata на базе открытой технологии для аналитических хранилищ Greenplum.

С озёрами и облачными хранилищами связан второй подход — ELT (extract, load, transform). Здесь данные сначала грузят сырыми, а преобразуют внутри самого хранилища. Так делают, когда объёмы огромные, а мощности хватает, чтобы взять трансформацию на себя.

По сути это тот же ETL с переставленными буквами: меняется момент, когда информацию приводят в порядок.
  • В ночной выгрузке заказов маркетплейса дата приходит в трёх видах: 02.09.2026, 2026−09−02 и «2 сентября». Город записан как «Москва», «мск» и «г. Москва». Сумма где-то в рублях, где-то в копейках. Трансформация сводит это к единым правилам: одна дата в формате ГГГГ-ММ-ДД, один справочник городов, сумма всегда в рублях. А заодно считает агрегаты — сколько заказов и на какую сумму пришлось на каждый город за день.

Инструменты дата-инженера: Airflow, Spark, dbt и SQL

За каждым шагом конвейера стоят свои инструменты. Их много, но есть набор, который встречается почти в любой вакансии дата-инженера.
  • SQL — язык запросов к базам данных
    На нём просят базу «дай все заказы за вчера» или «посчитай сумму по каждому городу». Базовый навык, который нужен на всех этапах: и чтобы забрать данные из источника, и чтобы описать преобразования, и чтобы проверить результат.
  • Apache Airflow — программа, которая управляет запуском конвейера
    Она описывает его как цепочку шагов, где один зависит от другого, запускает их по расписанию и следит, чтобы при сбое одного шага не посыпались остальные. По сути, дирижёр всего процесса.
  • Apache Spark — движок для тяжёлых вычислений над данными
    Когда объёмы не помещаются на один компьютер, Spark делит работу между множеством машин сразу и держит данные в оперативной памяти, поэтому быстро считает даже терабайты. Такой подход называют распределённой обработкой.
  • dbt — инструмент для трансформации данных прямо внутри хранилища
    Описывает преобразования на SQL, хранит историю их изменений и автоматически проверяет, что ничего не сломалось. Часто берёт на себя шаг T в подходе ELT.
Связка Airflow, Spark, dbt и SQL закрывает костяк задач по сбору и подготовке, а остальное — базы данных, облачные сервисы, Python — добавляется под конкретный проект.

Сколько зарабатывает дата-инженер и почему профессия востребована

Шаги конвейера и инструменты, которые мы разобрали, — это и есть повседневная работа дата-инженера. За такой труд неплохо платят, и людей, которые умеют его выполнять, не хватает.

По данным Хабр Карьеры, медиана дохода инженера данных в России во втором полугодии 2026 года — около 247 тыс. рублей: у джуна — примерно 134 тыс., у мидла — 237 тыс., у сеньора — 365 тыс.

По оценке рекрутингового агентства Brightis (исследование «Рынок IT-зарплат в России», июнь 2026), окладная вилка дата-инженера идёт от 200 тыс. у джуна до 420 тыс. у лида, а у более узкой роли ETL-разработчика начинается от 240 тыс.

Спрос держится на импортозамещении: компании переводят данные на российскую инфраструктуру и строят собственные хранилища, а каждое из них кто-то должен наполнять и поддерживать — этим и занимаются инженеры.

Автоматизация меняет профессию, но не отменяет её: рутинную часть ETL всё больше берут на себя инструменты вроде dbt (он автоматизирует преобразование данных) и облачные сервисы, поэтому от инженера ждут не столько ручного кода, сколько умения спроектировать надёжный конвейер.

Обучение Data Engineering в Нетологии

У дата-инженерии есть особенность: порог входа выше, чем у многих ИТ-профессий. Собрать её из коротких курсов трудно — нужна широкая база: программирование, базы данных, архитектура хранилищ и понимание, как всё это работает вместе. Поэтому в неё чаще приходят не с нуля, а из смежных областей: разработчики, аналитики, выпускники технических направлений — те, кто уже работает с кодом.

Перед выбором стоит честно свериться с собой. Дата-инженеру ближе системная работа — сделать так, чтобы данные всегда доезжали и ничего не падало, — чем анализ и наглядные отчёты. Если хочется считать метрики и искать закономерности, это скорее аналитик; если строить модели и прогнозы — дата-сайентист. А тем, кому нравится выстраивать надёжные процессы и доводить их до автоматизма, инженерия данных подойдёт.

Отсюда и выбор формата обучения. Короткие курсы удобны, чтобы точечно подтянуть инструмент, но профессию целиком дают программы с теорией и большой практикой на реальных данных: работодатель смотрит прежде всего на проекты в портфолио.

Самый системный путь — высшее образование по инженерии данных: там дают и широкую базу, и практику на реальных проектах, а диплом и портфолио на выходе помогают с трудоустройством.
Освоить инженерию данных системно ↓

Учиться можно вечером и по субботам — не бросая работу

Практика и стажировки у компаний-партнёров, портфолио уже во время учёбы

Первый семестр оплачивает Нетология, есть льготный кредит и отсрочка от армии

Смотреть программу

Учиться можно вечером и по субботам — не бросая работу

Практика и стажировки у компаний-партнёров, портфолио уже во время учёбы

Первый семестр оплачивает Нетология, есть льготный кредит и отсрочка от армии

Смотреть программу

ETL — костяк профессии дата-инженера

ETL — это путь, на котором сырые данные превращаются в отчёты и модели: их извлекают из источников, приводят в порядок и загружают в хранилище. А прокладывает и обслуживает его дата-инженер.

Вся профессия держится на тех же трёх шагах: собрать данные, привести в порядок, доставить в хранилище — и следить, чтобы ничего не ломалось. Остальное надстраивается поверх.

Если техническая база уже есть — опыт в разработке, аналитике или профильное образование, — войти в инженерию данных проще, чем кажется: навыки те же, просто направлены на новую задачу. А если базы пока нет, это не повод отказываться от цели: начать можно с бесплатного вводного курса — дальше основы, программирование и SQL, а к профессии приходят следующим шагом.
Читать также
Чтобы быть в курсе всех новостей и не пропускать новые статьи, присоединяйтесь к Telegram-каналу Нетологии.
Редакция Медиа Нетологии
Оцените статью