ВАЖНО! ТРЕБУЕТСЯ СООТВЕТСТВИЕ ВСЕМ ТРЕБОВАНИЯМ НИЖЕ:
Неизвестный работодатель · На сервисе с: 18.09.26 12:45
#аутстаф
Ищем 1 Middle Data инженер
(ID ••••••••)
Требования:
ВАЖНО! ТРЕБУЕТСЯ СООТВЕТСТВИЕ ВСЕМ ТРЕБОВАНИЯМ НИЖЕ:
- Опыт работы в роли Data Engineer от 1.5 – 2 года.
- Apache Spark: Опыт разработки распределенных приложений на Scala от 1.5 лет. Понимание архитектуры Spark (driver, executor, стадии, задачи, shuffling, data locality). Уверенное владение DataFrames/Datasets API, Spark SQL. Опыт работы с форматами данных (Parquet, ORC, Avro, JSON, CSV), чтение/запись данных в HDFS, Hive и реляционные базы данных через JDBC. Практический опыт оптимизации: partitioning, repartition/coalesce, broadcast variables, accumulators, cache/persist. Умение анализировать и профилировать задачи через Spark UI и логи Yarn.
Кандидат на словах подтверждает практический опыт работы со Spark на Scala. Объясняет базовые концепции (driver, executor, стадии, RDD vs DataFrame), принципы shuffling и broadcast join, особенности форматов Parquet/ORC, а также рассказывает, как разбирал ошибки и отслеживал выполнение задач через Spark UI / логи Yarn.
- Язык Scala: Уверенное знание структур данных и коллекций (List, Seq, Map, Set), применение функций высшего порядка (map, flatMap, filter, foldLeft). Владение концепциями ООП и ФП на Scala: traits, case classes, tuples, pattern matching, обработка ошибок в функциональном стиле (Option, Either, Try). Опыт сборки проектов с помощью sbt или maven (включая плагины assembly / fat-jar), управление зависимостями.
- Apache Airflow: Практический опыт разработки и документирования production DAG. Настройка расписания (schedule_interval, cron), атрибутов catchup, depends_on_past. Опыт использования SparkSubmitOperator, PythonOperator, BashOperator. Применение Airflow Variables, Connections, XCom, сенсоров и макросов, использование Trigger Rules.
Кандидат описывает структуру и код production DAG в Airflow для регулярного запуска Spark-задачи, применения сенсоров для ожидания входных данных и корректной обработки сбоев. Объясняет различия в передаче параметров (XCom vs Airflow Variables) и применение Trigger Rules.
- Язык Python: Уверенное владение Python (PEP8, ООП, модули, virtualenv). Опыт написания модульных тестов (pytest, unittest). Практический опыт работы с Web-API (RESTful API, библиотеки requests/aiohttp, сериализация и парсинг JSON, обработка сетевых ошибок, таймаутов и повторных попыток).
Кандидат подтверждает опыт написания скриптов на Python и объясняет последовательность интеграции с Web-API (отправка запросов к REST-эндпоинтам, сериализация/парсинг JSON, обработка сетевых ошибок и таймаутов).
- SQL & Хранилища данных: Продвинутое владение SQL: сложные выборки и JOIN (inner, left, full, semi/anti), агрегатные и оконные функции (ROW_NUMBER, DENSE_RANK, LEAD, LAG), CTE, подзапросы. Опыт проектирования таблиц, понимание партиционирования, индексов и представлений (View / Materialized View). Понимание принципов работы с HDFS и Hive.
Кандидат предлагает логически выверенную структуру витрины данных для векторизации профиля абонента и описывает процесс сбора и доставки событий обратной связи (выбор тарифа клиентом) с точки зрения целостности и идемпотентности данных.
Уверенно объясняет логику работы оконных функций (ROW_NUMBER, LEAD/LAG), различия видов JOIN (inner/left/semi/anti) и приводит примеры из своей практики по оптимизации медленных запросов (партиционирование, индексы).
- Linux & CI/CD: Базовые навыки работы в Linux/Bash (навигация, поиск по файлам, просмотр логов). Опыт работы с Git (ветки, merge requests), базовое понимание Docker.
На интервью кандидат подтверждает базовые навыки работы в Linux (команды навигации, просмотр логов процессов) и опыт работы в команде с использованием Git (коммиты, ветки, MR).
Задачи:
В состав оказываемых услуг входит:
• Разработка, тестирование и оптимизация процессов сбора, предобработки, агрегации и трансформации данных из корпоративных источников и хранилищ данных (HDFS, Hive, GreenPlum, реляционные СУБД) в целевые аналитические витрины.
• Создание, настройка и мониторинг регулярных пайплайнов поставки данных в Apache Airflow для регламентного расчета признаков абонентов (профили фактического потребления интернет- и голосового трафика, начисления, ARPU за 6 месяцев, параметры подключенных услуг, тарифных планов и др.).
• Разработка и оптимизация Spark-приложений на Scala для пакетной обработки массивов данных, векторизации исходных параметров абонентов и подготовки фичей для передачи в ML-модель движка подбора.
• Реализация архитектуры и процессов контура обратной связи (feedback loop) для рекомендательной системы: сбор, валидация и передача в ML-модель информации о фактическом отклике абонентов (какое тарифное предложение было выбрано, отклонено, оформлено) для последующего дообучения и оценки точности рекомендаций.
• Организация и поддержка интеграционного взаимодействия со смежными сервисами, микросервисами платформы и эндпоинтами через API, обеспечение отказоустойчивости, логирования, контроля таймаутов и мониторинга качества доставки данных.
• Оптимизация производительности (проектирование схем партиционирования, профилирование планов выполнения, эффективное управление памятью и ресурсами кластера).
• Покрытие разрабатываемого кода тестами, обеспечение чистоты кодовой базы, документирование структуры витрин (DDL, Data Dictionary) и ETL-процессов в Confluence.
О проекте:
Крупный российский телеком-оператор, аккредитованная ИТ-компания.
Локация: Россия
Время работы: UTC +3
Гражданство: РФ
Формат: Удаленно
Срок привлечения: с •••••••• по ••••••••
📨 Регистрируйтесь, загружайте резюме на •••••••• и оставляйте отклик на запрос
❗️Все актуальные запросы — ••••••••
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.