салютдевайсы

Middle/Senior Data Engineer (Python)

Определять и развивать целевую архитектуру платформы данных и ключевых доменных моделей

салютдевайсы На сервисе с: 06.10.26 19:06

Зарплата не указанаРоссияМоскваГибрид

Что предстоит делать?

  • Определять и развивать целевую архитектуру платформы данных и ключевых доменных моделей
  • Проектировать и реализовывать критичные пайплайны и хранилища, обеспечивая надёжность, производительность и масштабируемость
  • Вводить и поддерживать стандарты качества данных, схем, версионирования, мониторинга и алёртинга
  • Проводить архитектурные ревью, дизайн-сессии, помогать команде в декомпозиции и решении сложных задач
  • Оптимизировать существующие решения: хранение, запросы, пайплайны, снижать стоимость и повышать SLA
  • Проводить capacity planning и нагрузочное тестирование платформы, определять узкие места и планировать масштабирование вычислительных, сетевых и storage-ресурсов
  • Проектировать отказоустойчивость и disaster recovery платформы: репликацию, резервное копирование, восстановление, RPO/RTO и сценарии отказа отдельных компонентов и кластеров.

Мы ожидаем, что вы:

  • Имеете высокий уровень владения Python, SQL, Airflow, dbt.
  • Имеете опыт построения систем с HA/DR: отказоустойчивость, disaster recovery, backup/restore, RPO/RTO, multi-AZ/кластерные конфигурации
  • Имеете глубокое знание ClickHouse и его архитектуры, а так же методов оптимизации хранения/скорости доступа к данным: шардирование, репликация, Distributed-таблицы, ClickHouse Keeper, MergeTree-семейство, партиционирование, TTL, materialized views, projections, работа с S3, tiered storage, ORDER BY/primary key, индексы, JOIN, агрегации и т.п.
  • Имеете глубокое понимание архитектуры распределённых систем: CAP, репликация, консистентность, отказоустойчивость, идемпотентность
  • Имеете опыт построения высоконагруженных ingestion-пайплайнов, включая SLA на каждом этапе: ingestion → storage → transformation → serving → BI/ML. Kafka/очереди сообщений, batch и streaming ingestion, consumer groups, backpressure, retries, deduplication, ordering, schema evolution
  • Имеете опыт построения data platform / lakehouse / DWH: raw/bronze → silver → gold, медальонная модель, витрины, семантический слой, object storage
  • Обладаете навыками оптимизации стоимости хранения и обработки: hot/warm/cold storage, TTL, S3, compression, retention policies, pre-aggregation
  • Знаете Metabase (будет дополнительным плюсом)

Почему вам понравится работать у нас?

  • Сильная команда, амбициозные задачи и продукты, которыми пользуются миллионы
  • Новый офис SberDevices в центре Москвы
  • Удобный формат работы с возможностью гибкого начала рабочего дня
  • Надёжная программа ДМС и НС с первого месяца работы
  • Обучение и развитие: курсы и тренинги от корпоративного университета, внешнее обучение за счёт компании и участие в конференциях
  • Льготная ипотека и корпоративная пенсионная программа
  • СберКлуб: cкидки от партнёров, повышенные бонусы, акции экосистемы, подписка СберПрайм+.

Похожие вакансии Data Engineer

Сайты компаний
СБЕР

Tech Lead Data engineer

СБЕРНа сервисе с: 06.10.26 19:17
до 500k ₽РоссияМоскваОфис

Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.

  • разработка и оптимизация витрин данных: Проектирование и реализация эффективных ETL и ELT процессов для витрин данных с использованием Apache Spark и Greenplum. Обеспечение высокой производительности и отказоустойчивости пайплайнов.
  • потоковая обработка данных (RT и NRT): Разработка и поддержка стриминговых пайплайнов. Построение NRT пайплайнов обработки данных из Kafka в Apache Iceberg (Kafka2Iceberg) и RT пайплайнов между Kafka (Kafka2Kafka) с использованием Apache Flink и Spark Structured Streaming.

Архитектура данных:

  • активное участие в разработке архитектуры решения потоковой обработки данных Data Streamhouse данных для обеспечения
  • разработка предложений по развитию Data Lakehouse, внедрение best practices работы с Apache Iceberg (оптимизация партиционирования, compaction, time travel).

Инженерные практики:

  • реализация механизмов инкрементальной загрузки данных для минимизации времени обработки и нагрузки на источники
  • разработка и документирование API (на Java или Scala) для доступа к данным витрин и сервисам семантического слоя

Производительность и качество:

  • глубокая оптимизация Spark-приложений, включая использование векторного движка Gluten/Velox для ускорения рабочих нагрузок
  • разработка решений для сверки и контроля качества данных (Data Quality) с использованием Spark и Python.

DevOps и CI/CD: Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie или современных оркестраторах.

Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса.

·      Уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ).

·      Глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене.

·      Опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle.

·      Опыт работы с потоковыми данными: Apache Kafka (как источник/приемник) и хотя бы одним фреймворком стриминговой обработки (Apache Flink или Spark Streaming).

·      Понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg).

·      Опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).

Будет большим плюсом:

·      Опыт внедрения промышленных пайплайнов пакетной передачи данных.

·      Опыт внедрения промышленных пайплайнов потоковой передачи данных.

·      Опыт внедрения Gluten/Velox или аналогичных векторизованных движков.

·      Навыки сборки и развертывания Doker-образов приложений.

  • офисный формат работы (м Кутузовская ул. Поклонная 3)
  • годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • регулярные митапы и развитое DS-community
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • вознаграждение за рекомендацию друзей в команду Сбер.
Эта вакансия также есть на:hh.ru
hh.ru
ozon

Старший DWH-разработчик

ozonНа сервисе с: 06.10.26 19:10
Зарплата не указанаРоссияМоскваУдалёнка

Привет! Это команда DWH. Мы ищем разработчика аналитического хранилища Ozon, который умеет работать с большими объёмами данных, оптимизировать SQL-запросы, строить ETL-процессы, разбирать ошибки и взаимодействовать с бизнес-пользователями и аналитиками.

Наш стек

  • Trino, Vertica, Hadoop, Spark, Jupyter Notebook, Python, Airflow, Docker.

Вы будете

  • Разрабатывать и развивать ETL-системы, которые обеспечивают данными различные предметные области: продажи, учёт, логистику.
  • Анализировать данные и проектировать структуры данных под аналитические потребности различных бизнес-подразделений.
  • Оптимизировать и мониторить пайплайны обработки данных, повышая их производительность и стабильность.
  • Проектировать и реализовывать масштабируемые хранилища данных на базе HP Vertica, Trino, ClickHouse, PostgreSQL и Hadoop.

Нам важно

  • Самостоятельность в решении задач и опыт в роли ключевого разработчика на крупном проекте.
  • Опыт проектирования архитектуры хранения данных и связанных ETL-процессов.
  • Умение работать с техническими требованиями: аргументированно предлагать изменения и находить оптимальные решения.
  • Хорошие навыки проектирования и реализации ETL-процессов, обязательное знание Airflow.
  • Отличное знание SQL и системное мышление.
  • Опыт разработки хранилищ данных с использованием одной из колоночных СУБД: Vertica, Greenplum, Exadata, Teradata.
  • Опыт программирования на Python, в том числе для разработки решений по автогенерации ETL-задач и реализации логических алгоритмов.
  • Навыки работы с Bash и Docker.

Будет плюсом

  • Опыт работы со Spark.
  • Опыт работы с несколькими ETL-инструментами и их использованием в горизонтально масштабируемых системах обработки данных.
  • Знания в одной из областей: CI/CD, frontend- или backend-разработка, разработка интеграционных потоков.
  • Желание участвовать в управлении проектами и доводить фичи до production.
  • Желание развиваться в наставничестве и помогать другим участникам команды.
hh.ru
Зарплата не указанаРоссияМоскваУдалёнка

Обязанности:

  • Развивать DWH HR-отчетности: участвовать в проектировании и масштабировании корпоративного хранилища данных
  • Интегрировать источники: собирать, очищать и консолидировать данные из учетных систем (в том числе SAP HCM/SAP BW)
  • Проектировать витрины данных: переводить требование бизнеса и топ-менеджмента в понятные технические алгоритмы и данные
  • Обеспечивать качество данных: внедрить процессы Data Quality и Data Governancе

Требования:
  • Опыт работы в области DWH, ETL или Data Engineering – от 3 лет
  • Практический опыт проектирования и развития хранилищ данных
  • Уверенное владение Postgresql, MS Sql, Python (обработка данных, интеграции и автоматизации), Apache Airflow, Kafka, Git
  • Приверженность к Data Governance подход
  • Умение самостоятельно принимать решения, документировать их и доводить до промышленной эксплуатации
  • Понимание основных принципов хранения данных в SAP HCM / SAP BW будет преимуществом
  • Понимание требований BI систем к структуре и качеству данных будет преимуществом
  • Понимание основных метрик HR отчетности будет преимуществом

Условия:
  • Стабильный и прозрачный доход: размер заработной платы обсуждается по итогам собеседования + квартальная премия по результатам KPI
  • Гибкий график работы: вы сможете планировать время так, как удобно вам и вашей команде
  • Полную удалёнку или гибрид на выбор, а также уютный ИТ-хаб в Москве, Санкт-Петербурге, Екатеринбурге и сезонный коворкинг в Сочи
  • Сложные и интересные задачи, современный стек технологий
  • Заботу о вашем здоровье: программа ДМС с первых дней работы, куда входит стоматология, обслуживание в лучших клиниках города, страхование и компенсация 10-ти дней больничного
  • Возможность вертикального и горизонтального карьерного роста: регулярно проходят тренинги, вебинары, митапы и демо-дни
  • Оплату посещения профильных конференций и курсов, помогаем с подготовкой к публичным выступлениям и написанием статей на Хабр

  • Доступ к бесплатным корпоративным библиотекам Alpina Digital, МИФ и бизнес-изданий

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.