F

Data Platform Engineer

Flix is a global travel tech leader providing sustainable and affordable travel options.

flix На сервисе с: 06.10.26 20:47

Зарплата не указанаГерманияBerlinГибрид

Data Platform Engineer
Flix is a global travel tech leader providing sustainable and affordable travel options.
Hybrid (Berlin, Germany).
••••••••
More details in Yevheniia Perederii's ••••••••.

Похожие вакансии Data Engineer

Сайты компаний
СБЕР

Tech Lead Data engineer

СБЕРНа сервисе с: 06.10.26 19:17
до 500k ₽РоссияМоскваОфис

Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.

  • разработка и оптимизация витрин данных: Проектирование и реализация эффективных ETL и ELT процессов для витрин данных с использованием Apache Spark и Greenplum. Обеспечение высокой производительности и отказоустойчивости пайплайнов.
  • потоковая обработка данных (RT и NRT): Разработка и поддержка стриминговых пайплайнов. Построение NRT пайплайнов обработки данных из Kafka в Apache Iceberg (Kafka2Iceberg) и RT пайплайнов между Kafka (Kafka2Kafka) с использованием Apache Flink и Spark Structured Streaming.

Архитектура данных:

  • активное участие в разработке архитектуры решения потоковой обработки данных Data Streamhouse данных для обеспечения
  • разработка предложений по развитию Data Lakehouse, внедрение best practices работы с Apache Iceberg (оптимизация партиционирования, compaction, time travel).

Инженерные практики:

  • реализация механизмов инкрементальной загрузки данных для минимизации времени обработки и нагрузки на источники
  • разработка и документирование API (на Java или Scala) для доступа к данным витрин и сервисам семантического слоя

Производительность и качество:

  • глубокая оптимизация Spark-приложений, включая использование векторного движка Gluten/Velox для ускорения рабочих нагрузок
  • разработка решений для сверки и контроля качества данных (Data Quality) с использованием Spark и Python.

DevOps и CI/CD: Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie или современных оркестраторах.

Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса.

·      Уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ).

·      Глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене.

·      Опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle.

·      Опыт работы с потоковыми данными: Apache Kafka (как источник/приемник) и хотя бы одним фреймворком стриминговой обработки (Apache Flink или Spark Streaming).

·      Понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg).

·      Опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).

Будет большим плюсом:

·      Опыт внедрения промышленных пайплайнов пакетной передачи данных.

·      Опыт внедрения промышленных пайплайнов потоковой передачи данных.

·      Опыт внедрения Gluten/Velox или аналогичных векторизованных движков.

·      Навыки сборки и развертывания Doker-образов приложений.

  • офисный формат работы (м Кутузовская ул. Поклонная 3)
  • годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • регулярные митапы и развитое DS-community
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • вознаграждение за рекомендацию друзей в команду Сбер.
Эта вакансия также есть на:hh.ru
hh.ru
ozon

Старший DWH-разработчик

ozonНа сервисе с: 06.10.26 19:10
Зарплата не указанаРоссияМоскваУдалёнка

Привет! Это команда DWH. Мы ищем разработчика аналитического хранилища Ozon, который умеет работать с большими объёмами данных, оптимизировать SQL-запросы, строить ETL-процессы, разбирать ошибки и взаимодействовать с бизнес-пользователями и аналитиками.

Наш стек

  • Trino, Vertica, Hadoop, Spark, Jupyter Notebook, Python, Airflow, Docker.

Вы будете

  • Разрабатывать и развивать ETL-системы, которые обеспечивают данными различные предметные области: продажи, учёт, логистику.
  • Анализировать данные и проектировать структуры данных под аналитические потребности различных бизнес-подразделений.
  • Оптимизировать и мониторить пайплайны обработки данных, повышая их производительность и стабильность.
  • Проектировать и реализовывать масштабируемые хранилища данных на базе HP Vertica, Trino, ClickHouse, PostgreSQL и Hadoop.

Нам важно

  • Самостоятельность в решении задач и опыт в роли ключевого разработчика на крупном проекте.
  • Опыт проектирования архитектуры хранения данных и связанных ETL-процессов.
  • Умение работать с техническими требованиями: аргументированно предлагать изменения и находить оптимальные решения.
  • Хорошие навыки проектирования и реализации ETL-процессов, обязательное знание Airflow.
  • Отличное знание SQL и системное мышление.
  • Опыт разработки хранилищ данных с использованием одной из колоночных СУБД: Vertica, Greenplum, Exadata, Teradata.
  • Опыт программирования на Python, в том числе для разработки решений по автогенерации ETL-задач и реализации логических алгоритмов.
  • Навыки работы с Bash и Docker.

Будет плюсом

  • Опыт работы со Spark.
  • Опыт работы с несколькими ETL-инструментами и их использованием в горизонтально масштабируемых системах обработки данных.
  • Знания в одной из областей: CI/CD, frontend- или backend-разработка, разработка интеграционных потоков.
  • Желание участвовать в управлении проектами и доводить фичи до production.
  • Желание развиваться в наставничестве и помогать другим участникам команды.
hh.ru
салютдевайсы

Middle/Senior Data Engineer

салютдевайсыНа сервисе с: 06.10.26 19:06
Зарплата не указанаРоссияМоскваГибрид

Что предстоит делать?

  • Определять и развивать целевую архитектуру платформы данных и ключевых доменных моделей
  • Проектировать и реализовывать критичные пайплайны и хранилища, обеспечивая надёжность, производительность и масштабируемость
  • Вводить и поддерживать стандарты качества данных, схем, версионирования, мониторинга и алёртинга
  • Проводить архитектурные ревью, дизайн-сессии, помогать команде в декомпозиции и решении сложных задач
  • Оптимизировать существующие решения: хранение, запросы, пайплайны, снижать стоимость и повышать SLA
  • Проводить capacity planning и нагрузочное тестирование платформы, определять узкие места и планировать масштабирование вычислительных, сетевых и storage-ресурсов
  • Проектировать отказоустойчивость и disaster recovery платформы: репликацию, резервное копирование, восстановление, RPO/RTO и сценарии отказа отдельных компонентов и кластеров.

Мы ожидаем, что вы:

  • Имеете высокий уровень владения Python, SQL, Airflow, dbt.
  • Имеете опыт построения систем с HA/DR: отказоустойчивость, disaster recovery, backup/restore, RPO/RTO, multi-AZ/кластерные конфигурации
  • Имеете глубокое знание ClickHouse и его архитектуры, а так же методов оптимизации хранения/скорости доступа к данным: шардирование, репликация, Distributed-таблицы, ClickHouse Keeper, MergeTree-семейство, партиционирование, TTL, materialized views, projections, работа с S3, tiered storage, ORDER BY/primary key, индексы, JOIN, агрегации и т.п.
  • Имеете глубокое понимание архитектуры распределённых систем: CAP, репликация, консистентность, отказоустойчивость, идемпотентность
  • Имеете опыт построения высоконагруженных ingestion-пайплайнов, включая SLA на каждом этапе: ingestion → storage → transformation → serving → BI/ML. Kafka/очереди сообщений, batch и streaming ingestion, consumer groups, backpressure, retries, deduplication, ordering, schema evolution
  • Имеете опыт построения data platform / lakehouse / DWH: raw/bronze → silver → gold, медальонная модель, витрины, семантический слой, object storage
  • Обладаете навыками оптимизации стоимости хранения и обработки: hot/warm/cold storage, TTL, S3, compression, retention policies, pre-aggregation
  • Знаете Metabase (будет дополнительным плюсом)

Почему вам понравится работать у нас?

  • Сильная команда, амбициозные задачи и продукты, которыми пользуются миллионы
  • Новый офис SberDevices в центре Москвы
  • Удобный формат работы с возможностью гибкого начала рабочего дня
  • Надёжная программа ДМС и НС с первого месяца работы
  • Обучение и развитие: курсы и тренинги от корпоративного университета, внешнее обучение за счёт компании и участие в конференциях
  • Льготная ипотека и корпоративная пенсионная программа
  • СберКлуб: cкидки от партнёров, повышенные бонусы, акции экосистемы, подписка СберПрайм+.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.