
Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными…
СБЕР На сервисе с: 06.10.26 19:17
Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.
Архитектура данных:
Инженерные практики:
Производительность и качество:
DevOps и CI/CD: Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie или современных оркестраторах.
Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса.
· Уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ).
· Глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене.
· Опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle.
· Опыт работы с потоковыми данными: Apache Kafka (как источник/приемник) и хотя бы одним фреймворком стриминговой обработки (Apache Flink или Spark Streaming).
· Понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg).
· Опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).
Будет большим плюсом:
· Опыт внедрения промышленных пайплайнов пакетной передачи данных.
· Опыт внедрения промышленных пайплайнов потоковой передачи данных.
· Опыт внедрения Gluten/Velox или аналогичных векторизованных движков.
· Навыки сборки и развертывания Doker-образов приложений.
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.