wilix

Data Engineer (Python, Java)

WILIX — аккредитованная IT-компания. Мы создаем современные корпоративные системы и развиваем направление аутстаффинга. Мы предоставляем высокую инженерную экспертизу ведущим игрокам рынка: Сбер, Т-Банк, МТС Банк, X5 Ритейл, Магнит, Северс…

wilix На сервисе с: 06.10.26 17:51

180k–240k ₽РоссияМоскваУдалёнка

О Нас

WILIX — аккредитованная IT-компания. Мы создаем современные корпоративные системы и развиваем направление аутстаффинга. Мы предоставляем высокую инженерную экспертизу ведущим игрокам рынка: Сбер, Т-Банк, МТС Банк, X5 Ритейл, Магнит, Северсталь, Альфа Страхование, ОТП Банк и многим другим. Сегодня мы расширяем команду и ищем Инженера данных для работы над внешними проектами в таких сферах, как ритейл, EdTech, банкинг и других.

Чем предстоит заниматься

  • Проектировать и разрабатывать потоки данных на ETL/ELT-инструментах;

  • Имплементировать кастомные трансформации;

  • Проектировать и строить прототипы и витрины данных;

  • Анализировать производительность и масштабировать существующие системы;

  • Оптимизировать SQL-запросы и структуры баз данных;

  • Разрабатывать процедуры на языке PL/pgSQL;

  • Развивать архитектуру DWH, участвовать в анализе и выборе технологий, методологий и инструментов;

  • Создавать и актуализировать базу знаний для пользователей DWH;

  • Разрабатывать программный код и проводить его тестирование.

Что мы ожидаем

  • Знание принципов построения хранилищ данных;

  • Опыт работы с экосистемой Hadoop/HDFS/Hive (HDFS, YARN, Spark, Kafka, NiFi, Sqoop, Flume и др.);

  • Уверенное знание SQL (DDL, DML), опыт оптимизации запросов;

  • Опыт работы с Greenplum и PostgreSQL;

  • Знание Java или Python (NumPy, Pandas); знание Scala будет плюсом;

  • Опыт использования систем ведения проектов и документации, сопровождения и мониторинга информационных систем;

  • Опыт администрирования Hadoop/Linux;

  • Понимание принципов CI/CD (Jenkins, GitLab).

Будет плюсом

  • Опыт работы с оркестраторами (Airflow) и инструментами трансформации данных (dbt);

  • Работа с Clickhouse;

  • Опыт работы в консалтинге или на проектах с несколькими заказчиками;

  • Умение документировать решения и взаимодействовать с бизнес-заказчиком напрямую.

Мы предлагаем

  • Участие в разнообразных проектах ведущих компаний из разных отраслей;

  • Возможность профессионального развития и освоения новых технологий;

  • Работу в команде профессионалов.

Похожие вакансии Data Engineer

Сайты компаний
СБЕР

Tech Lead Data engineer

СБЕРНа сервисе с: 06.10.26 19:17
до 500k ₽РоссияМоскваОфис

Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.

  • разработка и оптимизация витрин данных: Проектирование и реализация эффективных ETL и ELT процессов для витрин данных с использованием Apache Spark и Greenplum. Обеспечение высокой производительности и отказоустойчивости пайплайнов.
  • потоковая обработка данных (RT и NRT): Разработка и поддержка стриминговых пайплайнов. Построение NRT пайплайнов обработки данных из Kafka в Apache Iceberg (Kafka2Iceberg) и RT пайплайнов между Kafka (Kafka2Kafka) с использованием Apache Flink и Spark Structured Streaming.

Архитектура данных:

  • активное участие в разработке архитектуры решения потоковой обработки данных Data Streamhouse данных для обеспечения
  • разработка предложений по развитию Data Lakehouse, внедрение best practices работы с Apache Iceberg (оптимизация партиционирования, compaction, time travel).

Инженерные практики:

  • реализация механизмов инкрементальной загрузки данных для минимизации времени обработки и нагрузки на источники
  • разработка и документирование API (на Java или Scala) для доступа к данным витрин и сервисам семантического слоя

Производительность и качество:

  • глубокая оптимизация Spark-приложений, включая использование векторного движка Gluten/Velox для ускорения рабочих нагрузок
  • разработка решений для сверки и контроля качества данных (Data Quality) с использованием Spark и Python.

DevOps и CI/CD: Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie или современных оркестраторах.

Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса.

·      Уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ).

·      Глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене.

·      Опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle.

·      Опыт работы с потоковыми данными: Apache Kafka (как источник/приемник) и хотя бы одним фреймворком стриминговой обработки (Apache Flink или Spark Streaming).

·      Понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg).

·      Опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).

Будет большим плюсом:

·      Опыт внедрения промышленных пайплайнов пакетной передачи данных.

·      Опыт внедрения промышленных пайплайнов потоковой передачи данных.

·      Опыт внедрения Gluten/Velox или аналогичных векторизованных движков.

·      Навыки сборки и развертывания Doker-образов приложений.

  • офисный формат работы (м Кутузовская ул. Поклонная 3)
  • годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • регулярные митапы и развитое DS-community
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • вознаграждение за рекомендацию друзей в команду Сбер.
Эта вакансия также есть на:hh.ru
hh.ru
ozon

Старший DWH-разработчик

ozonНа сервисе с: 06.10.26 19:10
Зарплата не указанаРоссияМоскваУдалёнка

Привет! Это команда DWH. Мы ищем разработчика аналитического хранилища Ozon, который умеет работать с большими объёмами данных, оптимизировать SQL-запросы, строить ETL-процессы, разбирать ошибки и взаимодействовать с бизнес-пользователями и аналитиками.

Наш стек

  • Trino, Vertica, Hadoop, Spark, Jupyter Notebook, Python, Airflow, Docker.

Вы будете

  • Разрабатывать и развивать ETL-системы, которые обеспечивают данными различные предметные области: продажи, учёт, логистику.
  • Анализировать данные и проектировать структуры данных под аналитические потребности различных бизнес-подразделений.
  • Оптимизировать и мониторить пайплайны обработки данных, повышая их производительность и стабильность.
  • Проектировать и реализовывать масштабируемые хранилища данных на базе HP Vertica, Trino, ClickHouse, PostgreSQL и Hadoop.

Нам важно

  • Самостоятельность в решении задач и опыт в роли ключевого разработчика на крупном проекте.
  • Опыт проектирования архитектуры хранения данных и связанных ETL-процессов.
  • Умение работать с техническими требованиями: аргументированно предлагать изменения и находить оптимальные решения.
  • Хорошие навыки проектирования и реализации ETL-процессов, обязательное знание Airflow.
  • Отличное знание SQL и системное мышление.
  • Опыт разработки хранилищ данных с использованием одной из колоночных СУБД: Vertica, Greenplum, Exadata, Teradata.
  • Опыт программирования на Python, в том числе для разработки решений по автогенерации ETL-задач и реализации логических алгоритмов.
  • Навыки работы с Bash и Docker.

Будет плюсом

  • Опыт работы со Spark.
  • Опыт работы с несколькими ETL-инструментами и их использованием в горизонтально масштабируемых системах обработки данных.
  • Знания в одной из областей: CI/CD, frontend- или backend-разработка, разработка интеграционных потоков.
  • Желание участвовать в управлении проектами и доводить фичи до production.
  • Желание развиваться в наставничестве и помогать другим участникам команды.
hh.ru
салютдевайсы

Middle/Senior Data Engineer

салютдевайсыНа сервисе с: 06.10.26 19:06
Зарплата не указанаРоссияМоскваГибрид

Что предстоит делать?

  • Определять и развивать целевую архитектуру платформы данных и ключевых доменных моделей
  • Проектировать и реализовывать критичные пайплайны и хранилища, обеспечивая надёжность, производительность и масштабируемость
  • Вводить и поддерживать стандарты качества данных, схем, версионирования, мониторинга и алёртинга
  • Проводить архитектурные ревью, дизайн-сессии, помогать команде в декомпозиции и решении сложных задач
  • Оптимизировать существующие решения: хранение, запросы, пайплайны, снижать стоимость и повышать SLA
  • Проводить capacity planning и нагрузочное тестирование платформы, определять узкие места и планировать масштабирование вычислительных, сетевых и storage-ресурсов
  • Проектировать отказоустойчивость и disaster recovery платформы: репликацию, резервное копирование, восстановление, RPO/RTO и сценарии отказа отдельных компонентов и кластеров.

Мы ожидаем, что вы:

  • Имеете высокий уровень владения Python, SQL, Airflow, dbt.
  • Имеете опыт построения систем с HA/DR: отказоустойчивость, disaster recovery, backup/restore, RPO/RTO, multi-AZ/кластерные конфигурации
  • Имеете глубокое знание ClickHouse и его архитектуры, а так же методов оптимизации хранения/скорости доступа к данным: шардирование, репликация, Distributed-таблицы, ClickHouse Keeper, MergeTree-семейство, партиционирование, TTL, materialized views, projections, работа с S3, tiered storage, ORDER BY/primary key, индексы, JOIN, агрегации и т.п.
  • Имеете глубокое понимание архитектуры распределённых систем: CAP, репликация, консистентность, отказоустойчивость, идемпотентность
  • Имеете опыт построения высоконагруженных ingestion-пайплайнов, включая SLA на каждом этапе: ingestion → storage → transformation → serving → BI/ML. Kafka/очереди сообщений, batch и streaming ingestion, consumer groups, backpressure, retries, deduplication, ordering, schema evolution
  • Имеете опыт построения data platform / lakehouse / DWH: raw/bronze → silver → gold, медальонная модель, витрины, семантический слой, object storage
  • Обладаете навыками оптимизации стоимости хранения и обработки: hot/warm/cold storage, TTL, S3, compression, retention policies, pre-aggregation
  • Знаете Metabase (будет дополнительным плюсом)

Почему вам понравится работать у нас?

  • Сильная команда, амбициозные задачи и продукты, которыми пользуются миллионы
  • Новый офис SberDevices в центре Москвы
  • Удобный формат работы с возможностью гибкого начала рабочего дня
  • Надёжная программа ДМС и НС с первого месяца работы
  • Обучение и развитие: курсы и тренинги от корпоративного университета, внешнее обучение за счёт компании и участие в конференциях
  • Льготная ипотека и корпоративная пенсионная программа
  • СберКлуб: cкидки от партнёров, повышенные бонусы, акции экосистемы, подписка СберПрайм+.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.