Data Engineer — свежие вакансии
Обновляется каждый час. Найдено: 124 вакансии за последнюю неделю.
- Вакансий за неделю:
- 124
- Медиана:
- 277 500 ₽
- Вилка:
- 207 135 ₽ — 360 000 ₽
Зарплаты — по 90 вакансиям с указанной вилкой за 30 дней
HireSeeker — агрегатор вакансий. Собираем вакансии со всех основных площадок и показываем по вашей специальности. Подпишитесь на ежедневную подборку только релевантных.
Специалист по базам данных (ETL и миграции данных) / Data Engineer
В связи с созданием нового отдела и развитием направления, мы формируем команду с нуля.
Важно: На начальном этапе вам предстоит самостоятельно выстроить архитектуру хранения данных и процессы ETL. Проект уникален для компании, поэтому мы ищем специалиста, который не боится «зеленого поля», готов принимать самостоятельные решения и брать на себя ответственность за разработку ключевых узлов системы.
Чем предстоит заниматься:
-
Проектирование и развертывание БД: Спроектируете структуру локальной базы данных под хранение и индексацию массива данных до 1 500 000 файлов (объем до 2 ТБ и более) с учетом горизонтального расширения в будущем.
-
Разработка инструментов миграции: Напишете скрипты для автоматического сбора, парсинга, очистки и загрузки файлов из сетевых корпоративных папок в новую систему.
-
Интеграция с OCR: Настроите взаимодействие ядра БД со специализированным софтом для распознавания текста.
-
Организация поиска: Внедрите инструменты быстрого полнотекстового поиска, а также поиска по атрибутам (шифр, дата, автор, тип документа).
-
Подготовка витрин данных: Спроектируете и реализуете выгрузку структурированных данных в форматах, удобных для дальнейшего использования специалистами по искусственному интеллекту.
Мы ждем, что вы:
- Имеете высшее инженерное образование.
-
СУБД: Экспертный уровень работы с реляционными СУБД. Глубокое понимание оптимизации сложных запросов, индексации больших объемов текста и настройки производительности.
-
Опыт миграций: Наличие успешно реализованных проектов по обработке и переносу терабайтных массивов данных из "сырых" источников в структурированное хранилище.
-
Программирование: Уверенное владение языками программирования для написания высоконагруженных скриптов автоматизации и работы с файловой системой.
-
API: Опыт создания серверной части для передачи данных на фронтенд или в смежные сервисы.
-
Инфраструктура: Базовые навыки администрирования для развертывания и изоляции БД в закрытом контуре (без доступа в интернет).
Будет преимуществом:
-
Опыт интеграции с OCR-системами (Content AI, Abbyy FineReader Server и др.).
-
Практика работы с движками полнотекстового поиска.
-
Понимание специфики проектной документации (чертежи, спецификации, текстовые тома ГОСТ).
Что мы предлагаем:
- Срочный трудовой договор с возможностью дальнейшей пролонгации.
- Офисный характер работы.
- Стабильность и надежность: работа в социально-ответственной компании с акцентом на проектирование НПЗ.
- Официальное оформление по ТК РФ с первого рабочего дня.
- Конкурентная зарплата: уровень дохода обсуждается на собеседовании, основанный на ваших профессиональном опыте (оклад + премия).
- ДМС (включая стоматологию) после испытательного срока.
- Поддержка наших сотрудников: материальная помощь при значимых событиях (свадьба, рождение ребенка и др.).
- Поддержка здорового образа жизни: частичная компенсация абонементов в спортзалы и фитнес-залы.
- Спортивная активность: возможность участия в марафонах и других командных спортивных мероприятиях.
- Корпоративные мероприятия: конкурсы, квизы, настольные игры и выезды.
- Обучение и развитие: доступ к корпоративной электронной библиотеке и возможности для регулярного обучения
- График работы: 5/2, с пн.-чт. с 8:00 до 17:00, пт. с 8:00 до 16:00.
- Комфортный и современный офис в Нижнем Новгороде, Максима Горького, 117.
Мы ценим каждого кандидата и внимательно изучаем все резюме. Если ваше резюме будет отобрано, мы свяжемся с вами для личной встречи.
Присоединяйтесь к команде профессионалов!
Управление командой
- Управлять кросс-функциональной командой из бизнес-аналитиков, дата-инженеров и разработчиков
- Приоритезировать задачи спринта исходя из ёмкости команды, финансового эффекта реализации и потребности бизнес-заказчика
- Консультировать бизнес-потребителей данных по реализованным дата-продуктам и общему дата-ландшафту банка
- Отслеживать приоритеты и сроки выполнения задач
- Управлять бэклогом команды
- Формулировать и описывать ТЗ (превращаем пожелания \ идеи бизнеса в технические требования)
- Проводить полный флоу работы по задаче: общение с заказчиком - обсуждение задачи - написание ТЗ - оценка по задаче - утверждение сроков - прототипирование - реализация задачи - тестирование и приемка - визуализация результатов в понятной для заказчиков форме
- Проводить системную аналитику для осуществления интеграционных работ
- Писать сложные SELECT запросы, объединения, подзапросы, CTE, оконные функции
- Проводить профилирование и тюнинг запросов (использование индексов, переписывание запросов, изменение планов выполнения) для повышения производительности
- Разбирать сложные инциденты с качеством данных
- Разрабатывать и поддерживать процедуры загрузки, трансформации и выгрузки данных (ETL) с использованием Informatica и Airflow, Spark
- Обеспечивать корректность и целостность данных при перемещении между источниками
- Тестирование и валидация реализованного функционала
- Высшее образование в области информатики, компьютерных наук, прикладной математики, экономики или смежных специальностей
- Навыки управления командой аналитиков \ дата-инженеров от 1 года
- Опыт работы от 5 лет в разработке аналитических решений
- Умение выстраивать доверительную и конструктивную коммуникацию с заказчиками всех уровней
- Продвинутый уровень SQL (T SQL, PL/SQL, PostgreSQL, MySQL, Iceberg и т.п.)
- Опыт написания сложных запросов, хранимых процедур, функций, триггеров, представлений
- Опыт работы с ETL инструментами (Spark, Airflow, Informatica) или написания скриптов загрузки данных
- Понимание Python, архитектуры БД Data Mash (необязательно, но плюс), принципов работы Data LakeHouse
Что мы предлагаем взамен
- Стабильный и прозрачный доход: размер заработной платы обсуждается по итогам собеседования + квартальная премия по результатам KPI
- Полную удалёнку или гибрид на выбор, а также уютный ИТ-хаб в Москве, Санкт-Петербурге, Екатеринбурге и сезонный коворкинг в Сочи
- Сложные и интересные задачи, современный стек технологий
- Заботу о вашем здоровье: программа ДМС с первых дней работы, куда входит стоматология, обслуживание в лучших клиниках города, страхование и полная компенсация 10-ти дней больничного
- Возможность вертикального и горизонтального карьерного роста: регулярно проходят тренинги, вебинары, митапы и демо-дни
- Доступ к бесплатным корпоративным библиотекам Alpina Digital, MyBook и бизнес-изданий
- Предложения от Банка только для сотрудников: собственные спортзалы (Москва, Санкт-Петербург, Екатеринбург), а также скидки на услуги туристических агентств, продукты питания, в рестораны, бары, магазины
Мы строим технологичную финтех-компанию ИТ Контакт: с 2019 года мы создаем современные цифровые платформы, которые позволяют упростить процессы, снизить затраты и повысить безопасность сделок, связанных с приобретением жилья.
Благодаря нашей работе множество людей по всему миру смогли воплотить в жизнь мечту о собственном доме. Нас уже более 700 человек, и, в связи с активным ростом компании, мы находимся в поисках Data Engineer в нашу команду.
Технологии: SQL, Python, Pandas, SQLAlchemy, Requests, MS SQL Server, Apache Airflow, Git, CI/CD, REST API, SFTP, Jira, Confluence, GitHub Copilot
Требования к кандидату:
- Отличное владение SQL и практический опыт работы с MS SQL Server.
- Практический опыт работы с Apache Airflow или другим инструментом оркестрации и готовность быстро углубиться в Airflow.
- Уверенное владение Python для задач обработки и интеграции данных, включая Pandas, SQLAlchemy и Requests.
- Хорошее понимание архитектуры DWH, принципов организации слоев хранения данных и построения Data Mart.
- Опыт разработки, сопровождения и рефакторинга ETL/ELT-процессов.
- Опыт интеграции данных из различных источников: SQL-баз, API, файлов и SFTP.
- Навыки оптимизации SQL-запросов и понимание принципов эффективной работы с базами данных.
Будет плюсом:
- Опыт переноса ETL-процессов, SQL Jobs или Python-скриптов в Airflow.
- Опыт работы с Git и понимание принципов version control.
- Понимание CI/CD применительно к data pipelines.
- Опыт работы с Jira и Confluence.
- Опыт использования LLM-инструментов, например GitHub Copilot, в процессе разработки.
- Опыт подготовки данных для аналитических систем или Power BI.
- Базовые навыки работы в Linux.
Чем вы будете заниматься:
- Рефакторить существующие ETL-процессы и структуру базы данных, содержащей данные из Jira и Bitbucket.
- Разрабатывать и сопровождать ETL/ELT-пайплайны.
- Переносить ETL-процессы и трансформации из SQL Server Jobs в Apache Airflow.
- Переносить существующие Python-скрипты в управляемые пайплайны Apache Airflow.
- Настраивать интеграции с различными источниками данных, включая базы данных, API, файлы и SFTP.
- Оптимизировать SQL-запросы и повышать производительность процессов обработки данных.
- Участвовать в развитии DWH и создании слоя Data Mart.
- Подготавливать данные для аналитических задач и внутренних заказчиков.
Что мы предлагаем?
- Аккредитованная IT-компания
- Комфортный офис в центре Санкт-Петербурга
- Предсказуемый график работы 5/2
- Мультикультурная амбициозная команда
- Общение на иностранных языках с коллегами и клиентами
- Внутреннее комьюнити для сотрудников: кафетерий льгот, сообщества по интересам, спортивные турниры, благотворительные программы и т.д.
В TradingView мы помогаем более чем 100 миллионам инвесторов по всему миру открывать новые торговые возможности и принимать взвешенные решения на глобальных рынках. Данные — это основа нашей стратегии, и мы убеждены: быстрый и удобный доступ к достоверной аналитике — ключ к успеху.
Команда Data Engineering — это фундамент, на котором строится работа всей компании. Мы создаём масштабируемую инфраструктуру, которая превращает огромные объёмы информации в понятные и надёжные инсайты.
Позиция предполагает высокую степень автономности и самостоятельности, но и вместе с тем плотное взаимодействие с коллегами, аналитиками, ML-engineer’ами и разработчиками.
Задачи
- Сопровождение и разработка Airflow DAGs
- Оптимизация/разработка SQL запросов для витрин данных
- Сопровождение и развитие инфраструктуры дата платформы
- Разработка dbt моделей. Портирование существующих витрин на dbt модели.
- Проектирование, разработка и тестирование ETL/ELT процессов
- Проведение Proof of concept с дальнейшей презентацией и внедрением в продакшен
- Участвовать в принятии архитектурных решений для дата платформы
- Описание технических частей итоговой работы в документации
- Опыт работы инженером данных от 4-5 лет
- Уверенно владеете Python на уровне написания Airflow DAG’ов.
- Уверенно владеет SQL на уровне оптимизации запросов. Умеете читать планы запросов и предлагать варианты по улучшению производительности запросов.
- Опыт работы с AWS
- Имеете опыт работы с Apache Airflow, знаете принципы построения пайплайнов
- Имеете опыт работы с dbt
- Знаете, что такое MPP(Massive Parallel Processing) СУБД, и имели опыт работы с подобными(Redshift, Greenplum, Vertica)
- Уверенный Linux пользователь
- Умение четко формулировать технические спецификации и отстаивать техническую позицию
- Умеете выбирать технологии для решения конкретных задач
Будет плюсом:
- Опыт работы с облачной инфраструктурой AWS для построение дата платформы
- Если есть опыт работы в области построения архитектуры Lakehouse с использованием Parquet, AWS Athena и других технологий AWS
- Если вы работали с системами мониторинга(Prometheus + Grafana, Zabbix)
- Если вы работали с СУБД Postgres, Clickhouse
- Если вы работали с Apache NiFi
- Если вы собирали и сопровождали контейнеры Docker
Мы готовы предложить вам:
-
Работа с первым по популярности продуктом в своей отрасли
-
Оформление по ТК Грузии, конкурентную заработную плату
-
Гибкий график, адаптивное рабочее место и пространство для отдыха
-
ДМС, а также 100% компенсацию больничного листа
-
Компенсацию питания и неограниченное количество снеков круглосуточно
-
Компенсацию изучения английского языка, конференции и курсы под спонсорством компании
-
Тимбилдинги и корпоративные мероприятия.
-
Поддержка от HR-партнера, который поможет адаптироваться и решить любые вопросы.
GlowByte - лидер в сфере разработки Business Intelligence (BI) решений. Компания на рынке c 2004 года.
Сегодня нас выбирают лидеры своих отраслей: крупнейшие банки (17 из Топ-20), телеком и сотовые операторы (все компании большой четверки), крупнейшие ритейлеры и логистические компании - с каждым годом этот список растет.
GlowByte - аккредитованная ИТ компания.
Мы создаем:
-
Платформы хранения и анализа данных (DWH/BI)
-
Системы принятия решений и управления рисками
-
Аналитические и операционные CRM
Мы внедряем аналитические решения на базе:
-
ORACLE DB, MS SQL Server, SAS, IBM, SAP BW/HANA,Vertica, Teradata, Hadoop, GreenPlum.
Сегодня нас больше 2000 человек, и мы активно растем и ищем в нашу команду разработчика.
Какие задачи будут стоять перед тобой (подробности, и детали проектов - на техническом интервью):
-
Цикл разработки и реализации корпоративных информационно-аналитических систем;
-
Участие в составление плана проекта, оценка проектных сроков и рисков, организация оптимального процесса разработки;
-
Доработка систем, оптимизация запросов, настройка ETL процессов, устранение дефектов в рамках проекта;
-
Участие в проектировании новых решений;
-
Участие в разработке технической документации по проекту;
-
Участие в приемке системы;
Требования:
- работа в офисе на Кутузовской (в дальнейшем возможен гибрид)
- уверенное знание SQL;
- опыт работы с Hadoop
- опыт работы с распределенной обработкой больших данных;
- опыт работы c Greenplum или другими MPP-СУБД;
- опыт разработки и поддержки DAG в Airflow;
- понимание принципов ETL/ELT;
- опыт построения аналитических витрин;
- опыт контроля качества данных;
- навыки технического документирования
Будет плюсом:
- знание Spark/PySpark
- опыт работы с потоковыми или near-real-time данным;
- знание Kafka или аналогичные технологии;
- понимание процессов DevOps
- опыт интеграции ML-моделей в промышленный data pipeline.
А что мы можем предложить тебе?
- Стабильный оклад и премию по итогам года/проекта
- Предлагаем хорошую команду, имеющую опыт на конкретно этом проекте и достаточно лояльного заказчика
- Широкий и современный технический стек
- Доступ к принятию решений
- ДМС, компенсация изучения английского языка/абонемента в фитнес-клуб
- Профессиональное обучение и сертификацию с оплатой за счёт компании
Жми откликнуться, и мы скоро свяжемся с тобой.
Привет! Мы команда Data Engineering. С ростом количества пользователей увеличивается и нагрузка на сервис, поэтому мы ищем опытного специалиста, который будет принимать участие в проектах по развитию дата-платформы.
У нас:
- Более 500 GB сырых Clickstream данных в сутки.
- Более 500 GB сырых Operational Data в сутки.
- Более 500 витрин данных.
- Более 10 видов источников данных.
Позиция предполагает высокую степень автономности и самостоятельности, но и вместе с тем плотное взаимодействие с коллегами, аналитиками, ML-engineer’ами и разработчиками.
Задачи
- Сопровождение и разработка Airflow DAGs.
- Оптимизация/разработка SQL запросов для витрин данных.
- Сопровождение и развитие инфраструктуры дата-платформы.
- Разработка dbt моделей. Портирование существующих витрин на dbt модели.
- Проектирование, разработка и тестирование ETL/ELT процессов.
- Проведение Proof of concept с дальнейшей презентацией и внедрением в продакшен.
- Участвовать в принятии архитектурных решений для дата-платформы.
- Описание технических частей итоговой работы в документации.
Навыки:
- Опыт работы инженером данных от 4-5 лет.
- Уверенно владеете Python на уровне написания Airflow DAG’ов.
- Уверенно владеете SQL на уровне оптимизации запросов. Умеете читать планы запросов и предлагать варианты по улучшению производительности запросов.
- Имеете опыт работы с Apache Airflow, знаете принципы построения пайплайнов.
- Имеете опыт работы с dbt.
- Знаете, что такое MPP (Massive Parallel Processing) СУБД, и имели опыт работы с подобными (Redshift, Greenplum, Vertica).
- Уверенный Linux пользователь.
- Умение четко формулировать технические спецификации и отстаивать техническую позицию.
- Умеете выбирать технологии для решения конкретных задач.
- Обязательный опыт работы с AWS.
Будет плюсом:
- Опыт работы с облачной инфраструктурой AWS для построения дата-платформы.
- Если есть опыт работы в области построения архитектуры Lakehouse с использованием Parquet, AWS Athena и других технологий AWS.
- Если вы работали с системами мониторинга (Prometheus + Grafana, Zabbix).
- Если вы работали с СУБД Postgres, Clickhouse.
- Если вы работали с Apache NiFi.
- Если вы собирали и сопровождали контейнеры Docker.
Мы готовы предложить вам:
-
Работа с первым по популярности продуктом в своей отрасли.
-
Оформление по ТК Грузии, конкурентную заработную плату.
-
Гибкий график, адаптивное рабочее место и пространство для отдыха.
-
ДМС, а также 100% компенсацию больничного листа.
-
Компенсацию питания и неограниченное количество снеков круглосуточно.
-
Компенсацию изучения английского языка, конференции и курсы под спонсорством компании.
-
Тимбилдинги и корпоративные мероприятия.
-
Поддержка от HR-партнера, который поможет адаптироваться и решить любые вопросы.
Мы не рассматриваем удаленный формат сотрудничества.
Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.
Мы предлагаем:
· Интересные задачи по построению Data Lakehouse на базе Apache Spark и Apache Iceberg.
· Работу с большими объемами данных и современным стеком технологий.
· Возможность влиять на архитектурные решения.
Ключевые технологии в вакансии: SQL, Java, Scala, Python, Apache Spark, Apache Iceberg, Apache Hadoop, Greenplum, Gluten, Velox, Oozie, Jenkins, Doker.
Разработка и оптимизация витрин данных:
- проектирование и реализация эффективных ETL и ELT процессов для витрин данных с использованием Apache Spark и Greenplum. Обеспечение высокой производительности и отказоустойчивости пайплайнов.
Архитектура данных:
- поддержание и развитие текущих пайплайнов обработки данных на Hadoop с использованием Apache Spark.
- разработка предложений по развитию Data Lakehouse, внедрение best practices работы с Apache Iceberg (оптимизация партиционирования, compaction, time travel).
Инженерные практики:
- реализация механизмов инкрементальной загрузки данных для минимизации времени обработки и нагрузки на источники.
- разработка и документирование API (на Java или Scala) для доступа к данным витрин и сервисам семантического слоя.
Производительность и качество:
- глубокая оптимизация Spark-приложений, включая использование векторного движка Gluten/Velox для ускорения рабочих нагрузок.
- разработка решений для сверки и контроля качества данных (Data Quality) с использованием Spark и Python.
- DevOps и CI/CD: Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie или современных оркестраторах.
Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса
- уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ).
- глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене.
- опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle.
- понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg).
- опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).
Будет большим плюсом:
-
опыт внедрения промышленных пайплайнов пакетной передачи данных.
-
опыт внедрения Gluten/Velox или аналогичных векторизованных движков.
-
навыки сборки и развертывания Doker-образов приложений.
-
офисный формат работы (м Кутузовская)
-
корпоративный спортзал и зоны отдыха
-
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
-
регулярные митапы и развитое DS-community
-
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
-
гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
-
подписка Прайм с возможностью совместного использования на трёх близких
-
вознаграждение за рекомендацию друзей в команду Сбер.
Основные требования:
SQL на продвинутом уровне (аналитические функции, подзапросы, хранимые процедуры, оптимизация производительности);
Cтек технологий Big Data (Hadoop, Spark, Hive/Impala) и любой СУБД;
Знание понятий и концепций DWH;
Python (PySpark, Pandas, NumPy, REST API);
Airflow/Dagster/Oozie;
BitBucket\Git;
Bash;
Внимательность к деталям, аналитические навыки, коммуникационные навыки, ответственность.
Будет плюсом:
Опыт работы с веб-аналитическими данными, данными мобильных приложений, рекламных кабинетов (YandexMetrica, AppMetrica или др. кликстримы);
Опыт работы с разметкой сайта через GoogleTagManager, базовые знания HTML, JavaScript;
Знание банковского бизнеса;
Опыт работы по Agile (SCRUM, Kanban, и т.д.);
Обязанности:
Загрузка, очистка и трансформация больших объемов данных из различных источников (RDBMS, Hadoop, плоские файлы) в рабочую область (платформы Hadoop);
Проектирование и разработка аналитических витрин данных;
Проектирование и разработка коннекторов для ETL процессов;
Мониторинг и оптимизация процессов загрузки, преобразования данных и сборки витрин;
Разработка, поддержка и оптимизация инфраструктуры и внутренних сервисов для обработки больших объемов данных;
Разработка инструментов для автоматизации рутинных задач, связанных с обработкой данных.
Условия:
Возможность профессионального и карьерного роста в компании;
Возможность поучаствовать в разных проектах;
Опыт работы в распределенной команде профессионалов;
Уровень заработной платы обсуждается индивидуально;
Формат работы: Офис в г. Москва.
Чем ты будешь заниматься:
- Проектировать и разработать ETL-процессы (batch).
- Создавать backend-сервисы на Python для обработки данных и интеграции с внешними системами.
- Инжиниренно оптимизировать ML-проекты: рефакторить и оборачивать в продакшен пайплайны обучения и инференса, обеспечивая стабильность, воспроизводимость и наблюдаемость.
- Участвовать в проектировании хранилищ данных и оптимизации существующих решений.
- Стек технологий: Язык и фреймворки: Python 3, PySpark, Pandas, FastAPI, Pydantic Хранилища и вычисления: PostgreSQL, ClickHouse, Greenplum, Trino, S3 Оркестрация и ML: Apache Airflow, MLflow Инфраструктура: Docker, Kubernetes, Git, GitLab CI/C
Мы ожидаем
- Опыт коммерческой разработки на Python не менее 2 лет; владение стандартной библиотекой и экосистемой data-разработки.
- Понимание принципов построения ETL/ELT-процессов.
- Опыт работы с распределёнными СУБД (Greenplum, ClickHouse) и вычислительными движками (Apache Spark, Trino).
- Оркестрация пайплайнов в Airflow.
- Верхнеуровневое понимание жизненного цикла ML-моделей.
- Основы CI/CD и DevOps: сборка, тестирование, деплой.
- Навыки работы в командной строке Linux.
- Контейнеризация (Docker).
- Использование ИИ-ассистентов в разработке (opencode или аналоги) для ускорения написания и ревью кода.
Ищем самостоятельного дата-инженера для развития потоков данных в прикладном _Legal_-домене. Вам предстоит строить надежные пайплайны от источников до автоматизированных систем-получателей.
-
cбор, анализ и формализация требований от бизнес-технологов (БТ) и владельцев продуктов юридического блока
-
поиск, исследование и подключение новых источников данных внутри КАП под задачи правового департамента
-
выполнение разовых (Ad-hoc) запросов по заявкам бизнеса для проработки требований, точечного анализа юридических метрик или поиска аномалий в данных
-
разработка ETL -процессов на Scala (Apache Spark 3.2+) с последующей пакетной доставкой подготовленных витрин данных в смежные автоматизированные системы (АС)
-
оптимизация производительности SQL-запросов к данным уровня HOF (Head of Function, сложные CTE, оконные функции, партиционирование) и Scala-кода
-
обеспечение стабильности работы продуктивных потоков: разбор инцидентов третьей линии поддержки (L3), восстановление целостности данных после сбоев, работа с логами YARN/HDFS
-
взаимодействие с командами DevOps для настройки CI/CD пайплайнов доставки кода и оркестрации задач
-
ведение технической документации в Confluence и управление задачами в Jira.
-
опыт работы Data Engineer от 2–3 лет
-
уверенное владение Apache Spark (версии 2.x или 3.x). Обязательно знание Scala как основного языка разработки трансформаций
-
Глубокое понимание архитектуры экосистемы Hadoop (YARN, HDFS, Hive Metastore)
-
экспертный уровень SQL: свободное использование оконных функций (ROW_NUMBER, RANK, LAG/LEAD), сложных джоинов и вложенных запросов
-
навык анализа требований бизнеса и перевода их на язык технических спецификаций
-
практический опыт расследования и устранения последствий инцидентов L3 в продуктивной среде больших данных
-
самостоятельность: умение декомпозировать задачу, оценить сроки и довести ее до релиза без микроменеджмента
-
знакомство с инструментами DevOps и практиками CI/CD применительно к доставке Spark-приложений
-
будет плюсом: опыт использования AI-инструментов в разработке (LLM-ассистенты для написания и ревью кода, агенты для автоматизации рутинных операций, инструменты автодополнения вроде GitHub Copilot)
Будет плюсом:
-
опыт работы с данными в финансовом секторе, ритейле или телекоме; знакомство со специфическими юридическими источниками
-
навыки работы с генеративными AI-моделями.
-
формат работы офис, локация офиса ул Вавилова д.19
-
ежегодный пересмотр зарплаты, квартальная и годовая премия
-
корпоративный спортзал и зоны отдыха
-
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
-
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
-
гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
-
подписка Прайм с возможностью совместного использования на трёх близких
-
вознаграждение за рекомендацию друзей в команду Сбера.
Ну очень качественная вакансия 🙌🏻
🔗 Data Quality-инженер
Примеры задач: сформировать методологию Master Data, выстроить и держать в актуальном состоянии модель данных по штатным единицам, создать правила использования корпоративных данных, модернизировать бизнес-логику.
#разработка #SQL #DWH #dwh_career
Привет! Команда Evrone занимается продуктовой разработкой стартапов и помогает в цифровой трансформации бизнеса в России, США и Европе. Думаю, что вы о нас слышали от Григория Петрова (Evrone Devrel).
Ищем Data/Lineage инженера уровня Senior. Заработная плата зависит от уровня и определяется после прохождения технического собеседования.
Проект в домене MedTech, формирование устойчивого контура идентичности, схем данных, происхождения и хранения артефактов в платформе in-silico drug discovery.
Стадия проекта: рабочий прототип, целевая архитектура не зафиксирована окончательно.
Среда: преимущественно on-prem и air-gap, возможны shared trust zone, dedicated cell и burst-очередь во внешний cloud.
Бизнес-задача роли: не допустить потери истории кандидатов и результатов вычислительных экспериментов при развитии платформы и замене отдельных инфраструктурных компонентов. Downstream-стадии должны получать входные данные по устойчивому идентификатору предшественника и ссылке на объектное хранилище, а не по локальному пути на GPU-ноде.
Задачи:
- Разобрать текущие источники данных, lineage-теги, выходные схемы и сценарии, где успешный статус задачи не гарантирует наличие скачиваемого файла;
- Зафиксировать правила идентичности сущностей. На текущем этапе — дисциплина тегов при enqueue; целевой контур — compound registry с соответствием `InChIKey ↔ internal id`;
- Версионировать `output_schema` и extractors для Vina, OpenFE, ADMET, Lilly, triage, nomination и MADD;
- Обеспечить читаемость старых артефактов после появления новых версий схем;
- Настроить происхождение между стадиями в формате OpenLineage `START / COMPLETE / FAIL` или эквиваленте;
- Реализовать audit exporter без создания второго журнала статусов рядом с оркестратором;
- Ввести QC артефактов. Объект в MinIO/S3 должен скачиваться и парситься; `completed` без файла должен завершаться явной ошибкой;
- Перевести downstream-получение входов на идентификаторы и `s3://`, исключив зависимость от локальных путей;
- Согласовать контракты схем через JSON Schema и YAML handoff, а также glossary научных метрик совместно с backend и R&D;
- Закрепить инварианты автоматизированными тестами и передать документацию внутренней команде
Что для нас важно:
- Уверенный Python;
- SQL и PostgreSQL, включая миграции и понимание Row-Level Security;
- Опыт построения пайплайнов, где объектное хранилище является source of truth;
- Практический опыт data contracts, schema evolution и lineage;
- Работа с файловыми и бинарными артефактами, а не только с таблицами DWH;
- Опыт проектирования устойчивой идентичности сущностей независимо от оркестратора;
- Умение фиксировать инварианты тестами и передавать решение внутренней команде
Будет ОГРОМНЫМ плюсом:
- Понимание семантики OpenLineage, Marquez или DataHub без привязки решения к конкретному бренду;
- Опыт MLOps или научных пайплайнов с артефактами: ClearML, MLflow, Flyte, Nextflow или Airflow;
- RDKit, SDF и Parquet, JSON Schema;
- Опыт on-prem или air-gap окружений
Результат первых 60–90 дней:
- Карта разрывов lineage на пути `enqueue → nomination`;
- Работающие инварианты «нет обязательных тегов — нет enqueue» и «нет файла — нет успешного завершения»;
- Версии extractors согласованы с `tools.manifest`;
- Принято решение по audit-событиям без появления второго source of truth;
- Зафиксирован контракт данных, не зависящий от API ClearML;
- Критичные инварианты покрыты тестами, документация передана внутренней команде
Вне скоупа:
- Интерпретация SAR и критерии nomination;
- SDTM/ADaM, SEND, ELN/LIMS, RWE и GLP system of record;
- GPU-очереди и выбор замены ClearML как workload manager;
- BFF и UI, кроме стыков по схемам, скачиванию и идентичности;
- Построение нового data lake или DWH
Почему Evrone:
- Мы занимаемся технически сложными, высоконагруженными, наукоёмкими проектами, проектами с большой бизнес логикой или большой серверной инфраструктурой. Нам доверяют: аналитику, проектирование интерфейсов и дизайн, разработку, инфраструктуру и эксплуатацию. Мы становимся технической командой проекта целиком или консультируем и расширяем возможности существующих команд наших клиентов.
- Кроме того, Evrone помогает развиваться сообществу разработчиков. Мы делаем самую большую в России конференцию по Ruby — RubyRussia, проводим технические митапы, делаем свой новостной дайджест, а также спонсируем и помогаем в проведении конференций по Go, Python, React/Vue и функциональным языкам.
- Наши инженеры выступают на ведущих конференциях России и Европы и вносят вклад в Open Source проекты, мы берем интервью у лидеров комьюнити и пишем статьи на самые горячие темы индустрии. В этом году мы ставили стенд и выступали на конференциях Highload и TeamLeadConf.
- Вся команда работает удаленно с 2008 года. Мы знаем как организовать распределенную разработку комфортно и эффективно. Есть офисы для работы и встреч в Москве и Воронеже, а также офисы продаж в Сан-Франциско и Берлине.
Что предлагаем:
- Удаленную фултайм работу и мягкий график. Достаточно синхронизировать тайм-зоны и иметь пересечения рабочего времени с командой;
- Качественный онбординг и hr-менеджмент (1:1, Grow Review). По желанию меняем проекты, не даем стагнировать. При формировании команды проекта учитываем профессиональные или личные интересы разработчиков;
- Работу в разновозрастном, разнополом и потрясающе дружном и профессиональном коллективе;
- Хорошо организованный воркфлоу, отсутствие бюрократии. Работа на доверии.
- Наши разработчики работают только над одним проектом. Без постоянных переключений между ними.
Одна из ценностей Evrone – работа с удовольствием.
Для этого мы придумали Evrone Benefits. Каждому из нас выделяется годовой бюджет, автоматически пополняемый каждый новый год вашей работы в Evrone. Его можно потратить на полезные категории трат, направленные на:
- ДМС и здоровье;
- Спорт и абонемент для фитнеса или инвентарь для спорта;
- Курсы иностранного языка;
- Техника для работы и улучшение рабочего места;
- Обучение: курсы, тренинги, мастер-классы, семинары, книги и конференции.
Бонусы и премии:
- Повышение зарплаты по мере роста компетенций (по результатам ассесмента);
- Премии за привлечение новых сотрудников и новых клиентов;
- Дополнительная премия за выступления на конференциях и митапах;
- У вас есть возможность принять участие в проведении технических интервью специалистов, которые могут стать вашими коллегами. Проведение интервью оплачивается.
Обучение и рост компетенций:
- Проводим митапы. Вы можете быть как и слушателем, так и спикером;
- У нас есть культура менторства. В повседневных задачах и планировании карьеры будет помогать наставник;
- Развивать профессиональный уровень можно с помощью системы ассессмента Evrone Challenge;
- Есть внутренняя библиотека с электронными книгами и записанными курсами;
- Работаем и дружим с западными заказчиками, есть возможность практиковать свой английский.
Возможность стать докладчиком или автором:
- Если вы хотите выступить на оффлайн конференции, мы поможем вам подготовить контент для доклада и сделаем крутые слайды. DevRel Evrone (Григорий Петров) поможет подготовиться к выступлению на конференции, окажем поддержку на самой конференции и подготовим материалы с вашим докладом.
- Если вы хотите выступить на онлайн конференции, помимо помощи по подготовке доклада и подбору конференции, мы организуем вам студийную съемку или трансляцию вашего доклада;
- У нас есть блоги на всех популярных платформах России и мира. Наши редакторы и профессиональные авторы еженедельно выпускают новые материалы;
- Если вы написали статью, мы нарисуем для нее иллюстрации и поможем вам ее оформить и опубликовать. Если у вас есть только идея - редакторы помогут сформулировать мысли, оформить пост самостоятельно и правильно опубликовать для максимального охвата.
Возможность прокачаться в Open Source:
- Если у вас есть популярные open source проекты – мы поможем с их продвижением и окажем поддержку в развитии;
- Если вы контрибьютите в популярные проекты с открытым исходным кодом, мы оплатим часы, которые вы на это потратили.
- Если вы ничего этого не делаете, но очень хочется начать – в Evrone есть менторы, которые помогут вам сделать первые шаги: подберут задачки для старта, помогут решить их и правильно оформить pr.
Отдых и развиртуализация:
Мы проводим ежегодный фестиваль Evrone Fest, на котором собирается вся наша команда, а также тематические встречи в различных городах. Поэтому, где бы вы ни находились, мы будем рады увидеться лично.
Ведущий разработчик аналитики данных (гибрид)
Обязанности:
- Участие в разработке единой модели данных DWH, картина «сверху вниз» и связная модель данных по всем измерениям (домены, типы потребления, слои хранения)
- Организация сбора данных с разных источников в т.ч. внешних систем по API
- Обработка информации на языке программирования Python
- Создание отчетов в платформе PowerBI
Требования:
- Продвинутые знания SQL
- Отличное знание языков программирования DAX, Python, VBA
- Отличное знание платформы PowerBI
- Умение использовать технологию API для сбора данных из внешних источников
- Понимание и применение на практике принципов разработки в высоконагруженных информационных системах.
- Опыт работы с ETL инструментами
Плюсом будет
- Опыт работы с SQL/NoSQL базами данных (PostgreSQL, ClickHouse, S3)
- Опыт работы с AirFlow
Условия:
- Работу в аккредитованной ИТ-компании
- График гибрид (дни обсуждаем)
- Поддержка менторов и наставников, помощь в поиске точек роста и карьерном развитии
- Корпоративные мероприятия и дружный коллектив
- Скидки на фитнес, на продукцию для сотрудников компании
- Достойную Вашего профессионального уровня зарплату
- Официальное трудоустройство по ТК РФ, оплачиваемый отпуск, больничный
ОДИН ИЗ ЛУЧШИХ РАБОТОДАТЕЛЕЙ РОССИИ
Мы – Neoflex. Аккредитованная IT компания. За 20 лет работы мы создали 12+ готовых решений для бизнеса, так же занимаемся заказной разработкой программного обеспечения.
Приветствуем на странице нашей компании и благодарим за интерес к вакансии. Будем рады оказаться полезны друг другу.
Сейчас мы расширяем команду, занимающуюся проектом по миграции данных из 87 источников на единую платформу. Команда входит в Центр компетенций BDS - одно из сильнейших подразделений нашей Компании, экспертов в области работы с большими данными, построения DWH и использующих в работе современный стек BigData: Greenplum, Hadoop, NiFi, Hive, Spark/Scala, PostgreSQL, Informatica, Kafka, Apache Airflow, Apache Griffin, Iceberg, Parquet, SQL, Python
Офисный режим работы , график 5/2
Москва: Кутузовский 32к1
Санкт-Петербург :Уральская 1А
Нижний Новгород: Академика Сахарова 2к1
Что нужно делать:
- Взаимодействовать с бизнес-заказчиком: анализировать, уточнять и согласовывать бизнес-требования. Вы будете мостиком между командой разработки и заказчиком.
- Искать источники данных и выполнять проверку качества данных (data sources, data quality checks)
- Разрабатывать модели данных витрин (прототипирование с помощью SQL)
- Согласовывать решения с архитекторами заказчика и презентовать их заказчику
- Разрабатывать прототипы ETL до передачи в разработку (если позволяют тех скилы, с помощью Python и Spark)
- Писать и выполнять тестовые сценарии, поддерживать сверки с эталонными данными
- Создавать проектную документацию (требования, S2T, модели данных, описание логики трансформаций)
- Выполнять ad-hoc-запросы (проверка гипотез, валидация и сверка данных, подготовка эталонов)
-
Участвовать в жизни команды разработки, дата-аналитики и дата- инжиниринга. Работа по Scrum
-
Позиция требует посещения офиса 5 дней в неделю и работу с чувствительными данными
- Уверенное знание SQL (join, CTE ), понимание принципов нормализации, опыт разработки витрин данных
- Базовые знания построения хранилищ данных, витрин и моделей данных
- Развитое логическое мышление, умение структурированно излагать мысли устно и письменно
- Опыт поиска информации, чтения и проектирования моделей данных
- Опыт работы с Jira и Confluence
Что ты приобретёшь, присоединившись к нам:
- Работу с задачами, которые просто не возникают в маленьких компаниях. Твой код здесь — это не эксперимент. Масштаб данных в Банке Топ-2 РФ — это другая лига. Это стандарт качества, на который ориентируется вся отрасль. Мы ищем людей, которым интересно решать задачи на пределе возможностей современных технологий!
- Возможность расти по карьерному пути как дата аналитика, так и дата инженера или деливери менеджера;
- достойную оплату труда + компенсационные, стимулирующие и мотивационные выплаты, бонусы за участие в реферальной программе;
- работа в команде профессионалов готовых делиться экспертизой;
- официальное трудоустройство по ТК РФ, аккредитация IT, расширенный социальный пакет:
✔️ страховка ДМС (с 3-го месяца работы, стоматология, возможность подключения родственников, теле медицина, полис ВЗР)
✔️ сотрудникам со стажем в Neoflex более 3 месяцев при предоставлении листка нетрудоспособности устанавливается доплата до полного заработка за период болезни,
✔️ обучение детей сотрудников ИТ специальностям,
✔️ компенсация затрат на фитнес и занятия английским языком;
- обеспечиваем техникой для работы (ноутбук, наушники, мышь);
- профессиональное развитие - в Учебном Центре (курсы по работе с большими данными, видео лекции, тренажеры, карьерный коучинг, лекции, тренинги, конференции, участие в митапах);
- персонального наставника с первого дня работы;
- насыщенную корпоративную жизнь: яркие корпоративы, праздники для детей сотрудников, корпоративные спортивные мероприятия, мотивационные награждения;
- комфортную, доброжелательную атмосферу в офисах заказчика, с организованным питанием, спорт залом с лаунж зонами и всем необходимым для комфортной работы в атмосфере заботы.
Мечты и команды работают вместе. Мы будем рады, если ты станешь частью нашей команды! Откликайся ;)
Системный Аналитик DWH (работа из офиса)
ОДИН ИЗ ЛУЧШИХ РАБОТОДАТЕЛЕЙ РОССИИ
Мы – Neoflex. Аккредитованная IT компания. За 20 лет работы мы создали 12+ готовых решений для бизнеса, так же занимаемся заказной разработкой программного обеспечения.
Приветствуем на странице нашей компании и благодарим за интерес к вакансии. Будем рады оказаться полезны друг другу.
Сейчас мы расширяем команду, занимающуюся проектом по миграции данных из 87 источников на единую платформу. Команда входит в Центр компетенций BDS - одно из сильнейших подразделений нашей Компании, экспертов в области работы с большими данными, построения DWH и использующих в работе современный стек BigData: Greenplum, Hadoop, NiFi, Hive, Spark/Scala, PostgreSQL, Informatica, Kafka, Apache Airflow, Apache Griffin, Iceberg, Parquet, SQL, Python
Офисный режим работы , график 5/2
Москва: Кутузовский 32к1
Санкт-Петербург :Уральская 1А
Нижний Новгород: Академика Сахарова 2к1
Что нужно делать:
- Взаимодействовать с бизнес-заказчиком: анализировать, уточнять и согласовывать бизнес-требования. Вы будете мостиком между командой разработки и заказчиком.
- Искать источники данных и выполнять проверку качества данных (data sources, data quality checks)
- Разрабатывать модели данных витрин (прототипирование с помощью SQL)
- Согласовывать решения с архитекторами заказчика и презентовать их заказчику
- Разрабатывать прототипы ETL до передачи в разработку (если позволяют тех скилы, с помощью Python и Spark)
- Писать и выполнять тестовые сценарии, поддерживать сверки с эталонными данными
- Создавать проектную документацию (требования, S2T, модели данных, описание логики трансформаций)
- Выполнять ad-hoc-запросы (проверка гипотез, валидация и сверка данных, подготовка эталонов)
-
Участвовать в жизни команды разработки, дата-аналитики и дата- инжиниринга. Работа по Scrum
-
Позиция требует посещения офиса 5 дней в неделю и работу с чувствительными данными
- Уверенное знание SQL (join, CTE ), понимание принципов нормализации, опыт разработки витрин данных
- Базовые знания построения хранилищ данных, витрин и моделей данных
- Развитое логическое мышление, умение структурированно излагать мысли устно и письменно
- Опыт поиска информации, чтения и проектирования моделей данных
- Опыт работы с Jira и Confluence
Что ты приобретёшь, присоединившись к нам:
- Работу с задачами, которые просто не возникают в маленьких компаниях. Твой код здесь — это не эксперимент. Масштаб данных в Банке Топ-2 РФ — это другая лига. Это стандарт качества, на который ориентируется вся отрасль. Мы ищем людей, которым интересно решать задачи на пределе возможностей современных технологий!
- Возможность расти по карьерному пути как дата аналитика, так и дата инженера или деливери менеджера;
- достойную оплату труда + компенсационные, стимулирующие и мотивационные выплаты, бонусы за участие в реферальной программе;
- работа в команде профессионалов готовых делиться экспертизой;
- официальное трудоустройство по ТК РФ, аккредитация IT, расширенный социальный пакет:
✔️ страховка ДМС (с 3-го месяца работы, стоматология, возможность подключения родственников, теле медицина, полис ВЗР)
✔️ сотрудникам со стажем в Neoflex более 3 месяцев при предоставлении листка нетрудоспособности устанавливается доплата до полного заработка за период болезни,
✔️ обучение детей сотрудников ИТ специальностям,
✔️ компенсация затрат на фитнес и занятия английским языком;
- обеспечиваем техникой для работы (ноутбук, наушники, мышь);
- профессиональное развитие - в Учебном Центре (курсы по работе с большими данными, видео лекции, тренажеры, карьерный коучинг, лекции, тренинги, конференции, участие в митапах);
- персонального наставника с первого дня работы;
- насыщенную корпоративную жизнь: яркие корпоративы, праздники для детей сотрудников, корпоративные спортивные мероприятия, мотивационные награждения;
- комфортную, доброжелательную атмосферу в офисах заказчика, с организованным питанием, спорт залом с лаунж зонами и всем необходимым для комфортной работы в атмосфере заботы.
Мечты и команды работают вместе. Мы будем рады, если ты станешь частью нашей команды! Откликайся ;)
Senior Data Engineer (Python, PostgreSQL)
#SeniorDataEngineer #DataEngineer #Senior #Python #Удаленно #РФ
Требования:
Образование высшее (ИТ, техническое, математическое, экономическое). Опыт не менее 3 лет в разработке. Отличное знание PostgreSQL и Python (middle+ / senior). Знание инструментов ETL (Apache Airflow). Опыт с системами DWH. Опыт с данными (анализ данных, создание критериев/метрик по их качеству). Желательно: Опыт настройки и разработки с использованием инструментов Data Quality. Опыт проектирования и построения DWH. Язык проекта: Русский.
Локация:📍Удалённо в РФ. Часовой пояс: МСК.
Контакт для отклика: @Oly_rec +CV
👉забрать special offer
Мы — аккредитованный системный интегратор, специализирующийся на заказной разработке и внедрении индивидуальных ИТ-решений для бизнеса.
Миссия компании:
Для компаний: Дать возможность сильным компаниям увеличиваться благодаря найму эффективных IT-специалистов.
Для соискателей: Дать возможность трудоустройства сильным кандидатам в передовые компании на выгодных условиях труда.
Для нашей команды: Обеспечить рост благополучия всех членов команды благодаря возможности зарабатывать, самосовершенствоваться и развиваться в рамках компании.
Требования:
Уверенный опыт разработки в области DWH
Опыт коммерческой разработки и сопровождения корпоративных хранилищ данных от 3 лет. Понимание архитектуры DWH, принципов построения слоёв хранения и обработки данных, подходов Kimball/Inmon, а также принципов работы с большими объемами данных.
SQL и разработка процедур
Уверенное владение SQL, опыт написания сложных запросов с использованием CTE, оконных и аналитических функций, подзапросов и различных типов JOIN. Умение анализировать и оптимизировать запросы, работать с планами выполнения и находить узкие места.
Базы данных
Практический опыт разработки на уровне СУБД. Обязателен опыт работы с Oracle. Будет плюсом знание PostgreSQL, MS SQL Server, Greenplum, Vertica, Hadoop или других аналитических СУБД.
ETL/ELT и загрузка данных
Опыт построения ETL/ELT-процессов, загрузки данных из различных источников, разработки процедур трансформации и контроля качества данных. Понимание принципов инкрементальной загрузки, CDC, обработки ошибок и повторного запуска загрузок.
Разработка витрин данных
Опыт проектирования и разработки многослойных DWH и аналитических витрин. Понимание принципов построения фактов и измерений, денормализации, историзации данных (SCD), формирования агрегатов и подготовки данных для BI-систем.
Интеграция источников
Опыт работы с различными источниками данных: реляционными БД, файловыми источниками, API и корпоративными информационными системами. Умение анализировать структуру исходных данных, определять правила преобразования и обеспечивать их корректную загрузку в хранилище.
ETL-инструменты и оркестрация
Опыт работы с Informatica PowerCenter и/или Apache Airflow. Понимание принципов построения DAG, зависимостей между задачами, мониторинга загрузок и обработки ошибок.
Качество и контроль данных
Понимание принципов Data Quality, умение реализовывать проверки полноты, уникальности, непротиворечивости и актуальности данных. Опыт поиска и устранения расхождений между источниками и DWH.
Производительность и большие объемы данных
Опыт оптимизации ETL-процессов и SQL-запросов, работа с большими объемами данных. Понимание партиционирования, индексации, статистики, параллельного выполнения и других механизмов оптимизации СУБД.
Командная разработка
Уверенное владение Git, опыт работы в команде разработки, участие в code review, взаимодействие с аналитиками, BI-разработчиками и бизнес-заказчиками. Умение документировать структуру данных, правила трансформации и логику загрузок.
Будет плюсом:
Опыт работы с Greenplum, Hadoop, Vertica, ClickHouse, PostgreSQL, Kafka, Spark, dbt, Kubernetes. Опыт построения высоконагруженных DWH, участия в миграции хранилищ и разработки решений для банковского или финансового сектора.
Условия:
Интересные проекты в крупнейших компаниях РФ.
Преимущественно удалённый формат работы.
График с 9:00 до 18:00 по МСК.
Возможность быстрого карьерного роста.
Трудоустройство в аккредитованной ИТ-компании.
Оформление по ТК РФ или через ИП (приоритет).
Работа в дружном, сплочённом коллективе.
Откликайтесь! Мы с нетерпением ждём вас в нашей команде!
Playerok — это маркетплейс цифровых товаров и услуг. Мы соединяем покупателей и продавцов, берём на себя безопасность сделки и запускаем собственные продукты. Строим масштабный бизнес на быстрорастущем рынке, на стыке гейминга, финтеха и e-commerce.
Мы ищем Data Engineer, который будет развивать нашу платформу данных: строить и поддерживать пайплайны загрузки данных в ClickHouse и PostgreSQL, развивать слои данных (staging, DDS, витрины) и обеспечивать их стабильную работу. Отдельное направление - настройка репликации данных из операционных баз в аналитическое хранилище через CDC (Debezium + Kafka).
1. Разрабатывать и поддерживать ETL/ELT пайплайны в Airflow: загрузка данных из внутренних систем и внешних источников в ClickHouse и PostgreSQL.
2. Развивать слои данных (staging, DDS, витрины) с помощью dbt: модели, инкрементальная загрузка, тесты, документация.
3. Настраивать и сопровождать репликацию данных из операционных PostgreSQL-баз в DWH через CDC (Debezium, Kafka).
4. Оптимизировать хранение и запросы в ClickHouse: схемы таблиц, партиционирование, ключи сортировки, материализованные представления.
5. Следить за качеством данных: тесты, валидация витрин, алертинг при сбоях пайплайнов.
6. Участвовать в code review и развитии инженерных практик команды (Git, CI/CD).
Что мы ожидаем:
1. Разрабатывать и поддерживать ETL/ELT пайплайны в Airflow: загрузка данных из внутренних систем и внешних источников в ClickHouse и PostgreSQL.
2. Развивать слои данных (staging, DDS, витрины) с помощью dbt: модели, инкрементальная загрузка, тесты, документация.
3. Настраивать и сопровождать репликацию данных из операционных PostgreSQL-баз в DWH через CDC (Debezium, Kafka).
4. Оптимизировать хранение и запросы в ClickHouse: схемы таблиц, партиционирование, ключи сортировки, материализованные представления.
5. Следить за качеством данных: тесты, валидация витрин, алертинг при сбоях пайплайнов.
6. Участвовать в code review и развитии инженерных практик команды (Git, CI/CD).
Будет плюсом:
1. Опыт интеграции Kafka с ClickHouse (Kafka Engine, Kafka Connect).
2. Опыт работы с Docker и Kubernetes.
3. Опыт работы с S3 / MinIO как промежуточным слоем.
4. Понимание методологий моделирования данных (Data Vault, dimensional modeling, SCD type 2).
5. Опыт настройки мониторинга и алертинга пайплайнов (например, в Slack / Telegram).
-
Удаленный формат сотрудничества.
-
200 000 руб — стартовая вилка, итоговая сумма обсуждается по опыту.
-
Возможность выбрать форму сотрудничества и оплаты (все налоги — наша забота).
-
Онбординг-квест — не бросим в бой без подготовки, введем в курс дела и подключим к команде.
-
Занятость 5/2 с 8-часовым рабочим днем.
-
Команда профи— работаешь с инициативными и увлеченными коллегами.
-
Пауза на восстановление — «перезагрузиться» можно в оплачиваемом отпуске или на больничном.
Откликайся на вакансию — это первый шаг к тому, чтобы стать частью команды, которая меняет правила игры. Ваш ход! 🎮
Мы аккредитованная ИТ-компания и являемся частью большой семьи ГК Softline.
Bell Integrator активно реализует проекты по всей России, среди наших заказчиков – крупнейшие системообразующие финансовые, телеком и ритейл компании страны.
Описание проекта: В команду маркетинга крупного банка РФ ищем разработчика продуктовых витрин.
Мы создаем Martech инструменты для сквозной аналитики, позволяющие отследить весь пользовательский путь от просмотра баннера до первой транзакции, автоматизировать запуск рекламы в Digital и эффективнее управлять ей. Наша основная цель – быть #1 в привлечение клиентов в цифровом пространстве.
Опыт работы: от 2х лет.
Основные требования к кандидату:
- SQL на продвинутом уровне (аналитические функции, подзапросы, хранимые процедуры, оптимизация производительности).
- Cтек технологий Big Data (Hadoop, Spark, Hive/Impala) и любой СУБД.
- Знание понятий и концепций DWH
- Python (PySpark, Pandas, NumPy, REST API);
- Airflow/Dagster/Oozie
- BitBucket\Git
- Bash
- Внимательность к деталям, аналитические навыки, коммуникационные навыки, ответственность
- Опыт работы с веб-аналитическими данными, данными мобильных приложений, рекламных кабинетов (YandexMetrica, AppMetrica или др. кликстримы)
- Опыт работы с разметкой сайта через GoogleTagManager, базовые знания HTML, JavaScript
- Знание банковского бизнеса;
- Опыт работы по Agile (SCRUM, Kanban, и т.д.);
- Проектирование и разработка аналитических витрин данных
- Проектирование и разработка коннекторов для ETL процессов
- Мониторинг и оптимизация процессов загрузки, преобразования данных и сборки витрин
- Разработка, поддержка и оптимизация инфраструктуры и внутренних сервисов для обработки больших объемов данных;
- Разработка инструментов для автоматизации рутинных задач, связанных с обработкой данных
Обязанности кандидата
Загрузка, очистка и трансформация больших объемов данных из различных источников (RDBMS, Hadoop, плоские файлы) в рабочую область (платформы Hadoop)
Возможность профессионального и карьерного роста в компании
Возможность поучаствовать в разных проектах
Опыт работы в распределенной команде профессионалов
Уровень заработной платы обсуждается индивидуально
Оформление в соответствии с ТК РФ в Bell Integrator https://bellintegrator.ru/
Формат работы ОФИС: МСК/ Оружейный пер. 41
Дирекция мониторинга Agile в поисках системного аналитика с опытом работы в крупных проектах/продуктах (несколько команд разработки: front-end, back-end, DE и хранилище, BI и AdHoc-отчетность).
Команда разрабатывает уникальный по масштабу и сложности проект, призванный изменить систему управления Банком, сделав её прозрачной за счёт data-driven подхода. Продукт внедрен и используется в периметре Sbergile – Agile dashboard (известный также как «черный» дэшборд). Ежемесячная аудитория дэшборда составляет 4500+ уникальных пользователей. Продукт активно развивается и дорабатывается новыми фичами на основе требований и пожеланий заказчиков. Наша система мониторинга ежедневно используется руководством Банка для принятия стратегических решений, а количество задач растёт изо дня в день.
Вам предстоит:
- прорабатывать архитектуру хранилища данных, а также его интеграцию с внешними системами
- проектировать и разрабатывать витрины данных для целей аналитики и моделирования на тех. стеке: PostgreSQL, ClickHouse, SQL, Python, Kafka, Rest API, Qlik
- загружать, очищать и трансформировать большие объемы данных из различных источников
- мониторинг и оптимизация процессов загрузки, преобразования данных и сборки витрин
- разрабатывать инструменты для автоматизации рутинных задач.
Мы ожидаем:
- опыт работы в качестве Data Engineer / MLE от 3 лет
- знание SQL на продвинутом уровне (аналитические функции, подзапросы, хранимые процедуры, оптимизация запросов и анализ плана выполнения)
- опыт разработки ETL-процессов (партиционирование, секционирование, работа с временными рядами)
- уверенное владение Python для автоматизации
- опыт работы с Apache AirFlow, NiFi.
Будет плюсом:
- опыт создания AI-агентов и использования их в работе
- опыт разработки и оптимизации ETL-процессов для ClickHouse.
Мы предлагаем:
- гибридный формат работы (3-4 дня в офисе)
- годовой бонус и ежегодный пересмотр
- расширенный ДМС с первого дня + стоматологию и льготное страхование для семьи
- корпоративный университет Сбера, внутреннюю образовательную платформу, участие в IT-конференциях
- офис на Кутузовской с зонами отдыха и спортзалом
- льготную ипотеку в Сбере, корпоративную пенсионную программу, подписку СберПрайм с возможностью совместного использования на трёх близких, скидки от партнеров и сервисов группы компаний.
ПРОЕКТ: в банковской сфере, ищем разработчика продуктовых витрин. Мы создаем Martech инструменты для сквозной аналитики, позволяющие отследить весь пользовательский путь от просмотра баннера до первой транзакции, автоматизировать запуск рекламы в Digital и эффективнее управлять ей.
ЧТО МЫ ОЖИДАЕМ ОТ КАНДИДАТА:
- Опыт работы от 2-х лет.
- Опыт с SQL на продвинутом уровне (аналитические функции, подзапросы, хранимые процедуры, оптимизация производительности).
- Опыт работы со стеком технологий Big Data (Hadoop, Spark, Hive/Impala) и любой СУБД, Python (PySpark, Pandas, NumPy, REST API), Airflow/Dagster/Oozie, BitBucket\Git, Bash.
- Знание понятий и концепций DWH.
- Внимательность к деталям, аналитические навыки, коммуникационные навыки, ответственность.
БУДЕТ ПЛЮСОМ:
- Опыт работы с веб-аналитическими данными, данными мобильных приложений, рекламных кабинетов (YandexMetrica, AppMetrica или др. кликстримы).
- Опыт работы с разметкой сайта через GoogleTagManager, базовые знания HTML, JavaScript.
- Знание банковского бизнеса.
- Опыт работы по Agile (SCRUM, Kanban, и т.д.).
ЧЕМ ПРЕДСТОИТ ЗАНИМАТЬСЯ:
- Загрузка, очистка и трансформация больших объемов данных из различных источников (RDBMS, Hadoop, плоские файлы) в рабочую область (платформы Hadoop).
- Проектирование и разработка аналитических витрин данных.
- Проектирование и разработка коннекторов для ETL процессов.
- Мониторинг и оптимизация процессов загрузки, преобразования данных и сборки витрин.
- Разработка, поддержка и оптимизация инфраструктуры и внутренних сервисов для обработки больших объемов данных.
- Разработка инструментов для автоматизации рутинных задач, связанных с обработкой данных.
МЫ ПРЕДЛАГАЕМ:
- Возможность участия в интересных проектах.
- Возможность профессионального и карьерного роста в компании.
- Опыт работы в команде профессионалов.
- Специальные тарифы для сотрудников в спортивные клубы и языковые курсы и пр.
- Офисный формат работы в Москве.
🧠😘😀😘😘🥰😀🫢
Data инженер
Грейд: Senior
Локация специалиста: РФ
Загрузка специалиста Full-time
• Гражданство: РФ
• Формат работы: удалённо
Описание проекта:
Разработка и развитие систем больших данных с использованием Python, Spark, Hadoop и современных инструментов обработки и хранения данных. Проект включает разработку низкоуровневой архитектуры, программного кода, ETL-процессов, оптимизацию и выпуск решений в промышленную эксплуатацию.
Задачи на проекте:
● Разработка низкоуровневой архитектуры систем больших данных на основании требований аналитиков и архитекторов.
● Подготовка документации по низкоуровневой архитектуре.
● Разработка программного кода систем больших данных.
● Разработка программ распределённых вычислений на Spark.
● Разработка и сопровождение ETL-процессов.
● Подготовка документации по алгоритмам разработанных систем.
● Разработка Unit-тестов.
● Подготовка и сборка установочных пакетов для промышленной среды.
● Проведение плановых работ по оптимизации программного кода.
● Исправление дефектов в разработанных приложениях.
● Подготовка и выпуск пакетов обновлений, включающих исправления и оптимизацию кода.
● Проведение Code Review.
Требования:
● От 3 лет коммерческой разработки.
● От 2 лет разработки систем, вышедших в промышленную эксплуатацию.
● От 2 лет опыта работы с Big Data.
● Глубокие теоретические знания и практический опыт работы со стеком технологий.
● Опыт работы с бизнес-требованиями: сбор, формирование и анализ.
● Опыт работы в условиях постоянно меняющихся требований.
● Умение давать и принимать обратную связь.
● Опыт написания программ распределённых вычислений на Spark.
● Опыт разработки ETL-процессов.
● Опыт проведения Code Review.
● Опыт или понимание разработки и проектирования архитектуры БД.
● Опыт создания и работы с БД.
● Опыт оптимизации SQL-запросов.
● Понимание процессов CI/CD.
● Опыт написания Unit-тестов.
● Python 3.5+.
● Spark 2.2+.
● Hadoop, Hive.
● Airflow.
● Kubernetes (K8S).
● SQLAlchemy.
● PostgreSQL, Greenplum.
● PyTest / Unittest.
● Flake8 / PyLint, Black.
● Docker.
● Git, GitLab, CI/CD.
● Умение разрешать конфликты в Git.
● Shell, Linux.
Digital Chief — IT-хаб новой ecom-платформы от Альфа-Банка, где мы объединяем экспертизу по построению процессов и технологий вокруг нового продукта на рынке.
Мы строим независимый e-com — единый мультиканальный сервис Альфа-Селлер.
Он объединит инструменты для работы на маркетплейсах, полный спектр решений для создания собственного интернет – магазина и управление кросс - канальными продажами в одном пространстве.
Наша ключевая задача — помочь селлерам снизить зависимость от отдельных площадок и выстроить устойчивую стратегию развития бизнеса.
Мы уже запустили e-com в Альфа-Банке и нашими продуктами воспользовались более 4000 селлеров.
Сейчас в нашей команде открыта позиция Data Engineer.
Задачи:
-
Проектирование и внедрение систем управления качеством данных (Data Quality Frameworks).
-
Поддержка и развитие каталогов данных (data catalog, lineage, схемы, владельцы, описания).
-
Архитектура и реализация витрин данных для аналитики, ML и AI-агентов.
-
Поддержка и написание пайплайнов ETL/ELT (Airflow / Spark / Kafka / etc.).
-
Настройка мониторинга качества данных: completeness, freshness, accuracy, consistency.
-
Работа с инструментами автоматической проверки данных (Great Expectations, Soda, dbt tests и др.).
-
Взаимодействие с командами DE, аналитики, ML и продуктов для обеспечения доверия к данным.
-
Сопровождение инициатив по data privacy, security, compliance (GDPR, SOC2, PII, etc.).
Что мы ожидаем:
-
3+ лет опыта в области Data Engineering, Data Governance, Data Quality или Data Platform.
-
Отличное знание SQL, уверенное владение Python.
-
Опыт внедрения и поддержки data catalog / data lineage (OpenMetaData).
-
Опыт написания ETL на БД Clickhouse.
-
Опыт внедрения фреймворков для валидации и контроля качества данных.
-
Опыт работы с инструментами: Great Expectations, Deequ, Soda, Monte Carlo, dbt tests.
-
Навыки построения документации и стандартов по качеству данных, SLA, ownership моделей.
Будет преимуществом:
-
Опыт работы в компаниях с распределенной архитектурой данных
-
Опыт с генеративным ИИ - структурирование и валидация входных/выходных данных для LLM.
Что мы предлагаем:
-
Официальное трудоустройство по ТК РФ;
-
Работа в аккредитованной ИТ-компании;
-
Стабильный и прозрачный доход: размер заработной платы обсуждается по итогам собеседования
-
Гибридный формат работы 5/2. Удобное рабочее место: наш современный офис находится в банковском кластере в 3-х минутах ходьбы от метро Технопарк. Рядом большой выбор кафе и ресторанов, где ты сможешь разнообразно пообедать с коллегами, сменить обстановку и “перезагрузиться”
-
Среду для твоего неизбежного развития: тебя ждут сложные и интересные задачи с использованием большого массива данных, у нас регулярно проходят тренинги, вебинары, у тебя будет доступ к бесплатным корпоративным библиотекам Альпины и бизнес - изданий, скидки на курсы иностранных языков
-
Карьерный рост: ты будешь понимать, что нужно сделать для перехода на другой уровень
-
Чувство локтя: у нас дружелюбная атмосфера и команда лучших профессионалов, которые готовы делиться с тобой экспертизой
-
Заботу о твоем здоровье: программа ДМС, куда входит стоматология и обслуживание в лучших клиниках города, скидки на абонементы в фитнес-клубы, неформальные спортивные сообщества. Также есть фитнес-зал в офисе
-
Возможности для разнообразного досуга: скидки на услуги туристических агентств, продукты питания, в рестораны и бары, в магазины и салоны красоты
#аутстаф
Ищем 1 Senior Data инженер
(ID 82925)
Требования:
- От 3 лет коммерческой разработки, от 2 лет - разработка систем, которые вышли в промышленную эксплуатацию, от 2 лет - BigData;
- Глубокие теоретические знания стека технологий и практический опыт;
- Умение давать и принимать обратную связь;
- Опыт работы с бизнес требованиями (сбор, формирование требований, анализ), опыт работы в условиях постоянно меняющихся требований;
- Опыт написания программ распределенных вычислений (Spark) и ETL процессов;
- Опыт проведения Code Review;
- Опыт/понимание разработки и проектирования архитектуры БД, создание и манипуляции с БД;
- Опыт оптимизации запросов;
- Понимание процессов CI/CD;
- Опыт оптимизации запросов;
- Опыт написания unit тестов;
- Стек: Python 3.5+ Spark 2.2+ Hadoop Hive Airflow Kubernetes (K8S) SQLAlchemy, PostgresQL, Greenplum PyTest / Unittest Flake8 / PyLint Black Docker Git, GitLab, CI / CD, разрешение конфликтов Shell, Linux.
Задачи:
- Разработка низкоуровневой архитектуры систем больших данных, на основании информации полученной от аналитиков и архитекторов;
- Разработка документа, описывающего низкоуровневую архитектуру разрабатываемых систем больших данных;
- Разработка программного кода систем больших данных;
- Подготовка документации, описывающей алгоритмы разработанных систем больших данных;
- Разработка Unit тестов для программного кода систем больших данных;
- Подготовка и сборка установочных пакетов, для установки разработанных решений на промышленную среду;
- Проведение плановых работ по оптимизации программного кода разработанных систем больших данных;
- Исправление дефектов в разработанных приложениях;
- Подготовка и выпуск пакетов обновлений, включающих в себя исправление дефектов и оптимизацию программного кода систем больших данных.
О проекте:
Крупный ритейлер
Локация: Любая
Время работы: UTC+3
Гражданство: Любое
Формат: Удаленно
Срок привлечения: до 31.10.2026 (с пролонгацией)
📨 Регистрируйтесь, загружайте резюме на https://skillstaff.ru и оставляйте отклик на запрос
❗️Все актуальные запросы — здесь
ID 3415 — Senior Инженер систем больших данных
🌍 Локация: Любая
💼 Удаленно
🕔 Занятость: фулл тайм
🏢 Проект: Х5
💡 Требования:
Все требования должны быть отражены в резюме!
- От 3 лет коммерческой разработки от 2 лет.
- Разработка систем, которые вышли в промышленную эксплуатацию от 2 лет.
- BigData: глубокие теоретические знания стека технологий и практический опыт.
- Умение давать и принимать обратную связь.
- Опыт работы с бизнес-требованиями (сбор, формирование требований, анализ).
- Опыт работы в условиях постоянно меняющихся требований.
- Опыт написания программ распределенных вычислений (Spark) и ETL процессов.
- Опыт проведения Code Review.
- Опыт/понимание разработки и проектирования архитектуры БД, создание и манипуляции с БД.
- Опыт оптимизации запросов.
- Понимание процессов CI/CD.
- Опыт оптимизации запросов.
- Опыт написания unit тестов.
- Python 3.5+ Spark 2.2+ Hadoop Hive Airflow Kubernetes (K8S) SQLAlchemy, PostgresQL, Greenplum PyTest / Unittest Flake8 / PyLint Black Docker Git, GitLab, CI / CD, разрешение конфликтов Shell, Linux
📋Задачи:
- Разработка низкоуровневой архитектуры систем больших данных, на основании информации полученной от аналитиков и архитекторов.
- Разработка документа, описывающего низкоуровневую архитектуру разрабатываемых систем больших данных.
- Разработка, программного кода систем больших данных.
- Подготовка документации, описывающей алгоритмы разработанных систем больших данных.
- Разработка Unit Тестов для программного кода систем больших данных.
- Подготовка и сборка установочных пакетов, для установки разработанных решений на промышленную среду.
- Проведение плановых работ по оптимизации программного кода разработанных систем больших данных.
- Исправление дефектов в разработанных приложениях.
- Подготовка и выпуск пакетов обновлений, включающих в себя исправление дефектов и оптимизацию программного кода систем больших данных.
📨 Отклик — через форму: https://forms.gle/qxF3H1eiV4E4T7p19 или напрямую рекрутеру: @Veroneko
❗️Откликайтесь только при релевантном опыте.
❗️При первичном отклике:
ID вакансии / ФИО / локация / возраст / занятость (работаете/нет) / формат работы (удаленка, гибрид, офис) / стек / опыт / резюме / сверка с требованиями
❗️Повторный отклик: ID вакансии + сверка.
#Data #Удаленно #вакансия
Кто такой Data Engineer
Data Engineer строит трубопроводы, по которым в компании движутся данные. Он собирает ETL/ELT-процессы, поднимает потоковую обработку, проектирует data lake и хранилища так, чтобы аналитикам и моделям всегда были доступны свежие, чистые и согласованные данные. В связке ML/AI дата-инженер обслуживает обучение моделей (Data Science и ML) и аналитику, а не отчётность ради отчётности.
Любая работа с данными упирается в их доставку: пока сырые логи не превращены в удобные таблицы, ни аналитик, ни модель ничего полезного не сделают. Кто-то должен наладить регулярную загрузку из десятков источников, справиться с объёмами и опозданиями данных, обеспечить качество и не дать пайплайну молча сломаться ночью. Это инженерная роль с прочным программистским фундаментом и вниманием к надёжности.
Требования и стек
Стек — про оркестрацию, обработку и хранение больших объёмов.
- Оркестрация: Airflow, Prefect, Dagster.
- Обработка: Apache Spark и Flink — батч и стриминг; dbt для трансформаций.
- Стриминг: Kafka, Pulsar, Kinesis.
- Хранение: data lake и lakehouse на Delta, Iceberg, Hudi поверх S3/GCS; ClickHouse, BigQuery, Snowflake, Greenplum.
- Языки: Python и Scala для пайплайнов, уверенный SQL.
Граница с соседями проходит по цели пайплайна: строить аналитический слой для отчётности — это работа BI / DWH специалистов; универсальная доставка данных для ML, приложений и озера — территория дата-инженера. Специализация на одном компоненте — например, только на Spark или только на Kafka — тоже считается дата-инженерией, а не отдельной профессией.
Что ждут от кандидата
Главный вход в профессию — прийти из backend-разработки: если вы уверенно пишете на Python или Scala и понимаете базы данных, дата-инженерия — логичный следующий шаг. Второй путь — из аналитики или из администрирования БД, где уже привыкли работать с SQL и большими выборками.
Что проверяют на собеседовании:
- SQL продвинутого уровня и понимание, как устроены СУБД внутри (индексы, планы, партиционирование);
- проектирование пайплайна: идемпотентность, обработка опоздавших данных, повторные запуски;
- опыт с распределённой обработкой — Spark или стриминг через Kafka;
- внимание к надёжности и качеству данных, а не только к тому, что «джоба зелёная».
Сильное преимущество — показать реальный пайплайн: источник, оркестрация, трансформация, хранилище. Даже учебный сквозной проект на открытых данных демонстрирует инженерное мышление лучше списка технологий — вынесите его в резюме первым пунктом.
Зарплаты и спрос
Медианная зарплата — 277 500 ₽ по вакансиям за последние 30 дней. Подробная статистика зарплат Data Engineer.
Смотрите также в каталоге
Хотите персональную подборку?
Введите свои критерии — мы отфильтруем вакансии по вашим требованиям
Найти подходящие вакансии →