• Опыт анализа данных - изучение семантики и связи таблиц и объектов данных, характеризующих общие бизнес-процессы, но находящихся в разных хранилищах, выявления причин расхождения семантически эквивалентных данных в разных хранилищах.
Неизвестный работодатель · На сервисе с: 12.08.26 09:32
ID 3352 — Middle Data Engineer
🌍 Локация/гражданство: РФ
💼 Удаленно
🕔 Занятость: фулл тайм
🏢 Проект: Альфа
☢️ Плановая дата старта работ ••••••••
💡 Требования:
• Опыт анализа данных - изучение семантики и связи таблиц и объектов данных, характеризующих общие бизнес-процессы, но находящихся в разных хранилищах, выявления причин расхождения семантически эквивалентных данных в разных хранилищах.
• Высокий уровень знаний языка программирования Python – структуры данных, итераторы и декораторы, параллельное и асинхронное программирование, объектно-ориентированное и функциональное программирование.
• Опыт работы в среде JupyterLab/JupyterHub.
• Опыт реализации промышленных отказоустойчивых сервисов на Python – сервисы пакетной загрузки и трансформации данных (ETL) на платформах Apache Airflow, Argo Workflows; веб-сервисы на основе библиотеки FastAPI.
• Понимание принципов микросервисной архитектуры.
• Понимание принципов распределенных вычислений и обработки данных.
• Понимание принципов потоковой обработки данных.
• Хорошие знания платформы Apache Spark – опыт использования библиотеки pyspark, влияние конфигурации приложения pyspark на производительность и эффективность обработки данных, отладка и анализ эффективности приложений pyspark с помощью Spark History Server.
• Знание и опыт использования платформы потоковой обработки данных Apache Kafka – чтение и запись потока данных Apache Kafka с помощью библиотек aiokafka, confluent-kafka, kafka-python, разработка потоковых приложений Apache Spark Structured Streaming.
• Опыт асинхронного программного взаимодействия с веб-сервисами по REST API с использованием библиотек – aiohttp, httpx.
• Отличные знания SQL – создание сложных запросов с использованием табличных выражений (CTE) и оконных функций.
• Хорошие знания и опыт использования реляционных баз данных Oracle, PostgreSQL
• Понимание особенностей обработки и хранения аналитических данных (OLAP), понимание отличий колоночных баз данных от строковых, знание колоночных форматов хранения данных – parquet, orc
• Хорошие знания и опыт использования хранилищ больших данных – Hadoop/HDFS, S3, форматы таблиц Hive, Iceberg
⭐️Личностные и коммуникативные навыки (Soft Skills)
• Проактивный подход к работе – способность и желание искать и предлагать методы и варианты решения задач.
• Общий позитивный настрой и активная жизненная позиция.
• Умение и желание работать в команде, делиться опытом с коллегами и учиться новым практикам.
• Открытость в коммуникации трудностей, препятствующих решению задач.
📨 Отклик — через форму: •••••••• или напрямую рекрутеру: ••••••••
❗️Откликайтесь только при релевантном опыте.
❗️При первичном отклике:
ID вакансии / ФИО / локация / возраст / занятость (работаете/нет) / формат работы (удаленка, гибрид, офис) / стек / опыт / резюме / сверка с требованиями
❗️Повторный отклик: ID вакансии + сверка.
#Data #Engineer #Удаленно #вакансия
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.