Data Engineer — свежие вакансии
Обновляется каждый час. Найдено: 124 вакансии за последнюю неделю.
- Вакансий за неделю:
- 124
- Медиана:
- 277 500 ₽
- Вилка:
- 207 135 ₽ — 360 000 ₽
Зарплаты — по 90 вакансиям с указанной вилкой за 30 дней
HireSeeker — агрегатор вакансий. Собираем вакансии со всех основных площадок и показываем по вашей специальности. Подпишитесь на ежедневную подборку только релевантных.
🧠😘😀😘😘🥰😀🫢
Data инженер
Грейд: Senior
Локация специалиста: РФ
Загрузка специалиста Full-time
• Гражданство: РФ
• Формат работы: удалённо
Описание проекта:
Разработка и развитие систем больших данных с использованием Python, Spark, Hadoop и современных инструментов обработки и хранения данных. Проект включает разработку низкоуровневой архитектуры, программного кода, ETL-процессов, оптимизацию и выпуск решений в промышленную эксплуатацию.
Задачи на проекте:
● Разработка низкоуровневой архитектуры систем больших данных на основании требований аналитиков и архитекторов.
● Подготовка документации по низкоуровневой архитектуре.
● Разработка программного кода систем больших данных.
● Разработка программ распределённых вычислений на Spark.
● Разработка и сопровождение ETL-процессов.
● Подготовка документации по алгоритмам разработанных систем.
● Разработка Unit-тестов.
● Подготовка и сборка установочных пакетов для промышленной среды.
● Проведение плановых работ по оптимизации программного кода.
● Исправление дефектов в разработанных приложениях.
● Подготовка и выпуск пакетов обновлений, включающих исправления и оптимизацию кода.
● Проведение Code Review.
Требования:
● От 3 лет коммерческой разработки.
● От 2 лет разработки систем, вышедших в промышленную эксплуатацию.
● От 2 лет опыта работы с Big Data.
● Глубокие теоретические знания и практический опыт работы со стеком технологий.
● Опыт работы с бизнес-требованиями: сбор, формирование и анализ.
● Опыт работы в условиях постоянно меняющихся требований.
● Умение давать и принимать обратную связь.
● Опыт написания программ распределённых вычислений на Spark.
● Опыт разработки ETL-процессов.
● Опыт проведения Code Review.
● Опыт или понимание разработки и проектирования архитектуры БД.
● Опыт создания и работы с БД.
● Опыт оптимизации SQL-запросов.
● Понимание процессов CI/CD.
● Опыт написания Unit-тестов.
● Python 3.5+.
● Spark 2.2+.
● Hadoop, Hive.
● Airflow.
● Kubernetes (K8S).
● SQLAlchemy.
● PostgreSQL, Greenplum.
● PyTest / Unittest.
● Flake8 / PyLint, Black.
● Docker.
● Git, GitLab, CI/CD.
● Умение разрешать конфликты в Git.
● Shell, Linux.
Digital Chief — IT-хаб новой ecom-платформы от Альфа-Банка, где мы объединяем экспертизу по построению процессов и технологий вокруг нового продукта на рынке.
Мы строим независимый e-com — единый мультиканальный сервис Альфа-Селлер.
Он объединит инструменты для работы на маркетплейсах, полный спектр решений для создания собственного интернет – магазина и управление кросс - канальными продажами в одном пространстве.
Наша ключевая задача — помочь селлерам снизить зависимость от отдельных площадок и выстроить устойчивую стратегию развития бизнеса.
Мы уже запустили e-com в Альфа-Банке и нашими продуктами воспользовались более 4000 селлеров.
Сейчас в нашей команде открыта позиция Data Engineer.
Задачи:
-
Проектирование и внедрение систем управления качеством данных (Data Quality Frameworks).
-
Поддержка и развитие каталогов данных (data catalog, lineage, схемы, владельцы, описания).
-
Архитектура и реализация витрин данных для аналитики, ML и AI-агентов.
-
Поддержка и написание пайплайнов ETL/ELT (Airflow / Spark / Kafka / etc.).
-
Настройка мониторинга качества данных: completeness, freshness, accuracy, consistency.
-
Работа с инструментами автоматической проверки данных (Great Expectations, Soda, dbt tests и др.).
-
Взаимодействие с командами DE, аналитики, ML и продуктов для обеспечения доверия к данным.
-
Сопровождение инициатив по data privacy, security, compliance (GDPR, SOC2, PII, etc.).
Что мы ожидаем:
-
3+ лет опыта в области Data Engineering, Data Governance, Data Quality или Data Platform.
-
Отличное знание SQL, уверенное владение Python.
-
Опыт внедрения и поддержки data catalog / data lineage (OpenMetaData).
-
Опыт написания ETL на БД Clickhouse.
-
Опыт внедрения фреймворков для валидации и контроля качества данных.
-
Опыт работы с инструментами: Great Expectations, Deequ, Soda, Monte Carlo, dbt tests.
-
Навыки построения документации и стандартов по качеству данных, SLA, ownership моделей.
Будет преимуществом:
-
Опыт работы в компаниях с распределенной архитектурой данных
-
Опыт с генеративным ИИ - структурирование и валидация входных/выходных данных для LLM.
Что мы предлагаем:
-
Официальное трудоустройство по ТК РФ;
-
Работа в аккредитованной ИТ-компании;
-
Стабильный и прозрачный доход: размер заработной платы обсуждается по итогам собеседования
-
Гибридный формат работы 5/2. Удобное рабочее место: наш современный офис находится в банковском кластере в 3-х минутах ходьбы от метро Технопарк. Рядом большой выбор кафе и ресторанов, где ты сможешь разнообразно пообедать с коллегами, сменить обстановку и “перезагрузиться”
-
Среду для твоего неизбежного развития: тебя ждут сложные и интересные задачи с использованием большого массива данных, у нас регулярно проходят тренинги, вебинары, у тебя будет доступ к бесплатным корпоративным библиотекам Альпины и бизнес - изданий, скидки на курсы иностранных языков
-
Карьерный рост: ты будешь понимать, что нужно сделать для перехода на другой уровень
-
Чувство локтя: у нас дружелюбная атмосфера и команда лучших профессионалов, которые готовы делиться с тобой экспертизой
-
Заботу о твоем здоровье: программа ДМС, куда входит стоматология и обслуживание в лучших клиниках города, скидки на абонементы в фитнес-клубы, неформальные спортивные сообщества. Также есть фитнес-зал в офисе
-
Возможности для разнообразного досуга: скидки на услуги туристических агентств, продукты питания, в рестораны и бары, в магазины и салоны красоты
#аутстаф
Ищем 1 Senior Data инженер
(ID 82925)
Требования:
- От 3 лет коммерческой разработки, от 2 лет - разработка систем, которые вышли в промышленную эксплуатацию, от 2 лет - BigData;
- Глубокие теоретические знания стека технологий и практический опыт;
- Умение давать и принимать обратную связь;
- Опыт работы с бизнес требованиями (сбор, формирование требований, анализ), опыт работы в условиях постоянно меняющихся требований;
- Опыт написания программ распределенных вычислений (Spark) и ETL процессов;
- Опыт проведения Code Review;
- Опыт/понимание разработки и проектирования архитектуры БД, создание и манипуляции с БД;
- Опыт оптимизации запросов;
- Понимание процессов CI/CD;
- Опыт оптимизации запросов;
- Опыт написания unit тестов;
- Стек: Python 3.5+ Spark 2.2+ Hadoop Hive Airflow Kubernetes (K8S) SQLAlchemy, PostgresQL, Greenplum PyTest / Unittest Flake8 / PyLint Black Docker Git, GitLab, CI / CD, разрешение конфликтов Shell, Linux.
Задачи:
- Разработка низкоуровневой архитектуры систем больших данных, на основании информации полученной от аналитиков и архитекторов;
- Разработка документа, описывающего низкоуровневую архитектуру разрабатываемых систем больших данных;
- Разработка программного кода систем больших данных;
- Подготовка документации, описывающей алгоритмы разработанных систем больших данных;
- Разработка Unit тестов для программного кода систем больших данных;
- Подготовка и сборка установочных пакетов, для установки разработанных решений на промышленную среду;
- Проведение плановых работ по оптимизации программного кода разработанных систем больших данных;
- Исправление дефектов в разработанных приложениях;
- Подготовка и выпуск пакетов обновлений, включающих в себя исправление дефектов и оптимизацию программного кода систем больших данных.
О проекте:
Крупный ритейлер
Локация: Любая
Время работы: UTC+3
Гражданство: Любое
Формат: Удаленно
Срок привлечения: до 31.10.2026 (с пролонгацией)
📨 Регистрируйтесь, загружайте резюме на https://skillstaff.ru и оставляйте отклик на запрос
❗️Все актуальные запросы — здесь
ID 3415 — Senior Инженер систем больших данных
🌍 Локация: Любая
💼 Удаленно
🕔 Занятость: фулл тайм
🏢 Проект: Х5
💡 Требования:
Все требования должны быть отражены в резюме!
- От 3 лет коммерческой разработки от 2 лет.
- Разработка систем, которые вышли в промышленную эксплуатацию от 2 лет.
- BigData: глубокие теоретические знания стека технологий и практический опыт.
- Умение давать и принимать обратную связь.
- Опыт работы с бизнес-требованиями (сбор, формирование требований, анализ).
- Опыт работы в условиях постоянно меняющихся требований.
- Опыт написания программ распределенных вычислений (Spark) и ETL процессов.
- Опыт проведения Code Review.
- Опыт/понимание разработки и проектирования архитектуры БД, создание и манипуляции с БД.
- Опыт оптимизации запросов.
- Понимание процессов CI/CD.
- Опыт оптимизации запросов.
- Опыт написания unit тестов.
- Python 3.5+ Spark 2.2+ Hadoop Hive Airflow Kubernetes (K8S) SQLAlchemy, PostgresQL, Greenplum PyTest / Unittest Flake8 / PyLint Black Docker Git, GitLab, CI / CD, разрешение конфликтов Shell, Linux
📋Задачи:
- Разработка низкоуровневой архитектуры систем больших данных, на основании информации полученной от аналитиков и архитекторов.
- Разработка документа, описывающего низкоуровневую архитектуру разрабатываемых систем больших данных.
- Разработка, программного кода систем больших данных.
- Подготовка документации, описывающей алгоритмы разработанных систем больших данных.
- Разработка Unit Тестов для программного кода систем больших данных.
- Подготовка и сборка установочных пакетов, для установки разработанных решений на промышленную среду.
- Проведение плановых работ по оптимизации программного кода разработанных систем больших данных.
- Исправление дефектов в разработанных приложениях.
- Подготовка и выпуск пакетов обновлений, включающих в себя исправление дефектов и оптимизацию программного кода систем больших данных.
📨 Отклик — через форму: https://forms.gle/qxF3H1eiV4E4T7p19 или напрямую рекрутеру: @Veroneko
❗️Откликайтесь только при релевантном опыте.
❗️При первичном отклике:
ID вакансии / ФИО / локация / возраст / занятость (работаете/нет) / формат работы (удаленка, гибрид, офис) / стек / опыт / резюме / сверка с требованиями
❗️Повторный отклик: ID вакансии + сверка.
#Data #Удаленно #вакансия
В Центре робототехники Сбера мы создаем роботов и системы ИИ, которым нужны большие и аккуратно подготовленные наборы данных. Data Conveyor Team отвечает за путь этих данных от сырых записей до формата, с которым могут работать ML-команды. Сейчас нам нужен Software Engineer, который будет превращать записи с роботов и внешние датасеты в понятный, проверяемый и воспроизводимый формат для обучения моделей.
Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика ждите сообщение от него, диалог займёт примерно 10 минут. Задача AI-рекрутера — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. AI-рекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным для всех!
-
проектировать и реализовывать пайплайны, которые превращают данные из разных источников в формат, пригодный для обучения моделей
-
стабилизировать основной путь конвертации данных с роботов: единый поддерживаемый процесс, проверяемые результаты, повторяемые запуски и понятные отчеты об ошибках
-
поддерживать dataset schema, versioning, compatibility checks, validators и manifests
-
подключать новые источники данных: записи с роботов, внешние датасеты, симуляции, egocentric data, данные тестовых запусков и корректирующих демонстраций
-
обеспечивать reproducible dataset builds и связь source data -> converted episodes -> filtered dataset -> dataset release -> training run -> benchmark result
-
создавать validation suite: проверка файлов, video/parquet layout, timestamps, required fields, metadata, annotation status и known historical variants
-
готовить данные к передаче в обучение так, чтобы ML-команды понимали состав датасета, ограничения, версию и качество
-
делать надежные CLI/tools, тесты, runbooks и отладочные отчеты для исследователей и инженеров.
-
сильный Python и опыт разработки batch / data processing pipelines
-
опыт backend, data engineering или software engineering для внутренних платформ и ML/data workflows
-
опыт работы с большими файлами, metadata manifests, reproducible builds и validation logic
-
практический опыт с Linux, Docker, Git, CI/CD и командной строкой
-
понимание storage и data formats: S3/object storage, network storage, parquet, zarr, hdf5, webdataset, video files или аналогичные форматы
-
умение разбираться в нестандартных форматах данных и приводить их к строгому контракту
-
готовность писать поддерживаемый production-like код, а не одноразовые conversion scripts.
Будет плюсом:
-
опыт с LeRobot, RLDS, DROID / Bridge / RT-X-like datasets, ROS bags или robotics trajectories
-
опыт с Ray, Airflow, Prefect, Kubernetes, SLURM, LSF или другими orchestration / job systems
-
опыт с W&B, MLflow, Hydra configs, experiment tracking или dataset management systems
-
понимание computer vision, multimodal data, VLA, imitation learning или robot learning
-
навыки работы с генеративными AI-моделями
-
опыт создания AI-агентов и использования их в работе будет преимуществом
-
опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов
-
инструментальное владение AI для анализа, генерации и автоматизации.
-
офисный формат работы, адрес офиса Автозаводская 23а к2
-
ежегодный пересмотр зарплаты, квартальная и годовая премия
-
корпоративный спортзал и зоны отдыха
-
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
-
программа адаптации и помощь руководителя на старте
-
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
-
гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
-
подписка Прайм с возможностью совместного использования на трёх близких
-
вознаграждение за рекомендацию друзей в команду Сбера.
Senior Analytics Engineer / Plummy Games ✅
Remote
Plummy Games is a casual mobile games developer and publisher.
Требования к кандидату:
- 3-5 years of experience in mobile gaming industry
- Strong SQL skills for data modeling and extraction
- Solid Python skills for data loading and DBT
- Hands-on experience with BI tools (Looker/Omni preferred)
- Experience with Git for collaboration and code quality
- Advanced English proficiency (spoken and written)
Читать подробнее:
→ Откликнуться тут
Вот уже 10 лет divan.ru каждый день работает, стараясь сделать мир еще удобнее, мягче и счастливее. Ведь жизнь в каждом доме начинается с мебели.
Мы динамично растем каждый год и не собираемся останавливаться. Сегодня мы уже глобальная компания с филиалами в Республике Беларусь, Казахстане, Узбекистане и мы только в начале нашего захватывающего пути.
Нам важно чтобы в нашей команде работали сотрудники, искренне разделяющие миссию компании, готовые ежедневно делать наших клиентов счастливее.
Обязанности:
- Разработка и сопровождение ETL/ELT-процессов.
- Подключение новых источников данных.
- Разработка моделей данных в PostgreSQL / ClickHouse.
- Развитие Data Warehouse и витрин данных.
- Оптимизация тяжелых SQL-запросов и ETL-процессов.
- Контроль качества и полноты данных.
- Мониторинг и устранение проблем в загрузках.
- Участие в проектировании архитектуры аналитической платформы.
- Взаимодействие с BI-разработчиками и аналитиками.
Обязательно
- От 2–3 лет опыта в Data Engineering / DWH / ETL.
- Уверенный SQL.
- Хорошее знание PostgreSQL или другой промышленной реляционной СУБД.
- Python для разработки ETL/ELT-процессов.
- Опыт работы с Apache Airflow или аналогичными оркестраторами.
- Понимание принципов построения DWH и аналитических витрин.
- Опыт работы с большими объемами данных.
- Понимание принципов оптимизации SQL-запросов.
- Опыт работы с Git.
- Умение самостоятельно разбираться в проблемах загрузки и качества данных.
Будет преимуществом
- Опыт работы с ClickHouse.
- Опыт работы с Data Vault.
- Опыт работы с dbt.
- Опыт контейнеризации с Docker.
- Опыт настройки CI/CD.
- Опыт работы с GitLab CI/CD.
- Опыт построения data quality checks.
- Опыт работы с Power BI или другими BI-системами.
- Опыт работы с SQL Server.
- Опыт интеграции данных из API и внешних информационных систем.
-
Много доверия и ответственности;
-
Широкий спектр интересных и амбициозных задач;
-
Быструю реализацию полезных идей без бюрократии;
- Удаленный формат работы;
- Обучение и наставничество от опытных коллег с первого дня работы;
-
Оформление по ГПХ в компанию ООО «Диван Трейд».
Обязанности
- Проектирование и разработка отказоустойчивых ETL/ELT процессов в экосистеме Hadoop и Oracle
- Оптимизация и сопровождение пайплайнов данных (Spark, PySpark, Airflow)
- Интеграция новых источников данных и построение витрин для бизнес-заказчиков
- Обеспечение качества и актуальности данных в продуктивных системах
- Участие в архитектурных решениях по хранению и обработке больших данных
- Ad-hoc аналитика и поддержка команд аналитиков и data scientist
Требования
- Высшее техническое образование (или завершающая стадия обучения)
- Опыт разработки на Python (написание скриптов, работа с библиотеками pandas, requests) от 6 месяцев (в т.ч. в рамках учебных проектов или стажировок)
- Уверенное знание SQL (написание сложных запросов, оконные функции, понимание планов выполнения, нормализация БД)
- Понимание основ архитектуры больших данных (понятия ETL/ELT, колоночные и реляционные хранилища, форматы хранения Parquet/ORC)
- Знакомство с концепциями оркестрации (Airflow) или опыт настройки простых пайплайнов в учебных целях
- Понимание принципов работы с системами контроля версий (Git) и умение работать в команде над кодом
- Базовые навыки работы в Linux (навигация по файловой системе, права доступа, простые bash-скрипты)
- Готовность к быстрому освоению технологий экосистемы Hadoop/Spark
- Навыки самостоятельного поиска информации и решения технических задач
- Опыт использования LLM-агентов и AI-ассистентов (например, Cursor, Claude Code) для генерации, рефакторинга и отладки инженерного кода
Data Engineer / ML Data Engineer для VLM-моделей
Мы в Центре Робототехники Сбера создаем универсальный воплощенный ИИ для роботов, который будет управлять разнообразными физическими воплощениями: манипуляторами, мобильными колесными роботами, роботами-собаками, мобильными манипуляторами и другими робототехническими платформами.
Сейчас мы ищем в команду специалиста уровня middle/senior.
Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика ждите сообщение от него в Сберчате, диалог зайдёт примерно 10 минут. Задача AI-рекрутера — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. AI-рекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным для всех!
-
подготовка и развитие датасетов для обучения VLM-моделей навыкам планирования и взаимодействия с роботом.Сбор, очистка, структурирование и валидация данных экспериментов, результатов работы моделей
-
формирование новых обучающих выборок на основе анализа ошибок моделей и потребностей расширения функционала системы
-
разработка пайплайнов для автоматизации сбора, фильтрации, разметки, проверки качества и версионирования данных
-
курирование разметки данных: подготовка инструкций, контроль качества
-
взаимодействие с ML-исследователями и инженерами для подготовки данных под обучение, дообучение и оценку моделей
-
обучение моделей.
-
опыт работы с подготовкой и обработкой данных для ML-задач
-
уверенное владение Python и библиотеками для работы с данными (Pandas, NumPy и аналогами)
-
опыт автоматизации процессов подготовки данных и разработки пайплайнов обработки данных
-
понимание принципов контроля качества датасетов и воспроизводимости экспериментов
-
опыт работы с Docker, Linux, Git
-
понимание машинного обучения и подготовки данных для обучения моделей
-
навыки работы с генеративными AI-моделями, опыт создания AI-агентов и использование их в работе будет преимуществом
-
опыт использования GigaChat, Kandinsky и аналогов в продуктах
-
инструментальное владение Ai для анализа, генерации и автоматизации
-
готовность разбираться в предметной области робототехники, VLM-моделей и мультимодальных данных.
Будет плюсом
-
опыт подготовки данных для ML, NLP, CV или мультимодальных моделей
-
опыт работы с данными для обучения LLM/VLM-моделей
-
опыт работы с DVC, MLflow, ClearML или другими инструментами для управления экспериментами и датасетами.
-
офисный/гибридный формат, адрес Автозаводская 23а к2
-
ежегодный пересмотр зарплаты и годовая премия
-
расширенный ДМС и льготное страхование для семьи
-
уникальная система обучения Сбера для профессионального и карьерного развития
-
выгодная ипотека для сотрудников
-
подписка Прайм с возможностью совместного использования на трёх близких
-
вознаграждение за рекомендацию друзей в команду Сбера.
Прикладная аналитическая платформа "Блока Риски" — это решение, позволяющее создавать аналитические витрины на Облаке Данных по различным направлениям бизнеса, таким как:
- Расчет оптимальных стратегий взыскания.
- Расчет предложений по реструктуризации.
- Расчет компонентов кредитного риска PD, LGD, EAD.
- Ускорение расчета RWA.
- Процесс калибровки промышленных моделей.
- Аналитика по портфелю, взысканию и фроду.
У нас более 120 витрин, 2000+ потоков загрузки данных, 1200 нод, 40 000 ядер и 25+ петабайт данных.
Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры.
ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!
Обязанности
- Участие в проектировании и разработке витрин и хранилищ данных.
- Участие в проектировании и реализации инструментов автоматизации разработки.
- Участие в доработке промышленных витрин данных.
Требования
- Опыт работы от 2-х лет с одной или несколькими СУБД: Oracle, MS SQL, Teradata либо СУБД стэка Bigdata.
- Опыт работы в роли аналитика с функцией подготовки выгрузки данных для заказчика.
- Уверенное знание SQL: сложные запросы, аналитические функции, понимание физической реализации join’ов, оптимизация производительности запросов.
- Знание одного или нескольких языков программирования: PL/SQL, T-SQL, Java, Python, Scala на уровне переменных, процедур, функций, циклов, условных операторов.
- Знание одного или нескольких ETL-инструментов: Informatica, MS SSIS, SAS, ODI.
- Понимание принципов организации хранилищ данных, подходов к проектированию логической и физической моделей, понимание основной проблематики хранилищ и подходов к решению.
Условия
- Возможность выбрать офис рядом со станцией метро Кутузовская или Тульская.
- Формат работы: фултайм офис.
- Ежегодный пересмотр зарплаты и годовая премия.
- Корпоративный спортзал и зоны отдыха.
- Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
- Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
- Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ.
- Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров.
- Вознаграждение за рекомендацию друзей в команду Сбера.
Работа в Сбере – это
Технологии
Участие в развитии инноваций на базе ИИ
Развитие
Акселераторы для стартапов, хакатоны и регулярные митапы от лидеров направлений
Комфортный офис
Креативные пространства для работы, спортзалы, зоны для отдыха и перезагрузки
Сообщество
Возможность найти союзников по любым интересам
Мы ищем Senior Data Engineer, который будет отвечать за инфраструктуру, пайплайны и качество данных для обучения современных Vision-Language Models. Роль находится на стыке data engineering и ML: нужно будет работать с большими мультимодальными датасетами, понимать потребности исследователей и ML-инженеров, строить пайплайны очистки, фильтрации, категоризации и генерации данных, а также обеспечивать воспроизводимый экспорт данных в формат для обучения моделей.
- Собирать и структурировать потребности ML-команды в данных: какие данные нужны для обучения, дообучения, оценки и улучшения VLM.
- Предлагать и реализовывать идеи пайплайнов очистки, фильтрации, дедупликации, категоризации и генерации данных.
- Ориентироваться в современных практиках построения датасетов для Vision-Language Models: image-text pairs, synthetic data, filtering, quality scoring, data mixture design, dataset versioning.
- Отвечать за инфраструктуру хранения и подготовки данных, включая:
- импорт данных из различных источников: production, Common Crawl, open-source datasets, generated data;
- валидацию и контроль качества данных;
- хранение и версионирование датасетов;
- экспорт данных в форматы, пригодные для обучения моделей.
-
Проектировать и реализовывать пайплайны обработки данных на большом масштабе, включая десятки миллиардов изображений.
-
Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM.
-
Собирать статистику по данным, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов.
-
Обеспечивать воспроизводимость, наблюдаемость и надёжность data-процессов.
-
Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой.
-
Сильный опыт в data engineering и построении production-grade data pipelines.
-
Уверенное владение Python, включая multiprocessing, multithreading и async-подходы.
-
Опыт работы с большими объёмами данных и распределённой обработкой.
-
Практический опыт с объектными хранилищами, в частности S3 или аналогами.
-
Опыт работы с YTsaurus или похожими системами для распределённого хранения и обработки данных.
-
Понимание принципов валидации, очистки, дедупликации и версионирования датасетов.
-
Опыт работы с DVC, Git, Docker.
-
Опыт работы с PostgreSQL или другими реляционными базами данных.
-
Умение проектировать устойчивые пайплайны: от импорта данных до финального экспорта в training-ready формат.
-
Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения.
-
Готовность работать на стыке engineering и ML research.
Будет плюсом
-
Опыт работы с мультимодальными данными: изображения, текст, image-text pairs, captions, OCR, metadata.
-
Понимание того, как устроены современные датасеты для обучения VLM / LMM / multimodal models.
-
Опыт построения пайплайнов для synthetic data generation.
-
Опыт реализации quality scoring, filtering, semantic deduplication, clustering или data attribution.
-
Опыт визуализации статистики по большим датасетам и построения внутренних аналитических дашбордов.
-
Опыт работы с Common Crawl, LAION-подобными датасетами, open-source vision-language datasets.
-
Базовое понимание ML training pipeline и того, как качество данных влияет на качество модели.
-
крупнейшее DS&AI community — более 600 DS-специалистов банка
-
дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира
-
возможность быть соавтором НИРов и статей для международных конференций
-
возможность выбрать удобный формат работы: гибрид или офис
-
ежегодный пересмотр зарплаты, годовая премия
-
корпоративный спортзал и зоны отдыха
-
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
-
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
-
ипотека выгоднее до 7% для каждого сотрудника
-
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
-
вознаграждение за рекомендацию друзей в команду Сбера.
Обязанности:
- Разворачивать, настраивать и сопровождать компоненты кампейн-платформы во всех окружениях (dev / test / prod) на Linux-серверах.
- Развивать интеграционный слой: API, коннекторы к каналам коммуникации, очереди, обмен с внутренними системами банка.
- Поддерживать стриминговую инфраструктуру: топики Kafka, деплой и сопровождение джобов, чекпоинты, состояние, масштабирование.
- Настраивать и тюнить сервинг-слой под онлайн-выдачу.
- Заниматься производительностью и надёжностью: нагрузочные тесты, capacity planning, разбор инцидентов и постмортемы.
- Настраивать разграничение доступа и выполнять требования ИБ.
DataOps - Выстраивать CI/CD для данных: версионирование кода витрин, DAG'ов и стриминговых джобов в Git, автотесты, автоматический прогон релизов между окружениями.
- Внедрять data quality as code: автоматические проверки свежести, объёма, схемы и дрейфа данных, quality gates внутри пайплайнов.
- Строить data observability: сквозной мониторинг лага, дашборды в Grafana по SLA данных, алертинг на нарушения.
- Развивать lineage и каталог данных (DataHub): автоматический сбор метаданных, прозрачность зависимостей кампейн-витрин.
- Управлять окружениями и тестовыми данными: воспроизводимость, обезличивание, быстрый разворот песочниц.
- Автоматизировать рутину и снижать time-to-market для новых кампаний: шаблоны, self-service инструменты для команды CVM.
Требования:
- От 3 лет опыта в эксплуатации или разработке распределённых систем / data-платформ.
- Уверенный Linux: администрирование, диагностика, работа с systemd, логами, ресурсами; сетевые основы.
- Скриптинг на Bash и Python.
- Практический опыт с Kafka: топики, партиционирование, консьюмер-группы, диагностика.
- Docker и Kubernetes на уровне уверенной эксплуатации.
- Опыт настройки CI/CD-пайплайнов (GitLab CI, Jenkins или аналог) и работы с Git.
- SQL и понимание работы СУБД: планы запросов, базовый тюнинг.
- Опыт построения мониторинга и алертинга: Prometheus, Grafana, работа с логами (ELK или аналог).
Будет плюсом:
• Практика DataOps: тестирование пайплайнов, data quality-фреймворки, контрактное тестирование данных.
• Apache Flink: деплой, стейт, чекпоинтинг, тюнинг.
• Greenplum, ClickHouse или другая СУБД.
• Redis, Informatica PowerCenter / PowerExchange CDC, NiFi, Airflow, DataHub, dbt.
• Ansible или другие инструменты автоматизации конфигурации.
• Опыт работы с кампейн-платформами / marketing automation.
• Понимание требований ИБ в банковской среде.
Став частью команды Forte, ты получишь:
- Конкурентную заработную плату и бонусы за персональную эффективность;
- График работы 5/2 с 9:00-18:00 в комфортном офисе;
- Жизнь внутри компании с ее корпоративными мероприятиями: тимбилдинги, челленджи, спортивные турниры, благотворительные акции;
- Заботу о здоровье с медицинским страхованием, а также DayOff в честь дня рождения и за выслугу лет;
- Выгодную рассрочку в крупные фитнес-клубы;
- Доступ к корпоративной библиотеке для непрерывного обучения и саморазвития.
Вам предстоит:
— Сбором, преобразованием и стандартизацией данных из различных источников
— Составлением пайплайнов трансформации данных с помощью фреймворка DBT (Greenplum, Clickhouse)
— Написанием Юнит тестов и DQ-тестов
— Документированием собственных разработок
— Работой с задачами по извлечению, трансформации и загрузке данных (ETL, ELT) в стеке Apache Airflow и сервисов «Яндекс облака»
— Участием в проектировании структур хранилища данных и витрин по заданиям от бизнеса
Для нас важны:
— Навыки написания и оптимизации запросов SQL, а также промышленного использования реляционных СУБД (преимущественно Postgres, Greenplum/Clickhouse/MS SQL)
— Базовый уровень владения Python (в области разработки ETL или конвейеров данных), желательно знакомство с библиотеками pandas, numpy, seaborn
— Опыт работы с системами контроля версий (GIT)
— Понимание принципов работы БД NoSQL и МПП
— Будет большим плюсом владение Apache Spark, Presto/Trino, Grafana, Kafka
#DWHразработчик #DWHвакансия #вакансия
DWH разработчик ❇️ | Компания ИТСтратегия
🔥 Мы в поиске DWH разработчика в консалтинговую ит компанию
Грейд: middle/Senior
Загрузка: фуллтайм
Оформление:ТК РФ, ИП, ГПХ, самозанятость
ЗП: готовы обговаривать индивидуально
✅ Требования
Уверенное владение SQL, Python
Понимание концепций проектирования DWH
Базовые навыки в области инженерии данных
Опыт работы с оркестраторами (Airflow, Prefect и др.)
Опыт разработки и поддержки etl-процессов
Опыт получения данных из различных типов API
Английский язык (на уровне чтения технической литературы).
📋Задачи
Участие в проектировании и разработке хранилищ данных для систем корпоративной отчетности
Разработка etl-процессов, их поддержка и оптимизация
Участие в R&D для выбора инструментов построения отдельных частей платформы данных
Разработка проектной документации
Ищем лидера для двух небольших команд data engineering и аналитики, суммарно до 10 человек. Это не greenfield и не роль «поставить красивые дашборды». У нас уже есть работающий, но неоднородный контур: ClickHouse, Kafka, dbt, Airflow/MWAA, AWS, GitLab CI, продуктовая аналитика в PostHog, внешние источники и витрины для продукта, финансов и антифрода. Он растёт быстрее, чем успевают закрепляться контракты, владение и правила эксплуатации. Нужен человек, который наведёт в этом порядок и затем сможет устойчиво развивать команды.
Чем предстоит заниматься
-Вести data engineering и analytics: цели, приоритеты, качество результата, развитие людей
-Описать и закрепить понятные контракты данных: источник, схема, ключи, временная семантика, дедупликация, backfill, SLA и владелец
-Сделать поставку данных предсказуемой: CI/CD для dbt и DAG, контроль версий, проверки до публикации, наблюдаемость и понятные разборы инцидентов
-Довести до эксплуатационного уровня витрины и ingestion-пайплайны на Kafka, ClickHouse, dbt и Airflow
-Выстроить data quality: сверки источника и витрин, идемпотентность, обработка поздних событий, reconciliation и тесты на критичных данных
-Свести потребности продукта, маркетинга, биллинга и антифрода в прозрачную модель приоритетов, а не в бесконечный поток разовых выгрузок
-Самому погружаться в сложные технические узлы, ревьюить решения и поднимать планку инженерной работы команды
Что важно
-Опыт руководства небольшой технической командой или сильного технического лидерства в data-направлении
-Уверенный SQL и практический опыт с ClickHouse: производительность, партиционирование, репликация, дедупликация, materialized views, Kafka Engine
-Опыт с Kafka, dbt и Airflow; понимание эксплуатации пайплайнов, а не только написания SQL-моделей
-Умение разбирать легаси-контур по фактам: код, схемы, логи, данные, потребители, стоимость и риски
-Опыт проектирования витрин для продуктовой, финансовой или риск-аналитики
-Умение превращать размытый запрос в проверяемый контракт и доводить его до работающего результата
-Нормальная управленческая зрелость: давать ясную обратную связь, не прятать проблемы, не подменять результат статусами и презентациями
-Опыт и культура code review: читать и разбирать чужой код, держать инженерные стандарты и качество командных решений
Кому не подойдёт
-Человеку, который хочет управлять большой функцией, не работая с платформой руками
-Аналитику, для которого data engineering заканчивается на постановке задачи
-Инженеру, который считает документацию, качество данных и договорённости необязательной бюрократией
-Кандидату, которому нужен идеальный greenfield вместо сложной, но живой системы
Что можно сделать в первый год
-Зафиксировать границы владения командами и критическими контурами
-Убрать непрозрачные и дублирующиеся поставки данных
-Ввести единый минимальный стандарт для новых источников, витрин, backfill и проверок качества
-Сделать состояние ключевых пайплайнов и данных наблюдаемым
-Сформировать самостоятельную команду, которой не нужен постоянный ручной контроль фаундера
Мы предлагаем
-Полностью удалённую работу из любой точки мира.
-Современное корпоративное оборудование.
-Работу над продуктом с реальной нагрузкой и масштабом.
-Влияние на ключевые продуктовые метрики через рекомендации
Data Engineer в Технопарк
💰По итогам собеседования (ср. рын. зп 200 000 ₽ – 270 000 ₽)
📌Условия и бонусы:
Фултайм, офис (МСК).
📌Наши ожидания:
– Навыки написания и оптимизации запросов SQL, а также промышленного использования реляционных СУБД (преимущественно Postgres, Greenplum/Clickhouse/MS SQL).
– Базовый уровень владения Python (в области разработки ETL или конвейеров данных), желательно знакомство с библиотеками pandas, numpy, seaborn.
– Опыт работы с системами контроля версий (GIT).
– Понимание принципов работы БД NoSQL и МПП.
– Будет большим плюсом владение Apache Spark, Presto/Trino, Grafana, Kafka.
A2 Consulting – представитель группы компаний КОРУСКонсалтинг, резидент ПВТ, команда профессионалов в области внедрения систем бизнес-анализа (BI) и корпоративных хранилищ данных (DWH) на предприятиях различных отраслей с покрытием региона СНГ, EU и USA.
Наша основная задача – предоставлять своим клиентам конкурентные преимущества посредством построения (внедрения) современных систем в сфере данных – DataGovernance, DataWareHouse и Buisness Intelligence.
В связи с активным ростом группа компаний A2 Consulting ищет в свою команду Data Engineer для участия в проектах по внедрению решений класса Data Lakehouse (DLH).
🔹 Что мы ищем в кандидатах:
- Опыт работы в качестве Data Engineer от 2 лет
- Уверенное знание SQL и реляционных баз данных
- Уверенное знание Python;
- Опыт работы с оркестраторами ETL-процессов (Apache Airflow).
- Понимание концепций Data Lakehouse и медальонной архитектуры;
- Опыт построения ETL/ELT pipelines (пакетная и потоковая обработка);
🔹 Что будет входить в обязанности:
- Проектирование, разработка и поддержка ETL/ELT-процессов загрузки данных из источников в Data Lakehouse;
- Разработка трансформаций данных по слоям решения;
- Сбор витрин данных по разработанному ТЗ для сервисов и BI-аналитики;
- Настройка и сопровождение оркестрации пайплайнов в Apache Airflow;
- Работа с табличным слоем на Apache Iceberg и объектным хранилищем;
- Участие в контроле качества данных;
- Написание документации, комментирование кода;
- Взаимодействие с Data-аналитиками и архитекторами для создания новых и оптимизации существующих витрин.
🔹 Будет плюсом:
- Опыт работы с объектным хранилищем (S3-совместимое MinIO/ Ceph) и табличными форматами (Apache Iceberg / Hudi / Delta);
- Опыт работы с Apache Spark;
- Опыт работы с SQL-движками Trino / Presto;
- Опыт работы с Apache Kafka и CDC (Debezium);
- Опыт работы с dbt;
- Опыт внедрения решений на Kubernetes;
- Опыт работы в банковской / финансовой сфере;
- Знакомство с инструментами data governance (Apache Atlas, Apache Ranger).
🔹 Что мы предлагаем:
- Стать сотрудником группы компаний КОРУСКонсалтинг – ТОП-10 IT-интеграторов на пространстве СНГ;
- Работу в компании-лидере рынка BI в Беларуси, резиденте Парка Высоких Технологий с офисами в EU и USA и экспертным коллективом;
- Совместное развитие в технологичной команде, участие в интересных проектах в перспективной и активно развивающейся отрасли;
- Прозрачную схему мотивации, официальное оформление в штат, социальный пакет и корпоративные бонусы (английский, спорт, ДМС, такси, скидки у партнеров, фрукты и ивенты в офисе);
- Стабильную и конкурентоспособную зарплату, привязанную к курсу USD;
- Комфортный офис в 10 минутах от метро «Площадь победы»
- Базовый график 5/2 с 9.00 до 18.00 с возможностью организации гибкого рабочего времени;
- Личностное и профессиональное развитие за счет компании, участие в конференциях и семинарах;
- Открытую корпоративную культуру, дружную команду, здоровую атмосферу и насыщенный календарь ярких корпоративов.
🔹 Мы ищем не идеальных кандидатов, а перспективных коллег, которые готовы прокачивать свои навыки и становиться экспертами.
Откликайся, будем знакомиться!
Ссылка на вакансию на портале службы занятости:
Привет! 👋 Мы — дата-инженерная команда внутри Управления экспериментальных систем машинного обучения SberAI. Наша миссия — поставлять качественные мультимодальные датасеты в продуктовые команды, которые развивают генеративные модели: speech, music, image, video, 3D, text.
🔍 Парсить открытые источники, собирать готовые датасеты
⚙️ Оркестрировать ETL/ELT-пайплайны, фильтровать и описывать данные, прогонять модели на бенчмарках
👥 Организовывать проекты ручного сбора и валидации на крауд-платформах TagMe, Elementary, ЯЗ.
Наш стек: 🛠
Python • SQL • S3 • Hadoop/GreenPlum • Airflow • Docker/K8s • Git • Vault • ML Space • Confluence • Jira
✅ Знание Python (библиотеки для работы с данными и API)
✅ Опыт с ML-пайплайнами и датасетами для CV/NLP
✅ Понимание ETL/ELT и жизненного цикла данных
✅ SQL: SELECT, JOIN, агрегаты, подзапросы
✅ Базовое понимание форматов: CSV, JSON, Parquet, сериализация
✅ Опыт с Docker/Kubernetes
Будет плюсом:
-
Airflow или другие оркестраторы
-
Понимание облачных сервисов
-
гибридный формат работы (2 раза в неделю офис м Кутузовская)
-
ежегодный пересмотр зарплаты, годовая премия
-
корпоративный спортзал и зоны отдыха
-
система обучения для профессионального и карьерного развития
-
расширенный полис ДМС с первого дня работы и страхование для семьи
-
программа ипотеки для сотрудников
-
подписка Прайм с возможностью совместного использования на трёх близких
-
вознаграждение за рекомендацию друзей в команду Сбера.
ZITREK & DEKO: Инструмент в каждый дом!
Компания 13 лет на рынке, проекту DEKO 6 лет. В нашем портфеле ТМ "DEKO", "Zitrek", "Desoon"
На рынке электроинструмента мы лидируем по продажам (по данным GFK), по доле импорта (по данным РАТПЭ), по узнаваемости бренда, по обороту, по представленности в online. Нашими ключевыми партнерами являются ВсеИнструменты, DNS, Лемана ПРО, OZON, Wildberries, Яндекс Маркет и многие другие.
DEKO - бренд №1 в своей категории на маркетплейсах.
Гордость компании – команда! При относительно небольшой численности мы добились весомых позиций на рынке! Ассортимент компании 1500+ SKU, складской комплекс класса «А» ~25 000 м2
У нас нет: удушающей бюрократии, формализма, штрафов.
Мы вместе, потому что нас объединяют: драйв и энергия, амбиции сохранять лидирующие позиции на рынке, отличная репутация, профессиональное развитие, возможность получать дополнительное образование за счёт компании и доброжелательная корпоративная среда.
В настоящее время мы в поисках коллеги на должность
Разработчик баз данных PostgreSQL / Data Engineer (PostgreSQL + ETL) / Специалист по работе с базами данных (PostgreSQL) / Администратор БД PostgreSQL / DBA c функциями ETL
Вы станете ключевым звеном в развитии нашей аналитической инфраструктуры и будете работать с большими объемами данных в сегменте e-commerce
Ваши задачи:
-
Проектирование и развитие архитектуры БД: Развитие структуры PostgreSQL под задачи e-commerce (заказы, товары, цены, маркетинговые данные, стоки);
-
Оптимизация: Работа с индексами, партиционированием, настройка производительности и миграции;
-
ETL-пайплайны: Разработка и поддержка скриптов (Python/SQL) для выгрузки данных из API Ozon, Wildberries и других источников. Настройка регулярных обновлений;
-
Аналитика: Создание витрин данных и сложных представлений для отчетов по продажам, маржинальности, возвратам;
-
Разработка витрин данных: Подготовка представлений для оперативной аналитики (отчёты продаж, маржа, возвраты, маркетинговые метрики);
-
BI-интеграция: Подготовка выгрузок и доступов для BI‑инструментов (Power BI/DataLens/Metabase): схемы, права доступа, контроль качества данных;
-
Документация: Ведение документации по структуре БД, витрин и процессов обновления данных.
У нашего будущего коллеги есть:
-
Опыт: от 2-х лет коммерческой разработки;
-
Стек: Глубокое знание PostgreSQL, опыт моделирования DWH;
-
Скриптинг: Уверенное владение Python (написание скриптов для работы с API);
-
Инструменты: Практика работы с Docker, понимание процессов ETL;
-
API: Опыт интеграции с внешними REST API маркетплейсов: Ozon, WB;
-
BI: Базовое понимание BI-стека (Power BI / DataLens / Metabase) для корректной подготовки данных;
-
Образование: Высшее техническое/математическое желательно.
Мы предлагаем:
- Задачи для роста и профессионального развития;
- Команду, где ценят инициативу;
- Комфортный офис в непосредственной близости от "Площади трех вокзалов" (ст.м. «Комсомольская», «Красные ворота», "Бауманская");
- Удобный график работы с 8:30 до 17:00, а в пятницу до в 16:00;
- Возможность гибридного формата работы после исп.срока;
- Достойный уровень заработной платы;
- Офис с душой: светло, удобно, с кофе, чаем, кухней и людьми, с которыми хочется работать.
Уважаемые кандидаты, мы ценим ваше время, уделенное изучению вакансии в ZITREK RUS, и рады, что Вы рассматриваете нашу Компанию как потенциального работодателя. При положительном рассмотрении вашего резюме мы свяжемся с вами в течение трёх рабочих дней. В ином случае ваше резюме будет зачислено в резерв, мы вернемся к нему при появлении вакансии, соответствующей вашим компетенциям и ожиданиям.
Желаем Вам успехов!
Наш клиент: международная продуктовая IT-компания, развивающая высоконагруженные онлайн-сервисы в развлекательном сегменте, находится в поисках Data Engineer, который будет работать над внутренними продуктами и решениями для команд и смежных подразделений.
Проекты находятся на разных стадиях: от активной разработки новых решений до поддержки существующих систем.
Работа предполагает релокацию на Кипр, в офис в Лимассоле.
Обязанности:
- Проектировать и внедрять новые потоки данных в существующие системы
- Выстраивать многослойную архитектуру хранения данных с нуля для новых проектов
- Взаимодействовать с продакт-менеджерами, аналитиками, SQL-разработчиками и внешними командами
Требования:
- Опыт работы с ETL-фреймворками (dagster, airflow, prefect) — от 3+ лет
- Опыт работы с реляционными БД (MSSQL, PostgreSQL, MySQL, Oracle)
- Опыт работы с аналитическими БД (Clickhouse, Vertica, Greenplum)
- Опыт работы с dbt
- Опыт написания юнит- и интеграционных тестов (pytest)
- Базовые знания Docker, опыт работы с Kubernetes будет плюсом
Условия:
- Релокация на Кипр (Лимассол) с поддержкой оформления документов для сотрудника и семьи
- Заработная плата обсуждается по итогам интервью
- Годовой бонус по результатам работы
- Работа в офисе в Лимассоле (современная техника, питание — завтраки и обеды, спортзал)
- Гибкий график с возможностью выбора начала рабочего дня
- Работа в русскоязычной команде
- Минимум бюрократии и быстрые процессы принятия решений
Вакансия открыта в связи с расширением Отдела аналитики процессов и отчётности информационной безопасности. Возможен удалённый формат работы.
Требования:
- высшее образование (техническое, ИТ),
- опыт работы от 2-х лет в качестве инженера данных, BI аналитика, ETL разработчика,
- опыт разработки и оптимизации ETL/ELT-процедур и скриптов загрузки данных с использованием Python, Airflow,
- навыки работы с витринами данных, хранилищами, СУБД PostgreSQL,
- владение SQL на уровне написания сложных запросов, умение оптимизировать запросы,
- опыт сопровождения разработки, валидации результатов и тестирования данных.
Будет плюсом:
- опыт проектирования СУБД PostgeSQL,
- опыт построения дашбордов,
- понимание принципов работы межсистемных интеграций (веб-сервисы REST, SOAP, очереди сообщений),
- навыки описания объектов визуализации BI систем,
- навыки графического описания и моделирования бизнес-процессов в UML, BPMN2.0.
Задачи:
- извлечение, преобразование, анализ и консолидация данных из разнородных источников (DWH, СЗИ, внутренние системы),
- проектирование архитектуры данных и интеграция источников в единую аналитическую базу данных (PostgreSQL),
- разработка витрин и моделей данных для целей Security Intelligence,
- разработка дашбордов полного цикла на отечественных и Open Source решениях (Insight и пр.) в рамках направления информационной безопасности компании,
- сопровождение дашбордов (контроль обновления данных, актуализация бизнес логики, консультация внутреннего бизнес-заказчика, взаимодействие с Вендором по вопросам устранения ошибок, контроль качества данных), в том числе доработка и оптимизация дашбордов,
- анализ ключевых показателей внутреннего бизнес-заказчика (статистические данные в виде единоразовых выгрузок, аналитические приложения и т.п.),
- развитие и поддержание базы знаний в актуальном состоянии (Confluence).
ID 3403 — Middle / Senior Data Engineer с опытом БКИ
🌍 Локация: Любая
💼 Удаленно
🕔 Занятость: фулл тайм
🏢 Проект: Быстроденьги
❗️ Опыт с БКИ ключевой! Ищем дата инженера с опытом формирования пакетов для передачи данных в БКИ согласно методологии БКИ.
💡 Требования:
Все требования должны быть отражены в резюме!
- Опыт от 2 лет опыта на аналогичной позиции ❗️
- Опыт формирования пакетов для передачи данных в БКИ согласно методологии БКИ.
- Опыт проектирования потоков загрузки данных и моделирования баз данных.
- Опыт в проектировании объектов баз данных и архитектуре хранилищ данных (от 3 лет).
⚙️Технический стек:
- Python, уверенное владение MSSQL либо Postgre/Greenplum (аналитические функции, оптимизация запросов).
- Промышленный ETL-инструментарий (Airflow, Debezium, ClickHouse и аналоги).
- Опыт работы с Credit Registry будет преимуществом.
📋Задачи:
- Разработка и оптимизация ETL-процессов: разработка и поддержка процессов загрузки и трансформации данных из мастер-систем (ETL).
- Разработка нового и доработка существующего функционала DWH.
- Оптимизация и рефакторинг существующих решений в контуре DWH.
- Управление оркестрацией процессов и системой мониторинга: настройка и сопровождение оркестрации процессов, настройка алертинга о событиях выполнения процедур в системы мониторинга и контроля.
- Создание проектной документации и деталей маппинга данных: подготовка проектной технической документации и формирование детальных спецификаций маппинга данных (Source-to-Target).
- Создание отчетных панелей и визуализаций данных: создание объектов бизнес-отчетности и визуализация данных с использованием инструментов SuperSet и PowerBI.
- Взаимодействие со смежными командами и заказчиками.
📨 Отклик — через форму: https://forms.gle/qxF3H1eiV4E4T7p19 или напрямую рекрутеру: @Veroneko
❗️Откликайтесь только при релевантном опыте.
❗️При первичном отклике:
ID вакансии / ФИО / локация / возраст / занятость (работаете/нет) / формат работы (удаленка, гибрид, офис) / стек / опыт / резюме / сверка с требованиями
❗️Повторный отклик: ID вакансии + сверка.
#Data #Engineer #Удаленно #вакансия
О компании
Амаркон — российская IT-компания с 15-летним опытом. Разрабатываем и внедряем собственные решения ECM, PIM, DAM, BI, e-commerce, а также выполняем заказную разработку и интеграцию. Клиенты: X5 Group, Tele2, Русатом Сервис, НЛМК, Metro CC, Лента и др.
Задачи:
● Анализ бизнес-потребностей в данных, формализация слабоструктурированных требований в ТЗ на разработку витрин.
● Разработка и согласование методологии расчёта KPI.
● Проектирование логических и физических моделей данных (витрины, ODS, DDS) по методологиям Kimball и Data Vault 2.0.
● Поиск и профилирование источников данных, разработка алгоритмов построения витрин, создание прототипов и их защита перед стейкхолдерами.
● Оценка вычислительных ресурсов (сторадж, компьют) и трудозатрат.
● Сопровождение витрин на всех этапах: разработка потоков, тестирование, UAT, передача в поддержку, решение инцидентов 3-й линии.
● Определение и имплементация логики Data Quality для витрин.
● Анализ существующих ETL/ELT-потоков и зависимостей (Airflow), выявление узких мест, оптимизация сложных запросов к большим данным (млрд записей, ТБ).
● Постановка задач смежным командам (разработчики, админы, инженеры данных).
● Участие в архитектурных решениях (DWH/Data Lake/Lakehouse, batch/stream, CDC), разработка документации и схем.
Требования:
● Методологии: практический опыт Kimball и Data Vault 2.0.● Платформы: понимание DWH, OLAP, Data Lake, Lakehouse.
● SQL: экспертное владение (оконные функции, CTE, JOIN-ы, execution plan, оптимизация, индексы, партиционирование).
● СУБД: PostgreSQL, Oracle, MS SQL Server (глубокое знание, настройка производительности).
● MPP: опыт с GreenPlum, ClickHouse, Trino (шардирование, колокация).
● Хранилища: опыт с Hadoop (HDFS) и объектными хранилищами (S3).
● Оркестрация: понимание ETL/ELT, анализ зависимостей в Airflow / Nifi / аналогах.
● Big Data: работа с объёмами от млрд записей и ТБ.
● Коммуникация: эффективное общение с бизнес-заказчиками, разработчиками, администраторами.
● Документирование: систематизация требований, формирование чётких ТЗ.
● Git: уверенное владение (ветки, мерж, конфликты).
Желательно:
● Профилирование данных, анализ ETL-зависимостей на уровне кода (Python/Java).
● Опыт с системами Data Quality (Great Expectations, Deequ).
● Облачные платформы (AWS/GCP/Azure: S3, EMR/Dataproc, IAM, VPC).
● Мониторинг (Grafana, Zabbix, Prometheus).
● Docker, Kubernetes/Rancher.
● Безопасность: маскировка PII, управление доступом (Ranger).
● Базовое администрирование Unix/Linux.
Мы предлагаем:
● Удалённая работа
● Официальное оформление (ИП, СЗ)
Команда DP в поисках специалиста по работе с данными исследования фармацевтического рынка.
Обязанности:
- Управление аналитическим инструментарием для синдикативных исследований фармацевтического рынка: аналитические базы и программы; импорт/экспорт данных различных форматов; разработка новых подходов к аналитике проектов и данных в целом; оптимизация структуры базы данных; оптимизация запросов к базе данных.
- Техническая поддержка баз данных Promo и Терапевтические Мониторы: работа с базой данных проектов (SQL/SPSS) и программами; подготовка баз для аналитики и дальнейшая загрузка в QV/QS; подготовка баз различных форматов для клиентов (QV, QS); программирование новых анализов и визуализаций в QS; подготовка макросов (сценариев) для выгрузки отчетов; организация выгрузки данных по проекту.
- Комплексная аналитика на базе данных синдикативных проектов по исследованиям фармацевтического рынка: подготовка данных; анализ и интерпретация данных; модернизация баз данных проекта для комплексной аналитики.
- Участие в задачах отдела: участие в разработке аналитики новых проектов/инструментов/подходов в исследованиях отдела; клиентская поддержка по техническим вопросам; автоматизация различных задач отдела, автоматизация отчетов клиентам, работа с корпоративным ИИ и активное внедрение в рабочие процессы отдела.
Требования:
- образование: высшее (техническое: инженер, программист, математик);
- SQL(продвинутый уровень);
- Python(Junior);
- SPSS(будет плюсом);
- опыт обработки больших массивов информации;
- разработка\поддержка\оптимизация производительности DWH;
- ETL\ELT-процессы
- знание компьютера: Microsoft Office, продвинутый пользователь Excel, Power Point, опыт написания макросов;
- знание Qlik Sense (знание языка, построение архитектуры данных, создание визуализаций в рамках оболочки) приветствуется;
- английский язык: не ниже среднего уровня;
- опыт работы: от 2 лет;
- сильное аналитическое мышление: умение разложить сложное на простое.
Условия:
- официальное оформление с первого рабочего дня, льготы и компенсации в соответствии с Трудовым законодательством (оплачиваемый отпуск/больничные).
- Дополнительное медицинское страхование с первого месяца работы. Программа корпоративных привилегий.
- Мы предлагаем гибкий "гибридный" график посещения офиса или дистанционную работу.
- Возможность профессионального развития, английский язык по корпоративному тарифу.
В 2022 году Московской бирже исполнилось 30 лет. Мы появились вместе с современной Россией и за эти годы с нуля создали рынок инвестиций.
Сегодня миллионы людей и тысячи компаний доверяют нам и пользуются нашей инфраструктурой.
- Ежедневно на наших торговых платформах совершаются миллионы транзакций в минуту – без задержек, без перебоев.
- Мы храним в депозитарии цифровые записи о каждом активе, который торгуется на бирже.
- Мы следим за тем, чтобы все операции соответствовали правилам торгов и требованиям регуляторов.
А еще мы активно развиваемся и давно вышли за рамки классического биржевого бизнеса.
- Мы разрабатываем и поддерживаем платформы, которые соединяют финансовые компании и клиентов,
- Мы идем на внебиржевой рынок и создаем на нем удобные сервисы,
- Мы открываем новые возможности для инвесторов, корпораций, банков.
- Мы развиваем финансовую культуру страны.
В #moexteam уже больше 2200 человек: ИТ-специалисты и эксперты по развитию рынков, продуктовые и проектные менеджеры, финансисты и юристы, маклеры и многие другие. Мы разные, но всех нас объединяет общая цель – помочь людям и компаниям управлять деньгами, используя передовые технологии и знания.
В Департамент по работе с данными требуется Data Engineer
Чем предстоит заниматься:
- Проектирование и разработка витрин данных и аналитических таблиц для аналитического подразделения Биржи;
- Оптимизация и рефакторинг: поиск «узких горлышек» в SQL-запросах и ETL-процессах, их исправление. Опыт работы с хранилищами Oracle, GreenPlum;
- Масштабирование процессов: внедрение стандартов код-ревью, тестирования данных (data quality) и документации, чтобы вся команда работала эффективно;
- Участие в архитектурных обсуждениях: предложение решений на основе экспертизы.
Hard Skills:
- SQL: уверенное владение CTE, оконными функциями. Умение читать Explain Plan и оптимизировать тяжелые запросы;
- Python: опыт написания скриптов для обработки данных, автоматизации;
- Orchestration: опыт работы с Airflow (создание DAG, настройка зависимостей, мониторинг);
- Git: понимание веток, merge/pull requests, решение конфликтов слияния.
Soft Skills (Критично):
- Проактивность: умение говорить «нет» плохому ФЗ и предлагать альтернативу;
- Командная игра: готовность делиться знаниями, проводить код-ревью, учить джуниоров.
Будет плюсом:
- Опыт бэкенд-разработки или построения data-инфраструктуры с нуля;
- Опыт работы с хранилищами S3, ClickHouse.
Смотрите также в каталоге
Хотите персональную подборку?
Введите свои критерии — мы отфильтруем вакансии по вашим требованиям
Найти подходящие вакансии →