СБЕР

Data Engineer for VLM Training Data (GigaChat Vision) (Python)

Мы ищем Data Engineer, который будет отвечать за инфраструктуру, пайплайны и качество данных для обучения современных Vision-Language Models. Роль находится на стыке data engineering и ML: нужно будет работать с большими мультимодальными д…

СБЕР На сервисе с: 16.06.26 19:01

↑ Вакансия с автоподнятием
Зарплата не указанаРоссияСШАМосква

Мы ищем Data Engineer, который будет отвечать за инфраструктуру, пайплайны и качество данных для обучения современных Vision-Language Models. Роль находится на стыке data engineering и ML: нужно будет работать с большими мультимодальными датасетами, понимать потребности исследователей и ML-инженеров, строить пайплайны очистки, фильтрации, категоризации и генерации данных, а также обеспечивать воспроизводимый экспорт данных в формат для обучения моделей.

  • Собирать и структурировать потребности ML-команды в данных: какие данные нужны для обучения, дообучения, оценки и улучшения VLM.
  • Предлагать и реализовывать идеи пайплайнов очистки, фильтрации, дедупликации, категоризации и генерации данных.
  • Ориентироваться в современных практиках построения датасетов для Vision-Language Models: image-text pairs, synthetic data, filtering, quality scoring, data mixture design, dataset versioning.
  • Отвечать за инфраструктуру хранения и подготовки данных, включая:
  1. импорт данных из различных источников: production, Common Crawl, open-source datasets, generated data;
  2. валидацию и контроль качества данных;
  3. хранение и версионирование датасетов;
  4. экспорт данных в форматы, пригодные для обучения моделей.
  • Проектировать и реализовывать пайплайны обработки данных на большом масштабе, включая десятки миллиардов изображений.

  • Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM.

  • Собирать статистику по данным, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов.

  • Обеспечивать воспроизводимость, наблюдаемость и надёжность data-процессов.

  • Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой.

  • Сильный опыт в data engineering и построении production-grade data pipelines.

  • Уверенное владение Python, включая multiprocessing, multithreading и async-подходы.

  • Опыт работы с большими объёмами данных и распределённой обработкой.

  • Практический опыт с объектными хранилищами, в частности S3 или аналогами.

  • Опыт работы с YTsaurus или похожими системами для распределённого хранения и обработки данных.

  • Понимание принципов валидации, очистки, дедупликации и версионирования датасетов.

  • Опыт работы с DVC, Git, Docker.

  • Опыт работы с PostgreSQL или другими реляционными базами данных.

  • Умение проектировать устойчивые пайплайны: от импорта данных до финального экспорта в training-ready формат.

  • Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения.

  • Готовность работать на стыке engineering и ML research.

Будет плюсом

  • Опыт работы с мультимодальными данными: изображения, текст, image-text pairs, captions, OCR, metadata.

  • Понимание того, как устроены современные датасеты для обучения VLM / LMM / multimodal models.

  • Опыт построения пайплайнов для synthetic data generation.

  • Опыт реализации quality scoring, filtering, semantic deduplication, clustering или data attribution.

  • Опыт визуализации статистики по большим датасетам и построения внутренних аналитических дашбордов.

  • Опыт работы с Common Crawl, LAION-подобными датасетами, open-source vision-language datasets.

  • Базовое понимание ML training pipeline и того, как качество данных влияет на качество модели.

  • крупнейшее DS&AI community — более 600 DS-специалистов банка

  • дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира

  • возможность быть соавтором НИРов и статей для международных конференций

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:Getmatch

Похожие вакансии Data Engineer

Соц.сети
A

Middle / Senior Data Engineer

aristek_systemsНа сервисе с: 10.10.26 20:06
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

Middle / Senior Data Engineer Aristek Systems

Местоположение: Весь мир
Формат работы: Удаленно
Опубликована: ••••••••

Требования:
• 4+ года коммерческого опыта в Data Engineering
• Уверенное знание AWS: S3, Glue, Athena, Lake Formation/IAM, Lambda, Step Functions
• Опыт построения data lake/lakehouse с нуля (Parquet, Iceberg/Delta/Hudi)
• Python (PySpark) и продвинутый SQL

Контакт: ••••••••

•••••••• опубликована в ••••••••

hh.ru
домклик

Data Engineer в платформенную команду

домкликНа сервисе с: 11.08.26 15:24↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваУдалёнка

Domclick.ru - единственный в России продукт, обеспечивающий полный цикл операций с недвижимостью. Доступен на всех популярных платформах (Web, iOS, Android). Решаем любые вопросы с недвижимостью, делая сложное простым, с заботой о каждом клиенте. Мы ищем единомышленников, чтобы вместе помогать людям исполнять мечту о собственном жилье.

Проект:

Мы - платформенная команда, и не занимаемся построением отчетов. Вместо этого мы разрабатываем базовый слой данных, который используется конечными потребителями.

Наш стек:

Python, PostgreSQL, Airflow, Trino, Greenplum, Clickhouse, Kafka, RabbitMQ, Go, K8s.

Чем предстоит заниматься:

  • построением базового слоя витрин данных с применением SQL и Python;
  • развивать и улучшать существующие продукты и сервисы;
  • участвовать в проработке и реализации интеграций с другими сервисами и командами (кстати, у нас полностью микросервисная архитектура);
  • обеспечивать высокое качество кода и улучшать процессы в своей команде;
  • участвовать в развитии инфраструктурных решений для работы с big data.

От вас мы ожидаем:

  • экспертное знание SQL;
  • продвинутый уровень Python;
  • навык оптимизации запросов;
  • понимание особенностей работы с различными хранилищами данных: PostgreSQL, Greenplum, Clickhouse;
  • владение архитектурой данных.

Будет плюсом:

  • опыт работы с Airflow, Trino, Superset, k8s;
  • опыт построения аналитического хранилища данных.

Мы предлагаем:

  • работу в аккредитованной IT компании;
  • конкурентную заработную плату;
  • полис ДМС с первого месяца работы;
  • современную технику для работы;
  • корпоративный университет, онлайн-курсы для повышения квалификации, конференции, митапы;
  • фитнес-зал в здании офиса;
  • льготную программу ипотеки для сотрудников;
  • комфортный офис класса А в 5 минутах от станции метро и МЦК Кутузовская;
  • гибкое начало рабочего дня и возможность работать в гибридном или удаленном формате в пределах РФ.
Соц.сети
А

Data Engineer (HR отчетность)

альфа_банкНа сервисе с: 10.10.26 13:47
Зарплата не указанаРоссияУдалёнка

#middle #удаленка

Альфа-Банк. ИТ-специалисты
Data Engineer (HR отчетность)
Опыт работы: 3–6 лет
Полная занятость
График: 5/2
Формат работы: удалённо

☑️ Чем предстоит заниматься
-Развивать DWH HR-отчетности: участвовать в проектировании и масштабировании корпоративного хранилища данных
-Интегрировать источники: собирать, очищать и консолидировать данные из учетных систем (в том числе SAP HCM/SAP BW)
-Проектировать витрины данных: переводить требование бизнеса и топ-менеджмента в понятные технические алгоритмы и данные
-Обеспечивать качество данных: внедрить процессы Data Quality и Data Governancе

☑️ Наши пожелания к кандидатам
-Опыт работы в области DWH, ETL или Data Engineering – от 3 лет
-Практический опыт проектирования и развития хранилищ данных
-Уверенное владение Postgresql, MS Sql, Python (обработка данных, интеграции и автоматизации), Apache Airflow, Kafka, Git
-Приверженность к Data Governance подход
-Умение самостоятельно принимать решения, документировать их и доводить до промышленной эксплуатации
-Понимание основных принципов хранения данных в SAP HCM / SAP BW будет преимуществом
-Понимание требований BI систем к структуре и качеству данных будет преимуществом
-Понимание основных метрик HR отчетности будет преимуществом

Контакты: ••••••••

🔥 •••••••• / •••••••• / ••••••••

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.