сбер

NLP Engineer (Reinforcement Learning)

сбер · На сервисе с: 11.07.26 03:17

↑ Вакансия с автоподнятием
300k–500k ₽РоссияУдалёнка

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.

Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.

Чем предстоит заниматься

  • Разрабатывать и улучшать методы online RL.
  • Реализовывать и дорабатывать подходы post-training и online RL.
  • Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин.
  • Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач.
  • Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру.
  • Строить и развивать инфраструктуру обучения.
  • Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели.
  • Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций.
  • Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест.
  • Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять.
  • Работать с данными и системой оценки качества.
  • Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки.
  • Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек.
  • Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения.
  • Работать в сильной команде.
  • Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры.
  • Брать на себя ответственность за целые куски системы: от идеи до результата в проде.
  • Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.

Для нас важно

  • Отличное владение Python и PyTorch.
  • Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.
  • Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы.
  • Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.
  • Умение писать чистый, надёжный, production-ready код.
  • Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.
  • Будет плюсом.
  • Опыт работы с reward-моделями, process reward models, LLM-as-a-judge.
  • Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
  • Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.).
  • Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.).
  • Публикации, open-source вклад или сильный прикладной track record.

Что предлагаем

  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
  • Прямое влияние на качество модели: результаты твоей работы видны в бенчмарках и в продукте.
  • Команду сильных инженеров и исследователей, у которых есть чему поучиться.
  • Возможность совмещать инженерную и исследовательскую работу.
  • Конкурентную компенсацию, премии и расширенный соцпакет.

Похожие вакансии Data Science & ML

Сайты компаний
сбер. it

Junior Data Scientist

сбер. itНа сервисе с: 20.08.26 19:59
Зарплата не указанаРоссияМоскваОфис

Наша команда помогает развивать сеть банкоматов Сбера и обеспечивать ее бесперебойную работу. Мы погружены в разные части этого процесса — от AI-агента в банкоматах нового поколения до автоматизации обработки заявок на техническое обслуживание устройств. В команде есть как современные решения на основе LLM, RAG и AI-агентов, так и классические ML-задачи.

  • Разрабатывать и развивать AI-агентов и LLM-системы: строить пайплайны, экспериментировать с моделями и подходами, оценивать качество и улучшать решения

  • Решать задачи классического ML и NLP: классификация, работа с текстами, эмбеддингами и другими ML-моделями

  • Проводить эксперименты с моделями и их параметрами, анализировать результаты и выбирать лучшие подходы

  • Разрабатывать пайплайны подготовки и обработки данных для ad-hoc аналитики и построения витрин

  • Организовывать и проводить оценку качества ML/LLM-решений, работать с разметкой данных

  • Участвовать в развитии решений на всех этапах: от постановки задачи и общения с заказчиком до внедрения и мониторинга в проде

  • Понимание принципов построения AI-агентов

  • Уверенное владение Python и SQL, умение работать с Git

  • Понимание основных этапов разработки ML-решения

  • Знание основ классического ML: классификация, регрессия, основные алгоритмы и метрики качества

  • Понимание основных подходов NLP и работы с текстовыми данными

Будет плюсом:

  • Знание RAG-систем

  • Знание Hadoop, Spark

  • Базовое понимание MLOps (Docker, Jenkins) и Linux

  • Комфортный современный офис рядом с м. Кутузовская (офисный или гибридный режим работы)

  • Корпоративный спортзал и зоны отдыха

  • Уникальная система обучения Сбера для профессионального и карьерного развития, семинары, тренинги, конференции

  • Программа адаптации и помощь руководителя на старте

  • ДМС, страхование от несчастных случаев, социальные гарантии

  • Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ

  • Подписка Прайм с возможностью совместного использования на трёх близких

  • Вознаграждение за рекомендацию друзей в команду Сбера

  • Корпоративная пенсионная программа

  • Корпоративные мероприятия.

Эта вакансия также есть на:hh.ru
Соц.сети
E

Data Scientist (Pricing)

emerging_travel_groupНа сервисе с: 20.08.26 19:16
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

#ds
Data Scientist (Pricing) ⚡️
Remote.

Emerging Travel Group — travel-tech компания с продуктами в сегментах B2C, B2B, B2A (RateHawk, Roundtrip, ZenHotels), которые помогают клиентам управлять всеми потребностями в путешествиях.

Расширяют Data Science‑команду в Emerging Travel Group по миру — ищу Data Scientist в направление Pricing ✨

Задачи: ценообразование для B2B/B2C, прогноз и оптимизация финансовых и операционных метрик, uplift‑моделирование, приоритизация инцидентов и эффективность customer journey (revenue growth, cost savings, business impact).

Проекты — от постановки задачи до пилота и передачи в прод.

Что важно:
• 3+ лет опыта в Data Science.
• End‑to‑end ML‑проекты: от формализации до результата.
• Классический ML: бустинги, классификация, регрессия.
• Uplift‑моделирование и временные ряды на реальных бизнес‑задачах.
• Python и SQL уверенно.

Плюсом:
• A/B‑тесты: метрики, сплиты, интерпретация.
• Работа со стейкхолдерами и понимание оптимизационных задач: pricing, LTV, retention.
• MLflow/DVC, Airflow, мониторинг моделей.

Читать подробнее:
→ Откликнуться тут

⚡️ - прямой контакт

Другие площадки
G

Senior ML Engineer

gettransferНа сервисе с: 20.08.26 19:01
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

ML Engineer — GetTransfer

GetTransferищет опытного ML Engineerдля разработки и внедрения ML-решений в production.
В периметре компании — широкий спектр проектов: от RightTech и mobilityдо fintech и других технологических направлений. Это возможность работать с разными типами ML-задач, современным стеком и практически безграничными возможностями для профессионального развития в области Machine Learning.

Что предстоит делать:
- разрабатывать и улучшать ML-модели;
- работать с большими объёмами данных;
- внедрять модели в production и поддерживать их жизненный цикл;
- выстраивать ML pipelines и MLOps-процессы;
- заниматься мониторингом качества моделей и данных;
- работать с Python и современным ML-стеком.

Ожидания:
- 5+ лет опыта в Machine Learning;
- сильный Python;
- опыт production deployment ML-моделей;
- опыт с MLOps, MLflow или аналогичными инструментами;
- понимание model/data versioning, CI/CD и автоматизации ML pipelines;
- опыт построения мониторинга моделей и data quality;
- умение работать с большими объёмами данных и сложными ML-системами.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.