СБЕР

Online RL (General) / Post-Training LLM в GigaChat

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения…

СБЕР · На сервисе с: 18.09.26 14:45

↑ Вакансия с автоподнятием
300k–500k ₽РоссияСШАУдалёнка

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.

Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.

  • Разрабатывать и улучшать методы online RL

  • Реализовывать и дорабатывать подходы post-training и online RL.

  • Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин.

  • Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач.

  • Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру.

  • Строить и развивать инфраструктуру обучения

  • Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели.

  • Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций.

  • Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест.

  • Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять.

  • Работать с данными и системой оценки качества

  • Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки.

  • Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек.

  • Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения.

  • Работать в сильной команде

  • Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры.

  • Брать на себя ответственность за целые куски системы: от идеи до результата в проде.

  • Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.

  • Отличное владение Python и PyTorch.

  • Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.

  • Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы.

  • Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.

  • Умение писать чистый, надёжный, production-ready код.

  • Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.

Будет плюсом

  • Опыт работы с reward-моделями, process reward models, LLM-as-a-judge.

  • Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.

  • Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.).

  • Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.).

  • Публикации, open-source вклад или сильный прикладной track record.

  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM.

  • Прямое влияние на качество модели: результаты твоей работы видны в бенчмарках и в продукте.

  • Команду сильных инженеров и исследователей, у которых есть чему поучиться.

  • Возможность совмещать инженерную и исследовательскую работу.

  • Конкурентную компенсацию, премии и расширенный соцпакет.

Эта вакансия также есть на:hh.ru Getmatch

Похожие вакансии Data Science & ML

Соц.сети
extyl

ML разработчик

extylНа сервисе с: 04.10.26 14:04
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

#senior #удаленка

Extyl
ML разработчик / Проектная работа / АУТСТАФФ
Формат работы: можно удалённо

☑️ Чем предстоит заниматься
-Разработка и обучение моделей для анализа изображений и облаков точек
-Подготовка датасетов, анализ данных
-Сбор, анализ и предобработка данных, составление датасетов
-Обучение моделей и тестирование гипотез
-Деплой полученных решений
-Написание технической документации
-Презентация результатов внутри команды и заказчику
-Изучение новых подходов для решения поставленных задач
-Взаимодействие с командой разработки и аналитиками

☑️ Наши пожелания к кандидатам
-Опыт разработки ML-решений для бизнеса от 3 лет
-Опыт работы с CV на реальных проектах от 1 года
-Опыт промышленной разработки на Python от 3 лет
-Умение писать production-ready код на Python
-Опыт работы с PyTorch
-Умение обучать и дообучать модели, проводить тестирование
-Опыт работы с Git
-Умение версионировать данные и логировать эксперименты (DVC, MLFlow, ClearML)
-Опыт работы с Docker
-Опыт проработки требований, опыт декомпозиции и приоритизации задач
-Умение вести техническую документацию
-Знание английского B2
-Опыт работы с трехмерными данными
-Будет плюсом:
-Опыт работы с ГИС и специальными форматами данных (geotiff, las)

Контакты: •••••••• / Telegram ••••••••

🔥 •••••••• / •••••••• / ••••••••

Соц.сети
Н

Senior ML / AI Engineer

Неизвестный работодательНа сервисе с: 04.10.26 13:17
4 000–7 000 € (≈ 377k–660k ₽)КипрLimassolОфис

#вакансия #кипр #офис #ML #AI #инженер

**Senior ML / AI Engineer**
Лимасол, Кипр

**Обязанности:**
- Владение задачами, а не только моделями. Совместно с менеджером продукта превращать цели в решения.
- Работа с LLM: проектирование контекста, извлечение данных, использование инструментов и агентных потоков.
- Обучение собственных моделей: модерация, классификация, распознавание и обнаружение аномалий.
- Принятие решений о создании или покупке: оценка качества, задержки и затраты.
- Вывод моделей в продакшн: работа под нагрузкой, мониторинг и откат.

**Требования:**
- Опыт работы с LLM в продакшне, включая извлечение и адаптацию моделей.
- Умение обучать собственные модели на реальных данных.
- Опыт работы в продакшн-инжиниринге не менее 5 лет, знание Python и PyTorch.
- Английский на уровне Intermediate и выше.

**Зарплата:** €4 000–7 000 gross в месяц

Если это звучит интересно — напишите мне ••••••••

Другие площадки
getmatch agency

ML Lead / Head of DS (Credit Risk)

getmatch agencyНа сервисе с: 04.10.26 12:05↑ Вакансия с автоподнятием
Зарплата не указанаРоссияСШАМоскваГибрид

Мы в поисках ML Lead / Head of DS (Credit Risk) для одного из крупнейших банков страны.

Задачи

  • Управление командой Data Science (4–5 человек).
  • Приоритизация и ведение бэклога.
  • Взаимодействие с бизнес-заказчиками и презентация результатов.
  • Помощь команде в выборе и реализации технических решений.
  • Разработка и улучшение ML-моделей для кредитного риска.
  • Тестирование новых источников данных и оценка их влияния на качество моделей.
  • Контроль внедрения моделей и достижения бизнес-эффекта.

Требования

  • Опыт разработки ML-моделей в банковской сфере.
  • Желателен опыт кредитования юридических лиц (SME/Corporate), кредитование ФЛ также рассматривается.
  • Опыт управления командой DS от 3–5 человек.
  • Понимание и практический опыт построения моделей PD, LGD, EAD, скоринга, antifraud и других риск-моделей.
  • Опыт работы с классическим ML на табличных данных.
  • Уверенное владение Python и SQL.
  • Опыт работы со стеком: Python, Pandas, NumPy, Scikit-learn, CatBoost, LightGBM, XGBoost, Spark, Hadoop, Hive, Impala.

Условия и бенефиты

  • Стабильная работа в одном из крупнейших банков страны.
  • Конкурентная заработная плата, соцпакет.
  • Формат работы: гибрид (достаточно 1 раз в неделю / 1 раз в 2 недели). Офис — Технопарк.
  • Сильное DS community, большое разнообразие рабочих и внерабочих активностей.
  • Дружный коллектив единомышленников (все специалисты, занимающиеся машинным обучением, объединены одним департаментом для максимально плотного и продуктивного обмена знаниями).
  • Условия для роста и развития (в т.ч. конференции, тренинги, внутренние программы развития).

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.