
Мы развиваем GigaChat и ищем сильного инженера в команду RL efficiency, который возьмёт на себя ускорение rollout — этапа, на котором модель генерирует траектории во время online RL обучения и который часто становится главной проблемой RL-…
сбер · На сервисе с: 21.07.26 15:06
↑ Вакансия с автоподнятиемМы развиваем GigaChat и ищем сильного инженера в команду RL efficiency, который возьмёт на себя ускорение rollout — этапа, на котором модель генерирует траектории во время online RL обучения и который часто становится главной проблемой RL-пайплайна.
Это роль для человека, который умеет одновременно разбираться в инференсе LLM, обучающем контуре и в том, как правильно стыковать их между собой, чтобы online RL обучение GigaChat работало быстро, стабильно и с максимальной утилизацией кластера.
Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных системах, предлагать новые решения и нести ответственность за результат.
ускорять rollout в online RL
оптимизировать генерацию rollout'ов: throughput, latency, утилизация GPU, batch-планирование, continuous batching
повышать эффективность работы инференс-движков (vLLM / SGLang / собственные решения) под задачи RL: длинные контексты, многократные запросы, динамический batch
работать с KV-cache: переиспользование, квантизация, offload, управление памятью при параллельных rollout'ах.
оптимизировать inference для MoE-моделей и специфичных для GigaChat архитектур
выстраивать связку rollout и обучения
строить эффективный обмен весами между обучающим контуром и rollout-движком: быстрое обновление, минимизация overhead
выстраивать overlap между rollout, reward-сигналами и шагами обучения, чтобы GPU не простаивал
поддерживать работу rollout на масштабе: десятки и сотни узлов, стабильность при сбоях, автоматическое восстановление
обеспечивать согласованность между моделью в обучении и в rollout: точность, токенизация, семплирование
профилировать и оптимизировать стек
находить узкие места в rollout-пайплайне с помощью профилирования на уровне kernel, memory, communication
писать кастомные оптимизации под H100 / B200 и эффективно использовать возможности hardware
выстраивать бенчмарки и регрессии по перфу rollout, чтобы улучшения были воспроизводимыми и стабильно держались в продакшене
тесно взаимодействовать с командами RL, pretrain, инфраструктуры и бэкенда
брать на себя ответственность за целые куски системы: от идеи до результата в проде
делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.
отличное владение Python и PyTorch
практический опыт с large-scale inference LLM: vLLM, SGLang, TRT-LLM или аналоги
глубокое понимание того, как устроен инференс трансформеров: KV-cache, attention, batching, семплирование
опыт оптимизации throughput и latency на GPU: профилирование, устранение узких мест, работа с памятью
понимание distributed training и того, как стыковать обучение и инференс в одном пайплайне
умение писать чистый, надёжный, production-ready код и разбираться в сложных системах.
Будет плюсом:
практический опыт с online RL / RLHF / RLVR и пониманием специфики rollout в этих пайплайнах
опыт написания CUDA / Triton ядер и понимание архитектуры NVIDIA GPU
опыт оптимизации инференса для MoE-моделей
опыт работы с современными RL-стеками: verl, TRL, OpenRLHF
понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), long-context, RoPE
публикации, open-source вклад или сильный прикладной track record.
возможность выбрать удобный формат работы: гибрид или офис
ежегодный пересмотр зарплаты, годовая премия
корпоративный спортзал и зоны отдыха
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
ипотека выгоднее до 7% для каждого сотрудника
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
вознаграждение за рекомендацию друзей в команду Сбера.
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.