Неизвестный работодатель · На сервисе с: 19.08.26 18:48
#вакансия #удаленно #РФ #ML
Вакансия: ML Engineer
Локация: РФ
В нашу команду нужен сильный разработчик, который строит production-решения на базе LLM, а не просто обучает модели в ноутбуке.
Критически важно:
✅ Реальный опыт разработки RAG-пайплайнов и работы с LLM в продакшене.
✅ Крепкий бэкенд (Python) + опыт внедрения ML-моделей как сервисов.
✅ Вы больше разработчик, чем Data Scientist.
🛠 Стек и технологии:
Core: Python (3+ лет в коммерческой разработке)
Orchestration & MLOps: Airflow / Argo Workflows, MLflow, Jenkins
Big Data & Streaming: Hadoop, PySpark, Kafka
Deployment: Docker, Kubernetes, Seldon / Kserve
ML/LLM: Опыт работы с ML-моделями, NLP, LLM (RAG, fine-tuning, deployment)
Отлик: @dobysh_v
Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.
Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.
Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.
Оптимизация инфраструктуры RL-обучения
Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.
Развитие инструментов диагностики
Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.
Повышение отказоустойчивости инфраструктуры
Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.
Исследование и внедрение современных решений
Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.
Больше о бэкенде в Яндексе — в канале Yandex for Backend
* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями
* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton
Привет! Это GigaChat Vision — команда, которая делает полный цикл обучения VLM моделей. Ищем руководителя направления ML VLM, который возглавит команду целиком: будет формировать техническую стратегию, собирать и развивать команду, синхронизировать ключевые направления и отвечать за результат от идеи до продакшна.
Первый этап отбора на эту вакансию – общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!
Формировать техническую стратегию VLM-направления: определять приоритетные направления, выбирать ключевые исследовательские и инженерные треки, строить роадмап на несколько кварталов вперед;
Принимать ключевые архитектурные и продуктовые решения по обучению моделей: pretrain, stage 1.5, post-train, eval, стратегию по данным — и нести за них ответственность;
Определять стратегию развития моделей: какие способности модели развивать в первую очередь, какие проблемы ограничивают качество, где нужно усиливать данные, где — обучение, а где — чинить валидацию;
Определять стратегию данных совместно с руководителем команды данных: какие данные нужны для pretrain и stage 1.5, какие требования к качеству и покрытию, как донести улучшения в
Определять стратегию post-train совместно с RL/SFT-направлением: как выстраивать контур SFT, DPO, RL, какие рецепты и подходы дают устойчивый прирост качества, как минимизировать деградации;
Определять и развивать систему оценки качества моделей: выбирать ключевые метрики[a][b];
Строить и развивать команду: нанимать лидов и ключевых инженеров, выстраивать роли и зоны ответственности, создавать сильную инженерную и исследовательскую среду;
Отслеживать состояние области и переводить свежие идеи из статей и open-source в конкретные эксперименты, гипотезы и решения;
Быть готовым при необходимости лично погружаться в сложные технические задачи: разбирать деградации, дебажить эксперименты, принимать решения в условиях неполной информации и доводить сложные инициативы до результата руками.
Глубокое понимание полного цикла обучения LLM/VLM: pretrain → stage 1.5 → SFT / DPO / RL;
Сильный технический бэкграунд в modern ML: понимание того, как данные, архитектура, обучение и eval влияют на итоговое качество модели;
Опыт технического лидерства команды от 5-ти человек: создание роадмапов, декомпозиция задач, приоритизация, менторинг, развитие лидов и senior IC;
Опыт принятия архитектурных решений в research-heavy ML среде и ответственность за их результат;
Умение выстраивать процессы и принимать решения в условиях высокой неопределенности;
Опыт взаимодействия со смежными командами и стейкхолдерами, способность синхронизировать несколько направлений одновременно;
Системное мышление: способность видеть всю картину целиком — от данных и обучения до валидации, инфраструктуры и продуктового качества модели.
Будет плюсом:
Опыт запуска или развития VLM/LLM-направления с нуля;
Опыт доведения моделей до продакшена;
Опыт найма и формирования сильной технической команды;
Опыт работы с мультимодальными моделями, OCR, grounding, video, document understanding
Публикации или open-source вклад в области LLM/VLM;
Опыт работы с распределённым обучением (DeepSpeed, FSDP) и training/inference infrastructure.
крупнейшее DS&AI community — более 600 DS-специалистов банка
дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира
возможность быть соавтором НИРов и статей для международных конференций
возможность выбрать удобный формат работы: гибрид или офис
ежегодный пересмотр зарплаты, годовая премия
корпоративный спортзал и зоны отдыха
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
ипотека выгоднее до 7% для каждого сотрудника
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
вознаграждение за рекомендацию друзей в команду Сбера.
#вакансия #удаленно #РФ #ML
Вакансия: ML Engineer
Локация: РФ
В нашу команду нужен сильный разработчик, который строит production-решения на базе LLM, а не просто обучает модели в ноутбуке.
Критически важно:
✅ Реальный опыт разработки RAG-пайплайнов и работы с LLM в продакшене.
✅ Крепкий бэкенд (Python) + опыт внедрения ML-моделей как сервисов.
✅ Вы больше разработчик, чем Data Scientist.
🛠 Стек и технологии:
Core: Python (3+ лет в коммерческой разработке)
Orchestration & MLOps: Airflow / Argo Workflows, MLflow, Jenkins
Big Data & Streaming: Hadoop, PySpark, Kafka
Deployment: Docker, Kubernetes, Seldon / Kserve
ML/LLM: Опыт работы с ML-моделями, NLP, LLM (RAG, fine-tuning, deployment)
Отлик: @dobysh_v
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.