гк орбита

MLOps Engineer (Middle)

гк орбита · На сервисе с: 19.08.26 11:04

Зарплата не указанаРоссияМоскваУдалёнка

Группа Компаний Орбита - ведущий разработчик цифровых решений, российская аккредитованная ИТ-компания

Масштабный технологический проект с глубокой экспертизой в цифровизации бизнеса. Ключевые отрасли: государственный сектор, FinTech, HR Tech, коммуникации и медиа, услуги, рынок недвижимости, travel.

Нам доверяют крупнейшие компании РФ, среди них: Т1, ВТБ, Иннотех, Альфа Банк, ОИС и другие.

Более 6 лет мы ведем собственную продуктовую и заказную разработку высокоэффективных цифровых решений.

Задачи:

  • Развертывать и поддерживать LLM/ML-платформу в Kubernetes.
  • Работать с Helm, Terraform и Kubernetes Operators.
  • Настраивать и развивать CI/CD для ML/AI-сервисов, включая обучение моделей, inference и data pipelines.
  • Автоматизировать ML workflow с использованием Kubeflow.
  • Настраивать мониторинг моделей и AI-сервисов: latency, drift, использование ресурсов и cost metrics.
  • Разрабатывать и поддерживать пайплайны данных для обучения и inference.
  • Работать с Kafka, Data Lake, S3-совместимыми объектными хранилищами и векторными базами данных.
  • Участвовать в оптимизации GPU-кластера и эффективном распределении вычислительных ресурсов.
  • Обеспечивать безопасность AI-инфраструктуры: изоляцию сред, контроль доступа, аудит и логирование.
  • Взаимодействовать с командами разработки, Data Science и инфраструктуры для развития платформы.

Требования:

  • Коммерческий опыт работы с Kubernetes и Kubernetes-кластерами в cloud или on-premise окружении.
  • Уверенное знание Python.
  • Опыт работы с MLOps-инструментами, желательно Kubeflow и Airflow.
  • Практический опыт настройки CI/CD, преимущественно Jenkins.
  • Опыт работы с системами хранения данных и векторными БД: Weaviate, Qdrant, PGVector или аналогами.
  • Знание инструментов мониторинга и логирования: Prometheus, Grafana, ELK, OpenTelemetry.
  • Понимание принципов построения ML/AI-инфраструктуры и жизненного цикла моделей.
  • Понимание принципов работы LLM, GenAI и RAG-систем будет преимуществом.

Мы предлагаем:

  • ​Удаленный формат работы;
  • Белую заработную плату, оформление согласно Трудовому кодексу РФ;
  • Комфортный старт: 3 месяца плавного погружения под присмотром HR;
  • Поддержку: IT-отсрочку и консультации HR/юристов;
  • Прозрачные процессы и открытую коммуникацию;
  • Работу на лучшем оборудовании без логирования времени, с фокусом на доверии и результате;
  • ДМС: медицинское страхование за счет компании;
  • Развитие: индивидуальный план обучения, посещение конференций и митапов, поддержка в развитии карьеры;
  • Личный бренд: возможность выступать на конференциях, митапах, публикация статей;
  • Бенефиты: ежеквартальное обновление корпоративных скидок;
  • Движ: организация вечеринок оффлайн и онлайн, предоставление мерча, проведение конкурсов и челленджей.

    Откликайтесь, будем рады познакомиться лично!

Похожие вакансии MLOps инженер

Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

Сайты компаний
сбер

Head of ML (VLM, GigaChat Vision)

сберНа сервисе с: 14.06.26 16:50↑ Вакансия с автоподнятием
от 500k ₽РоссияМоскваОфис

Привет! Это GigaChat Vision — команда, которая делает полный цикл обучения VLM моделей. Ищем руководителя направления ML VLM, который возглавит команду целиком: будет формировать техническую стратегию, собирать и развивать команду, синхронизировать ключевые направления и отвечать за результат от идеи до продакшна.

Первый этап отбора на эту вакансию – общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!

  • Формировать техническую стратегию VLM-направления: определять приоритетные направления, выбирать ключевые исследовательские и инженерные треки, строить роадмап на несколько кварталов вперед;

  • Принимать ключевые архитектурные и продуктовые решения по обучению моделей: pretrain, stage 1.5, post-train, eval, стратегию по данным — и нести за них ответственность;

  • Определять стратегию развития моделей: какие способности модели развивать в первую очередь, какие проблемы ограничивают качество, где нужно усиливать данные, где — обучение, а где — чинить валидацию;

  • Определять стратегию данных совместно с руководителем команды данных: какие данные нужны для pretrain и stage 1.5, какие требования к качеству и покрытию, как донести улучшения в

  • Определять стратегию post-train совместно с RL/SFT-направлением: как выстраивать контур SFT, DPO, RL, какие рецепты и подходы дают устойчивый прирост качества, как минимизировать деградации;

  • Определять и развивать систему оценки качества моделей: выбирать ключевые метрики[a][b];

  • Строить и развивать команду: нанимать лидов и ключевых инженеров, выстраивать роли и зоны ответственности, создавать сильную инженерную и исследовательскую среду;

  • Отслеживать состояние области и переводить свежие идеи из статей и open-source в конкретные эксперименты, гипотезы и решения;

  • Быть готовым при необходимости лично погружаться в сложные технические задачи: разбирать деградации, дебажить эксперименты, принимать решения в условиях неполной информации и доводить сложные инициативы до результата руками.

  • Глубокое понимание полного цикла обучения LLM/VLM: pretrain → stage 1.5 → SFT / DPO / RL;

  • Сильный технический бэкграунд в modern ML: понимание того, как данные, архитектура, обучение и eval влияют на итоговое качество модели;

  • Опыт технического лидерства команды от 5-ти человек: создание роадмапов, декомпозиция задач, приоритизация, менторинг, развитие лидов и senior IC;

  • Опыт принятия архитектурных решений в research-heavy ML среде и ответственность за их результат;

  • Умение выстраивать процессы и принимать решения в условиях высокой неопределенности;

  • Опыт взаимодействия со смежными командами и стейкхолдерами, способность синхронизировать несколько направлений одновременно;

  • Системное мышление: способность видеть всю картину целиком — от данных и обучения до валидации, инфраструктуры и продуктового качества модели.

Будет плюсом:

  • Опыт запуска или развития VLM/LLM-направления с нуля;

  • Опыт доведения моделей до продакшена;

  • Опыт найма и формирования сильной технической команды;

  • Опыт работы с мультимодальными моделями, OCR, grounding, video, document understanding

  • Публикации или open-source вклад в области LLM/VLM;

  • Опыт работы с распределённым обучением (DeepSpeed, FSDP) и training/inference infrastructure.

  • крупнейшее DS&AI community — более 600 DS-специалистов банка

  • дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира

  • возможность быть соавтором НИРов и статей для международных конференций

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:Getmatch
Соц.сети
Н

ML Engineer

Неизвестный работодательНа сервисе с: 19.08.26 18:48
Зарплата не указанаРоссияУдалёнка

#вакансия #удаленно #РФ #ML
Вакансия: ML Engineer
Локация: РФ

В нашу команду нужен сильный разработчик, который строит production-решения на базе LLM, а не просто обучает модели в ноутбуке.

Критически важно:
✅ Реальный опыт разработки RAG-пайплайнов и работы с LLM в продакшене.
✅ Крепкий бэкенд (Python) + опыт внедрения ML-моделей как сервисов.
✅ Вы больше разработчик, чем Data Scientist.

🛠 Стек и технологии:
Core: Python (3+ лет в коммерческой разработке)
Orchestration & MLOps: Airflow / Argo Workflows, MLflow, Jenkins
Big Data & Streaming: Hadoop, PySpark, Kafka
Deployment: Docker, Kubernetes, Seldon / Kserve
ML/LLM: Опыт работы с ML-моделями, NLP, LLM (RAG, fine-tuning, deployment)

Отлик: @dobysh_v

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.