ртк-цод

DevOps \ MLOps

ртк-цод · На сервисе с: 25.06.26 17:12

↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваУдалёнка
Обязанности:
  • Развивать и поддерживать платформу для запуска ML workloads.
  • Администрировать и диагностировать проблемы в Kubernetes-кластере ML платформы.
  • Автоматизировать рутинные задачи с помощью инструментов автоматизации - python, ansible и terraform.
  • Поддерживать и развивать CI/CD-пайплайны и Helm чарты для ML сервисов.
  • Выполнять клиентские заявки высокой сложности в Service Desk, ESMP, Jira.
  • Настраивать мониторинг ML инфраструктуры - Prometheus, Grafana, Loki, Zabbix.
  • Участвовать в проработке архитектуры будущих ML сервисов со стороны эксплуатации.
  • Проводить плановые работы любого уровня сложности.
  • Вести документацию в рамках зоны ответственности отдела.
  • Вести аварии и составлять планы пост аварийных мер на ML платформе.
Требования:
  • Опыт администрирования Kubernetes кластеров от одного года.
  • Понимание, как работают основные компоненты Kubernetes: kube-apiserver, scheduler, controller-manager, kubelet, kube-proxy, etcd, CoreDNS.
  • Практический опыт диагностики проблем в Kubernetes: networking, scheduling, probes, ресурсы, storage, ingress, RBAC, CRD/operators.
  • Опыт работы с Helm: написание, модификация, шаблонизация, отладка и проверка чартов.
  • Опыт работы с системами автоматизации: Ansible и Terraform.
  • Уверенное знание Linux на уровне администратора.
  • Понимание сетей в Linux и Kubernetes: routing, iptables/nftables, IPVS, DNS, service discovery, network policies, K8S CNI Calico/Cilium.
  • Опыт работы с CI/CD: желателен GitLab CI.
  • Понимание Gitops подхода и цикла разработки приложения для k8s.
  • Знание одного из языков программирования на среднем уровне: Python или Go.
  • Опыт работы с системами мониторинга и логирования: Prometheus, Grafan, Loki, Zabbix или аналоги.
  • Умение самостоятельно расследовать сложные технические проблемы, читать логи, метрики, события Kubernetes и исходники/документацию при необходимости.

Будет плюсом

  • Опыт эксплуатации GPU-инфраструктуры в Kubernetes.
  • Опыт работы с NVIDIA stack: GPU Operator, Network Operator, MIG, vGPU, NCCL.
  • Опыт с ML serving/inference технологиями: NVIDIA Triton, vLLM, Transformers, SGLang, TensorRT-LLM.
  • Опыт работы с KServe, Knative, Kubeflow.
  • Опыт с service mesh/gateway-слоем в k8s: Istio, Envoy Gateway, Gateway API.
  • Опыт с storage в Kubernetes: Ceph/Rook.
  • Опыт работы с baremetal серверами и облаками.
  • Понимание особенностей high-load inference workloads: long-running requests, streaming, autoscaling, GPU scheduling, лимиты ресурсов, latency, throughput.

Что мы предлагаем:

  • Стабильный «белый» доход и полноценный соц. пакет;
  • Гибкое начало дня и гибридный формат работы (обсуждаем индивидуально с каждым кандидатом);
  • Корпоративный университет для внутреннего и внешнего профильного обучения;
  • Отличные перспективы карьерного роста – горизонтального и вертикального.

А также для Вас:

  • Программа ДМС с обслуживанием в лучших клиниках города;
  • Корпоративные команды по футболу, волейболу, бегу, а также скидки на фитнес-абонементы;
  • Эксклюзивная программа корпоративных привилегий и скидок Primezone;
  • Корпоративная мобильная связь.

Работая вместе с нами, Вы сможете принять участие в амбициозных, крупных проектах, значимых для страны!

Похожие вакансии MLOps инженер

Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

Сайты компаний
сбер

Head of ML (VLM, GigaChat Vision)

сберНа сервисе с: 14.06.26 16:50↑ Вакансия с автоподнятием
от 500k ₽РоссияМоскваОфис

Привет! Это GigaChat Vision — команда, которая делает полный цикл обучения VLM моделей. Ищем руководителя направления ML VLM, который возглавит команду целиком: будет формировать техническую стратегию, собирать и развивать команду, синхронизировать ключевые направления и отвечать за результат от идеи до продакшна.

Первый этап отбора на эту вакансию – общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!

  • Формировать техническую стратегию VLM-направления: определять приоритетные направления, выбирать ключевые исследовательские и инженерные треки, строить роадмап на несколько кварталов вперед;

  • Принимать ключевые архитектурные и продуктовые решения по обучению моделей: pretrain, stage 1.5, post-train, eval, стратегию по данным — и нести за них ответственность;

  • Определять стратегию развития моделей: какие способности модели развивать в первую очередь, какие проблемы ограничивают качество, где нужно усиливать данные, где — обучение, а где — чинить валидацию;

  • Определять стратегию данных совместно с руководителем команды данных: какие данные нужны для pretrain и stage 1.5, какие требования к качеству и покрытию, как донести улучшения в

  • Определять стратегию post-train совместно с RL/SFT-направлением: как выстраивать контур SFT, DPO, RL, какие рецепты и подходы дают устойчивый прирост качества, как минимизировать деградации;

  • Определять и развивать систему оценки качества моделей: выбирать ключевые метрики[a][b];

  • Строить и развивать команду: нанимать лидов и ключевых инженеров, выстраивать роли и зоны ответственности, создавать сильную инженерную и исследовательскую среду;

  • Отслеживать состояние области и переводить свежие идеи из статей и open-source в конкретные эксперименты, гипотезы и решения;

  • Быть готовым при необходимости лично погружаться в сложные технические задачи: разбирать деградации, дебажить эксперименты, принимать решения в условиях неполной информации и доводить сложные инициативы до результата руками.

  • Глубокое понимание полного цикла обучения LLM/VLM: pretrain → stage 1.5 → SFT / DPO / RL;

  • Сильный технический бэкграунд в modern ML: понимание того, как данные, архитектура, обучение и eval влияют на итоговое качество модели;

  • Опыт технического лидерства команды от 5-ти человек: создание роадмапов, декомпозиция задач, приоритизация, менторинг, развитие лидов и senior IC;

  • Опыт принятия архитектурных решений в research-heavy ML среде и ответственность за их результат;

  • Умение выстраивать процессы и принимать решения в условиях высокой неопределенности;

  • Опыт взаимодействия со смежными командами и стейкхолдерами, способность синхронизировать несколько направлений одновременно;

  • Системное мышление: способность видеть всю картину целиком — от данных и обучения до валидации, инфраструктуры и продуктового качества модели.

Будет плюсом:

  • Опыт запуска или развития VLM/LLM-направления с нуля;

  • Опыт доведения моделей до продакшена;

  • Опыт найма и формирования сильной технической команды;

  • Опыт работы с мультимодальными моделями, OCR, grounding, video, document understanding

  • Публикации или open-source вклад в области LLM/VLM;

  • Опыт работы с распределённым обучением (DeepSpeed, FSDP) и training/inference infrastructure.

  • крупнейшее DS&AI community — более 600 DS-специалистов банка

  • дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира

  • возможность быть соавтором НИРов и статей для международных конференций

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:Getmatch
Соц.сети
Н

ML Engineer

Неизвестный работодательНа сервисе с: 19.08.26 18:48
Зарплата не указанаРоссияУдалёнка

#вакансия #удаленно #РФ #ML
Вакансия: ML Engineer
Локация: РФ

В нашу команду нужен сильный разработчик, который строит production-решения на базе LLM, а не просто обучает модели в ноутбуке.

Критически важно:
✅ Реальный опыт разработки RAG-пайплайнов и работы с LLM в продакшене.
✅ Крепкий бэкенд (Python) + опыт внедрения ML-моделей как сервисов.
✅ Вы больше разработчик, чем Data Scientist.

🛠 Стек и технологии:
Core: Python (3+ лет в коммерческой разработке)
Orchestration & MLOps: Airflow / Argo Workflows, MLflow, Jenkins
Big Data & Streaming: Hadoop, PySpark, Kafka
Deployment: Docker, Kubernetes, Seldon / Kserve
ML/LLM: Опыт работы с ML-моделями, NLP, LLM (RAG, fine-tuning, deployment)

Отлик: @dobysh_v

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.