rwb (wildberries & russ)

MLOps Engineer (Devops) (Python)

ML Platform – платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек – это сотни миллионов предска…

rwb (wildberries & russ) · На сервисе с: 23.09.26 14:39

Зарплата не указанаРоссияМоскваУдалёнка

Направление работы:

ML Platform – платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек – это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс – порядка 400–500K RPS, десятки инстансов Triton.

Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем – строим общую мультитенантную ML-платформу для всего отдела.

Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов.

Стань частью команды!

Вам предстоит:

  • Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости;

  • Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты;

  • Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела;

  • Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация;

  • Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant);

  • Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения;

  • Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью.

Формат работы - гибридный или удаленный по договоренности с руководителем.

Вы нам подходите, если:

  • Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator);

  • Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing;

  • Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow, Airflow или аналоги);

  • Владеете Linux и bare-metal, IaC (Ansible или Terraform), Helm;

  • Имеете опыт разработки на Python или Go: операторы, экспортеры, внутренний тулинг;

  • Умеете взаимодействовать с DS-командами и переводить потребности в технические решения;

Будет плюсом:

  • Опыт с Triton Inference Server, vLLM, KServe или аналогами;

  • Опыт разделения и виртуализации GPU в Kubernetes для multi-tenant окружений;

  • Понимание векторных БД и их оптимизации (pgvector, FAISS, Milvus);

  • Сторадж под данные обучения: S3, Ceph, NFS;

  • Multi-node training: NCCL, InfiniBand, RDMA.

Похожие вакансии MLOps инженер

Соц.сети
Н

Senior ML Engineer / MLOps Engineer

Неизвестный работодательНа сервисе с: 24.09.26 16:26
Зарплата не указанаПольшаУдалёнка

#вакансия #vacancy
🚀 Senior ML Engineer / MLOps Engineer — 100% Remote
Must-have:
• Strong Python
AWS / SageMaker
MLOps, CI/CD
Docker + Kubernetes
• ML lifecycle tools: MLflow / Kubeflow / SageMaker Pipelines
• Production experience with ML & LLM applications
Generative AI / LLMOps
• PySpark / Apache Spark
• FastAPI / Flask
• Model training, fine-tuning, evaluation & optimization
📍 100% Remote | 🇬🇧 English B2+
📅 Duration: 3 months + extension
💰 Rate: TBD
⏰ Full-time
📩 Для подачи присылайте CV в telegram: ••••••••

Соц.сети
Т

Middle ML

телекомНа сервисе с: 24.09.26 15:57
Зарплата не указанаРоссияУдалёнка

ID 3661 - Middle ML

🌍 Локация: РФ
💼 Удаленно
🕔 Занятость: фуллтайм

🏢 Проект: Телеком

💡 Требования:
• ML Engineer, middle 1 Опыт деплоя ML-моделей от 2 лет
• Опыт с очередями, написание прод кода для агентов
• Знание Docker, k8s, CI/CD. Опыт MLOps: мониторинг моделей, ре-тренинг
• Успешное прохождение очного интервью с решением задач на применнеие Python и SQL на темы: развёртывание агента в k8s; публикация скиллов; публикация Tool на MCP; настройка коммуникации агентов через A2A; использование LLM; настройка мониторинга, алертов

➕Будет плюсом:
• Понимание AgentOps

📨 Отклик — через форму: ••••••••
или напрямую рекрутеру ••••••••

❗️Откликайтесь только при релевантном опыте.

❗️При первичном отклике:
ID вакансии / ФИО / локация / возраст / занятость (работаете/нет) / формат работы (удаленка, гибрид, офис) / стек / опыт / резюме / сверка с требованиями

❗️Повторный отклик: ID вакансии + сверка.

#ML #Удаленно #вакансия

Соц.сети
Н

ML Engineer / MLOps (Middle)

Неизвестный работодательНа сервисе с: 24.09.26 14:56
Зарплата не указанаРоссияУдалёнка

ID 3661
ML
Middle
РФ
Телеком

Кол-во специалистов: 1
Формат: удаленный
Продолжительность: до конца 2027

✅ Требования:

• ML Engineer, middle 1 Опыт деплоя ML-моделей от 2 лет
• Опыт с очередями, написание прод кода для агентов
• Знание Docker, k8s, CI/CD. Опыт MLOps: мониторинг моделей, ре-тренинг
• Успешное прохождение очного интервью с решением задач на применнеие Python и SQL на темы: развёртывание агента в k8s; публикация скиллов; публикация Tool на MCP; настройка коммуникации агентов через A2A; использование LLM; настройка мониторинга, алертов

➕Будет плюсом:

• Понимание AgentOps

❗️❗️❗️Пишите ••••••••⚡️⚡️⚡️⚡️, прикладывая резюме, в котором указан возраст и местонахождение. Укажите 🆔 вакансии! Без этой информации заявки не будут рассматриваться! ❗️❗️

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.