x5 tech

MLOps / ML Infrastructure Engineer (Python, Java)

Мы ищем инженера, который будет отвечать за стабильную работу ML-инфраструктуры и сервисов инференса в production.

x5 tech · На сервисе с: 28.08.26 11:07

Зарплата не указанаРоссияУдалёнка

Мы ищем инженера, который будет отвечать за стабильную работу ML-инфраструктуры и сервисов инференса в production.
В этой роли предстоит настраивать и поддерживать Triton Inference Server, работать с Kubernetes и CI/CD, следить за стабильностью ML-сервисов и пайплайнов, разбирать инциденты и постепенно улучшать инфраструктуру.

В нашей команде тебе предстоит:

  • Настраивать и поддерживать NVIDIA Triton Inference Server для production-нагрузки;
  • Загружать и обновлять модели в Triton, настраивать model repository, версии моделей и параметры инференса;
  • Поддерживать и развивать CI/CD для моделей и ML-сервисов;
  • Настраивать Kubernetes-ресурсы: CPU, GPU, memory, requests/limits, autoscaling и deployment'ы;
  • Поддерживать DAG'и и пайплайны, разбирать и устранять возникающие проблемы;
  • Диагностировать инциденты: миграция базы, проблемы с сервисами, нехватка памяти/CPU/GPU, падения pod'ов и другие production-проблемы;
  • Следить за состоянием сервисов по дашбордам, метрикам и логам;
  • Анализировать логи и метрики: определять, что именно сломалось, когда началась проблема и где находится её первопричина;
  • Участвовать в устранении технического долга и развитии инфраструктуры;
  • Переводить существующие процессы на более современные инструменты, в том числе участвовать в миграции на MLflow;
  • Автоматизировать повторяющиеся операции и снижать количество ручных действий при эксплуатации ML-сервисов.
Что мы ожидаем от кандидата:
  • Уверенное знание Linux и понимание принципов эксплуатации production-сервисов;
  • Практический опыт работы с Kubernetes: deployments, pods, requests/limits, probes, ConfigMap/Secret, volumes, ресурсы и troubleshooting;
  • Опыт настройки и эксплуатации CI/CD;
  • Понимание принципов работы ML-инференса и жизненного цикла ML-модели в production;
  • Опыт работы с Triton Inference Server или близкими системами model serving;
  • Умение читать и анализировать логи и метрики, находить причину проблем, а не только перезапускать сервис;
  • Базовое понимание мониторинга: Prometheus/Grafana или аналогичные инструменты;
  • Опыт работы с Python и/или Bash для автоматизации;
  • Умение самостоятельно разбираться в незнакомой инфраструктуре и доводить проблему до решения.

Будет плюсом:

  • Опыт работы с GPU в Kubernetes: NVIDIA device plugin, GPU requests/limits, CUDA;
  • Опыт оптимизации ML-инференса и понимание latency/throughput/batching;
  • Знание MLflow и практический опыт работы с Model Registry;
  • Опыт с Airflow или другими системами оркестрации DAG'ов;
  • Опыт работы с Prometheus, Grafana, Loki/ELK и системами алертинга.
  • Знание Helm, Terraform или Argo CD;
  • Опыт эксплуатации ML-платформ или большого количества ML-сервисов в production.

Условия:

  • Возможность работать удалённо или в гибридном формате;
  • Гибкий график работы;
  • Официальное оформление с "белой" ЗП, ежеквартальные и годовые премии по результатам работы;
  • Удобный офис рядом с м. «Добрынинская» или удаленную работу;
  • Широкий пакет ДМС (включая выезд за рубеж и стоматологию), страхование жизни и здоровья;
  • Возможность учиться и развиваться за счёт компании: внешние тренинги и семинары по профессиональным тематикам, участие в крупнейших конференциях страны, программы развития цифровых и управленческих навыков (Цифровая академия, Школа Тимлидов), онлайн и офлайн мастер-классы, корпоративный университет «X5 Полка», школа наставников и многое другое;
  • Программы мотивации для спикеров и авторов: внутренняя школа Speak Up School, Write Up, ачивки и баллы за выступления, подготовка спикеров к крупнейшим конференциям страны, сообщество авторов на Хабре, возможность шерить опыт с комьюнити внутренних и внешних экспертов;
  • Обмен опытом через cообщества: 12 технических комьюнити от java до devops;
  • Яркая корпоративная жизнь с большим количеством мероприятий, конкурсов и возможностей для творческой реализации: регулярные внутренние митапы, демо-дни, открытые микрофоны, день IT-специалиста, программы волонтерства, корпоративное предпринимательство X5 Idea Challenge;
  • Забота о благополучии сотрудников: 7 спортивных сообществ (бег, футбол, волейбол, баскетбол, хоккей, лыжи, триатлон), ежегодная Неделя здоровья;
  • Скидки в экосистеме бизнесов Х5 («Пятёрочка», «Перекрёсток», «Много лосося», «Перекресток Впрок»);
  • Программа привилегий Prime-zone (скидки на товары и услуги и специальные предложения от компаний-партнёров);
  • Материальная помощь сотрудникам, попавшим в сложную жизненную ситуацию.
Эта вакансия также есть на:Getmatch

Похожие вакансии MLOps инженер

Соц.сети
Н

Senior ML Engineer / MLOps Engineer

Неизвестный работодательНа сервисе с: 24.09.26 16:26
Зарплата не указанаПольшаУдалёнка

#вакансия #vacancy
🚀 Senior ML Engineer / MLOps Engineer — 100% Remote
Must-have:
• Strong Python
AWS / SageMaker
MLOps, CI/CD
Docker + Kubernetes
• ML lifecycle tools: MLflow / Kubeflow / SageMaker Pipelines
• Production experience with ML & LLM applications
Generative AI / LLMOps
• PySpark / Apache Spark
• FastAPI / Flask
• Model training, fine-tuning, evaluation & optimization
📍 100% Remote | 🇬🇧 English B2+
📅 Duration: 3 months + extension
💰 Rate: TBD
⏰ Full-time
📩 Для подачи присылайте CV в telegram: ••••••••

Соц.сети
Т

Middle ML

телекомНа сервисе с: 24.09.26 15:57
Зарплата не указанаРоссияУдалёнка

ID 3661 - Middle ML

🌍 Локация: РФ
💼 Удаленно
🕔 Занятость: фуллтайм

🏢 Проект: Телеком

💡 Требования:
• ML Engineer, middle 1 Опыт деплоя ML-моделей от 2 лет
• Опыт с очередями, написание прод кода для агентов
• Знание Docker, k8s, CI/CD. Опыт MLOps: мониторинг моделей, ре-тренинг
• Успешное прохождение очного интервью с решением задач на применнеие Python и SQL на темы: развёртывание агента в k8s; публикация скиллов; публикация Tool на MCP; настройка коммуникации агентов через A2A; использование LLM; настройка мониторинга, алертов

➕Будет плюсом:
• Понимание AgentOps

📨 Отклик — через форму: ••••••••
или напрямую рекрутеру ••••••••

❗️Откликайтесь только при релевантном опыте.

❗️При первичном отклике:
ID вакансии / ФИО / локация / возраст / занятость (работаете/нет) / формат работы (удаленка, гибрид, офис) / стек / опыт / резюме / сверка с требованиями

❗️Повторный отклик: ID вакансии + сверка.

#ML #Удаленно #вакансия

Соц.сети
Н

ML Engineer / MLOps (Middle)

Неизвестный работодательНа сервисе с: 24.09.26 14:56
Зарплата не указанаРоссияУдалёнка

ID 3661
ML
Middle
РФ
Телеком

Кол-во специалистов: 1
Формат: удаленный
Продолжительность: до конца 2027

✅ Требования:

• ML Engineer, middle 1 Опыт деплоя ML-моделей от 2 лет
• Опыт с очередями, написание прод кода для агентов
• Знание Docker, k8s, CI/CD. Опыт MLOps: мониторинг моделей, ре-тренинг
• Успешное прохождение очного интервью с решением задач на применнеие Python и SQL на темы: развёртывание агента в k8s; публикация скиллов; публикация Tool на MCP; настройка коммуникации агентов через A2A; использование LLM; настройка мониторинга, алертов

➕Будет плюсом:

• Понимание AgentOps

❗️❗️❗️Пишите ••••••••⚡️⚡️⚡️⚡️, прикладывая резюме, в котором указан возраст и местонахождение. Укажите 🆔 вакансии! Без этой информации заявки не будут рассматриваться! ❗️❗️

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.