мтс

MLOps Engineer (LLM / Multi-Agent Systems / Kubernetes / RAG)

Ставка: до 250 000 руб. на руки в месяц.

мтс На сервисе с: 10.10.26 21:07

до 250k ₽РоссияУдалёнка

#vacancy

MLOps Engineer (LLM / Multi-Agent Systems / Kubernetes / RAG) ⚡️🤖

ID вакансии: MLm_DNA

Ставка: до 250 000 руб. на руки в месяц.

Грейд: Middle+ / Senior.

Загрузка: Full-time.

Формат: Удалённо.

Локация/Гражданство: РФ.

🏢 Клиент: МТС.

🧩 О проекте: построение и развитие современных MLOps-платформ для машинного обучения с фокусом на LLM-решения, RAG-пайплайны и мультиагентные системы.

Ищем MLOps-инженера, который находится на стыке классического DevOps и передовых AI-технологий. Роль для специалиста, который не только умеет строить надежные CI/CD и оркестрировать пайплайны в Kubernetes, но и глубоко понимает специфику развертывания и обслуживания LLM, LangGraph и Multi-Agent систем.

🚀 Ключевые задачи:

— Построение, развитие и поддержка MLOps-платформ для машинного обучения. — Оркестрация ML-пайплайнов и процессов обработки данных (Apache Airflow). — Внедрение и поддержка инструментов трекинга экспериментов, версионирования данных и моделей (MLflow, ClearML, Kubeflow, DVC). — Настройка и поддержка CI/CD процессов специально для ML-моделей и сервисов. — Инфраструктурная поддержка разработки и развертывания Multi-Agent Systems, RAG-пайплайнов и LLM-приложений. — Настройка мониторинга и наблюдаемости (Observability) для ML-сервисов и LLM-инференса.

🎯 Обязательные требования (Hard Skills):

MLOps и DevOps (КРИТИЧНО!): — Глубокое понимание и опыт работы с Docker и Kubernetes (K8s). — Опыт построения CI/CD for ML (специфичные пайплайны для обучения и деплоя моделей). — Владение инструментами MLOps: MLflow, ClearML, Kubeflow, DVC.

LLM и Agentic AI (КРИТИЧНО!): — Понимание и опыт работы с фреймворками: LangChain, LangGraph, LlamaIndex. — Опыт поддержки инфраструктуры для Multi-Agent Systems и Autonomous Agents. — Понимание принципов RAG (Retrieval-Augmented Generation), MCP (Model Context Protocol), Prompt Engineering и Tool Use. — Опыт работы с API LLM-провайдеров (OpenAI и аналоги).

Оркестрация и наблюдаемость: — Уверенный опыт работы с Apache Airflow. — Опыт настройки мониторинга и наблюдаемости (Observability) для ML-систем (метрики качества моделей, дрейф данных, latency, throughput).

💡 Будет плюсом: — Опыт оптимизации инференса LLM (vLLM, TensorRT-LLM, Ollama). — Знание Python на уровне, достаточном для написания скриптов автоматизации и кастомных операторов Airflow. — Понимание векторных баз данных (Qdrant, Milvus, pgvector) и их эксплуатации.

📲 Контакт для отклика: @hrwomenpro (При отклике, пожалуйста, пишите ID вакансии: MLm_DNA)

Похожие вакансии MLOps инженер

hh.ru
Зарплата не указанаРоссияМоскваУдалёнка
Ищем инженера, который совмещает прикладную ML-разработку и MLOps: умеет работать с данными и моделями, организовать воспроизводимый процесс и довести решение до стабильной работы в production с помощью ИИ-агентов.

Ответственность end-to-end: от постановки ML-задачи и выбора подхода до работающего сервиса и контроля качества после запуска. Нужен специалист, способный не только развернуть готовую модель, но и подготовить данные, обучить или адаптировать модель, оценить результат и лично проверить его в продукте.

Обязанности:
  • Вести ML-задачу полного цикла. Уточнять задачу и критерии успеха, анализировать и подготавливать данные, создавать baseline и выбирать подход. Определять, достаточно ли готовой модели или требуется её адаптация либо обучение.
  • Обучать и оценивать модели. Обучать или дообучать модели, анализировать ошибки, сравнивать решения по качеству, скорости и стоимости. Документировать результаты экспериментов и ограничения выбранного подхода.
  • Организовывать воспроизводимый MLOps-процесс. Автоматизировать подготовку данных, обучение, оценку и развёртывание; версионировать данные, код, модели и конфигурации. Обеспечивать повторяемость экспериментов и сборок.
  • Разрабатывать и сопровождать ML-сервисы. Создавать сервисы инференса и интеграции с продуктом, настраивать окружения CPU/GPU, тестирование, CI/CD, мониторинг, обновление и откат моделей.
  • Настраивать ИИ-агентов для ML и инфраструктуры. Создавать skills, проектные инструкции и workflow. Подключать инструменты и документацию, контролировать доступ к данным, секретам и вычислительным ресурсам, проверять подготовленный агентами код.
  • Лично валидировать качество. Вручную проверять данные и разметку на выборках, анализировать предсказания и ошибки модели, исследовать проблемные сценарии. Не ограничиваться сводными метриками.
  • Проверять решение в целевой среде. Лично проходить реальные сценарии в развёрнутом продукте, проверять интеграции и нагрузочные характеристики. Диагностировать проблемы данных, модели, сервиса и инфраструктуры.
  • Контролировать работу после запуска. Следить за качеством, задержками, ошибками, потреблением ресурсов и изменениями входных данных. Исследовать отклонения, устранять проблемы и проверять результат исправлений.
Требования:
  • Практический опыт прикладного ML. Самостоятельная подготовка данных, обучение и оценка моделей, анализ ошибок. Понимание выбора метрик, разделения данных на обучающие, валидационные и тестовые выборки, переобучения и утечек данных.
  • Самостоятельная ML-разработка. Уверенный Python, опыт PyTorch и/или scikit-learn либо аналогичных инструментов. Умение читать, писать и отлаживать код подготовки данных, обучения и инференса, а не только запускать готовые примеры.
  • Production-опыт и MLOps. Практический опыт развёртывания и сопровождения ML-сервисов. Понимание API, хранения и версионирования артефактов, воспроизводимости окружений, мониторинга, обновления и отката моделей.
  • Инженерная инфраструктура. Практические навыки Linux, Docker, Git, тестирования и CI/CD. Умение диагностировать проблемы производительности, использования CPU/GPU и памяти.
  • Coding agents и их адаптация. Практический опыт Codex, Claude Code или аналогов; создание skills и проектных инструкций, настройка контекста, инструментов и безопасных окружений под ML- и инфраструктурные задачи.
  • Личная ответственность за результат. Готовность самостоятельно проверять код и выводы агентов, вручную анализировать данные и предсказания, проверять реальные сценарии и доводить модель и сервис до согласованного качества.

Будет плюсом:

  • Опыт MLflow, DVC, Kubernetes и оркестраторов вычислительных задач.
  • Опыт оптимизации GPU-инференса, батчинга, квантования и нагрузочного тестирования ML-сервисов.
  • Опыт в одном или нескольких направлениях: NLP/LLM, компьютерное зрение, обработка речи или ML на табличных данных.

Что считается завершённой работой:

  • Получено воспроизводимое решение с подтверждённым качеством, проверенное в целевой среде и интегрированное в продукт. Результаты оценки и известные ограничения зафиксированы, мониторинг, обновление и откат предусмотрены.​​​​​​​​​​​​​​ ​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​Личный анализ данных и предсказаний, а также проверка реальных сценариев обязательны. Одной сводной метрики, обученной модели или работающего endpoint недостаточно.

Условия:

  • Фиксированная оплата труда. Уровень дохода в оффере будет согласовываться по грейдовой системе, исходя из результатов собеседования.
  • Готовы рассматривать кандидатов с разным уровнем квалификации (junior/middle/senior).
  • Оформление через ИП.
Соц.сети
мтс

Middle+ / Senior MLOps Engineer

мтсНа сервисе с: 09.10.26 15:48
Зарплата не указанаРоссияУдалёнка

Middle+ / Senior MLOps Engineer в МТС Актуально до 12.10.26
#Middle+ #Senior #MLOpsEngineer #РФ #Удаленно

Требования:
Критично: MLOps, DevOps; Docker, Kubernetes (K8s). CI/CD для ML (пайплайны обучения и деплоя). Инструменты MLOps: MLflow, ClearML, Kubeflow, DVC. LLM и Agentic AI (критично). Понимание и опыт с фреймворками: LangChain, LangGraph, LlamaIndex; поддержка Multi-Agent и Autonomous Agents. Знание RAG, MCP, Prompt Engineering, Tool Use; работа с API LLM‐провайдеров (OpenAI и аналоги). Оркестрация и наблюдаемость: Apache Airflow; мониторинг ML‐систем (качество моделей, дрейф данных, latency, throughput). Плюсом: оптимизация инференса LLM (vLLM, TensorRT‐LLM, Ollama). Дополнительно: Python для автоматизации и кастомных операторов Airflow; векторные БД (Qdrant, Milvus, pgvector) и их эксплуатации.

Локация:📍Удалённо, РФ. Гр: РФ. Full-time.

Контакт для отклика: •••••••• +CV акцент:MLOps пл.,Kubernetes, LLM/Agentic AI (LangGraph, RAG).ID вак:MLm_DNA

••••••••

Сайты компаний
СБЕР

Senior ML Platform Engineer

СБЕРНа сервисе с: 09.10.26 16:42
Зарплата не указанаРоссияМоскваГибрид

Мы ищем сильного бэкенд-разработчика, который будет отвечать за архитектуру и надежность сервисов и пайплайнов обучения ML-моделей

  • Разработка системного дизайна сервисов с нуля и выбор оптимальных компонентов (БД, очереди, кэши, векторные хранилища) под конкретные задачи.

  • Написание высоконагруженного и отказоустойчивого кода на Python.

  • Создание внутренних библиотек и фреймворков для упрощения работы с обучением ML-моделей.

  • Разработка пайплайнов для инференса моделей (включая LLM), управление контекстом, работа с API внешних провайдеров и локальных моделей.

  • Траблшутинг сложных проблем на стыке инфраструктуры и ML.

  • Настройка мониторинга, логирования и алертинга для сервисов.

  • Самостоятельный сбор и анализ требований от стейкхолдеров, превращение бизнес-задач в технические решения.

  • Проведение code review, помощь команде в вопросах архитектуры и лучших практик Python.

  • Опыт коммерческой разработки на Python от 5 лет (AsyncIO, Многопоточность, FastAPI, Django, Flask или аналоги) из них 1 год в ML

  • Глубокое понимание принципов построения распределенных систем, опыт проектирования отказоустойчивых архитектур (микросервисы, event-driven, паттерны работы с отказами)

  • Понимание GIL, async/await, работа с памятью, умение писать чистый, тестируемый и переиспользуемый код (библиотеки).

  • Понимание того, как работают ML-модели и LLM (эмбеддинги, RAG, fine-tuning, контекстное окно), умение выбрать подходящий инструмент (LangChain, vLLM и т.д.).

  • Опыт работы с Docker, Kubernetes, CI/CD.

  • Понимание принципов мониторинга (Prometheus, Grafana, Sentry) и умение диагностировать проблемы в проде.

  • Проактивность, умение работать в условиях неопределенности, способность самостоятельно находить требования и предлагать решения.

  • Будет плюсом опыт работы с векторными базами данных (Qdrant, Milvus, pgvector) и понимание MLOps-практик (MLflow, Clearml, Airflow, Feature Store).

  • крупнейшее DS&AI community — более 600 DS-специалистов банка

  • дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира

  • возможность быть соавтором НИРов и статей для международных конференций

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:hh.ru

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.