К

DevOps / MLOps Engineer (LLM Infrastructure) (Python)

Мы создаём B2B-платформу автономных ИИ-агентов для рынка США и ищем инженера, который возьмёт на себя инфраструктурный контур LLM-платформы: стабильное и безопасное развёртывание, масштабирование, наблюдаемость и стоимость AI-сервисов. Раз…

копылов евгений анатольевич · На сервисе с: 27.08.26 15:36

от 120k ₽РоссияМоскваОфис

О продукте и роли

Мы создаём B2B-платформу автономных ИИ-агентов для рынка США и ищем инженера, который возьмёт на себя инфраструктурный контур LLM-платформы: стабильное и безопасное развёртывание, масштабирование, наблюдаемость и стоимость AI-сервисов. Разработка ML-моделей и исследовательские эксперименты не являются ядром роли.

Что предстоит делать

Обслуживать облачную инфраструктуру компании. Поддерживать виртуальные машины, кластеры, сети и хранилища у облачных провайдеров: обновления и патчи, управление образами и конфигурациями, резервное копирование и проверка восстановления, контроль расходов на облако, планирование ресурсов под рост нагрузки.

Сопровождать инфраструктуру на стороне клиентов. Разворачивать и поддерживать сервисы в контуре заказчика: согласование доступов и регламентов, удалённая диагностика, обновления без простоя, мониторинг состояния, техническая документация для команды клиента.

Администрировать рабочие среды команды. Поддерживать защищённый удалённый доступ к средам разработки и внутренним сервисам, единые конфигурации и политики, защиту рабочих данных и централизованный контроль состояния.

Вести учётные записи и доступы. Поддерживать единую точку входа и многофакторную аутентификацию, управлять ролями и группами по принципу минимальных привилегий, выдавать и вовремя отзывать доступы к репозиториям, облакам, базам данных и внутренним сервисам, регулярно пересматривать права, вести реестр и журналирование, закрывать все доступы сотрудника в день увольнения.

Автоматизировать поставку сервисов и моделей. Строить CI/CD и GitOps-процессы, управлять инфраструктурой как кодом, обеспечивать воспроизводимые релизы, canary- и blue-green-развёртывания, rollback и disaster recovery. Давать разработчикам единый способ запускать, тестировать и выпускать LLM- и агентные сервисы без ручной настройки инфраструктуры.

Эксплуатировать LLM-сервисы. Поддерживать интеграции с managed-моделями и, при необходимости, inference-сервисы для open-source моделей. Настраивать маршрутизацию запросов, квоты, rate limits, retry, fallback и безопасное переключение между моделями и провайдерами.

Обеспечивать производительность и экономику inference. Контролировать latency, throughput, доступность, использование токенов и стоимость. Для self-hosted моделей — управлять GPU-ресурсами, планированием нагрузки, autoscaling, batching и кэшированием.

Строить наблюдаемость LLM-платформы. Метрики, логи и распределённая трассировка запросов; мониторинг версий моделей и конфигураций, ошибок провайдеров, расхода токенов и деградации производительности. Настраивать алерты и понятные дашборды для инженерной команды.

Обеспечивать надёжность и безопасность. Участвовать в on-call, расследовать инциденты, проводить RCA и postmortem, создавать runbooks и устранять системные причины повторных сбоев. Управлять секретами, настраивать сетевую изоляцию, шифрование, аудит действий и безопасную работу с пользовательскими данными.

Обязательные требования

  • 3+ лет опыта в DevOps/MLOps и практический опыт развёртывания или поддержки LLM- или GenAI-сервисов.
  • Опыт работы в крупной компании или с высоконагруженными промышленными системами: сможете описать масштаб, собственную зону ответственности, инциденты и принятые архитектурные решения.
  • Администрирование Linux в облачной среде: образы, конфигурации, обновления без простоя, резервное копирование и проверенное восстановление.
  • Уверенная эксплуатация Kubernetes в production: Helm, управление ресурсами, autoscaling, persistent storage, networking и безопасные обновления.
  • Практический опыт CI/CD и GitOps, infrastructure as code и автоматизации: GitLab CI, GitHub Actions или аналоги; Argo CD; Terraform и Ansible или сопоставимые инструменты.
  • Практический опыт одного или обоих контуров LLM-инфраструктуры: эксплуатация managed LLM API с маршрутизацией, квотами, retry и fallback; развёртывание open-source моделей через vLLM, TGI, Triton, Ollama или аналоги.
  • Наблюдаемость production-систем: метрики, логи, трассировка, алерты; контроль доступности, latency, throughput, ошибок и стоимости LLM-запросов.
  • Опыт обеспечения надёжности: on-call, расследование инцидентов, RCA и runbooks.
  • Управление доступами: SSO и провайдер идентификации (Google Workspace, Entra ID, Keycloak, Okta или аналоги), MFA, RBAC, отлаженные процессы onboarding и offboarding.
  • Организация защищённого удалённого доступа: VPN или Zero Trust, бастион-хосты, управление ключами и сертификатами.
  • Готовность к сервисным задачам: поддержка коллег и клиентов, работа по заявкам, соблюдение сроков реакции.
  • Python и Bash на уровне автоматизации инфраструктуры и диагностики production-сервисов.
  • Английский B1 или выше: чтение документации и рабочее взаимодействие с техническими командами.

Будет преимуществом

  • Эксплуатация GPU-кластеров: NVIDIA GPU Operator или device plugin, квоты, scheduling, autoscaling, мониторинг загрузки и capacity planning.
  • Оптимизация inference: batching, caching, quantization, управление latency, throughput и стоимостью.
  • RAG-инфраструктура, векторные хранилища и пайплайны данных: pgvector, Qdrant, Milvus, S3 или аналоги.
  • Langfuse, LangSmith, Arize Phoenix или другие инструменты трассировки и наблюдаемости LLM-приложений.
  • MLflow, Kubeflow, Ray, KServe или другие компоненты жизненного цикла и serving ML-моделей.
  • Опыт развёртывания решений в инфраструктуре корпоративных клиентов или в регулируемой среде.
  • Построение процессов управления доступом с нуля: регламенты, реестр, регулярный пересмотр прав.
  • Управление стоимостью облака: тегирование ресурсов, бюджеты, оптимизация потребления.
  • Прохождение аудита безопасности или соответствия требованиям заказчика (SOC 2, ISO 27001 или аналог).

Условия

  • Полная занятость, работа в офисе (Москва), возможна удаленка.
  • Возможность определять инфраструктурные стандарты LLM-платформы с ранней стадии.
  • Высокая самостоятельность в выборе инженерных решений; оценка по надёжности, скорости выпуска и стоимости эксплуатации.
  • Сложные задачи на стыке DevOps, MLOps, облачной инфраструктуры и production AI.

Как откликнуться

Вместо стандартного сопроводительного письма:

  1. Расскажите об одном LLM- или GenAI-сервисе, который вы лично довели до production или поддерживали после запуска: для кого он был создан, как был устроен, каков был масштаб и за что отвечали лично вы.
  2. Опишите самый сложный инфраструктурный инцидент в этом проекте: как он проявился, как вы нашли причину, что изменили и как проверили результат.
  3. Расскажите, какое первоначальное решение в этом проекте не сработало, почему и чем вы его заменили. Если возможно, приложите подтверждающие материалы: GitHub, архитектурную схему, техническую статью или публичный разбор.

Отклики из общих формулировок без конкретного production-опыта не рассматриваются.

Похожие вакансии MLOps инженер

Соц.сети
Н

Senior ML Engineer / MLOps Engineer

Неизвестный работодательНа сервисе с: 24.09.26 16:26
Зарплата не указанаПольшаУдалёнка

#вакансия #vacancy
🚀 Senior ML Engineer / MLOps Engineer — 100% Remote
Must-have:
• Strong Python
AWS / SageMaker
MLOps, CI/CD
Docker + Kubernetes
• ML lifecycle tools: MLflow / Kubeflow / SageMaker Pipelines
• Production experience with ML & LLM applications
Generative AI / LLMOps
• PySpark / Apache Spark
• FastAPI / Flask
• Model training, fine-tuning, evaluation & optimization
📍 100% Remote | 🇬🇧 English B2+
📅 Duration: 3 months + extension
💰 Rate: TBD
⏰ Full-time
📩 Для подачи присылайте CV в telegram: ••••••••

Соц.сети
Т

Middle ML

телекомНа сервисе с: 24.09.26 15:57
Зарплата не указанаРоссияУдалёнка

ID 3661 - Middle ML

🌍 Локация: РФ
💼 Удаленно
🕔 Занятость: фуллтайм

🏢 Проект: Телеком

💡 Требования:
• ML Engineer, middle 1 Опыт деплоя ML-моделей от 2 лет
• Опыт с очередями, написание прод кода для агентов
• Знание Docker, k8s, CI/CD. Опыт MLOps: мониторинг моделей, ре-тренинг
• Успешное прохождение очного интервью с решением задач на применнеие Python и SQL на темы: развёртывание агента в k8s; публикация скиллов; публикация Tool на MCP; настройка коммуникации агентов через A2A; использование LLM; настройка мониторинга, алертов

➕Будет плюсом:
• Понимание AgentOps

📨 Отклик — через форму: ••••••••
или напрямую рекрутеру ••••••••

❗️Откликайтесь только при релевантном опыте.

❗️При первичном отклике:
ID вакансии / ФИО / локация / возраст / занятость (работаете/нет) / формат работы (удаленка, гибрид, офис) / стек / опыт / резюме / сверка с требованиями

❗️Повторный отклик: ID вакансии + сверка.

#ML #Удаленно #вакансия

Соц.сети
Н

ML Engineer / MLOps (Middle)

Неизвестный работодательНа сервисе с: 24.09.26 14:56
Зарплата не указанаРоссияУдалёнка

ID 3661
ML
Middle
РФ
Телеком

Кол-во специалистов: 1
Формат: удаленный
Продолжительность: до конца 2027

✅ Требования:

• ML Engineer, middle 1 Опыт деплоя ML-моделей от 2 лет
• Опыт с очередями, написание прод кода для агентов
• Знание Docker, k8s, CI/CD. Опыт MLOps: мониторинг моделей, ре-тренинг
• Успешное прохождение очного интервью с решением задач на применнеие Python и SQL на темы: развёртывание агента в k8s; публикация скиллов; публикация Tool на MCP; настройка коммуникации агентов через A2A; использование LLM; настройка мониторинга, алертов

➕Будет плюсом:

• Понимание AgentOps

❗️❗️❗️Пишите ••••••••⚡️⚡️⚡️⚡️, прикладывая резюме, в котором указан возраст и местонахождение. Укажите 🆔 вакансии! Без этой информации заявки не будут рассматриваться! ❗️❗️

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.