островок.ostrovok!tech

Senior MLOps Engineer (Python)

Поддержка кластеров (GPU/TPU), контейнеризации и оркестрации ( Docker , Kubernetes);

островок.ostrovok!tech На сервисе с: 06.10.26 12:52

Зарплата не указанаРоссияМоскваУдалёнка

Ключевые задачи:

  • Поддержка кластеров (GPU/TPU), контейнеризации и оркестрации (Docker, Kubernetes);
  • Аудит, оптимизация инфраструктуры и затрат (batch vs real-time inference, разграничение проблем железа и кода);
  • Настройка мониторинга, алертинга и менеджмент железа между потребителями;
  • Развертывание и поддержка ML-сервисов (MLflow, Airflow, CVAT, Doccano) в production;
  • Настройка CI/CD для ML-пайплайнов и управление полным ML lifecycle (training -> serving).

Требования:

  • Опыт DevOps от 3х лет или MLOps от 1 года, с эксплуатацией продакшен-систем;
  • Уверенный Linux: администрирование, отладка, права доступа;
  • Коммерческий опыт с Kubernetes и Docker на уровне эксплуатации: deployments, ресурсные лимиты, autoscaling, оптимизация образов;
  • GPU-инфраструктура: NVIDIA stack, CUDA, драйверы, профилирование;
  • Написание скриптов на Python и Bash на уровне автоматизации и интеграций;
  • Понимание жизненного цикла ML-моделей: как их обучают и как применяют;
  • Понимание процессов построения и эксплуатации ML pipelines: этапов обучения, вывода в продакшн и дальнейшего сопровождения моделей;
  • Опыт работы с системами ML Serving: Triton, vLLM, Airflow (или аналоги), batch и async/sync model serving;
  • Опыт работы с Postgres, Redis, Kafka;
  • Навыки настройки и эксплуатации стека для ML и Data Science: MLflow, DVC и аналоги.

Будет плюсом, если есть опыт с:

  • Знание инструментов: Argo, Helm, Terraform, Ansible, S3;
  • Опыт работы с RBAC, Keycloak, LDAP/OAuth, работа с сертификатами;
  • Опыт работы с Prometheus, Grafana, ELK или аналоги, настройка алертинга.

Похожие вакансии MLOps инженер

Сайты компаний
N

Senior Applied ML Engineer (Agentic Search)

nebiusНа сервисе с: 06.10.26 00:11↑ Вакансия с автоподнятием
Зарплата не указанаВеликобританияНидерландыШвейцарияAmsterdam

About Nebius:

Nebius is leading a new era in cloud infrastructure for the global AI economy. We are building a full-stack AI cloud platform that supports developers and enterprises from data and model training through to production deployment, without the cost and complexity of building large in-house AI/ML infrastructure.

Built by engineers, for engineers. From large-scale GPU orchestration to inference optimization, we own the hard problems across compute, storage, networking and applied AI.

Listed on Nasdaq (NBIS) and headquartered in Amsterdam, we have a global footprint with R&D hubs across Europe, the UK, North America and Israel. Our team of 1,500+ includes hundreds of engineers with deep expertise across hardware, software and AI R&D.

We are seeking a Senior Applied ML Engineer to join a fast-growing team building an agent-native search platform for AI systems, the emerging web access layer for AI. You will develop and deploy machine learning models that power retrieval, ranking, and indexing at scale, helping AI systems access fresh, reliable information in real time. This is a high-impact role working on a production system used 24x7, tackling challenges comparable to large-scale web search.

Your responsibilities:

  • Design, train, and deploy ML models for retrieval, reranking, and search relevance in production
  • Build and optimise embedding-based indexing and large-scale retrieval systems
  • Develop models supporting crawling, data selection, and content understanding
  • Define and improve quality metrics for agent-native search and build evaluation pipelines
  • Work on systems operating at very large scale, including high-throughput query workloads
  • Collaborate closely with engineering teams to integrate ML models into production services
  • Analyse performance trade-offs across latency, quality, and cost
  • Experiment with and apply state-of-the-art techniques in search, retrieval, and LLM-integrated systems
  • Contribute to product and architectural decisions in a fast-moving environment

Must-haves:

  • 5+ years of experience in software engineering or applied machine learning
  • Strong programming skills in Python, Go, or C++
  • Proven experience deploying ML models in production systems
  • Hands-on experience with retrieval, ranking, recommendation, or similar ML problems
  • Strong understanding of machine learning and modern deep learning techniques
  • Experience working with large-scale data systems and high-throughput environments
  • Ability to design evaluation frameworks and define meaningful model metrics
  • Product-oriented mindset with a focus on impact and iteration
  • Strong problem-solving skills and ability to work in a distributed team

Nice-to-haves:

  • Experience with search systems or large-scale information retrieval
  • Familiarity with embeddings, transformers, and modern NLP systems
  • Experience working on LLM-powered or agent-based systems
  • Contributions to open-source projects, technical publications, or conference talks
  • Participation in competitive ML (e.g. Kaggle) or similar signals of strong technical ability

We conduct coding interviews as part of the process.

 

Benefits & Perks:

  • Competitive compensation
  • Career growth and learning opportunities
  • Flexibility and ownership
  • Collaborative and innovative culture
  • Opportunity to work on impactful AI projects
  • International environment and talented teams

What's it like to work at Nebius:

Fast moving - Bold thinking - Constant growth - Meaningful impact - Trust and real ownership - Opportunity to shape the future of AI 

Equal Opportunity Statement:

Nebius is an equal opportunity employer. We are committed to fostering an inclusive and diverse workplace and to providing equal employment opportunities in all aspects of employment. We do not discriminate on the basis of race, color, religion, sex (including pregnancy), national origin, ancestry, age, disability, genetic information, marital status, veteran status, sexual orientation, gender identity or expression, or any other characteristic protected by applicable law.

Applicants must be authorized to work in the country in which they apply and will be required to provide proof of employment eligibility as a condition of hire. 

If you need accommodations during the application process, please let us know.

Соц.сети
мтс
до 250k ₽РоссияУдалёнка

#vacancy

MLOps Engineer (LLM / Multi-Agent Systems / Kubernetes / RAG) ⚡️🤖

ID вакансии: MLm_DNA

Ставка: до 250 000 руб. на руки в месяц.

Грейд: Middle+ / Senior.

Загрузка: Full-time.

Формат: Удалённо.

Локация/Гражданство: РФ.

🏢 Клиент: МТС.

🧩 О проекте: построение и развитие современных MLOps-платформ для машинного обучения с фокусом на LLM-решения, RAG-пайплайны и мультиагентные системы.

Ищем MLOps-инженера, который находится на стыке классического DevOps и передовых AI-технологий. Роль для специалиста, который не только умеет строить надежные CI/CD и оркестрировать пайплайны в Kubernetes, но и глубоко понимает специфику развертывания и обслуживания LLM, LangGraph и Multi-Agent систем.

🚀 Ключевые задачи:

— Построение, развитие и поддержка MLOps-платформ для машинного обучения. — Оркестрация ML-пайплайнов и процессов обработки данных (Apache Airflow). — Внедрение и поддержка инструментов трекинга экспериментов, версионирования данных и моделей (MLflow, ClearML, Kubeflow, DVC). — Настройка и поддержка CI/CD процессов специально для ML-моделей и сервисов. — Инфраструктурная поддержка разработки и развертывания Multi-Agent Systems, RAG-пайплайнов и LLM-приложений. — Настройка мониторинга и наблюдаемости (Observability) для ML-сервисов и LLM-инференса.

🎯 Обязательные требования (Hard Skills):

MLOps и DevOps (КРИТИЧНО!): — Глубокое понимание и опыт работы с Docker и Kubernetes (K8s). — Опыт построения CI/CD for ML (специфичные пайплайны для обучения и деплоя моделей). — Владение инструментами MLOps: MLflow, ClearML, Kubeflow, DVC.

LLM и Agentic AI (КРИТИЧНО!): — Понимание и опыт работы с фреймворками: LangChain, LangGraph, LlamaIndex. — Опыт поддержки инфраструктуры для Multi-Agent Systems и Autonomous Agents. — Понимание принципов RAG (Retrieval-Augmented Generation), MCP (Model Context Protocol), Prompt Engineering и Tool Use. — Опыт работы с API LLM-провайдеров (OpenAI и аналоги).

Оркестрация и наблюдаемость: — Уверенный опыт работы с Apache Airflow. — Опыт настройки мониторинга и наблюдаемости (Observability) для ML-систем (метрики качества моделей, дрейф данных, latency, throughput).

💡 Будет плюсом: — Опыт оптимизации инференса LLM (vLLM, TensorRT-LLM, Ollama). — Знание Python на уровне, достаточном для написания скриптов автоматизации и кастомных операторов Airflow. — Понимание векторных баз данных (Qdrant, Milvus, pgvector) и их эксплуатации.

📲 Контакт для отклика: @hrwomenpro (При отклике, пожалуйста, пишите ID вакансии: MLm_DNA)

hh.ru
Зарплата не указанаРоссияМоскваУдалёнка
Ищем инженера, который совмещает прикладную ML-разработку и MLOps: умеет работать с данными и моделями, организовать воспроизводимый процесс и довести решение до стабильной работы в production с помощью ИИ-агентов.

Ответственность end-to-end: от постановки ML-задачи и выбора подхода до работающего сервиса и контроля качества после запуска. Нужен специалист, способный не только развернуть готовую модель, но и подготовить данные, обучить или адаптировать модель, оценить результат и лично проверить его в продукте.

Обязанности:
  • Вести ML-задачу полного цикла. Уточнять задачу и критерии успеха, анализировать и подготавливать данные, создавать baseline и выбирать подход. Определять, достаточно ли готовой модели или требуется её адаптация либо обучение.
  • Обучать и оценивать модели. Обучать или дообучать модели, анализировать ошибки, сравнивать решения по качеству, скорости и стоимости. Документировать результаты экспериментов и ограничения выбранного подхода.
  • Организовывать воспроизводимый MLOps-процесс. Автоматизировать подготовку данных, обучение, оценку и развёртывание; версионировать данные, код, модели и конфигурации. Обеспечивать повторяемость экспериментов и сборок.
  • Разрабатывать и сопровождать ML-сервисы. Создавать сервисы инференса и интеграции с продуктом, настраивать окружения CPU/GPU, тестирование, CI/CD, мониторинг, обновление и откат моделей.
  • Настраивать ИИ-агентов для ML и инфраструктуры. Создавать skills, проектные инструкции и workflow. Подключать инструменты и документацию, контролировать доступ к данным, секретам и вычислительным ресурсам, проверять подготовленный агентами код.
  • Лично валидировать качество. Вручную проверять данные и разметку на выборках, анализировать предсказания и ошибки модели, исследовать проблемные сценарии. Не ограничиваться сводными метриками.
  • Проверять решение в целевой среде. Лично проходить реальные сценарии в развёрнутом продукте, проверять интеграции и нагрузочные характеристики. Диагностировать проблемы данных, модели, сервиса и инфраструктуры.
  • Контролировать работу после запуска. Следить за качеством, задержками, ошибками, потреблением ресурсов и изменениями входных данных. Исследовать отклонения, устранять проблемы и проверять результат исправлений.
Требования:
  • Практический опыт прикладного ML. Самостоятельная подготовка данных, обучение и оценка моделей, анализ ошибок. Понимание выбора метрик, разделения данных на обучающие, валидационные и тестовые выборки, переобучения и утечек данных.
  • Самостоятельная ML-разработка. Уверенный Python, опыт PyTorch и/или scikit-learn либо аналогичных инструментов. Умение читать, писать и отлаживать код подготовки данных, обучения и инференса, а не только запускать готовые примеры.
  • Production-опыт и MLOps. Практический опыт развёртывания и сопровождения ML-сервисов. Понимание API, хранения и версионирования артефактов, воспроизводимости окружений, мониторинга, обновления и отката моделей.
  • Инженерная инфраструктура. Практические навыки Linux, Docker, Git, тестирования и CI/CD. Умение диагностировать проблемы производительности, использования CPU/GPU и памяти.
  • Coding agents и их адаптация. Практический опыт Codex, Claude Code или аналогов; создание skills и проектных инструкций, настройка контекста, инструментов и безопасных окружений под ML- и инфраструктурные задачи.
  • Личная ответственность за результат. Готовность самостоятельно проверять код и выводы агентов, вручную анализировать данные и предсказания, проверять реальные сценарии и доводить модель и сервис до согласованного качества.

Будет плюсом:

  • Опыт MLflow, DVC, Kubernetes и оркестраторов вычислительных задач.
  • Опыт оптимизации GPU-инференса, батчинга, квантования и нагрузочного тестирования ML-сервисов.
  • Опыт в одном или нескольких направлениях: NLP/LLM, компьютерное зрение, обработка речи или ML на табличных данных.

Что считается завершённой работой:

  • Получено воспроизводимое решение с подтверждённым качеством, проверенное в целевой среде и интегрированное в продукт. Результаты оценки и известные ограничения зафиксированы, мониторинг, обновление и откат предусмотрены.​​​​​​​​​​​​​​ ​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​​Личный анализ данных и предсказаний, а также проверка реальных сценариев обязательны. Одной сводной метрики, обученной модели или работающего endpoint недостаточно.

Условия:

  • Фиксированная оплата труда. Уровень дохода в оффере будет согласовываться по грейдовой системе, исходя из результатов собеседования.
  • Готовы рассматривать кандидатов с разным уровнем квалификации (junior/middle/senior).
  • Оформление через ИП.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.