сбер

Senior MLOps/DevOps Engineer (LLM)

сбер · На сервисе с: 17.06.26 12:18

↑ Вакансия с автоподнятием
300k–500k ₽РоссияМоскваГибрид

Мы строим платформу для инференса и SFT open-source LLM. Используем продвинутые cutting-edge движки для инференса, много экспериментируем и боремся за каждую дополнительную единицу в Token throughput. Cейчас мы находимся в поиске MLOps-инженера, который вместе с нами продолжит настраивать и улучшать инфраструктуру инференса LLM-моделей и осуществлять вывод решений в прод контур.

Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!

Вам предстоит:

  • Разрабатывать и оптимизировать инфраструктуру инференса LLM-моделей для минимальной задержки и высокой пропускной способности внутренних приложений и сервисов.
  • Обеспечивать масштабируемость и надежность LLM-serving инфраструктуры; выбирать и настраивать инструменты для инференса (sglang, vLLM, llama.cpp).
  • Разрабатывать механизмы разграничения доступов к API-сервисам моделей.
  • Строить систему observability и мониторинга LLM-инференса.
  • Собирать модели в сервисы и интерфейсы (FastAPI, Flask, Tornado, Streamlit, Chainlit и т.д.).

Мы ожидаем:

  • Опыт в аналогичной роли от 5 лет.
  • Опыт с Linux (сеть, storage, роли/пользователи, менеджмент процессов).
  • Уверенное владение Kubernetes (используем Istio Service Mesh).
  • Опыт построения высокопроизводительных LLM-сервисов (sglang, vLLM).
  • Опыт настройки высоконагруженных прокси-серверов (nginx, Envoy, HAProxy): load balancing, rate limiting, SSL termination, health checks.
  • Владение языками: Bash, Python, Groovy (Jenkins scripted).
  • Продвинутые навыки в CI/CD и оркестрации моделей.

Будет преимуществом:

  • Понимание распределенных систем и GPU-коммуникации (NCCL, MPI, RDMA, InfiniBand).
  • Знание служебных компонентов LLM-пайплайна: токенизаторы, KV-cache, контекстное окно.
  • Понимание внутренней архитектуры GPU (CUDA, cuDNN, Tensor Cores).
  • Опыт работы с векторными БД (Opensearch, Qdrant, FAISS, pgvector) для RAG и других задач.

Мы предлагаем:

  • Гибридный формат работы (2-3 дня в офисе).
  • Годовой бонус и ежегодный пересмотр.
  • Расширенный ДМС с первого дня + стоматологию и льготное страхование для семьи.
  • Корпоративный университет Сбера, внутреннюю образовательную платформу, участие в IT-конференциях.
  • Офис на Кутузовской с зонами отдыха и спортзалом.
  • Льготную ипотеку в Сбере, корпоративную пенсионную программу, подписку СберПрайм+, скидки от партнеров и сервисов группы компаний.

Похожие вакансии MLOps инженер

Другие площадки
selecty

Инженер агентного программирования

selectyНа сервисе с: 20.08.26 10:27
350k–400k ₽РоссияУдалёнка

Selecty — аккредитованная IT-компания, оказывающая услуги в сфере IT-аутсорсинга.

Работаем на рынке более 10 лет, с 2013 года успешно решая задачи любой сложности в рамках цифровой трансформации для крупного бизнеса. Среди заказчиков Selecty более 300 компаний из списка РБК Топ-500.

Мы ищем ИИ-инженеров нового поколения, которые сочетают в себе навыки архитектора, разработчика и продуктового визионера. Опыт разработки от Middle+

Технологии и инструменты

  • Асинхронность.
  • FastAPI.
  • Docker, понимание, что такое мультистейдж.
  • K8s, Helm.
  • Prometheus, Grafana.
  • Redis.
  • Kafka, RabbitMQ — абстракции Kafka (топик, партиция, ZooKeeper, offset, acks, содержимое файла).
  • ML-метрики (Accuracy, Precision, Recall) — важно.
  • AUC-ROC, AUC-PR — важно.
  • Классификация в ML (лог. регрессия, k-NN, SVM, Naive Bayes, Decision Tree, Random Forest, …).
  • Log loss.
  • TF-IDF, BM25 — важно.
  • Трансформеры — важно.
  • BERT, GPT.
  • RAG (пайплайн с нуля).
  • Qdrant (метрики близости, HNSW, квантирование, …).
  • Бенчмарки моделей.
  • LangChain, LangGraph.

Чем ты будешь заниматься

  • End-to-end-разработка: от логики базы данных до интерфейса.
  • Поэтапный запуск: создание работающих микрочастей (каждый коммит — рабочий результат).
  • AI-driven development: использование нейросетей для генерации кода, отладки и быстрой сборки архитектуры.
  • DevOps-задачи: работа с репозиториями и автодеплоем (Railway) сразу после коммитов.
  • Продуктовая работа: понимание болей пользователя и того, как технические решения их закрывают.

Требования

  • Qdrant — глубокое понимание внутренностей, методов оптимизации под нагрузку (возможно, знание альтернативной БД).
  • Работа с синтетическими чанками.
  • Работа с графами.
  • Опыт построения пайплайнов RAG.
  • Оптимизация эмбеддингов (подбор моделей, снижение стоимости хранения/запросов).
  • Интеграция с LLM.
  • Понимание метрик качества поиска (Recall@k, MRR и др.).
  • Знает, что такое брокер, желательно опыт с Kafka.
  • Мультитрединг, мультипроцессинг.
hh.ru
innovative people

Senior MLOps Engineer / Специалист по науке о данных (MLOps)

innovative peopleНа сервисе с: 20.08.26 10:22
Зарплата не указанаРоссияМоскваУдалёнка

Innovative People - группа компаний, которая 20 лет предоставляет комплексные услуги в сфере информационных технологий. Так же мы являемся аккредитированной IT- компанией.

Сейчас мы в поиске Senior MLOps Инженера на проект внутренней корпоративной AI-платформы для автоматизации процессов, поддержки сотрудников и повышения эффективности работы с данными.


Обязанности:
  • Развертывание и поддержка LLM-платформы в Kubernetes.
  • Работа с Helm, Terraform и Kubernetes Operators.
  • Настройка и поддержка CI/CD для ML/AI-сервисов, включая обучение моделей, inference и data pipelines.
  • Автоматизация ML-workflow в Kubeflow.
  • Настройка и поддержка мониторинга моделей: latency, drift, cost metrics.
  • Управление пайплайнами данных для обучения и inference.
  • Работа с Kafka, Data Lake и S3/object storage.
  • Настройка и поддержка векторных баз данных Weaviate, Qdrant, PGVector.
  • Оптимизация работы GPU-кластера, включая распределённое обучение и эффективное использование ресурсов.
  • Настройка мониторинга и логирования с использованием Prometheus, Grafana, ELK, OpenTelemetry.
  • Обеспечение безопасности и комплаенса: изоляция сред, контроль доступа и логирование.
Требования:
  • Опыт работы с Kubernetes, включая облачные и on-premise кластеры.
  • Уверенное знание Python.
  • Практический опыт работы с инструментами MLOps: Kubeflow, Airflow.
  • Опыт настройки и поддержки CI/CD, в том числе Jenkins.
  • Опыт работы с системами хранения и векторными базами данных: Weaviate, Qdrant, PGVector.
  • Знание инструментов мониторинга и логирования: Prometheus, Grafana, ELK, OpenTelemetry.
  • Понимание принципов работы LLM/GenAI и RAG-систем.

Будет плюсом:

  • Практический опыт работы с LLM/GenAI и RAG-системами.
  • Опыт работы с AI/ML-платформами в production.
Условия:
  • Работу в аккредитованной IT-компании.
  • ДМС со стоматологией.
  • Возможность посещения профильных конференций, семинаров, оплату курсов, необходимых для повышения квалификации.
  • Бессрочный трудовой договор, полное соблюдение ТК, гибкий старт и окончание рабочего дня.
  • Удаленный формат работы.
  • Удобную и мощную технику для работы.
  • Speaking club по английскому с преподавателем.
  • Корпоративный мерч.
Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.