согаз

MLOps

согаз · На сервисе с: 14.08.26 17:44

Зарплата не указанаРоссияМоскваГибрид

Хотите стать частью увлекательного процесса цифровой трансформации?

Блок IT в СОГАЗ активно развивается и меняет подход к созданию продуктов. Мы создаем новые сервисы и решения, которые делают нашу работу более технологичной и эффективной.

Проект: Мы — команда центра внедрения ИИ. Мы не просто автоматизируем рутину, а строим продуктовую ML-платформу. В фокусе: генеративные AI-ассистенты и классические модели машинного обучения.
Формат работы - у нас полный офис в комфортабельном бизнес-центре м. Курская.

Обязанности:

  • Проектировать архитектуру AI-систем;
  • Внедрение GPU-планировщика для шаринга нагрузки на одном железе;
  • Проектирование и поддержка ML-пайплайнов;
  • CI/CD для моделей: версионирование данных, моделей, экспериментов;
  • Мониторинг production-моделей;
  • Деплой и оптимизация LLM / inference-серверов;
  • Контейнеризация и оркестрация сервисов;
  • CI/CD (GitLab CI);
  • Мониторинг и observability (Prometheus, Grafana);
  • Обеспечение выполнения требований ИБ в отношении инфраструктуры.
Требования:
  • Бэкграунд в ML/DS — понимание процессов обучения, инференса, работы с данными;
  • Опыт от 2 лет в MLOps / DevOps с ML-спецификой;
  • Docker, Kubernetes — production-опыт;
  • CI/CD (GitLab CI, методология GitOps);
  • Глубокие знания Linux;
  • Опыт построения или управления GPU-кластерами (NVIDIA, CUDA, nvidia-container-toolkit);
  • Понимание специфики multi-tenant GPU-шаринга (MIG, MPS, time-slicing);
  • Опыт работы с LLM / inference-серверами (vLLM, TGI, Triton);
  • Опыт с GPU-планировщиками;
  • Опыт с MLflow, Kubeflow, Airflow или аналогами;
  • Высшее техническое образование.
Условия:
  • Оформление полностью в соответствии с ТК РФ, включая оплачиваемый отпуск 29 календарных дней (плюс 1 день отпуска);
  • ДМС в лучших клиниках города, страхование жизни и страхование от несчастных случаев и болезней + ДМС родственников с 75% скидкой;
  • Премиальные условия на всю продуктовую линейку группы компаний «СОГАЗ» для работников и их близких родственников (ОСАГО, каско, имущество, жизнь);
  • Социальный пакет и специальные предложения по страхованию, кредитованию и другие программы от наших партнёров;
  • Профессиональное развитие: курсы, тренинги, корпоративная библиотека;
  • Заботу компании о детях сотрудников: подарки на Новый год и скидки в детские лагеря.

Похожие вакансии MLOps инженер

Другие площадки
selecty

Инженер агентного программирования

selectyНа сервисе с: 20.08.26 10:27
350k–400k ₽РоссияУдалёнка

Selecty — аккредитованная IT-компания, оказывающая услуги в сфере IT-аутсорсинга.

Работаем на рынке более 10 лет, с 2013 года успешно решая задачи любой сложности в рамках цифровой трансформации для крупного бизнеса. Среди заказчиков Selecty более 300 компаний из списка РБК Топ-500.

Мы ищем ИИ-инженеров нового поколения, которые сочетают в себе навыки архитектора, разработчика и продуктового визионера. Опыт разработки от Middle+

Технологии и инструменты

  • Асинхронность.
  • FastAPI.
  • Docker, понимание, что такое мультистейдж.
  • K8s, Helm.
  • Prometheus, Grafana.
  • Redis.
  • Kafka, RabbitMQ — абстракции Kafka (топик, партиция, ZooKeeper, offset, acks, содержимое файла).
  • ML-метрики (Accuracy, Precision, Recall) — важно.
  • AUC-ROC, AUC-PR — важно.
  • Классификация в ML (лог. регрессия, k-NN, SVM, Naive Bayes, Decision Tree, Random Forest, …).
  • Log loss.
  • TF-IDF, BM25 — важно.
  • Трансформеры — важно.
  • BERT, GPT.
  • RAG (пайплайн с нуля).
  • Qdrant (метрики близости, HNSW, квантирование, …).
  • Бенчмарки моделей.
  • LangChain, LangGraph.

Чем ты будешь заниматься

  • End-to-end-разработка: от логики базы данных до интерфейса.
  • Поэтапный запуск: создание работающих микрочастей (каждый коммит — рабочий результат).
  • AI-driven development: использование нейросетей для генерации кода, отладки и быстрой сборки архитектуры.
  • DevOps-задачи: работа с репозиториями и автодеплоем (Railway) сразу после коммитов.
  • Продуктовая работа: понимание болей пользователя и того, как технические решения их закрывают.

Требования

  • Qdrant — глубокое понимание внутренностей, методов оптимизации под нагрузку (возможно, знание альтернативной БД).
  • Работа с синтетическими чанками.
  • Работа с графами.
  • Опыт построения пайплайнов RAG.
  • Оптимизация эмбеддингов (подбор моделей, снижение стоимости хранения/запросов).
  • Интеграция с LLM.
  • Понимание метрик качества поиска (Recall@k, MRR и др.).
  • Знает, что такое брокер, желательно опыт с Kafka.
  • Мультитрединг, мультипроцессинг.
hh.ru
innovative people

Senior MLOps Engineer / Специалист по науке о данных (MLOps)

innovative peopleНа сервисе с: 20.08.26 10:22
Зарплата не указанаРоссияМоскваУдалёнка

Innovative People - группа компаний, которая 20 лет предоставляет комплексные услуги в сфере информационных технологий. Так же мы являемся аккредитированной IT- компанией.

Сейчас мы в поиске Senior MLOps Инженера на проект внутренней корпоративной AI-платформы для автоматизации процессов, поддержки сотрудников и повышения эффективности работы с данными.


Обязанности:
  • Развертывание и поддержка LLM-платформы в Kubernetes.
  • Работа с Helm, Terraform и Kubernetes Operators.
  • Настройка и поддержка CI/CD для ML/AI-сервисов, включая обучение моделей, inference и data pipelines.
  • Автоматизация ML-workflow в Kubeflow.
  • Настройка и поддержка мониторинга моделей: latency, drift, cost metrics.
  • Управление пайплайнами данных для обучения и inference.
  • Работа с Kafka, Data Lake и S3/object storage.
  • Настройка и поддержка векторных баз данных Weaviate, Qdrant, PGVector.
  • Оптимизация работы GPU-кластера, включая распределённое обучение и эффективное использование ресурсов.
  • Настройка мониторинга и логирования с использованием Prometheus, Grafana, ELK, OpenTelemetry.
  • Обеспечение безопасности и комплаенса: изоляция сред, контроль доступа и логирование.
Требования:
  • Опыт работы с Kubernetes, включая облачные и on-premise кластеры.
  • Уверенное знание Python.
  • Практический опыт работы с инструментами MLOps: Kubeflow, Airflow.
  • Опыт настройки и поддержки CI/CD, в том числе Jenkins.
  • Опыт работы с системами хранения и векторными базами данных: Weaviate, Qdrant, PGVector.
  • Знание инструментов мониторинга и логирования: Prometheus, Grafana, ELK, OpenTelemetry.
  • Понимание принципов работы LLM/GenAI и RAG-систем.

Будет плюсом:

  • Практический опыт работы с LLM/GenAI и RAG-системами.
  • Опыт работы с AI/ML-платформами в production.
Условия:
  • Работу в аккредитованной IT-компании.
  • ДМС со стоматологией.
  • Возможность посещения профильных конференций, семинаров, оплату курсов, необходимых для повышения квалификации.
  • Бессрочный трудовой договор, полное соблюдение ТК, гибкий старт и окончание рабочего дня.
  • Удаленный формат работы.
  • Удобную и мощную технику для работы.
  • Speaking club по английскому с преподавателем.
  • Корпоративный мерч.
Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.