it-implant

MLOps инженер

it-implant · На сервисе с: 19.08.26 13:23

250k–280k ₽РоссияМоскваУдалёнка

ИТ-ИМПЛАНТ - аккредитованный системный интегратор, специализирующийся на заказной разработке и внедрении индивидуальных ИТ-решений для бизнеса.

Миссия компании:

Для компаний: Дать возможность сильным компаниям увеличиваться, благодаря аутстаффингу эффективных IT-специалистов.

Для соискателей: Дать возможность трудоустройства сильным соискателям в передовые компании на выгодных условиях труда.

MLOps Engineer (Strong Middle+/Senior)

О проекте:
Мы ищем инженера, который не просто «поднимает Airflow», а строит фундамент для ИИ-продуктов. Наши проекты разнородны: от высоконагруженных онлайн-инференсов (GPU) до пакетной обработки терабайт данных на-premise. Нам нужен человек, который понимает физику работы моделей так же хорошо, как и архитектуру облаков.

Ключевая задача:
Закрывать пробелы между Data Science и DevOps. Вы — мост, который превращает Jupyter Notebook в production-grade микросервис с мониторингом дрейфа данных.

Hard skills (Обязательно):

  1. Инженерия данных: Уверенное владение Python (плюс опыт асинхронности). Опыт работы с Pandas/Polars в продакшене (не в ноутбуках).

  2. Оркестрация: Глубокое понимание хотя бы одного инструмента (Airflow / Prefect / Dagster / Argo Workflows). Понимаете разницу между Event-driven и Scheduled пайплайнами.

  3. Контейнеризация и оркестрация: Docker + Kubernetes. Умение писать хелм-чарты, настраивать HPA (Horizontal Pod Autoscaler) под GPU-нагрузки.

  4. Infrastructure as Code (IaC): Опыт с Terraform или Pulumi (неважно, AWS, GCP или Yandex Cloud — важно понимание состояния и providerов).

  5. CI/CD для ML: Опыт настройки пайплайнов не только для кода, но и для данных (DVC / LakeFS / Git LFS).

  6. Мониторинг: Знание стеков (Prometheus + Grafana / VictoriaMetrics) и опыт настройки алертинга на качество модели (дрейф данных/концепций).

Будет Вашим преимуществом:

  • Если ваш стек — AWS/GCP/Azure: Будет плюсом опыт с SageMaker / Vertex AI / Azure ML, но мы также ценим, если вы умеете собирать тот же функционал из "чистых" сервисов (EC2 + S3 + Lambda) без готовых ML-обвязок.

  • Если ваш стек — On-premise / Bare-metal: Будет плюсом опыт с GPU-виртуализацией (MIG / vGPU), Slurm или Kubeflow, а также опыт настройки распределенных хранилищ (Ceph / MinIO / NFS).

  • Если ваш стек — Open Source: Будет огромным плюсом глубокое знание MLflow или Weights & Biases (включая самостоятельный хостинг), а также опыт с Ray (для распределенного обучения).

  • Если ваш стек — Feature Store: Мы будем рады, если вы работали с Feast / Tecton или писали свой велосипед на Redis / Cassandra для низколатентных фичей.

  • Если ваш стек — Безопасность: Опыт с аутентификацией (OIDC, Keycloak) и управлением секретами (Vault) в контексте ML-пайплайнов — это жирный плюс.

  • Если ваш стек — Бэкенд: Навыки написания микросервисов на FastAPI / Triton Inference Server / TorchServe для упаковки моделей.

Мы точно НЕ про вас, если:

  • Вы запускаете модели только через python app.py и считаете это MLOps.

  • Вы боитесь терминала Linux и не умеете читать dmesg или kubectl describe pod при падении GPU-ноды.

  • Вы считаете, что мониторинг — это только "смотрит ли CPU в потолок".

Мы предлагаем:

  • Удалённый формат работы

  • Оформление по Самозанятости или ИП (По ТК РФ ставка будет ниже, чем указано в вакансии)
  • Фултайм
  • График работы с гибким началом рабочего дня

Стеки на проектах разные, откликайтесь!

Похожие вакансии MLOps инженер

Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

Сайты компаний
сбер

Head of ML (VLM, GigaChat Vision)

сберНа сервисе с: 14.06.26 16:50↑ Вакансия с автоподнятием
от 500k ₽РоссияМоскваОфис

Привет! Это GigaChat Vision — команда, которая делает полный цикл обучения VLM моделей. Ищем руководителя направления ML VLM, который возглавит команду целиком: будет формировать техническую стратегию, собирать и развивать команду, синхронизировать ключевые направления и отвечать за результат от идеи до продакшна.

Первый этап отбора на эту вакансию – общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!

  • Формировать техническую стратегию VLM-направления: определять приоритетные направления, выбирать ключевые исследовательские и инженерные треки, строить роадмап на несколько кварталов вперед;

  • Принимать ключевые архитектурные и продуктовые решения по обучению моделей: pretrain, stage 1.5, post-train, eval, стратегию по данным — и нести за них ответственность;

  • Определять стратегию развития моделей: какие способности модели развивать в первую очередь, какие проблемы ограничивают качество, где нужно усиливать данные, где — обучение, а где — чинить валидацию;

  • Определять стратегию данных совместно с руководителем команды данных: какие данные нужны для pretrain и stage 1.5, какие требования к качеству и покрытию, как донести улучшения в

  • Определять стратегию post-train совместно с RL/SFT-направлением: как выстраивать контур SFT, DPO, RL, какие рецепты и подходы дают устойчивый прирост качества, как минимизировать деградации;

  • Определять и развивать систему оценки качества моделей: выбирать ключевые метрики[a][b];

  • Строить и развивать команду: нанимать лидов и ключевых инженеров, выстраивать роли и зоны ответственности, создавать сильную инженерную и исследовательскую среду;

  • Отслеживать состояние области и переводить свежие идеи из статей и open-source в конкретные эксперименты, гипотезы и решения;

  • Быть готовым при необходимости лично погружаться в сложные технические задачи: разбирать деградации, дебажить эксперименты, принимать решения в условиях неполной информации и доводить сложные инициативы до результата руками.

  • Глубокое понимание полного цикла обучения LLM/VLM: pretrain → stage 1.5 → SFT / DPO / RL;

  • Сильный технический бэкграунд в modern ML: понимание того, как данные, архитектура, обучение и eval влияют на итоговое качество модели;

  • Опыт технического лидерства команды от 5-ти человек: создание роадмапов, декомпозиция задач, приоритизация, менторинг, развитие лидов и senior IC;

  • Опыт принятия архитектурных решений в research-heavy ML среде и ответственность за их результат;

  • Умение выстраивать процессы и принимать решения в условиях высокой неопределенности;

  • Опыт взаимодействия со смежными командами и стейкхолдерами, способность синхронизировать несколько направлений одновременно;

  • Системное мышление: способность видеть всю картину целиком — от данных и обучения до валидации, инфраструктуры и продуктового качества модели.

Будет плюсом:

  • Опыт запуска или развития VLM/LLM-направления с нуля;

  • Опыт доведения моделей до продакшена;

  • Опыт найма и формирования сильной технической команды;

  • Опыт работы с мультимодальными моделями, OCR, grounding, video, document understanding

  • Публикации или open-source вклад в области LLM/VLM;

  • Опыт работы с распределённым обучением (DeepSpeed, FSDP) и training/inference infrastructure.

  • крупнейшее DS&AI community — более 600 DS-специалистов банка

  • дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира

  • возможность быть соавтором НИРов и статей для международных конференций

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:Getmatch
Соц.сети
Н

ML Engineer

Неизвестный работодательНа сервисе с: 19.08.26 18:48
Зарплата не указанаРоссияУдалёнка

#вакансия #удаленно #РФ #ML
Вакансия: ML Engineer
Локация: РФ

В нашу команду нужен сильный разработчик, который строит production-решения на базе LLM, а не просто обучает модели в ноутбуке.

Критически важно:
✅ Реальный опыт разработки RAG-пайплайнов и работы с LLM в продакшене.
✅ Крепкий бэкенд (Python) + опыт внедрения ML-моделей как сервисов.
✅ Вы больше разработчик, чем Data Scientist.

🛠 Стек и технологии:
Core: Python (3+ лет в коммерческой разработке)
Orchestration & MLOps: Airflow / Argo Workflows, MLflow, Jenkins
Big Data & Streaming: Hadoop, PySpark, Kafka
Deployment: Docker, Kubernetes, Seldon / Kserve
ML/LLM: Опыт работы с ML-моделями, NLP, LLM (RAG, fine-tuning, deployment)

Отлик: @dobysh_v

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.