E

HPC / GPU Cluster Expert (MedTech)

evrone.ru · На сервисе с: 19.08.26 14:21

Зарплата не указанаРоссияМоскваУдалёнка

Привет! Команда Evrone занимается продуктовой разработкой стартапов и помогает в цифровой трансформации бизнеса в России, США и Европе. Думаю, что вы о нас слышали от Григория Петрова (Evrone Devrel).

Ищем HPC/GPU Cluster Expert уровня Senior/Architect. Заработная плата зависит от уровня и определяется после прохождения технического собеседования.

Проект в домене MedTech, аудит рабочего прототипа вычислительной платформы и проектирования целевой вычислительной ткани.

Стадия проекта: рабочий прототип, целевая архитектура не зафиксирована окончательно.

Среда: преимущественно on-prem и air-gap, возможны shared trust zone, dedicated cell и burst-очередь во внешний cloud.

Текущий контур: React UI, BFF API, PostgreSQL с RLS, ClearML, MinIO/S3 и GPU-агенты. Использует Campaign Control, NVIDIA MPS, `finish_compute` и образы с pinned digest.

Бизнес-задача роли: снять требования реальных CPU/GPU-нагрузок и обоснованно выбрать целевую модель оркестрации. Решение должно поддерживать on-prem ячейки, shared trust zone и возможный burst во внешний cloud, но не превращать локальный scratch в source of truth. Роль не заменяет действующего MLOps-специалиста и не предполагает постоянный on-call.

Задачи:

  • Провести аудит прототипа: очереди, агенты, NVIDIA MPS, storage, сеть, образы, точки отказа и зависимости от ClearML;
  • Определить требования к CPU, GPU, VRAM, scratch и сети для Vina-GPU/CUDA, OpenFE, ADMET-AI и ближайших MD-сценариев;
  • Спроектировать целевую архитектуру on-prem cell, общей зоны доверия и burst-очереди во внешний cloud;
  • Сравнить Slurm, Kubernetes с GPU Operator, гибридную модель и развитие текущих агентов;
  • Подготовить обоснованное решение о замене ClearML;
  • Спроектировать очереди, квоты, packing и exclusive-режимы;
  • Зафиксировать требования к изоляции: non-root, без Docker socket;
  • Обеспечить воспроизводимость через pinned digest, host driver, NVIDIA Container Toolkit и air-gap bundle;
  • Провести PoC: fan-out докинга, packing OpenFE, отказ агента и точный повтор вычисления на том же образе;
  • Оценить требуемую мощность, стоимость и этапы внедрения;
  • Подготовить ADR и передать целевой контур внутреннему MLOps

Что для нас важно:

  • Практический опыт эксплуатации Linux GPU-фермы или HPC-кластера в production;
  • Глубокое понимание NVIDIA stack: драйверы, Container Toolkit, CUDA, MPS, MIG и packing;
  • Практический опыт Slurm и/или Kubernetes GPU;
  • Проектирование связки локального scratch и объектного хранилища.;
  • Опыт on-prem или hybrid-инфраструктуры; желательно air-gap;
  • Умение сравнивать архитектурные варианты, фиксировать решение в ADR и передавать контур эксплуатации

Будет ОГРОМНЫМ плюсом:

  • Опыт замены experiment tracker или workload manager без потери воспроизводимости и артефактов;
  • Научные или ML-нагрузки на GPU;
  • Prometheus, Grafana, DCGM и NVML;
  • Private registry и подготовка offline bundle;
  • Практика capacity planning и оценки стоимости GPU-контуров

Результат первых 30–60 дней при 0,5 FTE:

  • Карта компонентов и функций, которые перестанут работать при удалении ClearML;
  • Сравнение Slurm, Kubernetes, гибридной модели и развития агентов;
  • Целевая схема очередей, квот и packing для текущих нагрузок;
  • Один проверяемый PoC с fan-out, packing, отказом агента и повторяемостью образа;
  • ADR с рекомендуемой архитектурой и критериями приёмки для главного архитектора;
  • Предварительная оценка мощности, стоимости и этапов внедрения

Вне скоупа:

  • Разработка научных runners и payload отдельных инструментов;
  • Lineage, схемы, registry и идентичность кандидатов;
  • CI, секреты, compose control plane и постоянный on-call;
  • Замена действующего Senior MLOps / DevOps;
  • Политика выноса данных во внешний cloud;
  • Ежедневное администрирование GPU-нод

Почему Evrone:

  • Мы занимаемся технически сложными, высоконагруженными, наукоёмкими проектами, проектами с большой бизнес логикой или большой серверной инфраструктурой. Нам доверяют: аналитику, проектирование интерфейсов и дизайн, разработку, инфраструктуру и эксплуатацию. Мы становимся технической командой проекта целиком или консультируем и расширяем возможности существующих команд наших клиентов.
  • Кроме того, Evrone помогает развиваться сообществу разработчиков. Мы делаем самую большую в России конференцию по Ruby — RubyRussia, проводим технические митапы, делаем свой новостной дайджест, а также спонсируем и помогаем в проведении конференций по Go, Python, React/Vue и функциональным языкам.
  • Наши инженеры выступают на ведущих конференциях России и Европы и вносят вклад в Open Source проекты, мы берем интервью у лидеров комьюнити и пишем статьи на самые горячие темы индустрии. В этом году мы ставили стенд и выступали на конференциях Highload и TeamLeadConf.
  • Вся команда работает удаленно с 2008 года. Мы знаем как организовать распределенную разработку комфортно и эффективно. Есть офисы для работы и встреч в Москве и Воронеже, а также офисы продаж в Сан-Франциско и Берлине.

Что предлагаем:

  • Удаленную фултайм работу и мягкий график. Достаточно синхронизировать тайм-зоны и иметь пересечения рабочего времени с командой;
  • Качественный онбординг и hr-менеджмент (1:1, Grow Review). По желанию меняем проекты, не даем стагнировать. При формировании команды проекта учитываем профессиональные или личные интересы разработчиков;
  • Работу в разновозрастном, разнополом и потрясающе дружном и профессиональном коллективе;
  • Хорошо организованный воркфлоу, отсутствие бюрократии. Работа на доверии.
  • Наши разработчики работают только над одним проектом. Без постоянных переключений между ними.

Одна из ценностей Evrone – работа с удовольствием.

Для этого мы придумали Evrone Benefits. Каждому из нас выделяется годовой бюджет, автоматически пополняемый каждый новый год вашей работы в Evrone. Его можно потратить на полезные категории трат, направленные на:

  • ДМС и здоровье;
  • Спорт и абонемент для фитнеса или инвентарь для спорта;
  • Курсы иностранного языка;
  • Техника для работы и улучшение рабочего места;
  • Обучение: курсы, тренинги, мастер-классы, семинары, книги и конференции.

Бонусы и премии:

  • Повышение зарплаты по мере роста компетенций (по результатам ассесмента);
  • Премии за привлечение новых сотрудников и новых клиентов;
  • Дополнительная премия за выступления на конференциях и митапах;
  • У вас есть возможность принять участие в проведении технических интервью специалистов, которые могут стать вашими коллегами. Проведение интервью оплачивается.

Обучение и рост компетенций:

  • Проводим митапы. Вы можете быть как и слушателем, так и спикером;
  • У нас есть культура менторства. В повседневных задачах и планировании карьеры будет помогать наставник;
  • Развивать профессиональный уровень можно с помощью системы ассессмента Evrone Challenge;
  • Есть внутренняя библиотека с электронными книгами и записанными курсами;
  • Работаем и дружим с западными заказчиками, есть возможность практиковать свой английский.

Возможность стать докладчиком или автором:

  • Если вы хотите выступить на оффлайн конференции, мы поможем вам подготовить контент для доклада и сделаем крутые слайды. DevRel Evrone (Григорий Петров) поможет подготовиться к выступлению на конференции, окажем поддержку на самой конференции и подготовим материалы с вашим докладом.
  • Если вы хотите выступить на онлайн конференции, помимо помощи по подготовке доклада и подбору конференции, мы организуем вам студийную съемку или трансляцию вашего доклада;
  • У нас есть блоги на всех популярных платформах России и мира. Наши редакторы и профессиональные авторы еженедельно выпускают новые материалы;
  • Если вы написали статью, мы нарисуем для нее иллюстрации и поможем вам ее оформить и опубликовать. Если у вас есть только идея - редакторы помогут сформулировать мысли, оформить пост самостоятельно и правильно опубликовать для максимального охвата.

Возможность прокачаться в Open Source:

  • Если у вас есть популярные open source проекты – мы поможем с их продвижением и окажем поддержку в развитии;
  • Если вы контрибьютите в популярные проекты с открытым исходным кодом, мы оплатим часы, которые вы на это потратили.
  • Если вы ничего этого не делаете, но очень хочется начать – в Evrone есть менторы, которые помогут вам сделать первые шаги: подберут задачки для старта, помогут решить их и правильно оформить pr.

Отдых и развиртуализация:

Мы проводим ежегодный фестиваль Evrone Fest, на котором собирается вся наша команда, а также тематические встречи в различных городах. Поэтому, где бы вы ни находились, мы будем рады увидеться лично.

Похожие вакансии MLOps инженер

Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

Сайты компаний
сбер

Head of ML (VLM, GigaChat Vision)

сберНа сервисе с: 14.06.26 16:50↑ Вакансия с автоподнятием
от 500k ₽РоссияМоскваОфис

Привет! Это GigaChat Vision — команда, которая делает полный цикл обучения VLM моделей. Ищем руководителя направления ML VLM, который возглавит команду целиком: будет формировать техническую стратегию, собирать и развивать команду, синхронизировать ключевые направления и отвечать за результат от идеи до продакшна.

Первый этап отбора на эту вакансию – общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!

  • Формировать техническую стратегию VLM-направления: определять приоритетные направления, выбирать ключевые исследовательские и инженерные треки, строить роадмап на несколько кварталов вперед;

  • Принимать ключевые архитектурные и продуктовые решения по обучению моделей: pretrain, stage 1.5, post-train, eval, стратегию по данным — и нести за них ответственность;

  • Определять стратегию развития моделей: какие способности модели развивать в первую очередь, какие проблемы ограничивают качество, где нужно усиливать данные, где — обучение, а где — чинить валидацию;

  • Определять стратегию данных совместно с руководителем команды данных: какие данные нужны для pretrain и stage 1.5, какие требования к качеству и покрытию, как донести улучшения в

  • Определять стратегию post-train совместно с RL/SFT-направлением: как выстраивать контур SFT, DPO, RL, какие рецепты и подходы дают устойчивый прирост качества, как минимизировать деградации;

  • Определять и развивать систему оценки качества моделей: выбирать ключевые метрики[a][b];

  • Строить и развивать команду: нанимать лидов и ключевых инженеров, выстраивать роли и зоны ответственности, создавать сильную инженерную и исследовательскую среду;

  • Отслеживать состояние области и переводить свежие идеи из статей и open-source в конкретные эксперименты, гипотезы и решения;

  • Быть готовым при необходимости лично погружаться в сложные технические задачи: разбирать деградации, дебажить эксперименты, принимать решения в условиях неполной информации и доводить сложные инициативы до результата руками.

  • Глубокое понимание полного цикла обучения LLM/VLM: pretrain → stage 1.5 → SFT / DPO / RL;

  • Сильный технический бэкграунд в modern ML: понимание того, как данные, архитектура, обучение и eval влияют на итоговое качество модели;

  • Опыт технического лидерства команды от 5-ти человек: создание роадмапов, декомпозиция задач, приоритизация, менторинг, развитие лидов и senior IC;

  • Опыт принятия архитектурных решений в research-heavy ML среде и ответственность за их результат;

  • Умение выстраивать процессы и принимать решения в условиях высокой неопределенности;

  • Опыт взаимодействия со смежными командами и стейкхолдерами, способность синхронизировать несколько направлений одновременно;

  • Системное мышление: способность видеть всю картину целиком — от данных и обучения до валидации, инфраструктуры и продуктового качества модели.

Будет плюсом:

  • Опыт запуска или развития VLM/LLM-направления с нуля;

  • Опыт доведения моделей до продакшена;

  • Опыт найма и формирования сильной технической команды;

  • Опыт работы с мультимодальными моделями, OCR, grounding, video, document understanding

  • Публикации или open-source вклад в области LLM/VLM;

  • Опыт работы с распределённым обучением (DeepSpeed, FSDP) и training/inference infrastructure.

  • крупнейшее DS&AI community — более 600 DS-специалистов банка

  • дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира

  • возможность быть соавтором НИРов и статей для международных конференций

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:Getmatch
Соц.сети
Н

ML Engineer

Неизвестный работодательНа сервисе с: 19.08.26 18:48
Зарплата не указанаРоссияУдалёнка

#вакансия #удаленно #РФ #ML
Вакансия: ML Engineer
Локация: РФ

В нашу команду нужен сильный разработчик, который строит production-решения на базе LLM, а не просто обучает модели в ноутбуке.

Критически важно:
✅ Реальный опыт разработки RAG-пайплайнов и работы с LLM в продакшене.
✅ Крепкий бэкенд (Python) + опыт внедрения ML-моделей как сервисов.
✅ Вы больше разработчик, чем Data Scientist.

🛠 Стек и технологии:
Core: Python (3+ лет в коммерческой разработке)
Orchestration & MLOps: Airflow / Argo Workflows, MLflow, Jenkins
Big Data & Streaming: Hadoop, PySpark, Kafka
Deployment: Docker, Kubernetes, Seldon / Kserve
ML/LLM: Опыт работы с ML-моделями, NLP, LLM (RAG, fine-tuning, deployment)

Отлик: @dobysh_v

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.