simplenight

Senior MLOps & BlockchainOps Engineer (DevOps Engineer in AI & Blockchain products)

simplenight · На сервисе с: 13.08.26 10:50

300k–400k ₽РоссияМоскваУдалёнка

Position: Blockchain & AI Infrastructure Engineer
Level: Senior
Experience: 6+ лет (НЕ фриланс)
Location: Remote
Employment: Fulltime

КОГО ИЩЕМ:

  1. DevOps-инженера с опытом в Blockchain и в AI-инфраструктуре (биометрия / Computer Vision).
  2. Только fulltime, без совмещения, аутсорсинг и аутстаффинг НЕ рассматриваем.
  3. Нужны «рабочие руки», а НЕ технический менеджер.
  4. Нужен человек полностью соответствующий нашим ожиданиям, а НЕ который учится на ходу.

КТО НЕ ПОДОЙДЁТ:

  1. Кандидаты с преобладающим или последним опытом в роли технических менеджеров: Team Lead, CTO и т.п. – это нерелевантный данной позиции опыт работы. Мы ищем «рабочие руки», а не технического менеджера.
  2. Кандидаты, которые ищут себе вторую работу. Любое совмещение будет заметно в первые 2 месяца. Нужен честный фултайм.
  3. Кандидаты с преобладающим или последним опытом работы на фрилансе.

ОБЯЗАТЕЛЬНЫЕ ТРЕБОВАНИЯ:

  1. 1+ год опыта с AI-инфраструктурой (биометрия / Computer Vision).
  2. 1+ год работы с Nvidia GPU (Cuda, TensorRT).
  3. 1+ год опыта с Blockchain инфраструктурой.
  4. 1+ год работы с Bare metal K8s.
  5. 6+ лет общий опыт работы в роли DevOps Engineer.

ЗАДАЧИ:

  1. Управление и поддержка инфраструктуры на основе контейнеров и Kubernetes, распределенных по нескольким серверам.
  2. Работа с БД Apache Cassandra (ScyllaDB) и Postgres для обеспечения высокой доступности и надежности данных, опыт по разворачиванию и синхронизации данных на множестве серверов.
  3. Автоматизация процессов управления конфигурациями и деплоя с использованием Ansible, создание базовых образов для сборки микросервисов с общей кодовой базой.
  4. Работа с CI/CD для обеспечения бесперебойной и быстрой доставки продукта до конечного пользователя.
  5. Разворачивание кластеров со сложными связями, безопасное хранение паролей и ключей доступа на уровне Kubernetes.
  6. Мониторинг, управление логами и оповещения в инфраструктуре и сервисах;
  7. Оптимизация и усовершенствование инфраструктурных решений.
  8. Защита Kubernetes кластеров от внешнего доступа в On-Premise решениях, шифрование дисков, создание защищенных сред.
  9. Разворачивание микросервисов с учетом использования ресурсов GPU, автоматическое масштабирование в зависимости от нагрузки и балансировка инстансов.

МЫ ПРЕДЛАГАЕМ:

  1. Fully remote work format.
  2. Only fulltime.
  3. Оформление по ТК РФ после ИС.
  4. 100% оплата больничного.
  5. Оплачиваемый отпуск 28 календарных дней.
  6. Компания аккредитована в «Минцифре».
  7. Работа в продуктовой компании.
Эта вакансия также есть на:hh.ru

Похожие вакансии MLOps инженер

Другие площадки
selecty

Инженер агентного программирования

selectyНа сервисе с: 20.08.26 10:27
350k–400k ₽РоссияУдалёнка

Selecty — аккредитованная IT-компания, оказывающая услуги в сфере IT-аутсорсинга.

Работаем на рынке более 10 лет, с 2013 года успешно решая задачи любой сложности в рамках цифровой трансформации для крупного бизнеса. Среди заказчиков Selecty более 300 компаний из списка РБК Топ-500.

Мы ищем ИИ-инженеров нового поколения, которые сочетают в себе навыки архитектора, разработчика и продуктового визионера. Опыт разработки от Middle+

Технологии и инструменты

  • Асинхронность.
  • FastAPI.
  • Docker, понимание, что такое мультистейдж.
  • K8s, Helm.
  • Prometheus, Grafana.
  • Redis.
  • Kafka, RabbitMQ — абстракции Kafka (топик, партиция, ZooKeeper, offset, acks, содержимое файла).
  • ML-метрики (Accuracy, Precision, Recall) — важно.
  • AUC-ROC, AUC-PR — важно.
  • Классификация в ML (лог. регрессия, k-NN, SVM, Naive Bayes, Decision Tree, Random Forest, …).
  • Log loss.
  • TF-IDF, BM25 — важно.
  • Трансформеры — важно.
  • BERT, GPT.
  • RAG (пайплайн с нуля).
  • Qdrant (метрики близости, HNSW, квантирование, …).
  • Бенчмарки моделей.
  • LangChain, LangGraph.

Чем ты будешь заниматься

  • End-to-end-разработка: от логики базы данных до интерфейса.
  • Поэтапный запуск: создание работающих микрочастей (каждый коммит — рабочий результат).
  • AI-driven development: использование нейросетей для генерации кода, отладки и быстрой сборки архитектуры.
  • DevOps-задачи: работа с репозиториями и автодеплоем (Railway) сразу после коммитов.
  • Продуктовая работа: понимание болей пользователя и того, как технические решения их закрывают.

Требования

  • Qdrant — глубокое понимание внутренностей, методов оптимизации под нагрузку (возможно, знание альтернативной БД).
  • Работа с синтетическими чанками.
  • Работа с графами.
  • Опыт построения пайплайнов RAG.
  • Оптимизация эмбеддингов (подбор моделей, снижение стоимости хранения/запросов).
  • Интеграция с LLM.
  • Понимание метрик качества поиска (Recall@k, MRR и др.).
  • Знает, что такое брокер, желательно опыт с Kafka.
  • Мультитрединг, мультипроцессинг.
hh.ru
innovative people

Senior MLOps Engineer / Специалист по науке о данных (MLOps)

innovative peopleНа сервисе с: 20.08.26 10:22
Зарплата не указанаРоссияМоскваУдалёнка

Innovative People - группа компаний, которая 20 лет предоставляет комплексные услуги в сфере информационных технологий. Так же мы являемся аккредитированной IT- компанией.

Сейчас мы в поиске Senior MLOps Инженера на проект внутренней корпоративной AI-платформы для автоматизации процессов, поддержки сотрудников и повышения эффективности работы с данными.


Обязанности:
  • Развертывание и поддержка LLM-платформы в Kubernetes.
  • Работа с Helm, Terraform и Kubernetes Operators.
  • Настройка и поддержка CI/CD для ML/AI-сервисов, включая обучение моделей, inference и data pipelines.
  • Автоматизация ML-workflow в Kubeflow.
  • Настройка и поддержка мониторинга моделей: latency, drift, cost metrics.
  • Управление пайплайнами данных для обучения и inference.
  • Работа с Kafka, Data Lake и S3/object storage.
  • Настройка и поддержка векторных баз данных Weaviate, Qdrant, PGVector.
  • Оптимизация работы GPU-кластера, включая распределённое обучение и эффективное использование ресурсов.
  • Настройка мониторинга и логирования с использованием Prometheus, Grafana, ELK, OpenTelemetry.
  • Обеспечение безопасности и комплаенса: изоляция сред, контроль доступа и логирование.
Требования:
  • Опыт работы с Kubernetes, включая облачные и on-premise кластеры.
  • Уверенное знание Python.
  • Практический опыт работы с инструментами MLOps: Kubeflow, Airflow.
  • Опыт настройки и поддержки CI/CD, в том числе Jenkins.
  • Опыт работы с системами хранения и векторными базами данных: Weaviate, Qdrant, PGVector.
  • Знание инструментов мониторинга и логирования: Prometheus, Grafana, ELK, OpenTelemetry.
  • Понимание принципов работы LLM/GenAI и RAG-систем.

Будет плюсом:

  • Практический опыт работы с LLM/GenAI и RAG-системами.
  • Опыт работы с AI/ML-платформами в production.
Условия:
  • Работу в аккредитованной IT-компании.
  • ДМС со стоматологией.
  • Возможность посещения профильных конференций, семинаров, оплату курсов, необходимых для повышения квалификации.
  • Бессрочный трудовой договор, полное соблюдение ТК, гибкий старт и окончание рабочего дня.
  • Удаленный формат работы.
  • Удобную и мощную технику для работы.
  • Speaking club по английскому с преподавателем.
  • Корпоративный мерч.
Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.