трт

Senior ML Engineer

трт · На сервисе с: 13.08.26 11:59

до 8 000 $ (≈ до 664k ₽)ГрузияБатумиТбилисиУдалёнка
Локации (удалёнка):ТбилисиБатуми

Удалённая работа — географически не привязана. Щёлкни по любой из локаций, чтобы открыть оригинальную карточку.

Stealth-mode AI-powered Cloud-Native Health-Tech. The Business Domain revolves around providing Better Care for the US Patients; meaning, it’s about Treating Patients well.

It’s not vaporware, our platform supports US Physician Networks (IPAs) by enabling Smarter, Risk-Adjusted, and more Predictive Care that improves real patient outcomes.

Compensation and Benefits:

Paid Time Off

The company has Unlimited PTOs Policy and compensated New Years Holidays on top of that. The misuse of the policy isn’t welcomed, though it’s definitely possible to take at least two weeks – and fully compensated – vacation, or more.

Corporate Hardware

The company provides Corporate Hardware for employees who completed their Probationary Period, as well as proven their value.

Means of Communication

We use Google Workspace, Slack, Zoom, and similar collaboration tools for messaging, meetings, and document sharing across the organization. We don’t use Microsoft Outlook, Microsoft Team and similar software.

Cloud-Native

There’s real ability to make most solutions in a Cloud-Native and Third-Party Integrations manner, rarely spinning something self-hosted (e.g., over GKE). Fully Serverless Approach, based on Cloud Functions and Cloud Run is definitely not welcomed.

Relocation

Relocation assistance to a desired country may be provided after the probationary period, based on business needs and demonstrated performance.

About team

Working jointly with other ML engineers as part of a full-fledged AI team that includes data and medical analysts, data engineers, and data scientists.

Team Building

The company partially compensates Team Building events, when multiple teammates are located in nearby countries.

Location and timezone:

  • We are focused on hiring in time zones overlapping with the US (Portugal, Spain) or Western Europe

  • We are only able to engage contractors in countries where international payroll and compliance can be reliably supported

  • We are open to considering additional locations where time zone overlap and payroll compliance can be reliably supported, including certain Eastern European and Middle Eastern countries (Bulgaria, UAE, etc.).

Languages:

  • Upper-Intermediate English or higher; ability to present work and lead discussions with US-based teammates, customers, and stakeholders.

Responsibilities:

Build and operate ML solutions for multimodal healthcare data processing and real-time AI agent serving.

Key Focus Areas

  • Clinical document analysis: extract, classify, and structure medical data

  • Medical text processing: summarize clinical notes, provide clinical decision support

  • Conversational AI: develop voice and chat agents for healthcare workflows

What You’ll Own:

  • Architect, implement and optimize ML infrastructure using GCP tools (Vertex AI, BigQuery, Cloud Composer, GKE, Pub/Sub)

  • Design and develop DAG-based batch pipelines and real-time API endpoints for ML model and multimodal agent serving

  • Deploy and maintain self-hosted LLM solutions with custom fine-tuning and production optimization

  • Build monitoring and observability for production systems: track system health, model performance, inference latency and operational costs

  • Drive technical decisions and collaborate with cross-functional teams to integrate ML solutions into healthcare business processes

Required Experience

ML Engineering

  • 5+ years as an ML Engineer building, deploying and running ML solutions in high-load, real-world business processes

  • Proven track record of deployment of high-load ML solutions into production from R&D and Prototyping to Deployment and Productivization

  • Proven track record of building monitoring systems for ML solutions

Cloud-Native & GCP

  • Cloud-Native Experience with GCP – 3+ years using ML/data products (Vertex, BigQuery, Cloud Composer, GKE, Pub/Sub)

  • We don’t – at all – consider Legacy-only Big Data Experts. Meaning, it’s not enough to know outdated technologies, such as Teradata, Hadoop, Spark over Hadoop, etc.

  • This role requires working in a Unix-like Development Environment (e.g., macOS, Linux). We do not use Windows-based workstations for Engineering or AI-related tasks. Virtualization (e.g., WSL) isn’t enough.

Engineering and Fundamentals

  • We expect strong productization skills — the ability to take ML and LLM solutions beyond prototypes and deliver production-ready systems with a focus on latency, reliability, observability, cost efficiency, and continuous operation in healthcare environments.

  • We prioritize Cloud-Native architecture on GCP, leveraging managed and scalable services such as Vertex AI, BigQuery, Cloud Composer, GKE, and Pub/Sub. We avoid fully serverless designs when they limit control, visibility, or performance tuning for ML/LLM workloads.

  • Experience with high-performance LLM inference engines such as vLLM (or similar)

  • Strong Python expertise is required for production-grade ML/NLP/LLM development, including pandas, asyncio-based services, FastAPI, and Pydantic.

  • A solid understanding of data architecture and database internals is important — schema design, DDL, partitioning, indexing, storage formats, and cost/performance optimization at scale.

  • We also require strong SQL skills for working with large BigQuery datasets, including clustering, partitioning, and query optimization.

  • Deep experience with modern ML and NLP is essential — PyTorch, Transformers, the Hugging Face ecosystem, multimodal models and retrieval-augmented methods.

Компания, занимающаяся разработкой облачных технологий для здравоохранения на базе искусственного интеллекта, ищет талантливого Senior ML инженера для долгосрочного сотрудничества.

Вы присоединитесь к международной команде первоклассных профессионалов, которые с энтузиазмом создают продукты, улучшающие качество медицинских услуг.

Требуемый опыт:

  • Более 5 лет работы в качестве инженера по машинному обучению

  • Подтвержденный опыт внедрения решений машинного обучения с высокой нагрузкой

  • Подтвержденный опыт создания систем мониторинга для решений машинного обучения

  • Требуется опыт работы с Cloud-Native — 3+ лет. Предпочтительно с GCP. Кандидаты с высоким уровнем владения GCP всегда будут иметь приоритет перед Azure, AWS и другими облачными платформами

  • Мы не рассматриваем кандидатов, специализирующихся только на устаревших технологиях больших данных. То есть недостаточно знать устаревшие технологии, такие как Teradata, Hadoop, Spark over Hadoop и т. д.

  • Эта должность требует работы в Unix-подобной среде разработки (например, macOS, Linux)

  • Навык выводить решения ML и LLM за рамки прототипов и поставлять готовые к производству системы с акцентом на задержку, надежность, наблюдаемость, экономическую эффективность и непрерывную работу в среде здравоохранения

  • Мы отдаем приоритет облачной архитектуре на GCP, используя управляемые и масштабируемые сервисы, такие как Vertex AI, BigQuery, Cloud Composer, GKE и Pub/Sub.

  • Опыт работы с высокопроизводительными механизмами вывода LLM, такими как vLLM (или аналогичными).

  • Для разработки ML/NLP/LLM производственного уровня требуются глубокие знания Python, включая pandas, сервисы на основе asyncio, FastAPI и Pydantic.

  • Глубокое понимание архитектуры данных и внутреннего устройства баз данных — проектирование схем, DDL, разбиение на разделы, индексирование, форматы хранения и оптимизация затрат/производительности в масштабе.

  • Глубокие знания SQL для работы с большими наборами данных BigQuery, включая кластеризацию, разбиение на разделы и оптимизацию запросов.

  • Глубокий опыт работы с современными ML и NLP — PyTorch, Transformers, экосистема Hugging Face, мультимодальные модели и методы с расширенным поиском.

Похожие вакансии MLOps инженер

Другие площадки
selecty

Инженер агентного программирования

selectyНа сервисе с: 20.08.26 10:27
350k–400k ₽РоссияУдалёнка

Selecty — аккредитованная IT-компания, оказывающая услуги в сфере IT-аутсорсинга.

Работаем на рынке более 10 лет, с 2013 года успешно решая задачи любой сложности в рамках цифровой трансформации для крупного бизнеса. Среди заказчиков Selecty более 300 компаний из списка РБК Топ-500.

Мы ищем ИИ-инженеров нового поколения, которые сочетают в себе навыки архитектора, разработчика и продуктового визионера. Опыт разработки от Middle+

Технологии и инструменты

  • Асинхронность.
  • FastAPI.
  • Docker, понимание, что такое мультистейдж.
  • K8s, Helm.
  • Prometheus, Grafana.
  • Redis.
  • Kafka, RabbitMQ — абстракции Kafka (топик, партиция, ZooKeeper, offset, acks, содержимое файла).
  • ML-метрики (Accuracy, Precision, Recall) — важно.
  • AUC-ROC, AUC-PR — важно.
  • Классификация в ML (лог. регрессия, k-NN, SVM, Naive Bayes, Decision Tree, Random Forest, …).
  • Log loss.
  • TF-IDF, BM25 — важно.
  • Трансформеры — важно.
  • BERT, GPT.
  • RAG (пайплайн с нуля).
  • Qdrant (метрики близости, HNSW, квантирование, …).
  • Бенчмарки моделей.
  • LangChain, LangGraph.

Чем ты будешь заниматься

  • End-to-end-разработка: от логики базы данных до интерфейса.
  • Поэтапный запуск: создание работающих микрочастей (каждый коммит — рабочий результат).
  • AI-driven development: использование нейросетей для генерации кода, отладки и быстрой сборки архитектуры.
  • DevOps-задачи: работа с репозиториями и автодеплоем (Railway) сразу после коммитов.
  • Продуктовая работа: понимание болей пользователя и того, как технические решения их закрывают.

Требования

  • Qdrant — глубокое понимание внутренностей, методов оптимизации под нагрузку (возможно, знание альтернативной БД).
  • Работа с синтетическими чанками.
  • Работа с графами.
  • Опыт построения пайплайнов RAG.
  • Оптимизация эмбеддингов (подбор моделей, снижение стоимости хранения/запросов).
  • Интеграция с LLM.
  • Понимание метрик качества поиска (Recall@k, MRR и др.).
  • Знает, что такое брокер, желательно опыт с Kafka.
  • Мультитрединг, мультипроцессинг.
hh.ru
innovative people

Senior MLOps Engineer / Специалист по науке о данных (MLOps)

innovative peopleНа сервисе с: 20.08.26 10:22
Зарплата не указанаРоссияМоскваУдалёнка

Innovative People - группа компаний, которая 20 лет предоставляет комплексные услуги в сфере информационных технологий. Так же мы являемся аккредитированной IT- компанией.

Сейчас мы в поиске Senior MLOps Инженера на проект внутренней корпоративной AI-платформы для автоматизации процессов, поддержки сотрудников и повышения эффективности работы с данными.


Обязанности:
  • Развертывание и поддержка LLM-платформы в Kubernetes.
  • Работа с Helm, Terraform и Kubernetes Operators.
  • Настройка и поддержка CI/CD для ML/AI-сервисов, включая обучение моделей, inference и data pipelines.
  • Автоматизация ML-workflow в Kubeflow.
  • Настройка и поддержка мониторинга моделей: latency, drift, cost metrics.
  • Управление пайплайнами данных для обучения и inference.
  • Работа с Kafka, Data Lake и S3/object storage.
  • Настройка и поддержка векторных баз данных Weaviate, Qdrant, PGVector.
  • Оптимизация работы GPU-кластера, включая распределённое обучение и эффективное использование ресурсов.
  • Настройка мониторинга и логирования с использованием Prometheus, Grafana, ELK, OpenTelemetry.
  • Обеспечение безопасности и комплаенса: изоляция сред, контроль доступа и логирование.
Требования:
  • Опыт работы с Kubernetes, включая облачные и on-premise кластеры.
  • Уверенное знание Python.
  • Практический опыт работы с инструментами MLOps: Kubeflow, Airflow.
  • Опыт настройки и поддержки CI/CD, в том числе Jenkins.
  • Опыт работы с системами хранения и векторными базами данных: Weaviate, Qdrant, PGVector.
  • Знание инструментов мониторинга и логирования: Prometheus, Grafana, ELK, OpenTelemetry.
  • Понимание принципов работы LLM/GenAI и RAG-систем.

Будет плюсом:

  • Практический опыт работы с LLM/GenAI и RAG-системами.
  • Опыт работы с AI/ML-платформами в production.
Условия:
  • Работу в аккредитованной IT-компании.
  • ДМС со стоматологией.
  • Возможность посещения профильных конференций, семинаров, оплату курсов, необходимых для повышения квалификации.
  • Бессрочный трудовой договор, полное соблюдение ТК, гибкий старт и окончание рабочего дня.
  • Удаленный формат работы.
  • Удобную и мощную технику для работы.
  • Speaking club по английскому с преподавателем.
  • Корпоративный мерч.
Сайты компаний
яндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

яндексНа сервисе с: 06.07.26 22:55↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLМ) моделей, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Современное обучение таких моделей — это сложная система, которая включает десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать эту систему максимально эффективной, рационально используя вычислительные ресурсы и минимизируя риски сбоев.

Обучение моделей превратилось в задачу управления сложными распределёнными системами. Нужно обеспечивать отказоустойчивость, эффективную доставку данных и минимизировать задержки в коммуникациях. Чем сложнее система, тем больше точек отказа, а чем больше ресурсов нужно на обучение, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры: мы должны понимать и особенности аппаратного обеспечения (GPU, сети, шины данных, диски, память), и нюансы самого процесса обучения: составные части, взаимодействие компонентов, узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением, Reinforcement Learning, RL. С ростом популярности этого метода появляются всё более сложные подходы, увеличивается потребность в вычислительных ресурсах — и, как следствие, возникает необходимость строить специализированную инфраструктуру.

Оптимизация инфраструктуры RL-обучения

Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы.

Повышение отказоустойчивости инфраструктуры

Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям.

Исследование и внедрение современных решений

Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков
* Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed
* Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения
* Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне
* Умеете эффективно работать в команде и делиться знаниями

* Участвовали в создании инфраструктуры обучения ML-моделей
* Внедряли и оптимизировали RL-решения
* Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM
* Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации
* Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.