диджитал лайн

AI Инженер

диджитал лайн · На сервисе с: 21.08.26 16:35

250k–380k ₽РоссияМоскваУдалёнка
Обязанности:
  • Разработка и совершенствование агентов поддержки на базе LLM и агентных процессов (agentic workflows).
  • Работа с prompt- и context engineering, tool calling и structured outputs.
  • Проектирование и совершенствование системы оценки качества агентов (agent evaluation) и регрессионного тестирования.
  • Повышение надёжности, наблюдаемости (observability) и стабильности работы системы в production.
  • Рефакторинг существующих систем, сокращение технического долга и улучшение архитектуры.
  • Работа с open-source LLM и инфраструктурой для инференса моделей.
Требования:
  • Сильный опыт разработки на Python и backend-разработки (от 3х лет)
  • Хорошие навыки production-разработки: чистый код, SOLID, паттерны проектирования, тестирование.
  • Практический опыт работы с LLM и AI-агентами.
  • Хорошее понимание промптов, управления контекстом, tool calling и архитектуры AI-агентов.
  • Уверенная работа с Linux, Docker, сетями, логами и метриками, а также навыки отладки систем в production.
  • Опыт рефакторинга и переработки существующих систем

Будет преимуществом:

  • Опыт оценки качества AI-агентов / LLM (agent evaluation / LLM evals).
  • Понимание современных подходов к LLM-инференсу: vLLM, KV/prefix caching, batching и т. д.
  • Опыт работы с RAG/retrieval и мультиязычными продуктами на базе LLM.Стек: Python, PostgreSQL, vLLM, Docker, Linux, LGTM (Grafana)
Условия:​​​​​​​
  • Работа в международной компании с амбициозными маркетинговыми проектами.

  • Возможность влиять на развитие бренда и участвовать в запуске масштабных кампаний.

  • Культура, в которой ценятся самостоятельность, скорость и ответственность.
  • Гибкий формат удалённой работы.
  • Возможности для профессионального и карьерного роста.

  • Конкурентоспособная заработная плата.

Похожие вакансии AI инженер

hh.ru
skillstaff

LLM инженер (Middle+)

skillstaffНа сервисе с: 21.08.26 19:05
Зарплата не указанаРоссияМоскваУдалёнка
Мы ищет инженера по внедрению и оптимизации больших языковых моделей. Специалист, который поможет превратить передовые достижения в области GenAI в надежные, масштабируемые и экономически эффективные enterprise-решения.

Чем предстоит заниматься:

​​​​​​​
  • Интегрировать LLM в enterprise-процессы: RAG, агентные архитектуры, fine-tuning pipelines, human-in-the-loop сценарии.
  • Проводить техническое исследование новых подходов и фреймворков для эффективной эксплуатации LLM в production.
  • Оптимизировать производительность моделей: latency, throughput, cost-efficiency (quantization, distillation, speculative decoding и др.).

Для нас важно:

  • Опыт работы с LLM (инференс, дообучение, fine-tuning, RAG и пр.) не менее 3-х лет.
  • Уверенное владение Python и основными ML-библиотеками (PyTorch, Transformers, accelerate и т.п.).
  • Опыт проектирования LLM-агентов или production-систем на их основе (LangChain, LangGraph и т.п.).
  • Опыт вывода решений на основе LLM в пром (vLLM, SGLang).

Главный принцип SkillStaff - Выбирай!

  • РАЗНООБРАЗИЕ ПРОЕКТОВ. Выбирай из сотен компаний и проектов то, что интересно и полезно для твоего роста. SkillStaff помогает реализовывать ежегодно порядка 500 различных ИТ-проектов для крупного бизнеса.
  • КОМФОРТ. SkillStaff — аккредитованная IT-компания, белая зарплата и удобный график работы. Создавай идеальные условия для своей работы: удаленная работа или возможность работать как в офисе клиента, так и в комфортном офисе SkillStaff в центре Москвы на Воздвиженке.
  • РАЗВИТИЕ. Выбирай сам путь, по которому ты хочешь развиваться. Используй возможность обмена опытом и получение знаний через участие в разных проектах, совместную работу с высококвалифицированными коллегами.
  • КУЛЬТУРА. Нашу культуру создают сами сотрудники – мы их слышим и помогаем развиваться, чтобы #вместе переходить на новый уровень!
hh.ru
газпромнефть-снабжение

Технический лидер команды разработки AI/ML и backend-систем

газпромнефть-снабжениеНа сервисе с: 22.07.26 18:34↑ Вакансия с автоподнятием
Зарплата не указанаРоссияСанкт-ПетербургОфис

Ключевые цели:

  • Формирование и развитие кросс-функциональной технической команды разработки, выстраивание инженерных практик и стандартов для создания высоконагруженных backend-систем и промышленных AI/ML-решений.
  • Обеспечение сквозного цикла внедрения: от проектирования архитектуры и обучения моделей до промышленной эксплуатации (MLOps), автоматической оркестрации пайплайнов и бесшовной интеграции в production-контур.

Обязанности:

Архитектура и разработка:

  • Технический контроль реализации микросервисной архитектуры на базе FastAPI/Django 5.2 и Golang.
  • Проведение детального code-review с фокусом на обработку граничных условий, валидацию входных данных, корректность расчётов и отсутствие регрессий в логике.
  • Контроль качества интеграций: PostgreSQL/ClickHouse-запросы, кэширование в Redis, работа с очередями (Kafka, Celery), обработка ошибок и retry-политики.

MLOps и инфраструктура:

  • Надзор за промышленной эксплуатацией моделей: проверка конфигураций развёртывания через SeldonCore/Triton Inference Server, корректности пайплайнов в Apache Airflow и Temporal, изоляции LLM-вызовов.
  • Валидация метрик, логов, трейсов и алертинга в едином контуре Deckhouse;
  • Аудит процессов калибровки: верификация ночных jobs на Optuna + MLflow, безопасности GitOps-роллаутов через Jenkins/ArgoCD.

Лидерство и процессы:

  • Операционный контроль выполнения спринтовых задач: трекинг статусов, выявление блокеров, приоритизация багфиксов и технического долга без изменения объёма работ.
  • Системное проведение code-review и архитектурных ревью: обеспечение соблюдения стандартов кодирования, покрытия тестами, документирования API и миграций.
  • Анализ отклонений, инициация корректирующих действий, эскалация рисков при угрозе срыва сроков.

Взаимодействие и аналитика:

  • Техническая валидация результатов разработки перед передачей в staging/production: проверка соответствия DoD, полноты audit trail, корректности экспортных форматов (ZIP/Excel/JSON Schema).
  • Участие в разборе инцидентов: фиксация первопричин, контроль внедрения профилактических мер, обновление чек-листов для команды.
Требования:
  • Высшее образование (техническое).
  • Опыт разработки и вывода в production высоконагруженных backend-систем и AI/ML-решений от 5 лет, из них не менее 2 лет в роли Tech Lead или Engineering Manager.
  • Глубокое понимание полного жизненного цикла AI-проектов: от подготовки данных и обучения моделей до их масштабирования, мониторинга дрейфа и автоматического переобучения в промышленной среде.
  • Экспертное знание Agile/Scrum/Kanban и практический опыт адаптации процессов под специфику Data Science и backend-команд.

Технические навыки:

  • Уверенное владение Python и Golang, опыт проектирования отказоустойчивой микросервисной архитектуры на базе FastAPI и Django 5.2 с оптимизацией под конкурентные нагрузки.
  • Экспертиза в выборе и настройке систем хранения: PostgreSQL для транзакционных операций и бизнес-логики, ClickHouse для аналитических витрин и сбора телеметрии.
  • Практический опыт промышленного развертывания ML-моделей с использованием PyTorch, MLflow для трекинга экспериментов, а также SeldonCore и Triton Inference Server для высокопроизводительного инференса.
  • Понимание принципов контейнеризации и оркестрации (Kubernetes, Deckhouse), опыт настройки и поддержки пайплайнов обработки данных и ML-обучения через Apache Airflow.
  • Опыт проектирования пайплайнов с использованием low-code платформ (Loginom/KNIME/Apache NiFi): понимание преимуществ и недостатков использования low-code, опыт интеграции с внешними компонентами, применения для прототипирования и/или операционной эксплуатации.
  • Предметное понимание архитектурных паттернов и ограничений при внедрении LLM, NLP, Computer Vision и OCR в корпоративный IT-ландшафт.

Личностные качества:

  • Системное инженерное мышление: умение балансировать между скоростью предоставления, технической устойчивостью и безопасностью решений.
  • Навыки менторства, проведения архитектурных и code-review, способность формировать инженерную культуру и снижать технический долг без блокировки бизнес-задач.
  • Способность транслировать технические ограничения бизнесу, аргументированно отстаивать архитектурные решения.
Условия:
  • Офис в центре города - ст. метро «Сенная площадь».
  • Официальное трудоустройство.
  • Широкие возможности для профессионального роста.
  • ДМС (включая стоматологию) с первого дня работы.
  • Участие в инновационных проектах на стыке ИИ, ML и Big Data.
  • Возможность влиять на архитектуру решений и продуктовую стратегию.
  • Гибкий график.
  • Современная корпоративная культура.
Другие площадки
S

Software Engineer (LLM Inference)

sonioxНа сервисе с: 21.08.26 16:19
Зарплата не указанаСловенияУдалёнка

About the role

Soniox is pushing the boundaries of real-time AI, and we’re looking for an engineer to help us run large language models with exceptional speed, efficiency, and reliability at production scale.

In this role, you’ll work deep in the LLM inference stack, from vLLM scheduling and KV-cache management to CUDA kernels, distributed execution, and GPU profiling, optimizing every part of the path from request to generated token.

In this role, you will:

  • Build and optimize our vLLM-based inference stack for low latency, high throughput, and maximum GPU utilization.
  • Optimize continuous batching, scheduling, prefill/decode, prefix caching, and KV-cache allocation and reuse.
  • Optimize or implement CUDA and Triton kernels for attention, GEMMs, sampling, normalization, and other critical model operations.
  • Evaluate and integrate technologies such as FlashAttention, FlashInfer, CUDA Graphs, torch.compile, speculative decoding, and quantization.
  • Optimize distributed inference using tensor, data, and expert parallelism, NCCL, NVLink/NVSwitch, and InfiniBand.
  • Work closely with researchers to bring new dense and MoE model architectures into production quickly and efficiently.

You might thrive in this role if you:

  • Have deep hands-on experience with LLM inference, ideally working inside vLLM, SGLang, TensorRT-LLM, or similar systems, not just deploying them.
  • Understand TTFT, inter-token latency, throughput, continuous batching, PagedAttention, KV caching, and prefill vs. decode performance.
  • Are comfortable profiling GPUs and reasoning about compute, memory bandwidth, kernel launches, synchronization, and communication bottlenecks.
  • Have experience with CUDA, Triton, PyTorch, NCCL, and modern NVIDIA GPU architectures.
  • Understand Transformer internals including MHA/GQA, RoPE, KV cache, quantization, and MoE.
  • Have experience optimizing distributed, performance-critical systems in production.
  • Care deeply about performance, simplicity, and reliability, and take ownership from profiling through production deployment.

Why Soniox

  • You’ll help build one of the most technically advanced voice AI platforms in the world, and push LLM inference performance at every layer of the stack.
  • You’ll work directly with a world-class team of engineers and researchers on hard, measurable problems spanning models, GPU kernels, distributed systems, and production infrastructure.
  • You'll have a voice in how our technology evolves, how our company grows, and how AI transforms human communication.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.