S

Software Engineer (LLM Inference)

soniox · На сервисе с: 21.08.26 16:19

Зарплата не указанаСловенияУдалёнка

About the role

Soniox is pushing the boundaries of real-time AI, and we’re looking for an engineer to help us run large language models with exceptional speed, efficiency, and reliability at production scale.

In this role, you’ll work deep in the LLM inference stack, from vLLM scheduling and KV-cache management to CUDA kernels, distributed execution, and GPU profiling, optimizing every part of the path from request to generated token.

In this role, you will:

  • Build and optimize our vLLM-based inference stack for low latency, high throughput, and maximum GPU utilization.
  • Optimize continuous batching, scheduling, prefill/decode, prefix caching, and KV-cache allocation and reuse.
  • Optimize or implement CUDA and Triton kernels for attention, GEMMs, sampling, normalization, and other critical model operations.
  • Evaluate and integrate technologies such as FlashAttention, FlashInfer, CUDA Graphs, torch.compile, speculative decoding, and quantization.
  • Optimize distributed inference using tensor, data, and expert parallelism, NCCL, NVLink/NVSwitch, and InfiniBand.
  • Work closely with researchers to bring new dense and MoE model architectures into production quickly and efficiently.

You might thrive in this role if you:

  • Have deep hands-on experience with LLM inference, ideally working inside vLLM, SGLang, TensorRT-LLM, or similar systems, not just deploying them.
  • Understand TTFT, inter-token latency, throughput, continuous batching, PagedAttention, KV caching, and prefill vs. decode performance.
  • Are comfortable profiling GPUs and reasoning about compute, memory bandwidth, kernel launches, synchronization, and communication bottlenecks.
  • Have experience with CUDA, Triton, PyTorch, NCCL, and modern NVIDIA GPU architectures.
  • Understand Transformer internals including MHA/GQA, RoPE, KV cache, quantization, and MoE.
  • Have experience optimizing distributed, performance-critical systems in production.
  • Care deeply about performance, simplicity, and reliability, and take ownership from profiling through production deployment.

Why Soniox

  • You’ll help build one of the most technically advanced voice AI platforms in the world, and push LLM inference performance at every layer of the stack.
  • You’ll work directly with a world-class team of engineers and researchers on hard, measurable problems spanning models, GPU kernels, distributed systems, and production infrastructure.
  • You'll have a voice in how our technology evolves, how our company grows, and how AI transforms human communication.

Похожие вакансии Data Science & ML

hh.ru
positive technologies

ML-инженер

positive technologiesНа сервисе с: 21.08.26 18:52
Зарплата не указанаРоссияМоскваУдалёнка

Кто мы

Positive Technologies — вендор продуктов и услуг в области кибербезопасности. Более 20 лет наша основная задача — предотвращать хакерские атаки до того, как они причинят неприемлемый ущерб бизнесу и целым отраслям экономики. Наши технологии используют около 4000 организаций по всему миру.

О команде

Ищем ML-инженера в группу анализа файлов и уязвимостей — отдельное направление внутри большой ML-команды Positive Technologies. Группа разрабатывает нейросетевые технологии для поиска вредоносных файлов и решения других задач информационной безопасности.
Один из ключевых проектов — ByteDog, трансформер, который анализирует файлы как последовательности байтов.
В работе будет два основных фокуса: развитие промышленного контура ByteDog и создание новых компактных моделей для защитных продуктов Positive Technologies.

Чем предстоит заниматься:

  • Развивать инженерную часть ByteDog: пайплайны, тестирование, интеграцию и эксплуатацию модели в продуктах.
  • Адаптировать технологию анализа файлов для новых форматов данных, включая офисные документы. Здесь возможны подготовка датасетов, эксперименты и дообучение моделей, а также мониторинг качества на основе клиентской телеметрии.
  • Разрабатывать и обучать новые нейросетевые модели для задач защиты конечных пользовательских устройств.
  • Оптимизировать новые модели для быстрого инференса на CPU и в средах с ограниченными ресурсами. - Применять квантизацию, прунинг, дистилляцию и оптимизацию вычислительного графа.
  • Строить пайплайны подготовки данных, обучения и оценки качества моделей.
  • Участвовать в смежных проектах группы: например, в детектировании дипфейков или поиске фактов мошенничества в сообщениях.


Что нужно кандидату:

  • Опыт обучения трансформеров и других современных нейросетевых архитектур.
  • Опыт внедрения собственных моделей в production.
  • Понимание полного цикла ML-разработки: данные, обучение, оценка качества, оптимизация, внедрени мониторинг.
  • Опыт решения NLP-задач или анализа последовательностей.
  • Понимание способов профилирования и ускорения инференса.
  • Уверенное владение Python.
  • Знание SQL и опыт создания data pipelines.


Будет плюсом :

  • Практический опыт с ONNX/ONNX Runtime, Triton или TensorRT.
  • Airflow и опыт написания DAG.
  • dbt, Spark, Trino, Iceberg, S3 или DuckDB.
  • Опыт мониторинга моделей в продакшен-среде: детект дата-дрифтов, shadow-тестирование
  • Опыт разработки ML для мобильных, embedded- или endpoint-устройств. - C++ или Rust.
  • Опыт в computer vision, обработке речи, антифроде или информационной безопасности.
  • Понимание специфики разработки мобильных приложений.
  • Умение применять современные AI-инструменты в исследованиях и разработке.


Что мы предлагаем

  • Удаленный или гибридный формат работы и гибкое начало рабочего дня

  • Условия для постоянного развития: внешние и внутренние образовательные программы, митапы, научпоп-лекции, экспертное обучение, обучение для руководителей и не только

  • Гибкий подход к отдыху: 28 календарных дней отпуска, доплату отпускных до полного оклада и 10 day off в год

  • Заботу о здоровье: ДМС с первой недели работы, включая стоматологию, ежегодный чекап

  • Компенсацию до 50% расходов на занятия спортом и английским языком в рамках ежегодного бюджета

  • Работу в аккредитованной ИТ-компании и возможность использования льгот Министерства цифрового развития

hh.ru
skillstaff

LLM инженер (Middle+)

skillstaffНа сервисе с: 21.08.26 19:03
Зарплата не указанаРоссияМоскваУдалёнка
Мы ищет инженера по внедрению и оптимизации больших языковых моделей. Специалист, который поможет превратить передовые достижения в области GenAI в надежные, масштабируемые и экономически эффективные enterprise-решения.

Чем предстоит заниматься:

​​​​​​​
  • Интегрировать LLM в enterprise-процессы: RAG, агентные архитектуры, fine-tuning pipelines, human-in-the-loop сценарии.
  • Проводить техническое исследование новых подходов и фреймворков для эффективной эксплуатации LLM в production.
  • Оптимизировать производительность моделей: latency, throughput, cost-efficiency (quantization, distillation, speculative decoding и др.).

Для нас важно:

  • Опыт работы с LLM (инференс, дообучение, fine-tuning, RAG и пр.) не менее 3-х лет.
  • Уверенное владение Python и основными ML-библиотеками (PyTorch, Transformers, accelerate и т.п.).
  • Опыт проектирования LLM-агентов или production-систем на их основе (LangChain, LangGraph и т.п.).
  • Опыт вывода решений на основе LLM в пром (vLLM, SGLang).

Главный принцип SkillStaff - Выбирай!

  • РАЗНООБРАЗИЕ ПРОЕКТОВ. Выбирай из сотен компаний и проектов то, что интересно и полезно для твоего роста. SkillStaff помогает реализовывать ежегодно порядка 500 различных ИТ-проектов для крупного бизнеса.
  • КОМФОРТ. SkillStaff — аккредитованная IT-компания, белая зарплата и удобный график работы. Создавай идеальные условия для своей работы: удаленная работа или возможность работать как в офисе клиента, так и в комфортном офисе SkillStaff в центре Москвы на Воздвиженке.
  • РАЗВИТИЕ. Выбирай сам путь, по которому ты хочешь развиваться. Используй возможность обмена опытом и получение знаний через участие в разных проектах, совместную работу с высококвалифицированными коллегами.
  • КУЛЬТУРА. Нашу культуру создают сами сотрудники – мы их слышим и помогаем развиваться, чтобы #вместе переходить на новый уровень!
hh.ru
rwb (wildberries & russ)

ML engineer / Data Scientist

rwb (wildberries & russ)На сервисе с: 22.06.26 23:49↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваУдалёнка

Объединённая компания Wildberries и Russ — это международная технологическая компания, образованная в результате слияния двух лидеров рынка — IT-компании Wildberries и оператора наружной рекламы Russ.

О команде и проектах:
Команда MLE, DS, DA, MLops и backend-разработчиков с продуктовым мышлением. Решаем задачи ценообразования, кредитного скоринга b2c/b2b, роста клиентской базы
Вам предстоит :
  • Разрабатывать ML модели (на выбор несколько направлений);
  • PD/LGD/PnL и антифрод (classic и DL) для bnpl и банковских продуктов b2c/b2b;
  • Динамический прайсинг - назначения скидок для оптимизации GMV и прибыли в разрезе категорий товаров WB;
  • WB Кошелек - назначение скидок, рост клиентской базы и уровня проникновения, получение habit-forming эффекта
  • Выводить модели в production
  • Исследовать новые подходы для повышения метрик продукта
  • Исследовать новые источники данных разных модальностей
  • Принимать непосредственное участие в разработке ML инфраструктуры
  • Выстраивать мониторинг за стабильностью моделей и фичей
Формат работы : гибридный/удаленный

Вы нам подходите, если:

  • Работаете в DS/ML от 3 лет, а также от года в банках/fintech/marketplace/телекоме;
  • Отлично владеете классическим ML и DL, опыт uplift моделирования и построения behavioral моделей;
  • Обладаете промышленным опытом внедрения моделей;
  • Занимаетесь построением мониторинга за работой моделей;
  • Владеете python, Airflow, Spark, Docker, Git, PyTorch;
  • Работаете с S3/Hadoop, а также с аналитическими БД ClickHouse/GreenPlum;
nice-to-have: опыт разработки cross-attention/мультимодальных NN, построения Triton inference пайплайнов, разработки и имплементации RL, построения графовой аналитики/графовых NN и работы с графовыми СУБД, матчинге товаров

Преимущества для сотрудников:

  • Обучение и развитие: языковые клубы, собственный корпоративный университет, программы развития управленческих навыков и многое другое;
  • Благополучие сотрудников: корпоративный пакет ДМС со стоматологией, корпоративный спорт, консультации психолога и дополнительные возможности аккредитованной IT-компании;
  • Множество сообществ: клуб спикеров, футбола, йоги, шахмат и т.д.;
  • Забота о семьях: создаем условия, в которых легко сочетать карьеру и заботу о близких – от гибкого подхода до масштабных проектов для детей сотрудников;
  • Скидки и партнерские программы: на обучение, страхование, покупки и многое другое;
  • Комфортная рабочая среда: бесплатное питание в офисе, современные офисы рядом с метро, корпоративная техника и портал для сотрудников.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.