сбер

ML-инженер (AI Quality / Evaluation) в команду GigaChat

сбер · На сервисе с: 15.08.26 12:09

↑ Вакансия с автоподнятием
350k–600k ₽РоссияУдалёнка

Мы развиваем GigaChat и ищем сильного ML-инженера в команду AI Quality. Наша команда — это главный навигатор развития модели. Мы не просто тестируем сборки, мы исследуем новые возможности GigaChat, сопоставляем его работу с реальными продуктовыми требованиями и находим точки для кратного роста качества. Публичные бенчмарки покрывают далеко не всё и часто оторваны от жизни, поэтому мы строим собственную инфраструктуру замеров, которая честно показывает, как модель решает настоящие задачи пользователей.

Это роль для человека, который возьмёт на себя ответственность за сквозной цикл оценки: от ресёрча ландшафта и проектирования датасетов под продуктовые вызовы до написания надёжного кода и внедрения бенчмарка в общий харнесс. Ищем не столько исполнителя, собирающий дашборды, сколько мотивированного инженера-исследователя. Тот, кто глубоко понимает, что нужно продукту, замечает узкие места именного базового качества модели, вспоминает актуальную статью с подходящим методом оценки и приходит с готовым планом: «давайте замерим вот так, потому что именно это покажет наш реальный прогресс».

Чем предстоит заниматься

Развивать инфраструктуру и пайплайны замеров (Evaluation Harness).

  • Реализовывать и поддерживать бенчмарки: парсинг датасетов, промпт-шаблоны, постпроцессинг ответов, подсчёт метрик.
  • Обеспечивать железобетонную воспроизводимость: версионирование конфигов, CI-интеграция. Любой замер должен выдавать идентичный результат и сегодня, и через полгода.
  • Разбирать статьи и репозитории новых бенчмарков, понимать их методологию и встраивать в наш пайплайн с автоматическим запуском.

Строить и масштабировать LLM-as-a-Judge.

  • Развивать пайплайны моделей-судей: глубокий промпт-инжиниринг, калибровка, контроль смещений (bias), оценка консистентности и сравнение судей между собой.
  • Проектировать, настраивать и автоматизировать arena-style оценки.

Создавать целевые датасеты и анализировать данные.

  • Проектировать новые арены и тестовые наборы под конкретные слабые места модели и проверяемые гипотезы.
  • Вытаскивать сигналы о деградациях из пользовательских логов, собирать промпты, следить за актуальностью и контаминацией существующих датасетов.
  • Проводить аналитику и быстро писать скрипты для ответа на вопрос: «почему просела метрика и что именно сломалось».

Проводить research и влиять на релизы.

  • Самостоятельно отслеживать state-of-the-art в области evaluation, инициировать внедрение лучших подходов — не дожидаясь постановки задачи сверху.
  • Готовить аналитические отчёты по замерам, формулировать жёсткие go/no-go рекомендации и аргументированно отстаивать их перед командой pretrain/post-train.

Для нас важно

  • Уверенный Python и инженерная культура: код ревьюится, тестируется и не гниёт. Уверенное владение Git, CI/CD, Bash на уровне самостоятельной поддержки сервисов. Использование AI-ассистентов и знание best practices горячо приветствуются.
  • Глубокое понимание устройства LLM: не на уровне обзоров, а на практике. Вы знаете, что такое chat template, почему ризонеры могут давать разные результаты при нулевой температуре, и почему один и тот же бенчмарк можно замерить тремя способами, получив три разных числа. Практический опыт инференса open-source моделей (vLLM, SGLang).
  • Насмотренность и инициативность: вы умеете не просто следить за потоком статей, но в нужный момент вытащить из памяти релевантный подход, связать его с текущей задачей и конвертировать в конкретный план действий.
  • Базовая статистическая грамотность: доверительные интервалы, bootstrap, чёткое понимание того, когда разница в метрике статистически значима, а когда — это просто шум.

Будет плюсом

  • Опыт работы с evaluation-фреймворками (lm-evaluation-harness, HELM, BigCode Evaluation) или написания собственных харнессов.
  • Опыт с LLM-judge подходами и глубокое знакомство с профильной литературой (MT-Bench, AlpacaEval, Chatbot Arena).
  • Публикации или заметный open-source вклад в области evaluation.

Что предлагаем

  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
  • Огромную степень влияния на продукт: от ваших метрик и рекомендаций зависит, пойдет ли флагманская модель в релиз.
  • Команду сильных инженеров и исследователей, задающих высокую планку инженерной надёжности.
  • Конкурентную компенсацию, премии и расширенный соцпакет.

Похожие вакансии Data Science & ML

Сайты компаний
сбер. it

Junior Data Scientist

сбер. itНа сервисе с: 20.08.26 19:59
Зарплата не указанаРоссияМоскваОфис

Наша команда помогает развивать сеть банкоматов Сбера и обеспечивать ее бесперебойную работу. Мы погружены в разные части этого процесса — от AI-агента в банкоматах нового поколения до автоматизации обработки заявок на техническое обслуживание устройств. В команде есть как современные решения на основе LLM, RAG и AI-агентов, так и классические ML-задачи.

  • Разрабатывать и развивать AI-агентов и LLM-системы: строить пайплайны, экспериментировать с моделями и подходами, оценивать качество и улучшать решения

  • Решать задачи классического ML и NLP: классификация, работа с текстами, эмбеддингами и другими ML-моделями

  • Проводить эксперименты с моделями и их параметрами, анализировать результаты и выбирать лучшие подходы

  • Разрабатывать пайплайны подготовки и обработки данных для ad-hoc аналитики и построения витрин

  • Организовывать и проводить оценку качества ML/LLM-решений, работать с разметкой данных

  • Участвовать в развитии решений на всех этапах: от постановки задачи и общения с заказчиком до внедрения и мониторинга в проде

  • Понимание принципов построения AI-агентов

  • Уверенное владение Python и SQL, умение работать с Git

  • Понимание основных этапов разработки ML-решения

  • Знание основ классического ML: классификация, регрессия, основные алгоритмы и метрики качества

  • Понимание основных подходов NLP и работы с текстовыми данными

Будет плюсом:

  • Знание RAG-систем

  • Знание Hadoop, Spark

  • Базовое понимание MLOps (Docker, Jenkins) и Linux

  • Комфортный современный офис рядом с м. Кутузовская (офисный или гибридный режим работы)

  • Корпоративный спортзал и зоны отдыха

  • Уникальная система обучения Сбера для профессионального и карьерного развития, семинары, тренинги, конференции

  • Программа адаптации и помощь руководителя на старте

  • ДМС, страхование от несчастных случаев, социальные гарантии

  • Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ

  • Подписка Прайм с возможностью совместного использования на трёх близких

  • Вознаграждение за рекомендацию друзей в команду Сбера

  • Корпоративная пенсионная программа

  • Корпоративные мероприятия.

Эта вакансия также есть на:hh.ru
Соц.сети
E

Data Scientist (Pricing)

emerging_travel_groupНа сервисе с: 20.08.26 19:16
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

#ds
Data Scientist (Pricing) ⚡️
Remote.

Emerging Travel Group — travel-tech компания с продуктами в сегментах B2C, B2B, B2A (RateHawk, Roundtrip, ZenHotels), которые помогают клиентам управлять всеми потребностями в путешествиях.

Расширяют Data Science‑команду в Emerging Travel Group по миру — ищу Data Scientist в направление Pricing ✨

Задачи: ценообразование для B2B/B2C, прогноз и оптимизация финансовых и операционных метрик, uplift‑моделирование, приоритизация инцидентов и эффективность customer journey (revenue growth, cost savings, business impact).

Проекты — от постановки задачи до пилота и передачи в прод.

Что важно:
• 3+ лет опыта в Data Science.
• End‑to‑end ML‑проекты: от формализации до результата.
• Классический ML: бустинги, классификация, регрессия.
• Uplift‑моделирование и временные ряды на реальных бизнес‑задачах.
• Python и SQL уверенно.

Плюсом:
• A/B‑тесты: метрики, сплиты, интерпретация.
• Работа со стейкхолдерами и понимание оптимизационных задач: pricing, LTV, retention.
• MLflow/DVC, Airflow, мониторинг моделей.

Читать подробнее:
→ Откликнуться тут

⚡️ - прямой контакт

Другие площадки
G

Senior ML Engineer

gettransferНа сервисе с: 20.08.26 19:01
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

ML Engineer — GetTransfer

GetTransferищет опытного ML Engineerдля разработки и внедрения ML-решений в production.
В периметре компании — широкий спектр проектов: от RightTech и mobilityдо fintech и других технологических направлений. Это возможность работать с разными типами ML-задач, современным стеком и практически безграничными возможностями для профессионального развития в области Machine Learning.

Что предстоит делать:
- разрабатывать и улучшать ML-модели;
- работать с большими объёмами данных;
- внедрять модели в production и поддерживать их жизненный цикл;
- выстраивать ML pipelines и MLOps-процессы;
- заниматься мониторингом качества моделей и данных;
- работать с Python и современным ML-стеком.

Ожидания:
- 5+ лет опыта в Machine Learning;
- сильный Python;
- опыт production deployment ML-моделей;
- опыт с MLOps, MLflow или аналогичными инструментами;
- понимание model/data versioning, CI/CD и автоматизации ML pipelines;
- опыт построения мониторинга моделей и data quality;
- умение работать с большими объёмами данных и сложными ML-системами.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.