
Мы ищем ML-аналитика, который возьмёт на себя оценку качества продуктовых ИИ-функций и агентов. Такие решения уже появляются в Почте, Диске, Документах, Таблицах, Календаре, Телемосте и других сервисах Яндекс 360.
яндекс На сервисе с: 29.09.26 14:42
Мы ищем ML-аналитика, который возьмёт на себя оценку качества продуктовых ИИ-функций и агентов. Такие решения уже появляются в Почте, Диске, Документах, Таблицах, Календаре, Телемосте и других сервисах Яндекс 360.
ИИ-функции ищут информацию, готовят документы, пересказывают встречи и выполняют действия через инструменты. Для каждого сценария нужно понимать, насколько хорошо он работает на реальных запросах и что меняется после обновления модели, промпта, агента или тулов.
Построение системы оценки качества моделей и агентов
Вам предстоит разработать и внедрить LLM-as-a-judge для автоматической оценки ответов моделей, а также построить eval-систему для оценки качества агентов. С её помощью команда будет проверять, насколько хорошо агенты решают пользовательские задачи и работают с тулами на каждом шаге.
Создание пайплайнов обработки данных
Вы будете работать с текстовыми и мультимодальными данными, создавая надёжные и эффективные пайплайны для сбора данных обучения и оценки. Ваша задача — автоматизировать процессы, чтобы данные были всегда актуальными и качественными.
Разработка end-to-end-метрик для агентов Яндекс 360
Вы поможете разработать систему офлайн-метрик для агентов Яндекс 360: определить критерии качества, построить пайплайны и подобрать данные для оценки.
Встраивание решений в продакшн
Созданные вами инструменты и метрики не должны оставаться в виде прототипов. Важной частью работы будет интеграция ваших решений в продовые процессы команды ML-разработчиков и аналитиков.
Больше об ML в Яндексе — в канале Yandex for ML
* Уверенно работаете с Python и SQL, анализируете данные с помощью pandas или похожих инструментов
* Пишете поддерживаемый аналитический код и умеете доводить пайплайны до регулярной работы
* Хорошо знаете теорию вероятностей и математическую статистику
* Понимаете, как работают ML-модели и как оценивать их качество
* Умеете ставить эксперименты, собирать репрезентативные выборки и находить смещения в данных
* Можете связать качество модели с продуктовым сценарием и поведением пользователей
* Самостоятельно разбираетесь в новой области и умеете договориться с разработчиками и продуктовыми командами о критериях качества
* Оценивали LLM, RAG-системы или агентов, которые работают с инструментами
* Работали с экспертной или краудсорсинговой разметкой
* Проводили онлайн-эксперименты и анализ продуктовых метрик
* Знакомы с NLP или мультимодальными моделями
* Запускали новую аналитическую или ML-практику
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.