яндекс

Аналитик-разработчик по оценке качества LLM в Генеративные технологии

Алиса — один из самых популярных ассистентов в России, которым ежедневно пользуются миллионы людей. Наша команда развивает качество ключевой LLM-технологии компании: мы измеряем, как модели отвечают на реальные пользовательские запросы, и…

яндекс · На сервисе с: 23.09.26 07:00

Зарплата не указанаРоссияМосква

Алиса — один из самых популярных ассистентов в России, которым ежедневно пользуются миллионы людей. Наша команда развивает качество ключевой LLM-технологии компании: мы измеряем, как модели отвечают на реальные пользовательские запросы, и на основании этих замеров команда принимает решение о релизе.

Приёмка — момент, когда решается судьба выкатки. Перед каждым релизом нужно понять, как изменилось качество модели: на каких сценариях она выросла, где просела и достаточно ли этого качества для пользователей. Мы измеряем модель по нескольким независимым аспектам силами профессиональных разметчиков, доменных экспертов и автоматических оценщиков, а затем собираем из этих сигналов одно заключение. Заключение приёмки — основание, по которому модель уезжает в прод или не уезжает; решение принимается вместе с ML-разработчиками и продуктовой командой.

Мы расширяем команду. Ищем аналитика, который возьмёт на себя контур замеров: запуск приёмок, контроль прохождения разметки и анализ результатов.

Вы увидите изнутри всю кухню оценки качества LLM — от состава оценочных наборов до критериев, по которым релиз останавливают. Процесс активно автоматизируется: рутина будет уходить, а ваша роль — расти в сторону анализа и методологии. Вы будете работать бок о бок с ML-инженерами качества, доменными экспертами и командой краудсорса.

Организация приёмок новых версий моделей

В ваши обязанности войдёт подготовка оценочных наборов, постановка задач по всем аспектам качества, настройка и запуск пайплайнов оценки.

Приёмки проходят несколько раз в неделю, они идут параллельно и зависят от дат релизов, поэтому очень важно их все контролировать.

Контроль разметки

Замер действует неделю и проходит через несколько команд и пулов. Вам предстоит следить за его статусом, выявлять и устранять сбои, а также отслеживать недоставленные или потерянные данные. Нужно будет разбираться в причинах и доводить модель до работающего результата вместе с командой краудсорса и соседними командами. Это та часть работы, где аккуратность и въедливость дают больше всего.

Сбор и анализ результатов

Вы будете сводить результаты всех аспектов в одну картину: считать значимость, отличать настоящее изменение от шума, объяснять расхождения между аспектами и между людьми и автоматическими оценщиками.

По каждому релизу должно быть заключение с разбором сценариев и конкретными примерами; раз в неделю — сводка по всем замерам для ML-команд и продукта.

Развитие процесса

Параллельно мы автоматизируем приёмку и строим под неё инструменты. Вы будете главным заказчиком и первым пользователем этой автоматизации: приносить требования, обкатывать новое и забирать себе те задачи, которые она освобождает.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

* Уверенно работаете с Python и SQL
* Знаете математическую статистику и теорию вероятностей
* Доводите до конца многошаговые процессы с внешними зависимостями: чужие пайплайны, пулы разметки, сроки соседних команд
* Умеете формулировать обоснованное заключение по данным и защищать его перед заказчиками
* Самостоятельны и готовы браться за новые задачи, для которых нет готового решения
* Интересуетесь развитием LLM и хотите глубоко погрузиться в тему

* Проводили оценку качества LLM с использованием голден-сетов, LLM-as-a-Judge и контроля разметки
* Работали на стыке офлайн-оценки и онлайн-экспериментов
* Занимались оценкой агентских сценариев и мультимодальных моделей
* Применяли NLP, краудсорсинговые разметки и ML

Похожие вакансии Data Science & ML

Другие площадки
альфа-банк

Старший ML-инженер

альфа-банкНа сервисе с: 27.07.26 10:24↑ Вакансия с автоподнятием
от 300k ₽РоссияУдалёнка

Чем предстоит заниматься

  • Внедрение моделей машинного обучения.
  • Сопровождение полного цикла сборки модели.
  • Обработка и анализ данных.
  • Поддержание коммуникаций с разработчиками моделей.
  • Проработка архитектуры моделей.
  • Тестирование и участие в разработке пайплайнов внедрения моделей.

Наши пожелания к кандидатам

  • Опыт работы в стеке от 3-х лет.
  • Ключевой стек: Python, Airflow/Argo WorkFlow, MLflow, Hadoop, PySpark, Kafka, Seldon/Kserve, Kubernetes, Jenkins.
  • Опыт работы с моделями машинного обучения.
  • Опыт внедрения моделей машинного обучения как сервисы.
  • Опыт бэкенд-разработки, веб-разработки.
  • Опыт разработки с LLM, NLP-моделями.
  • Опыт с Docker, Kubernetes.

Что мы предлагаем

  • Стабильный и прозрачный доход: размер заработной платы обсуждается по итогам собеседования.
  • Удаленный формат работы.
  • Сложные и интересные задачи, современный стек технологий.
  • Возможность вертикального и горизонтального карьерного роста: регулярно проходят тренинги, вебинары, митапы и демо-дни.
  • Доступ к бесплатным корпоративным библиотекам Alpina Digital, MyBook и бизнес-изданиям.
  • Предложения от Банка только для сотрудников: собственный спортзал, а также скидки на услуги туристических агентств, продукты питания, в рестораны, бары, магазины.
  • Работа у трижды лучшего работодателя РФ по версии hh.ru, Forbes, РБК.
  • Программа развития ИИ-грамотности: треки по работе с нейросетями от базового до продвинутого уровня.
hh.ru
розничный бизнес и мсб

Senior/Middle ML engineer (Classification Models)

розничный бизнес и мсбНа сервисе с: 01.08.26 17:33↑ Вакансия с автоподнятием
Зарплата не указанаУзбекистанТашкентОфис

Обязанности

  • Разработка, деплоймент, поддержка и мониторинг классификационных, uplift и регрессионных моделей: Application Scoring, Behavioral Scoring, Income Estimation, Antifraud Scoring, Collection Scoring
  • Анализ эффективности новых источников данных с последующим их внедрением в существующие и разрабатываемые модели
  • Общение с Product Owner, выявление бизнес-потребностей
  • Коммуникация со смежными командами: Data Engineers, DevOps, Data Analysts
  • Поведенческая и клиентская аналитика

Требования

  • Уверенное владение Python и соответствующими библиотеками: catboost, xgboost, lightgbm, statsmodels, scikit-learn, optuna, FastAPI, git
  • Уверенное владение инструментами для анализа и визуализации данных: SQL, pandas, seaborn, matplotlib
  • Уверенное знание теории вероятности и статистики
  • Высшее образование в STEM (Science, Technology, Engineering, Mathematics)
  • Наличие опыта разработки классификационных моделей от 2 лет
  • Будет большим преимуществом умение работать с такими инструментами как Airflow, MLFlow, Power BI

Условия

  • Возможность решать интересные прикладные задачи с непосредственным влиянием на бизнес-результат по множеству банковских продуктов: Cash Loan, Mortgage, Car Loan, Loans for Medium and Small Enterprises
  • Условия для роста и развития:
  • работа в одной из лучших DS/ML команд Узбекистана
  • возможность участия в конференциях и командировках
  • Работа с различными доменами данных: соцдем, карточные транзакции, доходы, кредитная история, телеком, финансовая отчетность компаний и др.
  • Годовой бонус

hh.ru
т1 иннотех

Data Science (LLM/RAG)

т1 иннотехНа сервисе с: 21.08.26 11:00↑ Вакансия с автоподнятием
Зарплата не указанаРоссияНижний НовгородУдалёнка

Чем предстоит заниматься:

  • Разработка и оптимизация RAG-систем на базе LLM (LLaMA, GPT-подобные модели) для обработки внутренних документов, отчётов и регламентов ключевых заказчиков;
  • Реализация и тонкая настройка классических NLP-моделей: текстовая классификация, извлечение именованных сущностей (NER), семантический анализ, извлечение ключевых метаданных;
  • Интеграция NLP-моделей в существующие ETL- и BI-процессы, обеспечение стабильной работы в продуктивной среде;
  • Работа с большими объёмами структурированных и неструктурированных данных (PDF, DOCX, XML, логи, базы данных);
  • Документирование архитектуры, метрик качества и процессов развертывания моделей;
  • Участие в проектах предиктивной аналитики для клиентов из ритейла, транспорта и промышленности: прогнозирование спроса, оптимизация логистики, предиктивное обслуживание оборудования;
  • Разработка ML-моделей на основе внешних признаков, обработанных LLM (погода, новости, рыночные индикаторы, геоданные, телеметрия);
  • Создание автоматизированных ML-отчётов и инфографик с визуализацией результатов (Power BI, Streamlit, Plotly, Tableau) — с акцентом на понятность для бизнес-пользователей;
  • Применение LLM для генерации текстовых резюме, аналитических выводов и рекомендаций на основе данных (например: “Снижение спроса на товар X в регионе Y связано с ростом цен на логистику и погодными условиями”);
  • Построение пайплайнов ML/LLMOps: от сбора данных до деплоя и мониторинга моделей;
  • Участие в презентациях для клиентов: демонстрация результатов, объяснение моделей, подготовка кейсов.

Здорово, если у тебя есть:

  • Высшее образование (IT, техническое, математическое);

  • Опыт разработки RAG-систем (векторные базы, реранкинг, retrieval-стратегии);

  • Глубокое понимание классических NLP-задач: классификация, NER, сущностное извлечение, токенизация, эмбеддинги (BERT, RoBERTa, FastText и др.);

  • Практический опыт работы с LLM (Hugging Face, LangChain, LlamaIndex, vLLM, Ollama) и их адаптацией под бизнес-задачи;

  • Уверенное владение Python (Pandas, Scikit-learn, PyTorch/TensorFlow), SQL, Git, Docker;

  • Опыт работы с ML-отчётами и инфографикой: умение превращать сложные модели в понятные визуализации для бизнеса;

  • Опыт работы в проектах с внешними данными (API, окрытые данные, телеметрия, гео, рынок) — преимущество;

  • Понимание основ MLOps (MLflow, Weights & Biases, Airflow) — желательно;

  • Готовность к быстрому погружению в новые направления (ритейл, транспорт, промышленность);

  • Английский язык — на уровне чтения технической документации.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.