
яндекс · На сервисе с: 18.08.26 16:03
Алиса помогает миллионам людей решать повседневные задачи. В команде Алисы AI мы строим Мою Память — единое место для того, что важно пользователю: заметок, дел, списков, планов и файлов. Но наша цель — не просто сделать ещё один заметочник. Мы создаём контекстный слой Алисы: пользователь сможет без лишних усилий сохранить важное, найти это обычными словами и получить нужный контекст в подходящий момент — в чате, с помощью колонки или на другом устройстве с Алисой.
Например:
«Запомни код домофона»
«Добавь молоко в список покупок»
«Что педиатр написал про витамин D?»
«Напомни записаться к врачу через две недели»
В основе сценария — LLM, которая понимает намерение пользователя, вызывает нужные инструменты для создания, поиска и изменения записей и формирует итоговый ответ. Здесь особенно важны точность и надёжность: Алиса не должна забывать сохранить обещанное, менять не ту запись или уверенно говорить о действии, которого не произошло.
Ищем ML-аналитика, который поможет нам измерять и системно улучшать качество Моей Памяти — от первого решения модели до результата, который увидит пользователь.
Создание системы оценки качества AI-продукта
Вы будете формировать целостную картину качества сценария: определять ключевые метрики и раскладывать их по этапам — роутинг, поиск контекста, вызов инструментов, итоговый ответ и доставка результата. Нужно будет связывать офлайн-оценку моделей с поведением продукта в реальном потоке, проектировать мониторинги и дашборды, которые помогают вовремя замечать деградации. Предстоит находить срезы, в которых общая метрика скрывает проблемы: разные устройства, интенты, типы записей и сложность диалога.
Приёмка новых моделей и изменений
Вместе с ML-разработчиками, продуктом и редакторами вы будете отвечать на практический вопрос: можно ли выпускать новую модель пользователям? Для этого предстоит: собирать репрезентативные eval-наборы и приёмочные корзинки, сравнивать версии моделей и разбирать регрессии, развивать LLM-as-a-judge и проверять его согласованность с человеческой оценкой. Нужно будет определять критерии готовности к эксперименту и запуску, проводить постанализ после выкладки и проверять, подтвердился ли ожидаемый эффект.
Разбор ошибок модели и поиск точек роста
Вам предстоит много работать с живыми пользовательскими сценариями и текстовыми логами. Ваши задачи — искать срабатывания false positive и false negative; разбирать DSAT и проблемные диалоги; кластеризовать ошибки и отделять проблемы намерения, retrieval, tool calling и генерации ответа. Нужно будет выявлять повторяющиеся паттерны через data mining и эвристики, превращать наблюдения в проверяемые продуктовые и ML-гипотезы, оценивать масштаб проблемы и ожидаемый эффект исправления.
Подготовка данных для улучшения моделей и проверка изменений онлайн
Вы будете участвовать во всём цикле улучшения качества: формировать выборки для обучения, валидации и независимой приёмки; следить за покрытием сценариев и смещениями в данных; помогать определять разметку и таксономию ошибок. Нужно будет оценивать качество датасетов и автоматической разметки, делать воспроизводимые исследования, которыми сможет пользоваться вся команда.
После офлайн-приёмки предстоит оценивать работу продукта на реальных пользователях: проектировать и анализировать A/B-эксперименты, интерпретировать изменения продуктовых и качественных метрик, отделять эффект модели от изменений состава трафика, находить новые проблемы и удачные сценарии, которые проявляются только в живом потоке.
* Уверенно владеете SQL и Python и умеете самостоятельно проводить исследование от сырых данных до вывода
* Умеете работать с большими объёмами событийных данных и текстовых логов
* Знаете основы математической статистики и A/B-тестирования
* Умеете проектировать метрики, проверять их валидность и объяснять ограничения
* Способны превратить размытый вопрос о качестве продукта в измеримую постановку
* Умеете находить причины за агрегатами и проверять гипотезы на данных
* Понимаете базовые принципы работы ML-моделей и готовы разбираться в сложной LLM-системе
* Ясно формулируете выводы и можете обсуждать их с ML-разработчиками, инженерами, редакторами и менеджерами
* Работали с LLM-продуктами, NLP или голосовыми ассистентами
* Строили evals, LLM-as-a-judge или системы автоматической оценки моделей
* Оценивали качество ранжирования, поиска или классификации
* Собирали обучающие и приёмочные датасеты
* Строили аналитические дашборды и мониторинги
* Знакомы с retrieval, RAG, tool calling и агентными системами
* Умеете работать с неструктурированными данными и проектировать таксономии ошибок
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.