
ИИ-помощник умеет отвечать на вопросы, пользоваться инструментами и выполнять задачи. Но как понять, что новая версия действительно стала лучше? Почему один сценарий работает хорошо, а в другом помощник ошибается? И что нужно изменить в мо…
СБЕР На сервисе с: 05.10.26 19:43
ИИ-помощник умеет отвечать на вопросы, пользоваться инструментами и выполнять задачи. Но как понять, что новая версия действительно стала лучше? Почему один сценарий работает хорошо, а в другом помощник ошибается? И что нужно изменить в модели или продукте, чтобы это исправить?
Ищем ML-аналитика, которому интересно разбираться в этих вопросах: исследовать поведение ИИ, придумывать способы измерения качества и помогать команде делать помощника полезнее.
Нам нужен ai-native специалист. Человек, для которого работа с ИИ - привычная часть решения задач. Вы умеете поручить агенту написание кода, собрать с его помощью исследовательский пайплайн, быстро проверить несколько гипотез и разобраться, где результату можно доверять. При этом постановка задачи, выбор метода и ответственность за вывод остаются за вами.
Исследовать, как помощник справляется с реальными задачами пользователей: где ошибается, чего ему не хватает и какие улучшения дадут эффект.
Создавать eval-наборы и бенчмарки, на которых можно проверить новые модели, промпты, скиллы и работу с инструментами.
Развивать SBS и LLM-as-judge: учить автоматическую оценку замечать существенные различия и проверять её на человеческой разметке.
Превращать найденные проблемы в гипотезы, данные для дообучения и понятные критерии приёмки.
Связывать качество модели с качеством продукта: выяснять, какие изменения помогают пользователю решить свою задачу.
Строить инструменты, которые позволяют команде быстрее исследовать качество и замечать регрессии.
Вам интересно докопаться до причины ошибки и придумать эксперимент, который поможет её проверить.
Вы умеете работать с неопределённостью: понимаете ограничения данных, замечаете слабые места в методе и можете объяснить, что следует из результата.
У вас сильная база в статистике и анализе данных.
Вы уверенно работаете с Python и SQL, можете прочитать, проверить и исправить код, созданный ИИ.
Понимаете принципы работы LLM и хотите глубже разобраться в том, как оценивать модели и агентов.
Вы уже используете кодинговых агентов в своей работе.
Можете показать, как с их помощью решили исследовательскую задачу, автоматизировали процесс или собрали собственный инструмент.
Нам интересен ваш подход: что вы поручили ИИ, как проверили результат и что получилось.
комфортный современный офис рядом с м. Кутузовская
гибридный формат работы
ежегодный пересмотр зарплаты, годовая премия
корпоративный спортзал и зоны отдыха
система обучения для профессионального и карьерного развития
расширенный полис ДМС с первого дня работы и страхование для семьи
программа ипотеки для сотрудников
вознаграждение за рекомендацию друзей в команду Сбер.
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.