
Команда разметки и анализа данных занимается добычей, систематизацией и улучшением существующих датасетов для всего отдела ML в развлекательных сервисах: Яндекс Музыка, Кинопоиск, Яндекс Книги и т. д. При этом мы доводим данные и ML-модели…
яндекс · На сервисе с: 07.08.26 12:42
↑ Вакансия с автоподнятиемКоманда разметки и анализа данных занимается добычей, систематизацией и улучшением существующих датасетов для всего отдела ML в развлекательных сервисах: Яндекс Музыка, Кинопоиск, Яндекс Книги и т. д. При этом мы доводим данные и ML-модели до состояния, когда на них можно запускать продукт.
Мы ищем аналитика, который поможет нам добывать новые данные, а также систематизировать и улучшать текущие базы данных. Вас ждёт и написание парсеров, и работа с краудсорсингом, и работа с AI.
Строить и улучшать автоматические процессы разметки данных
Разметка будет содержательно описывать сущности, которые могут быть рекомендованы пользователю или показаны в продукте. На каком языке этот трек? Жив ли этот музыкальный исполнитель? Этот музыкальный клип — студийный, или это запись концерта? Можно ли включить этот сериал ребёнку? Какая книга является наилучшим ответом на этот поисковый запрос? На все эти и многие другие вопросы будет отвечать разметка, за которой будете стоять вы.
Оценивать качество размеченных датасетов
Нередко получается так, что наша команда получает готовую разметку на десятки миллионов единиц контента: от правообладателей, внешнего мира, других команд и т. д. Вам нужно будет ответить, хороша ли эта разметка. Какие у неё проблемные места? Лучше ли она уже существующей? Можем ли мы сделать её лучше?
Находить полезные данные за пределами Фантеха
Бывают случаи, когда нужных данных нет, а процесс их разметки строить намного дороже, нежели найти их где-то ещё. Вам предстоит выяснить, есть ли эти данные внутри Яндекса. Или, может быть, они есть в интернете? Как сопоставить эти данные с сущностями из базы данных Музыки/Кинопоиска/Книг?
Больше об аналитике в Яндексе — в канале Yandex for Analytics
* Хорошо владеете теорией вероятностей и математической статистикой
* Можете делать выводы на основе данных
* Умеете программировать на Python и SQL
* Понимаете, как работает интернет
* Работали с распределёнными системами хранения и обработки данных MapReduce
* Имеете опыт работы с ML
* Писали парсеры
* Работали с платформами для краудсорсинга: Label Studio, Toloka, Amazon Mechanical Turk и т. д.
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.