яндекс

ML-инженер в команду данных синтеза речи (Python)

Команда синтеза речи делает такие продукты Яндекса, как перевод видео, аудиокниги, голос Алисы. В синтезе наступила эпоха перехода от low resource (даже для основных языков) к большим данным и претрейнам. Новые модели позволяют спеть извес…

яндекс На сервисе с: 08.09.26 12:20

↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указана

Команда синтеза речи делает такие продукты Яндекса, как перевод видео, аудиокниги, голос Алисы. В синтезе наступила эпоха перехода от low resource (даже для основных языков) к большим данным и претрейнам. Новые модели позволяют спеть известные песни вашим голосом и произнести любую фразу всего по нескольким секундам вашего голоса. Основа этих моделей — сотни тысяч часов качественных аудиоданных и текстов для них, которые нам предстоит собрать.

Работа с данными

Вам предстоит разрабатывать систему хранения действительно больших данных и доступа к ним для ML-разработчиков. В вашем распоряжении будут петабайты аудио, которые необходимо эффективно хранить и быстро обрабатывать.

Майнинг данных

Вы будете улучшать пропускную способность текущих пайплайнов сбора данных и масштабировать их для поддержки множества языков, работать с разнородными источниками и строить процессы майнинга аудиоданных.

Оценивание качества данных

Вам предстоит работать с процессами оценивания параметров данных, разрабатывать и применять ML-модели детекции шума, музыки, языка, нескольких голосов, синтетической речи, несовпадения текста и аудио. Эти оценки позволят отфильтровать данные и сделать наш синтез лучшим в мире.

Больше об ML в Яндексе — в канале Yandex for ML

* Пишете на Python
* Строили пайплайны сбора данных для ML
* Понимаете, как работать с большими объёмами данных
* Применяли на практике, а лучше — обучали ML-модели
* Мотивированны и готовы глубоко погружаться в область

Похожие вакансии Data Science & ML

hh.ru
лучи

ML Tech Lead (ML/LLM, AI-агенты для MedTech)

лучиНа сервисе с: 29.07.26 12:35↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваУдалёнка

«Лучи» — это новая онлайн-страховая: простая, быстрая и честная.

Мы объединили страхование, медицину и IT, чтобы создать экосистему полезных сервисов. Так мы упрощаем жизни более миллиона людей по всей стране.

В основе нашей компании — собственная технологическая платформа. Единый ID пользователя связывает все продукты, делая клиентский путь удобным и понятным.

Мы задаём ритм, действуем решительно и работаем на другой скорости, чтобы быть лидерами на страховом рынке России.

Цифры говорят за нас:
>1 000 000 застрахованных клиентов
>400 компаний доверяют нам здоровье своих сотрудников
4,85 из 5 — оценка мобильного приложения
100% наших сотрудников влияют на результат
0 минут тратится на формальные встречи
75% клиентов готовы рекомендовать нас

Кого мы ищем:
Мы ищем сильного ML-техлида, который возглавит техническое развитие AI-решений для нашего медицинского направления. Это роль для эксперта, который не хочет уходить в чистое управление, а стремится решать инженерные задачи руками (80% времени — разработка). Вместе с командой предстоит доводить AI-решения до продакшена — от разработки архитектуры до мониторинга модели в проде. Для нас важен опыт вывода агентных систем под реальную нагрузку, умение строить надежные eval-пайплайны и понимание экономики инференса.

Про проект:
Основной фокус сейчас — создание «ИИ-врача», интеллектуального ассистента для нашей телемедицинской клиники. Предстоит с нуля построить агентную экосистему, которая автоматизирует сбор анамнеза, саммаризацию медкарт, драфтинг заключений и согласование назначений по ДМС. Это решение позволит врачу делегировать рутину и сосредоточиться на лечении, а не на бюрократии. Принцип «ИИ драфтит — врач правит и подписывает» превращает каждое исправление эксперта в готовый сигнал для дообучения модели, создавая уникальную для медицинской сферы петлю улучшения качества.

⚙️Стек технологий: Python 3.13+, FastAPI, PostgreSQL, MLflow, LangGraph, OpenAI, Celery, RabbitMQ, Kafka, Docker, k8s, flake8, mypy, pytest.

Чем предстоит заниматься:

  • Определять и развивать архитектуру ML/LLM-агентных систем продукта, принимать и документировать ключевые технические решения
  • Проектировать инфраструктуру вокруг агентов (harness): оркестрация, маршрутизация, управление контекстом и памятью, вызов инструментов, отказоустойчивость, трейсинг
  • Проектировать и развивать самообучающийся контур: сбор ошибок из продакшена, пополнение датасетов оценки, регрессионное тестирование, контролируемая выкатка улучшений
  • Отвечать за качество моделей: эталонные наборы, метрики точности, автоматические гейты качества в CI, мониторинг деградации в проде.
  • Отвечать за производительность и экономику решения: нагрузка, latency, стоимость обработки обращения
  • Обеспечивать соответствие требованиям по работе с персональными и медицинскими данными на уровне архитектуры (обезличивание, аудит решений, хранение)
  • Проводить код-ревью и дизайн-ревью, развивать middle ML-инженеров через наставничество и парное проектирование
  • Представлять и защищать архитектурные решения перед CTO и продуктовой командой

Что для нас важно:

  • Опыт в роли ML-инженера от 4 лет
  • Опыт запуска в production масштабных и сложных ML / LLM-решений
  • Опыт реализации моделей классического ML (Scikit-learn, CatBoost)
  • Глубокое понимание архитектуры современных LLM и мультимодальных моделей
  • Опыт промышленного использования inference-фреймворков: vLLM, SGLang, TensorRT-LLM, llama.cpp
  • LLMOps Воспроизводимость системы, бенчмарки и регрессионное тестирование
  • Опыт дообучения трансформеров (LoRA, QLoRA, SFT) — DPO / RLHF будет плюсом
  • Современный LLM-стек: уверенное понимание RAG, agentic-loop, agent harness, multi-agent систем, MCP
  • Знание теории вероятностей, опыт проведения и оценки A/B тестов
  • Опыт разработки и настройки guardrails для LLM-систем
  • Уверенное владение Python и асинхронными фреймворками, такими как FastAPI
  • Умение писать тесты (pytest)
  • Опыт работы с асинхронными задачами (RabbitMQ, Celery, Kafka)
  • Контейнеризация Владение инструментами контейнеризации (Docker)
  • Знание стандартов качества кода (Flake8, mypy)
  • Навыки настройки CI/CD-процессов и базовая работа с k8s

Будет плюсом:

  • Будет плюсом опыт в MedTech / Healthcare, NLP на медицинских текстах и работе с чувствительными данными

  • Опыт разработки самообучающихся агентов (self-harness)

У нас в команде:

  • Ежегодный отпуск продолжительностью 28 календарных дней
  • Формат работы на выбор: удаленный, гибрид или офис
  • ДМС «Лучи» для тебя и твоих несовершеннолетних детей через 3 месяца после начала работы + доступ к виртуальной клинике с первого дня работы
  • Скидка на подключение к ДМС «Лучи» для родственников
  • Страхование от несчастных случаев после трех месяцев работы
  • Страховой полис выезжающего за рубеж (ВЗР) для тебя и двух твоих родственников после трех месяцев работы
  • Помощь в значимых для тебя событиях
  • Корпоративная программа лояльности BestBenefits

❤️ Ты будешь частью большого социально значимого дела. Мы реализуем амбициозную задачу — меняем рынок страхования и здравоохранения, действительно помогаем людям, и у нас это отлично получается.

И у тебя получится!

Другие площадки
extyl

ML разработчик / Проектная работа / АУТСТАФФ

extylНа сервисе с: 16.06.26 13:19↑ Вакансия с автоподнятием
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

Мы ищем опытного ML разработчика для выполнения проектных задач ПО МОДЕЛИ АУТСТАФФ (подключение специалиста в команду заказчика).

Наши условия:

Оформление по ИП/Самозанятости, удаленный формат работы, полная занятость❗️

Требования:

  • Опыт разработки ML-решений для бизнеса от 3 лет;
  • Опыт работы с CV на реальных проектах от 1 года;
  • Опыт промышленной разработки на Python от 3 лет;
  • Умение писать production-ready код на Python;
  • Опыт работы с PyTorch;
  • Умение обучать и дообучать модели, проводить тестирование;
  • Опыт работы с Git;
  • Умение версионировать данные и логировать эксперименты (DVC, MLFlow, ClearML);
  • Опыт работы с Docker;
  • Опыт проработки требований, опыт декомпозиции и приоритизации задач;
  • Умение вести техническую документацию;
  • Знание английского B2;
  • Опыт работы с трехмерными данными.

Стек:

  • python, pytorch, opencv, rasterio, laspy

Будет плюсом:

  • Опыт работы с ГИС и специальными форматами данных (geotiff, las).

Обязанности:

  • Разработка и обучение моделей для анализа изображений и облаков точек.
  • Подготовка датасетов, анализ данных.
  • Сбор, анализ и предобработка данных, составление датасетов;
  • Обучение моделей и тестирование гипотез;
  • Деплой полученных решений;
  • Написание технической документации;
  • Презентация результатов внутри команды и заказчику;
  • Изучение новых подходов для решения поставленных задач;
  • Взаимодействие с командой разработки и аналитиками.
hh.ru
Зарплата не указанаРоссияМоскваУдалёнка
Привет! Это команда "Модерация контента пользователей".

Наша команда отвечает за автоматическую модерацию контента, обеспечивая его соответствие законодательству РФ и правилам маркетплейса. Много работаем с изображениями и текстами, используем современные подходы из NLP, CV и Multi-modal ML, а также активно внедряем их в production.

Вы будете

  • Участвовать в составлении роадмапа разработки, проводить ресерч и формулировать гипотезы для решения задач.
  • Заниматься полным циклом разработки моделей автомодерации контента.
  • Работать с multi-modal данными: изображениями, текстами и таблицами.
  • Разрабатывать эффективный и воспроизводимый код для обучения моделей.
  • Оптимизировать модели, ускорять inference и улучшать бизнес-метрики.
  • Делиться опытом с другими участниками команды, участвовать в код-ревью.
  • Взаимодействовать с аналитиками, продактами и разработчиками сервисов.

Нам важно

  • Уверенное знание Python и опыт разработки на нём.
  • Понимание алгоритмов и структур данных.
  • Практический опыт работы с PyTorch.
  • Знание математической статистики, линейной алгебры и теории вероятностей.
  • Отличные знания в области машинного обучения: классический ML и DL, способность объяснить принципы работы алгоритмов и выбрать подходящий для задачи.
  • Практический опыт работы в задачах NLP и/или CV, знание современных архитектур (Transformers, CLIP и др.).
  • Понимание принципов работы с большими данными, знакомство с такими инструментами как Hadoop, Spark, Airflow, SQL.
  • Опыт ведения проектов: принятие технических решений, декомпозиция и распределение задач, координации разработки.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.