Н

Middle+/Senior Data Scientist

Ищем 1 Middle+ /Senior Data Scientist

Неизвестный работодатель · На сервисе с: 01.10.26 10:45

Зарплата не указанаРоссияБеларусьУдалёнка

#аутстаф

Ищем 1 Middle+
/Senior Data Scientist
(ID ••••••••)

Требования:
- Подтверждённый опыт внедрения ML/DS‐решений в промышленную эксплуатацию (в т.ч. за пределами прототипов и Jupyter‐блокнотов);
- Уверенное владение 3D‐геометрией и обработкой пространственных данных: работа с полигональными сетками, вокселями, триангуляцией, 2D/3D‐объектами, понимание лежащей в основе математики;
- Практические навыки в Information Retrieval и LLM‐задачах: построение гибридного поиска (сочетание dense‐ и sparse‐подходов, включая BM25), работа с эмбеддингами, применение инструментов для оценки качества поиска и ответов моделей (например, LLM‐evals, retrieval‐метрики);
- Высокий уровень инженерной культуры: глубокое понимание принципов работы используемых технологий, навык написания надёжного, асинхронного и легко поддерживаемого кода для продакшена;
- Опыт координации небольшой команды или технического руководства разработчиками;
- Способность переводить абстрактные бизнес‐задачи в чёткие технические требования и разбивать их на реализуемые подзадачи;
- Навыки работы с Python 3.10+ (в том числе с asyncio и typing), а также с библиотеками NumPy, SciPy, Pandas;
- Знание Search‐ и LLM‐экосистемы: опыт применения векторных баз данных (Qdrant, Milvus, pgvector, Weaviate и другие), построения пайплайнов гибридного поиска (работа с эмбеддингами, sparse‐репрезентациями, методами переранжирования вроде Reciprocal Rank Fusion);
- Владение инструментами оценки качества генерации и поиска LLM‐evals (Ragas, TruLens, DeepEval) либо умение разрабатывать собственные метрики;
- Навыки в backend‐разработке и инфраструктуре: работа с FastAPI (включая микросервисную архитектуру, REST, асинхронную обработку), контейнеризацией приложений и Docker, эксплуатация в среде Linux (Ubuntu);
- Умение применять инструменты профилирования cProfile, Scalene, memory_profiler и аналогичные.

Задачи:
- Решение сложных алгоритмических и исследовательских задач: обработка 3D‐данных, полигональных сеток и пространственных объектов, разработка пайплайнов поиска;
- Проектирование архитектуры ML/DS‐сервисов и внедрение готовых решений в инфраструктуру проекта;
- Профилирование производительности и снижение вычислительной сложности, в том числе при работе с 3D‐структурами и векторными индексами;
- Подготовка технической документации, фиксация принятых архитектурных решений, участие в приёмочных испытаниях;
- Координация работы подгруппы разработки: разбиение задач на подзадачи, оценка трудозатрат, участие в планировании спринтов;
- Исполнение функций тимлида в периоды его отсутствия;
- Проведение Code Review, контроль качества кода и соблюдения принятых engineering‐стандартов;
- Менторинг, сопровождение онбординга и профессиональное развитие специалистов уровня Junior и Middle в команде.

О проекте:
ИТ-компания, работающая над R&D-задачами в области 3D-данных, поисковых систем и ML-сервисов

Локация: Россия, Беларусь
Время работы: UTC+3
Гражданство: РФ, РБ
Формат: Удаленно
Срок привлечения: 3 месяца с возможностью пролонгации
📨 Регистрируйтесь, загружайте резюме на
•••••••• и оставляйте отклик на запрос
❗️Все актуальные запросы —
••••••••

Похожие вакансии Data Science & ML

hh.ru
В

Machine Learning Engineer (NLP)

воронцова викторияНа сервисе с: 01.10.26 12:08
до 320k ₽РоссияМоскваУдалёнка

Чем предстоит заниматься:

Полный цикл внедрения ML-моделей в продакшен: от постановки задачи до мониторинга качества и ретренинга. Построение пайплайнов обработки неструктурированных данных (PDF, шумные тексты), очистка, NER, feature engineering.

Обучение классических моделей и генеративных моделей для синтетических данных с оценкой качества и privacy-проверками. Упаковка решений в API и контейнеры.


Требования:

Опыт от 3 лет в роли ML-инженера / Data Scientist.

Уверенный Python, pandas, numpy, scikit-learn.

NLP: SpaCy, Hugging Face, работа с неструктурированными данными, извлечение сущностей (NER).

Классический ML: деревья решений, ансамбли (Random Forest), интерпретация результатов, подбор гиперпараметров, оценка рисков переобучения.

Синтетические данные: CTGAN, TVAE (SDV), оценка статистической близости, сохранение распределений, privacy-проверки.

Базовый MLOps: Docker, FastAPI/Flask, MLflow/DVC, понимание CI/CD.

Сайты компаний
СБЕР

Стажер-аналитик AI

СБЕРНа сервисе с: 01.10.26 12:42
Зарплата не указанаРоссияМоскваОфис

Мы ищем талантливого AI-разработчика, который поможет создавать интеллектуальных чат-ботов и AI-агентов, интегрировать их с базами знаний и встраивать в них AI-алгоритмы.

Если тебе интересно разрабатывать AI-решения, работающие с текстами и данными, а также строить системы, которые понимают, учатся и помогают людям, мы будем рады видеть тебя в команде развития чата банковского приложения (СБОЛ).

Немного о направлении: Разработка и последующее развитие мультиагентной системы для единой ленты чатов.

  • разработка, оптимизация промптов для генерации, классификации и извлечения информации

  • тестирование и внедрение ассистентов и AI-агентов на базе LLM

  • проведение экспериментов с LLM и оценка эффективности различных подходов

  • сбор данных из разных источников, создание датасетов для анализа и разработки моделей, анализ данных

  • оценка качества моделей, разработка метрик и проведение A/B-тестов

  • настройка логирования и мониторинга приложения.

  • знание Python

  • знание теоретической базы ML (основные задачи и методы, метрики, типовые архитектуры моделей и т.д.) и NLP домена (токенизаторы, векторизаторы, transformers, BERT, LLM, RAG и т.д.)

  • опыт применения ML-библиотек (pandas, numpy, scikit-learn, langchain или аналогичные библиотеки для работы с LLM)

  • желателен опыт разработки RAG-пайплайнов

  • будет плюсом владение SQL с использованием подзапросов, оконных функций, регулярных выражений.

  • комфортный современный офис рядом с м. Кутузовская

  • офисный формат работы

  • ежегодный пересмотр зарплаты, квартальная и годовая премия

  • корпоративный спортзал и зоны отдыха более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • программа адаптации и помощь руководителя на старте

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ

  • подписка Прайм с возможностью совместного использования на трёх близких

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:hh.ru
Сайты компаний
Зарплата не указанаРоссияМосква

Мы разрабатываем Vision-Language-Action-модели для управления роботами. Учим их выполнять манипуляционные задачи по текстовым инструкциям, используя изображения с камер и данные о состоянии робота.

Наша команда занимается претрейном: разрабатывает архитектуры и методы обучения, работает с данными разных робототехнических платформ и масштабирует обучение. Среди задач — перенос навыков между роботами, обобщение на новые объекты и условия, подключение новых модальностей.

Ищем ML-разработчика, который будет развивать методы претрейна, проводить исследовательские эксперименты и доводить удачные решения до использования в основных обучающих запусках.

Разработка и претрейн VLA-моделей

Вам предстоит разрабатывать и обучать VLA-модели для манипуляционных задач. Вы будете экспериментировать с архитектурами, представлениями наблюдений и действий, функциями потерь и методами объединения модальностей, улучшать перенос навыков на новые объекты, условия и робототехнические платформы.

Работа с обучающими данными

Вы будете формировать смеси робототехнических и мультимодальных датасетов, настраивать семплирование и согласовывать данные роботов с разными сенсорами и пространствами действий. Предстоит оценивать влияние качества, объёма и состава данных на способности моделей и улучшать обучающие выборки.

Разработка пайплайнов контроля качества данных

Вам предстоит автоматизировать проверку и очистку данных перед обучением: выявлять рассинхронизацию видео, состояний и действий, пропуски и зависания кадров, аномалии в траекториях. Вы будете развивать инструменты визуального разбора эпизодов, формировать отчёты о качестве, настраивать исправление, фильтрацию и маскирование проблемных фрагментов. Предстоит проверять ложные срабатывания и оценивать влияние очистки данных на качество моделей.

Масштабирование и оптимизация распределённого обучения

Вам предстоит развивать распределённое обучение на нескольких GPU и узлах, повышать стабильность длительных запусков и эффективность использования ресурсов. Вместе с инфраструктурной командой вы будете профилировать обучение и устранять узкие места в вычислениях, коммуникациях и загрузке данных.

Исследования и оценка качества моделей

Нужно будет формулировать и проверять исследовательские гипотезы, воспроизводить подходы из статей и проводить абляционные эксперименты. Вместе с командой робототехники вы будете проверять модели на реальных роботах, анализировать ошибки и использовать результаты для улучшения претрейна.

Больше об ML в Яндексе — в канале Yandex for ML

* Разрабатывали и обучали трансформерные или генеративные модели в одном или нескольких направлениях: мультимодальное обучение, Computer Vision, NLP, генерация видео или Robot Learning
* Хорошо понимаете основы глубинного обучения, устройство трансформеров и методы оптимизации, умеете разбираться в причинах нестабильного обучения и ухудшения качества моделей
* Уверенно программируете на Python, работаете с PyTorch или JAX, умеете писать поддерживаемый обучающий код и разбираться в существующем
* Имеете опыт распределённого обучения с FSDP, DeepSpeed или аналогичными инструментами, понимаете принципы параллелизма данных и шардинга, умеете диагностировать проблемы производительности, потребления памяти и стабильности запусков
* Работали с большими датасетами и пайплайнами их подготовки, понимаете влияние качества данных, семплирования и организации загрузки на обучение
* Умеете самостоятельно ставить эксперименты, выбирать метрики, обеспечивать воспроизводимость результатов и аргументировать технические решения

* Работали с VLA, Imitation Learning, Behavior Cloning или обучали политики на данных разных робототехнических платформ
* Обучали диффузионные или flow-matching-модели, генеративные модели изображений и видео
* Оптимизировали многоузловое обучение: профилировали GPU и коммуникации, подбирали стратегии параллелизма, работали с mixed precision, activation checkpointing, сохранением и восстановлением состояния обучения
* Разрабатывали пайплайны автоматического контроля качества данных, инструменты визуализации и поиска аномалий в видео и временных рядах
* Внедряли обученные политики на реальных роботах и оценивали качество выполнения задач
* Имеете исследовательские публикации, участвуете в опенсорс-проектах или можете рассказать о собственных проектах с воспроизводимыми результатами

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.