Н

Data Scientist (ML Engineer)

Неизвестный работодатель · На сервисе с: 20.08.26 13:49

Зарплата не указанаРоссияУдалёнка

#DS #datascientist #ml #mlengineer  #vacancy #job #вакансия
 
 
 
Data Scientist (ML Engineer)

#Проект:

#Условия:
- Клиент: Пищевая промышленность
- Занятость: полная
- Локация: РФ
- Гражданство: РФ
- Рабочий график: МСК ± 2
- Формат: Удаленно

#Позиция:

- Роль: Data Scientist
- Уровень: Middle/Senior
- Количество: 1
- Английский: Intermediate

#Обязательно:

- Уверенное знание Python и SQL;
- Хорошее понимание методов машинного обучения и математической статистики: линейные модели, Random Forest, градиентный бустинг;
- Практический опыт работы с временными рядами: подготовка данных, прогнозирование, оценка качества и кросс-валидация;
- Опыт работы с библиотеками градиентного бустинга: XGBoost, LightGBM или CatBoost;
- Знание методов математической и дискретной оптимизации: LP, MILP / MIP;
- Практический опыт работы хотя бы с одним из инструментов оптимизации: Pyomo, OR-Tools, PuLP или аналоги;
- Опыт использования оптимизационных решателей: Gurobi, CPLEX, SCIP, COPT, GLPK или аналоги;
- Опыт разработки ML-решений от анализа данных и построения модели до рабочего прототипа;
- Уверенное владение Git.

#Желательно:

- Опыт применения продвинутых моделей прогнозирования временных рядов: Prophet, LSTM, DeepAR или аналогов;
- Опыт работы с большими данными и Data-инфраструктурой: Spark / PySpark, S3;
- Опыт интеграции ML-моделей в сервисы и понимание базового MLOps: FastAPI, Docker, CI/CD, KubeFlow или аналоги;
- Опыт написания unit- и integration-тестов, понимание ООП;
- Опыт в FMCG / Supply Chain / Demand Planning / Forecasting / ERP / APS.

#Задачи:

- Сбор, очистка и подготовка данных из различных источников для дальнейшего анализа;
- Проведение первичного анализа данных: выявление закономерностей и аномалий, создание визуализаций;
- Разработка и внедрение моделей машинного обучения (включая регрессию, классификацию и кластеризацию), особый фокус на разработку моделей, связанных с временными рядами;
- Разработка оптимизатора, основанного на линейной и смешанно-целочисленной оптимизации, LP, MILP;
- Оценка качества моделей, настройка гиперпараметров и проведение кросс-валидации;
- Участие в интеграции моделей в бизнес-процессы компании;
- Подготовка аналитических отчетов;
- Эффективное взаимодействие с представителями бизнеса и техническими командами;
- Улучшение текущих подходов и изучение новых инструментов и алгоритмов.

#Важно, резюме должно отражать:
- Расписано, чем занимался на каждом проекте
- Указаны навыки и программы которые использовались

Жду ваши резюме здесь @mary_shimoff

Похожие вакансии Data Science & ML

hh.ru
pravotech

LLM / RAG Engineer

pravotechНа сервисе с: 20.08.26 14:22
до 350k ₽РоссияМоскваУдалёнка

ПравоТех — продуктовая IT-компания, которая с 2008 года создает решения для автоматизации юридических бизнес-процессов.

Нашими продуктами ежедневно пользуются тысячи компаний по всей стране, включая крупнейшие банки, страховые компании и корпоративных клиентов.

Сегодня мы активно развиваем AI-направление и ищем LLM / RAG Engineer, который присоединится к команде и будет развивать сервисы для интеллектуальной работы с юридическими документами.

Ключевой фокус роли — LLM, RAG и работа с текстовыми данными: извлечение значимой информации из документов, построение векторных представлений, развитие retrieval-пайплайнов и повышение качества ответов AI-сервисов.

🧠 О роли

Мы работаем с большим массивом судебных и юридических документов и создаем технологии, которые помогают находить в них действительно значимую правовую информацию.

Одна из ключевых задач команды — извлекать из судебных решений правовую позицию и ход рассуждений суда с помощью LLM, преобразовывать полученный текст в векторные представления и использовать их в Retrieval/RAG-сценариях для поиска информации и формирования ответов пользователям.

Нам нужен инженер, который умеет работать с LLM и текстовыми данными, понимает принципы embeddings и векторного поиска и готов влиять не только на реализацию, но и на качество AI-сервиса.

В этой роли будет возможность много экспериментировать: проверять гипотезы, сравнивать подходы и искать решения, которые повышают точность работы продукта.

Чем предстоит заниматься:

  • разрабатывать и развивать пайплайны извлечения значимой информации из юридических документов с помощью LLM;

  • работать с RAG / Retrieval-сценариями и улучшать качество поиска и ответов AI-сервисов;

  • создавать векторные представления текстов с помощью embedding-моделей;

  • работать с хранением и использованием векторов для поиска по базе документов;

  • развивать подходы и метрики для оценки качества извлечения информации;

  • анализировать текущие решения и находить точки роста для повышения точности сервиса;

  • тестировать новые модели, подходы и гипотезы;

  • создавать end-to-end пайплайны обработки новых типов документов;

  • работать с различными источниками юридических данных: судебными решениями, нормативно-правовыми актами, кодексами и другими документами;

  • совместно с AI-экспертами и командой продукта развивать качество AI-сценариев.

Для нас важно:

  • уверенное владение Python;

  • практический опыт работы с LLM;

  • опыт работы с RAG / Retrieval или близкими по архитектуре решениями;

  • понимание принципов работы embeddings и векторных представлений текста;

  • практический опыт работы с текстовыми данными и NLP-задачами;

  • опыт построения и поддержки data/ML pipelines;

  • опыт работы с Airflow;

  • понимание подходов к оценке качества ML/LLM-решений;

  • готовность разбираться в существующей кодовой базе, самостоятельно искать точки роста и предлагать технические решения.

➕ Будет плюсом

  • опыт разработки production-систем на базе LLM;

  • опыт построения RAG-систем и векторного поиска;

  • опыт работы с vector databases или другими хранилищами векторных представлений;

  • опыт разработки рекомендательных систем;

  • опыт работы с embedding-моделями и semantic search;

  • опыт построения пайплайнов обработки больших объемов текстовых данных;

  • опыт проведения экспериментов и оценки качества LLM/ML-моделей;

  • опыт работы с юридическими или другими сложными неструктурированными текстами.

🚀 Первые задачи

В первый месяц мы ожидаем, что вы:

  • разберетесь в существующей кодовой базе и архитектуре сервиса;

  • погрузитесь в текущую логику обработки и обновления данных;

  • проанализируете существующие решения и найдете потенциальные точки роста для повышения точности ответов;

  • предложите и протестируете собственные гипотезы по улучшению сервиса;

  • начнете разработку нового end-to-end pipeline для дополнительного типа юридических документов.

Одна из практических задач на период адаптации — самостоятельно пройти весь путь обработки нового источника документов: от получения и извлечения нужной информации до подготовки данных для дальнейшего использования в Retrieval/RAG-сценариях.

Что мы предлагаем:

  • возможность работать над реальными LLM/RAG-сценариями в LegalTech;

  • задачи на больших массивах юридических документов и сложных текстовых данных;

  • возможность напрямую влиять на качество AI-продуктов и технические решения;

  • пространство для экспериментов с LLM, embeddings, retrieval-подходами и новыми архитектурными решениями;

  • небольшую команду, в которой можно существенно влиять на развитие направления;

  • оформление по ТК РФ;

  • ДМС;

  • корпоративные программы обучения;

  • командный бонус по результатам работы;

  • удаленный или гибридный формат работы (Москва / Самара).

hh.ru
сбер. it

Стажёр в команду NLP / RL (GigaChat )

сбер. itНа сервисе с: 20.08.26 14:02
100k–100k ₽РоссияМоскваОфис

Привет! Это GigaChat Reasoning — команда, которая даёт модели суперсилу размышлять. Мы придумываем среды, тренируем через online RL, ускоряем обучение и доводим решения до продакшна.

Направления

Улучшение GigaChat Reasoning: полный цикл обучения от холодного старта до вывода модели продакшн. Добавление новых доменов, создание датасетов и функций оценки ответов.

Развитие агентских навыков и tool calling с помощью Online RL: создание сред для обучения LLM, обучение и тестирование моделей.

Улучшение продукта Deep Research

На эти роли мы ищем талантливого NLP Engineer со знанием и опытом в Reinforcement Learning. Для всех этих экспериментов у нас есть кластер с большим числом A/H 100'ых.

Обязанности

  • Улучшать качество работы GigaChat Reasoning на русском и английском языках
  • Ускорять пайплайн обучения: профилирование узких мест, эффективный сэмплинг.
  • Тестировать новые Loss-функции и подходы к обучению
  • Помогать выводить в прод всё, что мы обучим.
  • Постоянно держаться up-to-date со свежими статьями.

Требования

  • Опыт в online RL и хорошие теоретические знания
  • Уверенное владение Python, PyTorch.
  • Знание базовых алгоритмов и математики.
  • Знания в DL, опыт обучения простых и больших моделей.
  • Опыт обучения моделей для продакшена.
  • Понимание текущего состояния эволюции больших LLM'ов.
  • Будет плюсом наличие публикаций.

Условия

  • Погружение в разработку самых современных NLP-систем.
  • Возможность совмещать учёбу и работу над реальными проектами.
  • По итогам стажировки — приглашение на Junior+ или Middle позиции.
  • Полная удалёнка: работай из любой точки России, где есть интернет.
Эта вакансия также есть на:Getmatch
Сайты компаний
Зарплата не указанаРоссияМосква

Наша команда занимается разработкой computer-use-агентов, которые проходят тест-кейсы в интерфейсах и приложениях Яндекса — смотрят на экран, кликают, проверяют результат. Это помогает экономить время на рутинных тестах и сокращает время на выпуск версий.

Наша работа происходит на стыке harness и моделей, которых мы дообучаем через SFT/RL. Если вам интересно разрабатывать агентов, отвечая за весь стек технологий, используемых под капотом, — будем рады познакомиться!

Развитие harness

Нам важно строить эффективную (как по токенам, так и по скорости) обвязку вокруг модели. Разработка базы знаний по большой вариации тест-кейсов, улучшение планера, разработка верификаторов и тулов — это лишь малая часть задач, которые окружают harness.

Агентское планирование в модели

Уже сейчас наши модели неплохо справляются с автоматизацией. Но инструментов становится больше, тест-кейсы — сложнее. Чтобы сохранять эффективность и находить оптимальные пути решения задач, вам предстоит обучать модель таким эффективным стратегиям, а также работе в нашем harness.

Больше об ML в Яндексе — в канале Yandex for ML

* Понимаете, как строятся VLM-агенты и tool calling, работали с ними
* Разбираетесь с RL в интерактивных средах
* Хорошо знаете NLP/CV, особенно LLM/VLM
* Умеете решать ML-задачи полного цикла — от сбора разметки до внедрения в продакшен

* Понимаете ограничения современных VLM
* Следите за трендами в области агентов и tool-augmented-моделей

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.