СБЕР

NLP Engineer (GigaChat Pretrain)

Мы - команда GigaChat Pretrain Data, готовим pretrain данные для GigaChat и GigaChat Vision. Pretrain данные - это фундамент, с которого начинается путь современной LLM модели и то, от чего наиболее зависит ее итоговое качество. Сырых данн…

СБЕР На сервисе с: 21.09.26 12:37

Зарплата не указанаРоссияМоскваГибрид

Мы - команда GigaChat Pretrain Data, готовим pretrain данные для GigaChat и GigaChat Vision. Pretrain данные - это фундамент, с которого начинается путь современной LLM модели и то, от чего наиболее зависит ее итоговое качество. Сырых данных более 40Пб и основная задача заключается в том, чтобы из этого хаоса сделать датасет, на котором будет обучена лучшая LLM в России.

Обязанности

  • генерировать синтетические данные: математика, код, произвольная синтетика с сидами - документами из Web
  • исследовать токенизацию и ее влияние на качество модели (возможно написание статей)
  • решать задачи кластеризации миллиардов документов
  • исследовать разные факторы, которыми обладают текстовые данные
  • генерировать Vision данные для прокачки VLM
  • разрабатывать новые алгоритмы парсинга HTML и исследовать его влияние на качество модели
  • исследовать зависимости между pretrain данными и agentic capabilities итоговой модели
  • разрабатывать стабильную инфраструктуру, которая будет поддерживать проведение сотен и тысяч экспериментов над данными.

Требования

  • имеешь коммерческий релевантный опыт связанный с NLP или построением инфраструктуры для данных от двух лет.

Будет плюсом:

  • навыки работы с генеративными AI-моделями; опыт создания AI-агентов и использования их в работе будет преимуществом
  • опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов
  • инструментальное владение AI для анализа, генерации и автоматизации
  • опыт с MapReduce системами.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • гибридный формат работы (2 дня в офисе, 3 дня на удалёнке)
  • ежегодный пересмотр зарплаты, годовая премия
  • корпоративный спортзал и зоны отдыха
  • система обучения для профессионального и карьерного развития
  • расширенный полис ДМС с первого дня работы и страхование для семьи
  • льготная программа ипотеки для сотрудников
  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.
Эта вакансия также есть на:Сайт компании

Похожие вакансии Data Science & ML

hh.ru
страховая компания сбербанк страхование

Senior/Team Lead DS

страховая компания сбербанк страхованиеНа сервисе с: 02.09.26 15:37↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваОфис

В команду требуются специалисты по Data Science для внедрения современных ML и AI решений в различные процессы всех линий бизнеса Сбербанк Страхования. Мы ищем профессионала, который будет развивать направление генеративного ИИ и создавать инновационные решения на базе больших языковых моделей. Если у тебя есть идеи как сделать жизнь множества клиентов Сбербанк Страхования лучше - тогда нам по пути!

Обязанности

  • Проведение исследовательского анализа данных (EDA) для выявления ключевых метрик и закономерностей, построение моделей. Data-driven подход к разработке;
  • Разработка и внедрение AI-агентов на базе LLM (SOTA open-source решения), в т.ч участие в создании и развитии RAG-систем (Retrieval-Augmented Generation);
  • Проектировать архитектуру приложений и пайплайнов обработки пользовательских запросов;
  • Работа с LLM: написание и оптимизация промптов (prompt engineering), управление взаимодействием с моделью;
  • Интеграция решений с корпоративными системами, обеспечение их взаимодействия;
  • Создание автономных бизнес-процессов в компании.

Требования

  • Опыт работы с Python и библиотеками: pytorch, pandas, numpy, SQLAlchemy, Scikit-learn, Matplotlib/Seaborn
  • Писать поддерживаемый, читаемый код; участвовать в ревью, обсуждениях и формировании технических подходов.
  • Практический опыт в NLP: векторизация текста, классификация запросов, построение RAG-систем, дообучение языковых моделей, эмбеддингов и пр.
  • Практический опыт в CV: дообучение Sota моделей в задачах классификации, детекции, сегментации, идентификации и пр.
  • Понимание классических алгоритмов ML
  • Понимание методов обучения нейросетевых моделей (transfer learning, fine tuning)
  • Навыки работы с Git, опыт интеграции решений в промышленные среды
  • Будет плюсом:
  • LangChain/LangGraph
  • Базовые навыки работы с OracleDB/PostgreSQL
  • Понимание PEFT методов дообучения LLM/VLM
  • Опыт разработки чат-ботов и диалоговых систем, знание этапов продакшн-Внедрения ML/AI-решений
  • Навыки контейнеризации (Docker) и работы с async/threading.
  • Навык работы с генеративными AI-моделями и опыт создания AI-агентов и использования их в работе

Условия

  • Гибридный формат работы (современный офис в Москве, Олимпийский проспект 14);
  • Льготные ипотечные условия кредитования;
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров: Okko, Сбер Маркет, Мега Маркет, Самокат, Еаптека и другие;
  • ДМС с первого дня и скидки на страхование для близких;
  • Корпоративная пенсионная программа;
  • Детский отдых и подарки за счет Компании;
  • Обучение за счет Компании: онлайн курсы, неограниченный доступ к библиотеке и обучение на базе Корпоративного университета, тренинги, митапы и возможность получить новую квалификацию;
Сайты компаний
Зарплата не указанаРоссияМосква

<iframe allow="autoplay; fullscreen; accelerometer; gyroscope; picture-in-picture; encrypted-media" frameborder="0" height="315" scrolling="no" src="https://runtime.strm.yandex.ru/player/video/vplvrjxixu4yqmlo2q7x?autoplay=1&amp;mute=1" width="560"></iframe>

Больше об аналитике и метриках Поиска — в видео от Лены, руководителя группы экосистемных исследований.

В Яндексе много разных поисков (квартиры, видео, афиша, врачи, услуги, товары и другие). Они различаются по технологиям, масштабу, качеству, но одно верно: сделать новый поиск — это большой инженерный и продуктовый проект. Мы радикально упрощаем эту задачу и создаём платформу, на которой поиски можно будет запускать или улучшать одним промптом.

Аналитическая команда внутри платформы отвечает за:
* формализацию продуктовых требований от заказчиков о том, как выглядит хорошее ранжирование;
* создание датасетов для валидации и обучения;
* эталонную разметку;
* разработку агентов-разметчиков;
* дизайн логов;
* офлайн- и онлайн-приёмку.

Главное отличие от обычной аналитической работы — мы делаем конвейер аналитики, а не улучшаем отдельные сервисы.

На каждом этапе мы придумываем универсальные критерии качества, которые будут работать сразу для сотен клиентов: как должны выглядеть хорошие датасеты; по каким признакам принимать работу агентов-разметчиков; как убедиться, что пользователи стали счастливее.

Датасеты

Вы будете придумывать, как агентам из логов любого сервиса собрать честный и воспроизводимый набор для оценки: что считать репрезентативным; как не потерять сложные случаи и как понять, что набор вообще способен различать хорошее ранжирование и плохое.

Разметка

Вам предстоит понять, как переводить продуктовый заказ в разметку и какими внешними знаниями должны обладать агенты для хорошей разметки. Кроме того, важно определить, как контролировать качество семантического слоя, из которого берутся эти знания, а также как обеспечить устойчивость разметки к внешним факторам.

Приёмка

Вам нужно будет определять, по каким признакам вообще можно принять новое ранжирование: какие офлайн-метрики предсказывают онлайн-эффект; как построить иерархию метрик для сервиса, который видишь впервые; как отличить настоящее улучшение от артефакта разметки; как извлекать идеи для будущих улучшений из реальных логов.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Уверенно пишете на Python и SQL
* Разбираетесь в алгоритмах и структурах данных
* Знаете математическую статистику и умеете проверять гипотезы
* Понимаете, почему важно всегда смотреть на данные

* Работали с поиском или рекомендациями
* Интересуетесь ML-аналитикой
* Знаете, как работать с кодинг-агентами
* Умеете общаться, ясно излагать мысли, понимать и учитывать мнение коллег, убеждать

hh.ru
jacobs douwe egberts (jde)

Аналитик данных | Data scientist

jacobs douwe egberts (jde)На сервисе с: 06.08.26 14:18↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваГибрид

Чем предстоит заниматься:

Это роль-гибрид: вы будете одновременно AI-лидером (проработка гипотез, работа с подрядчиками) и Data Scientist'ом (модели, данные, ML).
🔬 1. Бизнес-гипотезы

  • Взаимодействовать с бизнес-заказчиками (маркетинг, продажи, продукт, HR, логистика), выявлять точки применения AI
  • Формулировать и тестировать гипотезы: «А что, если мы автоматизируем / предскажем / кластеризуем / порекомендуем вот это?»
  • Проводить оценку эффективности гипотез (стоимость разработки vs выгода)

🤖 2. Работа с LLM и YandexGPT

  • Развивать текущую интеграцию с LLM (Яндекс) — уже используем её, нужно масштабировать
  • Проектировать RAG-решения (Retrieval-Augmented Generation) для ответов по корпоративным данным
  • Разрабатывать AI-ассистентов для: Ad-hoc запросов по анализу данных - ответы на типичные вопросы по данным виесто формирования типовых дашбордов, внутренних процессов — поиск по документам, генерация отчётов, интерпретация показателей

📊 3. Data Science (модели и данные)

  • Разрабатывать ML-модели (классификация, регрессия, кластеризация, прогнозирование временных рядов)
  • Собирать и подготавливать данные для моделей из DWH и других корпоративных источников
  • Проводить EDA, feature engineering, валидацию, A/B-тесты
  • Подтверждать качество моделей — формальная метрика качества (business metrics, а не только ML-метрики)
  • Документировать результаты (отчёты, презентации для стейкхолдеров)

🤝 4. Работа с подрядчиками и пилотами

  • Искать на рынке внешние AI-решения, отвечающие запросам бизнеса
  • Формировать ТЗ для подрядчиков, оценивать их компетенции
  • Управлять пилотами: сроки, KPI, приёмка результатов
  • Готовить фактуру для принятия решения: build (делаем сами) vs buy (покупаем готовое решение vs partner (берём подрядчика)
  • Текущий пул: LLM-проекты с Яндексом; в планах — AI-ассистенты для данных, NLP-решения, Computer Vision (если есть потребность)

🛠️ 5. Интеграция и внедрение

  • Доводить модели до продакшена — встраивать их в существующую DWH-инфраструктуру
  • Писать ETL/ELT-пайплайны для ML (совместно с DWH-инженерами)
  • Мониторить качество моделей в продуктивном контуре, настраивать автопереобучение
  • Интегрировать AI-решения с текущими системами компании (CRM, BI, корпоративный портал)

Что мы ожидаем:

  • Опыт работы со сложными запросами, оконными функциями, CTE, DWH (PostgreSQL / ClickHouse);
  • Опыт работы с YandexGPT / GPT / Open-source LLM, понимание RAG, промпт-инжиниринг;
  • Владеете базовыми навыками разработки;
  • Имеете опыт ведения проектов от сбора требований, защиты идей перед стейкхолдерами до презентации результатов.

А также:

  • Pandas, NumPy, Scikit-learn, FastAPI / Flask;
  • Градиентный бустинг (CatBoost, XGBoost, LightGBM), линейные модели, кластеризация, метрики, валидация.

Со своей стороны мы предлагаем:

  • Работу в одной из крупнейших международных компаний, с брендами, которые действительно любят;
  • Конкурентоспособную заработную плату (по результатам собеседования), годовой бонус;
  • Официальное трудоустройство, соблюдение Трудового Кодекса РФ;
  • Оплачиваемый больничный до 100% оклада;
  • Полис ДМС (расширенный со стоматологией), страхование жизни;
  • Компенсацию питания;
  • Сервис «Понимаю» - бесплатные консультации психологов, юристов, финансистов, специалистов по здоровому образу жизни;
  • Пятидневную рабочую неделю (гибридный формат работы), пятница - сокращённый рабочий день (до 15:30);
  • Офис в центре Москвы (7 минут от ст. м. Новослободская и Маяковская);
  • Кофейные наборы в подарок каждый квартал;
  • Лучший кофе в офисе :)

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.