С

Руководитель направления ML Pretrain Multimodal LLM

Мы развиваем GigaChat и ищем сильного руководителя направления ML pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pre…

сбербанк · На сервисе с: 25.09.26 17:02

Зарплата не указанаРоссияМосква

Мы развиваем GigaChat и ищем сильного руководителя направления ML pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pretrain является ядром самого быстрорастущего AI-проекта Сбера.

Это роль для человека, который возьмёт на себя архитектурную часть pretrain: design моделей, законы масштабирования, выбор и адаптация attention / MoE / позиционных схем, а также все архитектурные решения, которые определяют, какой именно будет следующая флагманская модель GigaChat.Нам нужен не просто менеджер, а сильный технический руководитель, который способен глубоко погружаться в детали, самостоятельно собирать ключевые части решения и доводить архитектурные идеи до реального роста качества модели на масштабе.

  • Развивать архитектуру моделей GigaChat

  • Определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели.

  • Проектировать архитектуру флагманских моделей и отвечать за ключевые архитектурные решения: attention, позиционные схемы (RoPE и варианты), нормализации, активации, инициализация.

  • Развивать MoE-архитектуру: маршрутизация, балансировка экспертов, устойчивость маршрутизатора, влияние на качество и производительность.

  • Работать с long-context и мультимодальностью на уровне архитектуры: что именно нужно менять в модели, чтобы эти возможности работали стабильно.

  • Изучать и применять законы масштабирования

  • Проводить scaling-эксперименты и на их основе принимать решения по размеру модели, ширине / глубине, числу и размеру экспертов, размерам батча и длительности обучения.

  • Предсказывать, как архитектурные изменения поведут себя при переходе с небольших абляций на полный масштаб.

  • Определять и развивать метрики, которые корректно отражают архитектурные изменения в обучении моделей.

  • Определять, в каких случаях архитектурные изменения действительно дают прирост качества по сравнению с более простыми baseline'ами, а в каких — нет.

  • Анализировать стабильность архитектурных решений

  • Разбираться с нестабильностью на больших прогонах со стороны архитектуры: почему конкретная конфигурация расходится, где проявляются артефакты маршрутизации, коллапс энтропии, неустойчивости в attention.

  • Предлагать изменения в нормализациях, клиппинге, точности вычислений и структуре блоков, которые делают обучение более предсказуемым.

  • Обеспечивать безопасное масштабирование при внедрении крупных архитектурных изменений в основной трейн.

  • Писать ключевой код и оставаться сильным исследователем

  • Самостоятельно писать и дорабатывать архитектурные компоненты и абляции.

  • Делать надёжные и воспроизводимые эксперименты: понятные версии данных, конфиги, сравнение запусков, контроль деградаций.

  • Читать статьи, воспроизводить ключевые результаты и адаптировать лучшие идеи под наши задачи и инфраструктуру.

  • Оставаться сильным инженером и исследователем, а не только руководителем: при необходимости самому разбирать узкие места в коде, экспериментах и настройках обучения.

  • Руководить сильной технической командой

  • Руководить командой исследователей и инженеров, работающих над архитектурой, задавать высокую планку по качеству решений, скорости работы и глубине проработки.

  • Помогать команде превращать архитектурные идеи в работающие решения, которые можно встроить в основной цикл обучения.

  • Удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.

  • Отличное владение Python и PyTorch.

  • Глубокое понимание устройства обучения нейросетей: не на уровне обзоров, а на уровне, где вы можете объяснить, почему конкретная архитектурная конфигурация расходится, глядя на кривые функции потерь, нормы градиентов и энтропии.

  • Глубокое понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), RoPE и варианты позиционных эмбеддингов, нормализации, инициализации, long-context, MoE.

  • Практический опыт с обучением больших моделей (а не только инференсом) и проведением архитектурных абляций.

  • Способность самостоятельно взять направление и довести его до результата: от чтения статей и постановки гипотез до внедрения в основной трейн.

  • Умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов.

  • Опыт руководства сильной технической командой и готовность лично писать важные части системы руками.

Будет плюсом

  • Опыт работы с MoE-архитектурами: маршрутизатор, балансировка нагрузки, переполнение, артефакты маршрутизации.

  • Опыт проведения scaling-экспериментов и работы с законами масштабирования.

  • Опыт работы с long-context и мультимодальными расширениями LLM.

  • Опыт работы с distributed training (5D-параллелизм: DP/TP/PP/EP/SP) и large-scale инференсом.

  • Публикации, open-source вклад или сильный прикладной research track record.

  • Понимание современных open-source стеков для обучения больших языковых моделей.

  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM.

  • Большую степень влияния на архитектуру решений, методы обучения и качество итоговой модели.

  • Команду сильных инженеров и исследователей.

  • Возможность совмещать управление направлением с глубокой технической работой.

  • Конкурентную компенсацию, премии и расширенный соцпакет.

Эта вакансия также есть на:hh.ru

Похожие вакансии Data Science & ML

Соц.сети
Н

Data Scientist (Middle+ / Senior)

Неизвестный работодательНа сервисе с: 25.09.26 17:51
Зарплата не указанаСербияУдалёнка

Data Scientist (Middle+ / Senior) — Remote
Наша дата-команда расширяется! Ищем Data Scientist в международную FinTech-компанию, который станет ключевым драйвером развития прогнозной аналитики, causal analysis и ML-решений в production.
📍 Формат: Полностью удаленно (Remote)
📊 Команда: Сотрудничество с Head of Analytics и BI-аналитиком
🔹 Чем предстоит заниматься:
Прогнозная аналитика: разработка моделей прогнозирования спроса и ресурсов (почасовые прогнозы, доверительные интервалы).
Machine Learning: вывод и поддержка ML-моделей в production, создание ML-агентов и систем мониторинга/алертов в реальном времени.
Product & Decision Science: causal-анализ, поиск причин изменения метрик, скоринг, сегментация и модели оттока.
Сотрудничество с C-level: презентация результатов и объяснение сложных моделей простым языком для бизнеса.
🔹 Что мы ожидаем:
Опыт: коммерческий опыт Data Scientist уровня Middle+ / Senior.
Hard Skills: Python, сильный SQL, pandas, scikit-learn, statsmodels.
ML & Time Series: практический опыт работы с временными рядами (Prophet, SARIMAX, Gradient Boosting) и деплоя ML в production.
Math & Stat: глубокая статистика, понимание качественного backtesting.
💡 Будет преимуществом: Опыт в FinTech/Payments/Marketplace, работа с LLM API, FastAPI, навыки визуализации данных.
🔹 Что мы предлагаем:
Влияние на реальные операционные и бизнес-решения компании.
Свободу в выборе подходов, инструментов и технологий.
Конкурентную заработную плату и работу со сложными большими данными.
📥 Интересно? Присылайте свое резюме в личные сообщения:
Телеграм: ••••••••

Сайты компаний
ozon tech

Data Scientist, Внутренние сервисы

ozon techНа сервисе с: 25.09.26 17:38
Зарплата не указанаРоссияМосква

Привет! Это команда Внутренних сервисов. 

Мы развиваем систему интеллектуального распознавания документов, которой пользуются внутренние сервисы компании. Система уже работает в проде и распознаёт 30+ видов документов. 

Сейчас мы ищем Senior ML-инженера, который будет развивать существующий ML-продукт: улучшать качество распознавания и извлечения информации из документов, дообучать LLM под конкретные задачи и запускать новые сценарии в production. 

Мы активно используем LLM — с их помощью решаем задачи, для которых раньше требовались сложные CV-пайплайны.  

Наш стек 

  • Python, PyTorch, Transformers, LLM, PostgreSQL, Redis, Kubernetes, Docker. 

Вы будете 

  • Развивать существующую систему распознавания документов и улучшать качество её работы. 

  • Обучать и дообучать LLM под задачи распознавания, классификации, извлечения и структурирования информации из документов. 

  • Исследовать новые подходы к применению LLM и выбирать модели и методы обучения под конкретные задачи. 

  • Запускать ML-решения в production, анализировать их качество и улучшать существующие пайплайны. 

  • Работать на стыке ML, NLP и Computer Vision: решать задачи обработки документов, где LLM дополняют или заменяют классические CV-подходы. 

Примеры задач 

  • Распознавание и парсинг сканов ЭТК — от паспортов до заграничных документов. 

  • Классификация резюме и других документов. 

  • Саммаризация документов. 

  • Извлечение структурированной информации из неструктурированных документов с помощью LLM. 

  • Дообучение LLM под конкретные задачи распознавания документов.

  • Исследование новых моделей и подходов, которые могут улучшить качество или упростить существующие решения. 

Нам важно 

  • Сильная база в Machine Learning и Deep Learning. 

  • Практический опыт обучения и дообучения LLM. 

  • Опыт работы с Python и современным ML-стеком. 

  • Понимание подходов к оценке качества ML-моделей и умение анализировать результаты экспериментов. 

  • Опыт внедрения ML-моделей в production. 

  • Способность самостоятельно разбираться в новой задаче, выбирать подход к её решению и доводить результат до production. 

Будет плюсом 

  • Опыт работы с OCR и задачами распознавания документов. 

  • Опыт в NLP и работе с LLM для извлечения и структурирования информации. 

  • Опыт работы с Computer Vision. 

  • Опыт использования LoRA, PEFT и других подходов к эффективному дообучению LLM.

hh.ru
ozon производство

Менеджер проектов | Прогнозирование

ozon производствоНа сервисе с: 25.09.26 17:39
Зарплата не указанаРоссияМоскваОфис

Вам предстоит

  • Лидировать end-to-end проекты по созданию и развитию систем автоматического прогнозирования спроса и планирования продаж;
  • Формировать дорожную карту (roadmap) развития инструментов прогнозирования и их интеграции в общую ИТ-архитектуру компании;
  • Оценивать экономический эффект от внедрения новых моделей прогнозирования;
  • Собирать и формализовывать требования: взаимодействовать с коммерческим департаментом, категорийными менеджерами и отделом товародвижения, выявлять факторы, влияющие на спрос (промо, сезонность, тренды);
  • Ставить задачи и совместно с командами Data Science создавать, тестировать и валидировать прогнозные модели (включая ML-алгоритмы);
  • Разрабатывать ТЗ для интеграции прогнозных модулей с ERP-системой и модулями автозаказа;
  • Организовывать пилотные запуски моделей, проводить A/B-тесты (сравнение старых алгоритмов с новыми) и оценивать точность;
  • Расследовать системные ошибки прогноза (недопрогноз/перепрогноз), выявлять корневые причины (data quality, аномалии) и устранять их;
  • Формировать и приоритизировать бэклог задач для команды разработки и аналитиков;
  • Создавать дашборды для мониторинга точности прогнозов в разрезе категорий, регионов и горизонтов планирования.

Мы ожидаем

  • Опыт работы от 3–5 лет в роли продакт-/проджект-менеджера или системного аналитика в проектах автоматизации прогнозирования спроса, пополнения запасов;
  • Глубокое понимание математических методов прогнозирования, принципов работы S&OP и факторов, влияющих на потребительский спрос;
  • Опыт работы со сложными массивами данных, уверенное знание SQL;
  • Практический опыт взаимодействия с командами Data Science / Machine Learning (понимание ИТ-языка математиков и разработчиков);
  • Понимание метрик качества прогноза (WAPE, MAPE, BIAS) и их связи с финансовыми метриками бизнеса;
  • Будет преимуществом — опыт работы в крупном ритейле (FMCG, e-commerce) с широкой матрицей SKU;
  • Будет преимуществом — базовые знания Python для анализа данных.

Мы предлагаем

  • Динамичный и быстроразвивающийся бизнес, ресурсы, возможность сделать вместе лучший продукт на рынке e-commerce;

  • Достойный уровень заработной платы;

  • Спорт: йога, танцы, функциональные тренировки онлайн. Скидки на клубные карты различных фитнес-сетей;

  • Развитие: наши сотрудники участвуют в конференциях, мы оплачиваем обучение. У нас есть корпоративная офлайн библиотека;

  • Корпоративные программы: скидки и привилегии от компаний-партнёров для наших сотрудников;

  • Социальная ответственность: материальная помощь, подарочные сертификат при рождении ребенка;

  • Здоровье: ДМС со стоматологией, страхование от несчастных случаев, полис выезжающих за рубеж;

  • Оформление по ТК РФ;

  • График работы: 5/2 пн - пт, гибкое начало рабочего дня.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.