сбер

Руководитель направления ML Pretrain Multimodal LLM

сбер · На сервисе с: 30.06.26 09:06

↑ Вакансия с автоподнятием
650k–850k ₽РоссияОфис

Мы развиваем GigaChat и ищем сильного руководителя направления ML pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pretrain является ядром самого быстрорастущего AI-проекта Сбера.

Это роль для человека, который возьмёт на себя архитектурную часть pretrain: design моделей, законы масштабирования, выбор и адаптация attention / MoE / позиционных схем, а также все архитектурные решения, которые определяют, какой именно будет следующая флагманская модель GigaChat.

  • развивать архитектуру моделей GigaChat

  • определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели

  • проектировать архитектуру флагманских моделей и отвечать за ключевые архитектурные решения: attention, позиционные схемы (RoPE и варианты), нормализации, активации, инициализация

  • развивать MoE-архитектуру: маршрутизация, балансировка экспертов, устойчивость маршрутизатора, влияние на качество и производительность

  • работать с long-context и мультимодальностью на уровне архитектуры: что именно нужно менять в модели, чтобы эти возможности работали стабильно

  • изучать и применять законы масштабирования

  • проводить scaling-эксперименты и на их основе принимать решения по размеру модели, ширине / глубине, числу и размеру экспертов, размерам батча и длительности обучения

  • предсказывать, как архитектурные изменения поведут себя при переходе с небольших абляций на полный масштаб

  • определять и развивать метрики, которые корректно отражают архитектурные изменения в обучении моделей

  • определять, в каких случаях архитектурные изменения действительно дают прирост качества по сравнению с более простыми baseline'ами, а в каких — нет

  • анализировать стабильность архитектурных решений

  • разбираться с нестабильностью на больших прогонах со стороны архитектуры: почему конкретная конфигурация расходится, где проявляются артефакты маршрутизации, коллапс энтропии, неустойчивости в attention

  • предлагать изменения в нормализациях, клиппинге, точности вычислений и структуре блоков, которые делают обучение более предсказуемым

  • обеспечивать безопасное масштабирование при внедрении крупных архитектурных изменений в основной трейн

  • писать ключевой код и оставаться сильным исследователем

  • самостоятельно писать и дорабатывать архитектурные компоненты и абляции.

  • Делать надёжные и воспроизводимые эксперименты: понятные версии данных, конфиги, сравнение запусков, контроль деградаций

  • читать статьи, воспроизводить ключевые результаты и адаптировать лучшие идеи под наши задачи и инфраструктуру

  • руководить сильной технической командой

  • руководить командой исследователей и инженеров, работающих над архитектурой, задавать высокую планку по качеству решений, скорости работы и глубине проработки

  • Паомогать команде превращать архитектурные идеи в работающие решения, которые можно встроить в основной цикл обучения

  • удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.

  • отличное владение Python и PyTorch

  • глубокое понимание устройства обучения нейросетей: не на уровне обзоров, а на уровне, где вы можете объяснить, почему конкретная архитектурная конфигурация расходится, глядя на кривые функции потерь, нормы градиентов и энтропии

  • глубокое понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), RoPE и варианты позиционных эмбеддингов, нормализации, инициализации, long-context, MoE

  • практический опыт с обучением больших моделей (а не только инференсом) и проведением архитектурных абляций

  • способность самостоятельно взять направление и довести его до результата: от чтения статей и постановки гипотез до внедрения в основной трейн

  • умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов

  • опыт руководства сильной технической командой и готовность лично писать важные части системы руками.

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:hh.ru Getmatch

Похожие вакансии Data Science & ML

Соц.сети
Н

Data Scientist

Неизвестный работодательНа сервисе с: 20.08.26 12:46
Зарплата не указанаРоссияБеларусьУдалёнка

ID 3424
Data Scientist
Senior
РФ/РБ

Загрузка специалиста Full-time

• Количество позиций: 1
• Гражданство: РФ / дружественные страны
• Формат работы: удалённо

❗️Обязательные данные по кандидату при подаче: ❗️
● Дата рождения
● Оценить требования ДА/НЕТ, в соответствии с наличием опыта.
● ВСЕ ТРЕБОВАНИЯ ИЗ ЗАПРОСА ОТРАЖЕНЫ В ПРОЕКТАХ РЕЗЮМЕ

Описание проекта:

Разработка AI-ассистентов и функциональных агентов в рамках PoC для проверки AI-гипотез. Проект включает NLP, работу с LLM, RAG, векторными базами, GPU/CPU-инфраструктурой, контейнеризацией и ML-инструментами.

Задачи на проекте:

● Разработка AI-ассистентов и функциональных агентов.
● Участие в реализации и проверке PoC для AI-гипотез.
● Работа с NLP и LLM.
● Запуск моделей на GPU и CPU.
● Контейнеризация ML/AI-решений.
● Работа с Jenkins.
● Работа с векторными базами и embeddings для RAG.
● Реализация function calling.
● Работа с KServe.
● Работа с BERT-подобными моделями.
● Разработка и применение эвристик.
● Квантизация LLM.
● Построение evals для LLM-систем.
● Оценка качества ответов, контроль галлюцинаций и мониторинг поведения AI-систем.

Требования:

● Понимание принципов проектирования AI-агентов: управление состоянием и контекстом, выбор инструментов, контроль автономности и human-in-the-loop.
● Глубокое понимание принципов машинного обучения: подготовка данных и признаков, выбор моделей, регуляризация, переобучение, data leakage, интерпретация результатов.
● Знание математической статистики: проверка гипотез, доверительные интервалы, дизайн и анализ A/B-тестов.
● Понимание оценки качества ML-систем: offline/online-метрики, валидация, оценка бизнес-эффекта, мониторинг качества моделей и данных.
● Опыт хотя бы в одном направлении: классическое ML, временные ряды и прогнозирование, рекомендательные системы, поиск и ранжирование, NLP/LLM/GenAI.
● Уверенное владение Python.
● Знание pandas или Polars, NumPy, scikit-learn.
● Опыт работы с CatBoost / LightGBM / XGBoost.
● Опыт работы с PyTorch или аналогичными инструментами.
● Умение писать поддерживаемый production-код: модульная архитектура, тестирование, логирование, документация.
● Опыт работы с Git и участия в code review.
● Уверенное владение SQL.
● Опыт построения evals для LLM-систем.
● Опыт оценки качества ответов, контроля галлюцинаций и мониторинга поведения системы.
● Понимание рисков prompt injection, некорректного tool calling, утечки данных и чрезмерных прав доступа агента.
● Опыт работы с API языковых моделей.
● Опыт работы с Hugging Face и orchestration-фреймворками.
● Умение оценивать стоимость, latency и масштабируемость LLM-решений.
● Опыт работы в e-commerce, retail или других продуктовых highload-системах.
● Опыт работы с Airflow, MLflow, Kafka, Redis, Kubernetes, Prometheus и Grafana.
● Опыт эксплуатации GPU-инфраструктуры и оптимизации inference.
● Опыт fine-tuning или адаптации LLM, включая LoRA / PEFT.
● Опыт проектирования agentic workflows или multi-agent-систем.
● Понимание принципов информационной безопасности, privacy и работы с персональными данными.
● Практические знания NLP.
● Опыт работы с векторными базами и embeddings для RAG.
● Опыт работы с KServe.
● Опыт работы с BERT-подобными моделями.
● Опыт квантизации LLM.

❗️❗️❗️Писать @veroneko⚡️⚡️⚡️⚡️ С РЕЗЮМЕ В КОТОРОМ УКАЗАН ВОЗРАСТ И ЛОКАЦИЯ НАХОЖДЕНИЯ. Укажите 🆔 вакансии❗️ Без этой информации отклики не рассматриваются ❗️❗️

Соц.сети
M

ML Engineer

meteoro_platformНа сервисе с: 20.08.26 12:34
Зарплата не указанаКазахстанУдалёнка

- Способность понимать, воспроизводить, оценивать и адаптировать последние научные работы в области генеративного ИИ.

Мы предлагаем:
- Работа в динамичной и инновационной AI Tech среде
- Конкурентный пакет зарплаты
25 дней отпуска, дополнительные выходные дни и больничный
- Удаленный формат работы
- Возможность профессионального и карьерного роста в стартап среде

Контакт @tata_babi

Соц.сети
N

Senior ML-Engineer (ChatGPT)

next_geniumНа сервисе с: 20.08.26 12:18
Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

Вакансия SENIOR ML-ENGINEER (ChatGPT)

🟢Удаленно🟢Полная занятость
🟢ЗП обсуждается на собеседовании
🟢В компанию Next Genium
#ds_ml

🟦Задачи
– разработка индивидуального продукта на основе кода ChatGPT для Коммерческого использования
– проработка архитектуры системы, анализ и разработка моделей, технических требований, подготовка данных, оценка эффективности, тестирование

🟦Требования
– высшее техническое или математическое образование
– уверенное знание мат. статистики
– глубокие знания в областях Machine Learning, Deep Learning
– опыт в обучении ChatGPT
– понимание метрик эффективности моделей машинного обучения
– знание С/С++, Python (multithreading, numpy, scikit, pandas, matplotlib и др.)
– знание и опыт использования ML фреймворков: Tensorflow Object DetectionAPI/Keras/Tensorflow
– знание и понимание классических структур данных и алгоритмов их обработки
– уверенное владение linux/bash
– английский язык на уровне чтения технической литературы
– знание GIT

🟦Будет плюсом
– опыт разработки коммерческих ML продуктов
– наличие сертификатов пройденных курсов по машинному обучению и анализу данных от ВШЭ, МФТИ, Яндекса, coursera

🟦Мы предлагаем
– часовая ставка оплаты услуг по договору определяется по итогам собеседования в зависимости от квалификации исполнителя
– оформление договора оказания услуг
– возможность работать полностью удаленно или в гибридном режиме
– интересная работа в передовой команде над инновационным продуктом

🌐 Откликнуться

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.