СБЕР

Руководитель направления ML Pretrain Multimodal LLM

Мы развиваем GigaChat и ищем сильного руководителя направления ML pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pre…

СБЕР На сервисе с: 30.06.26 09:06

↑ Вакансия с автоподнятием
650k–1000k ₽РоссияМоскваОфис

Мы развиваем GigaChat и ищем сильного руководителя направления ML pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pretrain является ядром самого быстрорастущего AI-проекта Сбера.

Это роль для человека, который возьмёт на себя архитектурную часть pretrain: design моделей, законы масштабирования, выбор и адаптация attention / MoE / позиционных схем, а также все архитектурные решения, которые определяют, какой именно будет следующая флагманская модель GigaChat.

  • развивать архитектуру моделей GigaChat

  • определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели

  • проектировать архитектуру флагманских моделей и отвечать за ключевые архитектурные решения: attention, позиционные схемы (RoPE и варианты), нормализации, активации, инициализация

  • развивать MoE-архитектуру: маршрутизация, балансировка экспертов, устойчивость маршрутизатора, влияние на качество и производительность

  • работать с long-context и мультимодальностью на уровне архитектуры: что именно нужно менять в модели, чтобы эти возможности работали стабильно

  • изучать и применять законы масштабирования

  • проводить scaling-эксперименты и на их основе принимать решения по размеру модели, ширине / глубине, числу и размеру экспертов, размерам батча и длительности обучения

  • предсказывать, как архитектурные изменения поведут себя при переходе с небольших абляций на полный масштаб

  • определять и развивать метрики, которые корректно отражают архитектурные изменения в обучении моделей

  • определять, в каких случаях архитектурные изменения действительно дают прирост качества по сравнению с более простыми baseline'ами, а в каких — нет

  • анализировать стабильность архитектурных решений

  • разбираться с нестабильностью на больших прогонах со стороны архитектуры: почему конкретная конфигурация расходится, где проявляются артефакты маршрутизации, коллапс энтропии, неустойчивости в attention

  • предлагать изменения в нормализациях, клиппинге, точности вычислений и структуре блоков, которые делают обучение более предсказуемым

  • обеспечивать безопасное масштабирование при внедрении крупных архитектурных изменений в основной трейн

  • писать ключевой код и оставаться сильным исследователем

  • самостоятельно писать и дорабатывать архитектурные компоненты и абляции.

  • Делать надёжные и воспроизводимые эксперименты: понятные версии данных, конфиги, сравнение запусков, контроль деградаций

  • читать статьи, воспроизводить ключевые результаты и адаптировать лучшие идеи под наши задачи и инфраструктуру

  • руководить сильной технической командой

  • руководить командой исследователей и инженеров, работающих над архитектурой, задавать высокую планку по качеству решений, скорости работы и глубине проработки

  • Паомогать команде превращать архитектурные идеи в работающие решения, которые можно встроить в основной цикл обучения

  • удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.

  • отличное владение Python и PyTorch

  • глубокое понимание устройства обучения нейросетей: не на уровне обзоров, а на уровне, где вы можете объяснить, почему конкретная архитектурная конфигурация расходится, глядя на кривые функции потерь, нормы градиентов и энтропии

  • глубокое понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), RoPE и варианты позиционных эмбеддингов, нормализации, инициализации, long-context, MoE

  • практический опыт с обучением больших моделей (а не только инференсом) и проведением архитектурных абляций

  • способность самостоятельно взять направление и довести его до результата: от чтения статей и постановки гипотез до внедрения в основной трейн

  • умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов

  • опыт руководства сильной технической командой и готовность лично писать важные части системы руками.

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Эта вакансия также есть на:Getmatch

Похожие вакансии Data Science & ML

Сайты компаний
selecty

ML-разработчик

selectyНа сервисе с: 20.06.26 14:55↑ Вакансия с автоподнятием
Зарплата не указанаРоссия
Крупнейший частный банк, который входит в ТОП-10 работодателей РФ и активно развивает направление ML и AI.

Проекты связаны с разработкой скоринговых моделей для розничного бизнеса, а также банковских корпоративных функций.
  • Работа предполагает чистую разработку, построение ML-моделей.
  • Уверенное владение Python и SQL.
  • Классический ML: Хорошие знания алгоритмов. Бустинги, деревья, логистическая и линейная регрессия, кластеризация, uplift и ранжирующие модели, работа с дисбалансом, калибровка. Уверенное владение Python и SQL.
  • Классический ML: Хорошие знания алгоритмов. Бустинги, деревья, логистическая и линейная регрессия, кластеризация, uplift и ранжирующие модели, работа с дисбалансом, калибровка.
  • Формат: удаленка или гибрид
  • Оформление: по ТК РФ, «белая» зарплата + бонусы.
  • ДМС (стоматология) + страхование жизни.
  • Оплата сертификаций и курсов (Coursera, Udemy и др.).
Selecty - аккредитованная IT-компания, оказывающая услуги в сфере IT-аутсорсинга.

Работаем на рынке более 10 лет, с 2013 года успешно решая задачи любой сложности в рамках цифровой трансформации для крупного бизнеса. Среди заказчиков Selecty более 300 компаний из списка РБК Топ-500. Расскажите нам о себе и мы обязательно свяжемся с вами!
Соц.сети
контур

Data scientist по ИИ-агентам, senior

контурНа сервисе с: 10.08.26 14:13↑ Вакансия с автоподнятием
Зарплата не указанаСанкт-ПетербургУдалёнка

#senior #удаленка

Контур
Data scientist по ИИ-агентам, senior
Опыт работы: более 6 лет
Полная занятость
График: 5/2
Формат работы: удалённо

☑️ Чем предстоит заниматься
-Проектировать и реализовывать агентное ядро — turn-loop, оркестрацию tool-calling, управление подагентами, контекст-менеджмент: компакция и токен-бюджеты, промпт-архитектура, устойчивый роутинг моделей с graceful degradation
-Разрабатывать плагинную архитектуру для интеграции с внешними B2B-системами — писать MCP-серверы, обеспечивать безопасное исполнение кода в песочницах, строить абстракции над LLM-провайдерами Anthropic, OpenAI, Bedrock, Vertex через LiteLLM и собственные прокси
-Оркестрировать мультиагентные workflow — проектировать взаимодействие агентов на собственной архитектуре, адаптированной под доменную специфику
-Разрабатывать систему оценки качества — создавать eval-гейты, бенчмарки для агентов, инструменты для трассировки и отладки

☑️ Наши пожелания к кандидатам
-Опыт создания production-агентных систем, построения мультиагентных рантаймов с подагентами, планировщиками, динамическим роутингом моделей. Важен опыт разработки сложных отказоустойчивых систем, а не просто цепочки из нескольких вызовов
-Опыт разработки на Python, TypeScript, Bun или Node.js
-Опыт интеграции с LLM-провайдерами — работа с OpenAI API, Anthropic, AWS Bedrock, Vertex AI, использование или написание собственных шлюзов на базе LiteLLM. Понимание нюансов кэширования, стриминга, retry-политик
-Опыт работы с LangChain или LangGraph, CrewAI, Agno, LlamaIndex или OpenAI/Anthropic Agents SDK, а также с MCP (••••••••/sdk). Понимание их ограничений и готовность создавать собственные решения, если опенсорс не закрывает доменные требования
-Опыт построения системы оценки и мониторинга, настройки трассировки с помощью OTel или Langfuse, внедрения eval-гейта, разработки бенчмарков для агентов, умение измерять качество и надежность
-Опыт технического лидства на уровне больших фичей или продукта
-Готовность писать как высокоуровневую архитектуру, так и низкоуровневый код для работы с SDK Anthropic и OpenAI и прокси-слоями

Контакты: •••••••• / Telegram ••••••••

🔥 •••••••• / •••••••• / ••••••••

hh.ru
getmatch

ML - инженер/ML Engineer

getmatchНа сервисе с: 10.09.26 14:49↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваОфис

Ищем ML Engineer для нашего клиента — российской IT-компании, специализирующейся на кибербезопасности, исследовании угроз и разработке собственных продуктов защиты информации. Компания развивает новое продуктовое направление и создает решения для анализа угроз и защиты конечных устройств.

Чем предстоит заниматься:

  • Внедрение ML- технологий в существующие процессы и продукты;
  • Разработка тестовых сценариев и оценка качества моделей в соответствии с целевыми метриками;
  • Обучение, валидация и тестирование ML-моделей;
  • Оптимизация моделей для работы с учетом ограничений целевого устройства;
  • Подготовка моделей к интеграции и участие в процессе их внедрения;
  • Тесное взаимодействие с командой Embedded при интеграции ML-решений.

Требования:
  • Коммерческий опыт работы с Machine Learning и Deep Learning;
  • Уверенное владение Python и PyTorch;
  • Опыт production-внедрения ML-моделей: обучение, валидация, deployment и последующий мониторинг качества;
  • Практический опыт работы с поведенческими моделями, anomaly detection и/или задачами классификации;
  • Понимание современных архитектур глубокого обучения: Transformers, LSTM, GNN. Не требуется production-опыт с каждой архитектурой — важны понимание принципов их работы, областей применения и практический опыт хотя бы с частью из них;
  • Опыт работы с метриками качества ML-моделей, понимание FPR (False Positive Rate) будет преимуществом;
  • Практический опыт работы с Docker и Git.
Условия:​​​​​​​
  • Официальное трудоустройство, работа в аккредитованной IT-компании;

  • Оплата питания;

  • Доплата за отпуск до оклада 6-8 недель в год;;

  • Оплачиваемый больничный 100% 14 дней в год, а так же 5 day off в год по согласованию с руководителем;

  • Офисный формат работы с 09:30 до 18:30 с перерывом на обед: комфортный офис класса А рядом с метро, массажные кресла, фрукты, десерты, настольный теннис.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.