ML и AI — свежие вакансии
Обновляется каждый час. Найдено: 443 вакансии за последнюю неделю.
- Вакансий за неделю:
- 443
- Медиана:
- 250 000 ₽
- Вилка:
- 150 000 ₽ — 350 000 ₽
Зарплаты — по 350 вакансиям с указанной вилкой за 30 дней
HireSeeker — агрегатор вакансий. Собираем вакансии со всех основных площадок и показываем по вашей специальности. Подпишитесь на ежедневную подборку только релевантных.
Мы в Центре Робототехники Сбера создаем универсальный воплощенный ИИ для роботов, который будет управлять разнообразными физическими воплощениями. Например, манипуляторами, мобильными колесными роботами, роботами собаками, мобильными манипуляторами.
В основу нашего ИИ ляжет большая мультимодальная модель. Ей будут подчиняться фундаментальные модели навигации, манипуляции и планирования движений.
Один из основных шагов на этом длинном пути - это масштабные исследования возможностей больших языковых моделей (Large Language Models) и мультиагентных систем для задач робототехники.
Сейчас мы ищем в команду специалистов уровня middle\senior.
Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика ждите сообщение от него в Сберчате, диалог зайдёт примерно 10 минут. Задача AI-рекрутера — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. AI-рекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным для всех!
-
разработка сервисов на основе мультимодальных LLM для взаимодействия с пользователем и декомпозиции высокоуровневых задач с учетом возможностей роботов и ограничений среды
-
обучение и дообучение языковых и мультимодальных моделей
-
анализ и внедрение идей из научных публикаций
-
разработка и тестирование мультиагентных систем.
-
уверенное владение Python
-
знание алгоритмов и структур данных
-
опыт обучения языковых моделей
-
опыт работы с PyTorch и HuggingFace Transformers
-
понимание классических ML-алгоритмов и архитектур нейросетей (Transformers, RNN, LSTM)
-
навыки работы с генеративными AI-моделями, опыт создания AI-агентов и использование их в работе будет преимуществом
-
опыт использования GigaChat, Kandinsky и аналогов в продуктах
-
инструментальное владение Ai для анализа, генерации и автоматизации
-
технический английский (чтение статей и документации).
-
офисный формат, адрес Автозаводская 23а к2
-
ежегодный пересмотр зарплаты и годовая премия
-
расширенный ДМС и льготное страхование для семьи
-
уникальная система обучения Сбера для профессионального и карьерного развития
-
выгодная ипотека для сотрудников
-
подписка Прайм с возможностью совместного использования на трёх близких
-
вознаграждение за рекомендацию друзей в команду Сбера.
Data Engineer / ML Data Engineer для VLM-моделей
Мы в Центре Робототехники Сбера создаем универсальный воплощенный ИИ для роботов, который будет управлять разнообразными физическими воплощениями: манипуляторами, мобильными колесными роботами, роботами-собаками, мобильными манипуляторами и другими робототехническими платформами.
Сейчас мы ищем в команду специалиста уровня middle/senior.
Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика ждите сообщение от него в Сберчате, диалог зайдёт примерно 10 минут. Задача AI-рекрутера — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. AI-рекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным для всех!
-
подготовка и развитие датасетов для обучения VLM-моделей навыкам планирования и взаимодействия с роботом.Сбор, очистка, структурирование и валидация данных экспериментов, результатов работы моделей
-
формирование новых обучающих выборок на основе анализа ошибок моделей и потребностей расширения функционала системы
-
разработка пайплайнов для автоматизации сбора, фильтрации, разметки, проверки качества и версионирования данных
-
курирование разметки данных: подготовка инструкций, контроль качества
-
взаимодействие с ML-исследователями и инженерами для подготовки данных под обучение, дообучение и оценку моделей
-
обучение моделей.
-
опыт работы с подготовкой и обработкой данных для ML-задач
-
уверенное владение Python и библиотеками для работы с данными (Pandas, NumPy и аналогами)
-
опыт автоматизации процессов подготовки данных и разработки пайплайнов обработки данных
-
понимание принципов контроля качества датасетов и воспроизводимости экспериментов
-
опыт работы с Docker, Linux, Git
-
понимание машинного обучения и подготовки данных для обучения моделей
-
навыки работы с генеративными AI-моделями, опыт создания AI-агентов и использование их в работе будет преимуществом
-
опыт использования GigaChat, Kandinsky и аналогов в продуктах
-
инструментальное владение Ai для анализа, генерации и автоматизации
-
готовность разбираться в предметной области робототехники, VLM-моделей и мультимодальных данных.
Будет плюсом
-
опыт подготовки данных для ML, NLP, CV или мультимодальных моделей
-
опыт работы с данными для обучения LLM/VLM-моделей
-
опыт работы с DVC, MLflow, ClearML или другими инструментами для управления экспериментами и датасетами.
-
офисный/гибридный формат, адрес Автозаводская 23а к2
-
ежегодный пересмотр зарплаты и годовая премия
-
расширенный ДМС и льготное страхование для семьи
-
уникальная система обучения Сбера для профессионального и карьерного развития
-
выгодная ипотека для сотрудников
-
подписка Прайм с возможностью совместного использования на трёх близких
-
вознаграждение за рекомендацию друзей в команду Сбера.
Планирование архитектуры приложений с использованием LLM (Large Language Model) в качестве основной технологии;
Разработка ML-бэкендов и микросервисов для обеспечения функциональности и интеграции различных сервисов;
Выстраивание интеграционных взаимодействий со смежными командами: активное участие в встречах и согласование решений;
Оптимизация текущих решений с акцентом на производительность и управление нагрузкой (onnx, openvino, tensorrt).
Опыт работы в роли MLE от 2-х лет;
Опыт разработки классических моделей машинного обучения в областях NLP (Natural Language Processing);
Уверенное знание Python и опыт разработки сетевых/асинхронных приложений;
Опыт разработки, внедрения и оценки эффективности решений на основе современных NLP моделей в роли ведущего или лида проекта;
Широкая насмотренность в области LLM, RAG (Retrieval-Augmented Generation), а также опыт применения современных подходов к разработке решений;
Опыт выстраивания процессов и внедрения лучших практик в разработке и анализе данных;
Знание Docker, CI/CD, FastAPI и SQL, с готовностью разрабатывать решения с нуля;
Опыт с topic modeling, NER, кластеризацией, SSL, few shot / unsupervised learning;
Опыт участия в проектах по внедрению Gen AI-решений;
Опыт в оптимизации инференса (vllm, Triton Inference Server, аналоги).
Работа в крупнейшем в России интегрированном провайдере цифровых решений;
Возможна полная или частичная удаленная работа из России;
В Москве - БЦ Академик, победивший в номинации лучший проект «Бизнес-центр класса А. Москва» Возможность работать из офисов в городе Краснодар и Новосибирск.
Официальное оформление — согласно ТК РФ (полный соц. пакет: ежегодный оплачиваемый отпуск 28 календарных дней, оплата больничных);
Официальная заработная плата (оклад и годовая премия);
Кафетерий льгот с 1 рабочего дня: ДМС, компенсация транспорта, интернета, спорта, обучения и др.;
Корпоративное обучение: внутренние митапы, участие в конференциях, доступ к корпоративным библиотекам технической и бизнес литературы.
Middle+/Senior Data Scientist в Защитник [Big Data, МТС Веб Сервисы]
МТС Web Services (MWS) — бигтех-компания, предоставляющая облачные, AI-сервисы и платформенные решения под разные задачи бизнеса: от работы с данными до разработки продуктов и оптимизации процессов. Также мы запустили новую публичную платформу собственной разработки — MWS Cloud Platform.
Big Data – один из ключевых юнитов МТС.
Сегодня Big Data – это: 20 петабайт данных, 5 000 метрик на профиль и 400 увлеченных профессионалов в команде.
Мы – data-команда продукта МТС Защитник, который защищает миллионы пользователей от телефонного спама и мошенников. Это живая и постоянно меняющаяся задача: спамеры адаптируются под фильтры, меняют поведение и тексты, а мошенники регулярно придумывают новые схемы, используя социальную инженерию и давление на эмоции. Мы работаем с большими объёмами данных и моделями, которые должны не просто хорошо считать метрики, но и стабильно работать в продакшене с жёсткими требованиями к latency и качеству - и реально влиять на безопасность людей.
Поэтому мы ищем Middle+/Senior ML Engineer, который поможет нам в развитии инструментов борьбы со спамом и мошенниками.
Используемый стек ML: Python, CatBoost, PyTorch, Transformers, ONNX, Triton Inference Server, MLflow; Data: PySpark, ClickHouse, Pandas, NumPy
Задачи
Поддерживать и развивать ML-модели для выявления телефонного спама и мошенничества (табличные модели и NLP: классификация текстов, анализ расшифровок звонков);
Заниматься feature engineering, у нас много витрин и источников данных, важно извлекать из них полезные сигналы;
Участвовать в построении pipeline от данных до production-инференса (обучение, оптимизация, мониторинг);
Участвовать в постановке задач разметки и работе с качеством данных;
Общаться с бизнес-заказчиками: помогать формализовать задачи, согласовывать метрики, объяснять ограничения и результаты моделей;
Предлагать и проверять новые подходы к детектированию спама и мошеннических сценариев
Требования
Опыт работы в Data Science / ML от 3 лет;
Хорошее понимание классического ML и практический опыт feature engineering;
Опыт продуктивизации ML-моделей и их сопровождения;
Опыт в дообучении NLP-моделей под конкретные задачи: классификация, NER;
Умение переводить бизнес-задачи в ML-формулировки и внятно объяснять результаты;
Уверенные навыки Python и SQL;
Будет плюсом: PySpark, Hadoop, MLOps
Условия
Собственную платформу MTS Ocean для получения ИТ-ресурсов, а это значит, что деплой, мониторинг, observability — не будут для тебя проблемой, ты сможешь сосредоточиться на фичах;
Профессиональные гильдии инженеров, где мы поддерживаем друг друга и помогаем стать лучше;
Внутреннюю площадку TechTalks для обмена опытом, дискуссий, развития навыков самопрезентации;
Участие во внешних IT конференциях. Мы выступаем на HighLoad++, DataFest, Mobius, Test Driven Conf, Joker, DevOps, Матемаркетинг и даже проводим собственную конференцию по архитектуре True Tech Arch;
Полезные курсы и вебинары в корпоративном университете и электронную библиотеку;
ДМС с первого месяца работы, включая стоматологию;
Страхование от несчастных случаев с 1 месяца работы. Материальную помощь в сложных жизненных ситуациях;
Отпуск 28 календарных дней (+3 дополнительных дня за ненормированный рабочий день);
Гибридный формат работы;
Прием врачей общей практики и массаж в офисе;
Мобильная связь за счет компании и льготные тарифы для близких;
Подписка на онлайн-кинотеатр KION, сервис МТС Музыка, книжный сервис Строки от МТС, безлимитные мессенджеры и соцсети.
Старший Data Scientist, AI поисковый ассистент
Привет! Это отдел функциональности поиска.
Современный сервис для пользователя – это не просто инструмент решения понятных и привычных задач, но еще и помощник для исследования чего-то нового и ранее неизвестного. Зачастую покупатель на маркетплейсе не знает какой конкретный товар закроет его потребность, ему нужна консультация эксперта и возможность удобного выражения своих желаний. Прямо как в магазине, только на экране мобильного телефона.
Мы уверены, что в мире развитых AI технологий все это уже возможно. Мы ищем DS-специалиста, который будет работать в стриме применения перспективных AI/LLM-технологий в функциональности поиска Ozon.
Вы будете
Разрабатывать и внедрять ИИ-агенты для поискового ассистента.
Проектировать и реализовывать системы на основе Retrieval-Augmented Generation (RAG).
Адаптировать LLM под внутренние и внешние задачи с применением PEFT-методов, RLHF, DPO.
Заниматься построением пайплайнов обработки и сбора данных и обучения LLM.
Участвовать в полном ML-цикле: от исследования и создания прототипов до продакшн-внедрения и мониторинга моделей
Нам важно
Наличие фундаментальной математической базы, знание алгоритмов, математической статистики, классического ML и нейросетей.
Понимание технических деталей современных LM (как large, так и small), особенности их обучения, понимание принципов дообучения готовой модели на новых данных.
Опыт работы с современными архитектурами языковых моделей, в том числе обучение/дообучение своих моделей.
Понимание принципов построения ассистентов на базе LLM, оценки их качества, контроля безопасности и этических вопросов
Будет плюсом
Опыт разработки продуктов, связанных с поиском, рекламными технологиями или рекомендательными системами.
Знание технологий обработки больших данных, таких как Hadoop, Spark или аналогичные.
Навыки работы с инструментами автоматизации ML-пайплайнов.
Руководитель команды рекомендаций в международный Поиск
Наша команда разрабатывает систему рекомендаций для международного Поиска. Наша цель — персонализированно показать человеку наиболее релевантный контент из интернета. Мы ищем энергичного и целеустремлённого специалиста, который возглавит центр международной экспертизы по рекомендациям.
Обучение SOTA моделей
Вам предстоит обучение SOTA моделей для построения рекомендательных систем. Необходимо создавать интересные, полезные и этичные рекомендации для пользователей.
Обработка петабайтов данных на всех языках
Значительный вклад в качество алгоритма машинного обучения дают правильные данные. У нас есть десятки источников и хранилища с петабайтами данных, вам необходимо грамотно использовать ровно то, что поможет решить целевую задачу.
Улучшение архитектуры системы рекомендаций
В рекомендациях участвует не один алгоритм машинного обучения. Это большая рантайм-система со множеством взаимодействий между компонентами. Вам предстоит участвовать в проектировании компонентов системы и оценивать влияние новых изменений.
* Руководили командой
* Хотите делать качественный сервис, следить за его состоянием и думать о пользователях
* Хорошо знаете C++ или Python
* Готовы погружаться в новые технологии, предлагать и реализовывать идеи по их улучшению
* Отлично знаете базу классического машинного обучения
* Понимаете, как устроены современные рекомендательные системы
Yandex Crowd — крупный инфраструктурный сервис Яндекса. Мы используем краудсорсинг, чтобы расширять бизнес-процессы: разметку данных, модерацию контента, полевые исследования, тестирование. Также мы разрабатываем внутренние функции для наших продуктов: клиентский сервис, телемаркетинг, локализацию и документирование.
Наша цель — автоматизировать рутинные задачи краудсорс-исполнителей. Работаем по двум направлениям: асессорская разметка и клиентский сервис. Создаём и внедряем генеративных чат-ботов, агентов, co-pilot для операторов и асессоров, GenAI-based-разметку. Количество наших моделей и микросервисов, интегрированных в платформы, растёт. Нужно поддерживать стабильность, прозрачность и единообразие разработки и вывода в прод.
Ищем MLOps-лида, который соберёт команду и выстроит инфраструктуру и процессы для наших смелых ML-решений.
Автоматизация ML-процессов
Вам предстоит создавать эффективные автоматизированные пайплайны для обучения, тестирования и развёртывания ML-моделей, внедрять CI/CD и современные инструменты управления ML-процессами.
Стабильность и доступность моделей
Вам нужно будет обеспечивать стабильную работу моделей в продакшне, контролировать их состояние и гарантировать, что сервисы будут доступны для пользователей и отказоустойчивы.
Развитие ML-платформы
Вам предстоит определить техническое видение развития ML-платформы в Yandex Crowd и инструментов для Data Scientist, выстроить процессы, чтобы быстро и эффективно запускать новые решения, сократить время вывода их на рынок и масштабировать лучшие практики внутренней инфраструктуры.
Развитие команды MLOps-инженеров
Вы будете формировать и развивать команду MLOps-инженеров: нанимать сотрудников, быть для них наставником, передавать экспертный опыт, распределять задачи и способствовать их профессиональному росту.
* Работали в команде над разработкой на Python
* Руководили созданием и поддержкой бэкенд-сервисов
* Организовывали и внедряли системы мониторинга и логирования
* Умеете работать с Docker и Kubernetes
* Разбираетесь в полном жизненном цикле ML-моделей, выводе их в продакшн
* Способны принимать архитектурные решения
* Руководили построением или эволюцией CI/CD-процессов
* Внедряли инструменты для управления GenAI-решениями: RAG, агенты, LLM-пайплайны
* Занимались построением внутренних ML-платформ или сложных ML-продуктовых инструментов
ML-разработчик на С++ в команду визуального поиска Яндекса
Команда визуального поиска разрабатывает CV-технологии в самом сердце Яндекса. Наши алгоритмы и сервисы интегрированы в ключевые продукты компании и помогают миллионам пользователей решать повседневные задачи. Вы точно с нами знакомы, если пользовались поиском по картинке, Алисой, умной камерой, Маркетом или другими сервисами, в сценариях которых изображение играет главную роль.
Мы не только создаём инновационные сценарии с нуля, но и постоянно совершенствуем существующие, обеспечивая их стабильность и высочайшее качество на уровне мировых стандартов.
Ищем опытного разработчика на C++ с глубокими знаниями в ML, который готов создавать и внедрять в продакшн сложные технологии компьютерного зрения.
Проектирование архитектуры ML-систем
Вам предстоит не просто писать код, а проектировать целостные системы для визуального поиска и анализа изображений. Вы будете отвечать за выбор технических подходов, построение пайплайнов и обеспечение масштабируемости и отказоустойчивости наших решений.
Внедрение и оптимизация моделей в продакшене
Ваша ключевая задача — превращать state-of-the-art-модели (CV, LLM/VLM) в быстрые и стабильные компоненты высоконагруженных сервисов Яндекса. Это включает в себя глубокую работу с кодом на C++, его профилирование и оптимизацию производительности для достижения максимальной эффективности.
Участие в полном цикле жизни продукта
Вы будете не просто исполнителем, а полноценным участником процесса: от генерации и проверки гипотез вместе с командой до выкатки фич, участия в PR-активностях и анализа результатов после запуска.
Взаимодействие с R&D- и ML-исследователями
Предстоит тесно работать с исследовательскими командами Яндекса, чтобы быстро адаптировать самые передовые технологии и внедрять их в продукты.
Больше об ML в Яндексе — в канале Yandex for ML
* Отлично знаете C++ и занимались коммерческой разработкой на нём
* Глубоко понимаете принципы машинного обучения и классические алгоритмы
* Внедряли ML-модели в продакшн: знаете, как заставить модель работать быстро и стабильно под нагрузкой
* Умеете разбираться в сложной кодовой базе, рефакторить и улучшать существующие решения
* Готовы быстро погружаться в устройство сервисов Яндекса и находить лучшие точки применения для ML-технологий
* Работали с Python для ML-задач (PyTorch, TensorFlow)
* Понимаете архитектуру современных нейронных сетей: трансформеры, VLM, CNN
Прикладная аналитическая платформа "Блока Риски" — это решение, позволяющее создавать аналитические витрины на Облаке Данных по различным направлениям бизнеса, таким как:
- Расчет оптимальных стратегий взыскания.
- Расчет предложений по реструктуризации.
- Расчет компонентов кредитного риска PD, LGD, EAD.
- Ускорение расчета RWA.
- Процесс калибровки промышленных моделей.
- Аналитика по портфелю, взысканию и фроду.
У нас более 120 витрин, 2000+ потоков загрузки данных, 1200 нод, 40 000 ядер и 25+ петабайт данных.
Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры.
ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!
Обязанности
- Участие в проектировании и разработке витрин и хранилищ данных.
- Участие в проектировании и реализации инструментов автоматизации разработки.
- Участие в доработке промышленных витрин данных.
Требования
- Опыт работы от 2-х лет с одной или несколькими СУБД: Oracle, MS SQL, Teradata либо СУБД стэка Bigdata.
- Опыт работы в роли аналитика с функцией подготовки выгрузки данных для заказчика.
- Уверенное знание SQL: сложные запросы, аналитические функции, понимание физической реализации join’ов, оптимизация производительности запросов.
- Знание одного или нескольких языков программирования: PL/SQL, T-SQL, Java, Python, Scala на уровне переменных, процедур, функций, циклов, условных операторов.
- Знание одного или нескольких ETL-инструментов: Informatica, MS SSIS, SAS, ODI.
- Понимание принципов организации хранилищ данных, подходов к проектированию логической и физической моделей, понимание основной проблематики хранилищ и подходов к решению.
Условия
- Возможность выбрать офис рядом со станцией метро Кутузовская или Тульская.
- Формат работы: фултайм офис.
- Ежегодный пересмотр зарплаты и годовая премия.
- Корпоративный спортзал и зоны отдыха.
- Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
- Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
- Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ.
- Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров.
- Вознаграждение за рекомендацию друзей в команду Сбера.
Работа в Сбере – это
Технологии
Участие в развитии инноваций на базе ИИ
Развитие
Акселераторы для стартапов, хакатоны и регулярные митапы от лидеров направлений
Комфортный офис
Креативные пространства для работы, спортзалы, зоны для отдыха и перезагрузки
Сообщество
Возможность найти союзников по любым интересам
Мы — команда GigaChat, создающая и развивающая core-технологию генеративной языковой модели. Наша система умеет писать тексты, видеть изображения и даже ловить вайб в коде. Она отвечает на вопросы, ведёт диалоги, сочиняет стихи и рассказы, генерирует бизнес-идеи, пишет письма и многое другое.
Недавно мы выпустили крутую русскоязычную модель GigaChat MAX 2 уровня GPT-4 , а ещё научили её слушать.
Сейчас мы расширяем команду отдела production-внедрения. Мы развиваем инфраструктуру инференса больших языковых моделей: раскатка моделей, стабильность сервисов, производительность, cost optimization, взаимодействие с продуктовыми командами и эксплуатацией.
Обязанности
- низкоуровневая оптимизация работы с «железом»
- работа над инфраструктурой для нагрузок на кластеры и балансировки запросов
- вывод новых архитектур в продуктив.
Требования
- опыт работы в области глубокого обучения, в том числе с LLM
- глубокое знание CUDA и Python
- опыт использования GigaChat, Kandinsky и аналогов в продуктах
- навыки создания и использования AI-агентов.
Условия
- комфортный современный офис рядом с м. Кутузовская
- возможность выбрать удобный график – офис/гибрид/удаленка (в РФ)
- годовая премия
- корпоративный спортзал и зоны отдыха
- более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
- расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- ипотека для сотрудников по дисконтной прогамме
- бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера.
Мы ищем Senior Data Engineer, который будет отвечать за инфраструктуру, пайплайны и качество данных для обучения современных Vision-Language Models. Роль находится на стыке data engineering и ML: нужно будет работать с большими мультимодальными датасетами, понимать потребности исследователей и ML-инженеров, строить пайплайны очистки, фильтрации, категоризации и генерации данных, а также обеспечивать воспроизводимый экспорт данных в формат для обучения моделей.
- Собирать и структурировать потребности ML-команды в данных: какие данные нужны для обучения, дообучения, оценки и улучшения VLM.
- Предлагать и реализовывать идеи пайплайнов очистки, фильтрации, дедупликации, категоризации и генерации данных.
- Ориентироваться в современных практиках построения датасетов для Vision-Language Models: image-text pairs, synthetic data, filtering, quality scoring, data mixture design, dataset versioning.
- Отвечать за инфраструктуру хранения и подготовки данных, включая:
- импорт данных из различных источников: production, Common Crawl, open-source datasets, generated data;
- валидацию и контроль качества данных;
- хранение и версионирование датасетов;
- экспорт данных в форматы, пригодные для обучения моделей.
-
Проектировать и реализовывать пайплайны обработки данных на большом масштабе, включая десятки миллиардов изображений.
-
Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM.
-
Собирать статистику по данным, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов.
-
Обеспечивать воспроизводимость, наблюдаемость и надёжность data-процессов.
-
Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой.
-
Сильный опыт в data engineering и построении production-grade data pipelines.
-
Уверенное владение Python, включая multiprocessing, multithreading и async-подходы.
-
Опыт работы с большими объёмами данных и распределённой обработкой.
-
Практический опыт с объектными хранилищами, в частности S3 или аналогами.
-
Опыт работы с YTsaurus или похожими системами для распределённого хранения и обработки данных.
-
Понимание принципов валидации, очистки, дедупликации и версионирования датасетов.
-
Опыт работы с DVC, Git, Docker.
-
Опыт работы с PostgreSQL или другими реляционными базами данных.
-
Умение проектировать устойчивые пайплайны: от импорта данных до финального экспорта в training-ready формат.
-
Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения.
-
Готовность работать на стыке engineering и ML research.
Будет плюсом
-
Опыт работы с мультимодальными данными: изображения, текст, image-text pairs, captions, OCR, metadata.
-
Понимание того, как устроены современные датасеты для обучения VLM / LMM / multimodal models.
-
Опыт построения пайплайнов для synthetic data generation.
-
Опыт реализации quality scoring, filtering, semantic deduplication, clustering или data attribution.
-
Опыт визуализации статистики по большим датасетам и построения внутренних аналитических дашбордов.
-
Опыт работы с Common Crawl, LAION-подобными датасетами, open-source vision-language datasets.
-
Базовое понимание ML training pipeline и того, как качество данных влияет на качество модели.
-
крупнейшее DS&AI community — более 600 DS-специалистов банка
-
дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира
-
возможность быть соавтором НИРов и статей для международных конференций
-
возможность выбрать удобный формат работы: гибрид или офис
-
ежегодный пересмотр зарплаты, годовая премия
-
корпоративный спортзал и зоны отдыха
-
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
-
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
-
ипотека выгоднее до 7% для каждого сотрудника
-
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
-
вознаграждение за рекомендацию друзей в команду Сбера.
Computer Vision Engineer (Senior)
Локация РФ, обязательно гражданство РФ!
QLAN — технологический интегратор, внедряющий end-to-end ИИ-решения в бизнес-процессы крупных компаний и государственных структур.
Мы в поиске Computer Vision Engineer (Middle/ Senior) с коммерческим опытом от 3 лет для разработки и внедрения современных решений в области компьютерного зрения. Нам важно хорошее знание классического машинного обучения, статистического анализа и алгоритмов Computer Vision, а также практический опыт работы с PyTorch, NumPy, scikit-learn, Matplotlib и OpenCV.
Обязанности:
Разработка и внедрение решений в области Computer Vision.
Подготовка и анализ данных, работа с датасетами и разметкой.
Проведение экспериментов и анализ качества моделей с использованием соответствующих метрик.
Разработка и поддержка production-ready решений в области компьютерного зрения.
Работа с Linux, Git, Docker/Docker Compose в рамках разработки и deployment.
Взаимодействие с другими разработчиками и участниками проекта для реализации CV-решений.
Участие в техническом анализе задач, выборе подходов и оценке результатов экспериментов.
Требования:
Опыт коммерческой разработки в области Computer Vision от 3 лет.
Хорошее понимание: классического машинного обучения, статистического анализа, классических алгоритмов Computer Vision;
Практический опыт работы с нейросетевыми фреймворками: PyTorch;
Умение читать научные статьи, воспроизводить решения и адаптировать их под реальные задачи.
Уверенное владение библиотеками: NumPy; scikit-learn; Matplotlib; OpenCV.
Уверенная работа с Linux (предпочтительно Ubuntu, Mint или Debian).
Опыт контейнеризации с использованием Docker и Docker Compose.
Уверенное владение Git.
Английский язык — Upper-Intermediate (B2) или выше (обязательно).
Наличие проектов, которые были самостоятельно доведены до production.
Условия работы:
Формат работы: полностью удалённый.
Занятость: full-time, 5/2.
Гибкое начало рабочего дня — возможность самостоятельно выбирать время начала работы в рамках рабочего графика команды.
Работа в современной IT-команде над интересными задачами в области Computer Vision.
Возможность профессионального развития и работы с современными технологиями и подходами в CV/ML.
Вилка от 250к
====
⚠️ Перед откликом обязательно изучите Регламент безопасности канала.
====
Контакт для связи: @juulia_recruiter
Обязанности:
- Разворачивать, настраивать и сопровождать компоненты кампейн-платформы во всех окружениях (dev / test / prod) на Linux-серверах.
- Развивать интеграционный слой: API, коннекторы к каналам коммуникации, очереди, обмен с внутренними системами банка.
- Поддерживать стриминговую инфраструктуру: топики Kafka, деплой и сопровождение джобов, чекпоинты, состояние, масштабирование.
- Настраивать и тюнить сервинг-слой под онлайн-выдачу.
- Заниматься производительностью и надёжностью: нагрузочные тесты, capacity planning, разбор инцидентов и постмортемы.
- Настраивать разграничение доступа и выполнять требования ИБ.
DataOps - Выстраивать CI/CD для данных: версионирование кода витрин, DAG'ов и стриминговых джобов в Git, автотесты, автоматический прогон релизов между окружениями.
- Внедрять data quality as code: автоматические проверки свежести, объёма, схемы и дрейфа данных, quality gates внутри пайплайнов.
- Строить data observability: сквозной мониторинг лага, дашборды в Grafana по SLA данных, алертинг на нарушения.
- Развивать lineage и каталог данных (DataHub): автоматический сбор метаданных, прозрачность зависимостей кампейн-витрин.
- Управлять окружениями и тестовыми данными: воспроизводимость, обезличивание, быстрый разворот песочниц.
- Автоматизировать рутину и снижать time-to-market для новых кампаний: шаблоны, self-service инструменты для команды CVM.
Требования:
- От 3 лет опыта в эксплуатации или разработке распределённых систем / data-платформ.
- Уверенный Linux: администрирование, диагностика, работа с systemd, логами, ресурсами; сетевые основы.
- Скриптинг на Bash и Python.
- Практический опыт с Kafka: топики, партиционирование, консьюмер-группы, диагностика.
- Docker и Kubernetes на уровне уверенной эксплуатации.
- Опыт настройки CI/CD-пайплайнов (GitLab CI, Jenkins или аналог) и работы с Git.
- SQL и понимание работы СУБД: планы запросов, базовый тюнинг.
- Опыт построения мониторинга и алертинга: Prometheus, Grafana, работа с логами (ELK или аналог).
Будет плюсом:
• Практика DataOps: тестирование пайплайнов, data quality-фреймворки, контрактное тестирование данных.
• Apache Flink: деплой, стейт, чекпоинтинг, тюнинг.
• Greenplum, ClickHouse или другая СУБД.
• Redis, Informatica PowerCenter / PowerExchange CDC, NiFi, Airflow, DataHub, dbt.
• Ansible или другие инструменты автоматизации конфигурации.
• Опыт работы с кампейн-платформами / marketing automation.
• Понимание требований ИБ в банковской среде.
Став частью команды Forte, ты получишь:
- Конкурентную заработную плату и бонусы за персональную эффективность;
- График работы 5/2 с 9:00-18:00 в комфортном офисе;
- Жизнь внутри компании с ее корпоративными мероприятиями: тимбилдинги, челленджи, спортивные турниры, благотворительные акции;
- Заботу о здоровье с медицинским страхованием, а также DayOff в честь дня рождения и за выслугу лет;
- Выгодную рассрочку в крупные фитнес-клубы;
- Доступ к корпоративной библиотеке для непрерывного обучения и саморазвития.
Ищем Inference-инженера в Точка Банк. Мы — финтех-компания, создаём онлайн-банк и экосистему сервисов для бизнеса. В нашей команде больше 6 000 сотрудников, а сервисами пользуются более 800 000 клиентов.
О команде
Ты будешь работать в команде разработки внутренней LLM-платформы. Наш фокус — техническая инфраструктура и базовые инструменты. Мы развиваем LLM-гейтвей, инференс внутренней LLM, систему Information Retrieval и guardrails. Именно на этих компонентах строится работа с нейросетями.
Фактически мы создаём технологическую основу для LLM-автоматизации в банке. Наша задача — сделать так, чтобы всё работало стабильно и качественно. Поэтому задачи будут техническими, с минимальным взаимодействием с продуктом.
Мы плотно работаем с инференс-движками: не просто запускаем, а конфигурируем под highload и патчим исходный код при необходимости.
Что делать
- Разрабатывать высокопроизводительный inference-слой. Оборачивать ML-модели в оптимальные сервисы: настраивать токенизацию, динамический батчинг, работу с GIL и асинхронностью, оптимизировать использование GPU- и CPU-ресурсов.
- Работать с деплоем. Настраивать CI/CD, работать с Kubernetes. А также разрабатывать решения для деплоя сервисов, который работают с ML-моделями, включая LLM.
- Поддерживать стабильность сервисов. Работать с техническим долгом, проводить code review, настраивать детальный мониторинг и алертинг, вести архитектурную документацию.
- Драйвить R&D. Индустрия LLM постоянно меняется, поэтому нужно исследовать новые методы оптимизации и инструменты, чтобы платформа всегда использовала лучшие практики.
Ты подойдёшь, если
- Есть опыт работы с Python и asyncio, а также с aiohttp и FastAPI от 4 лет.
- Любишь работать на низком уровне: тебе интересно разбираться, как инструменты работают под капотом, а также оптимизировать их производительность.
- Спокойно относишься к тому, что в поиске лучшего решения код может часто меняться или «выбрасываться».
- Комфортно работаешь в условиях неопределённости и быстрых экспериментов.
- Умеешь брать ответственность за результат и коммуникацию.
- Самостоятельно организуешь свою работу и определяешь вектор, исходя из прозрачных целей команды.
- Есть опыт работы с ML-инфраструктурой и ML-сервисами. Понимаешь базовые принципы работы LLM, их ограничения и возможности.
Будет преимуществом:
- Опыт работы с vLLM или SGLang в роли инженера, а не только пользователя. Например, понимаешь принципы работы KV-cache и разницу между prefill phase и decoding phase.
- Опыт GPU-оптимизации. Например, написание GPU Kernels на CUDA или Tritonlang/Tilelang.
Что ждёт тебя в Точка Банк
- Официальная зарплата до 700 000 ₽. Точная сумма зависит от твоих навыков и ожиданий — обсудим их на собеседовании. Это сумма до вычета налогов. Помни, что с 2025 года ставка НДФЛ меняется в зависимости от суммарного дохода за год.
- Пятидневная рабочая неделя с гибким началом и окончанием дня.
- Удалёнка или любой офис в городах присутствия. Наши офисы — это продуманные опенспейсы с комфортными рабочими местами и зонами отдыха. Ты можешь самостоятельно выбрать, где работать — ходить в офис необязательно.
- Понятная система развития и роста по грейдам.
- Возможность влиять и менять. Если у тебя есть предложение или идея, смело делись ей с командой — тебя услышат.
- Бесплатное обучение: ты сможешь ездить на IT-конференции, митапы и хакатоны и проходить курсы за счёт компании. А ещё пользоваться нашей библиотекой и платформой с онлайн-курсами.
- Комфорт не только в работе, но и в жизни. После испытательного срока: ДМС со стоматологией, психолог, чекапы здоровья и 4 дополнительных дэй-оффа в год.
- Бонусы от партнёров: Skillbox, Skyeng, Яндекс Практикум, Ясно и других.
- Онлайн-кабинет сотрудника, где ты можешь заказать справку, поставить отпуск или отгул, заказать технику или посмотреть выплаты.
- Активная корпоративная жизнь: устраиваем кинопоказы, спортивные марафоны и корпоративы, которые потом ещё долго вспоминают.
15.06.2026
ML-инженер (команда разработки LLM) в АТОН
АТОН - старейшая инвестиционная компания России.
Пройдя более чем 35-летний путь, инвестиционная группа неоднократно менялась и адаптировалась к новым условиям.Мы движимы амбициями и стремлением к профессиональному развитию. Нас объединяют общие ценности, мы создаем продукты и решения, уникальные для российского рынка.
Мы развиваем внутреннюю LLM-платформу и создаем AI-продукты для бизнеса на базе современных языковых моделей и мультиагентных систем. Ищем разработчика, который будет участвовать в проектировании, разработке и внедрении production-grade LLM-решений в тесном взаимодействии с техническим лидером и командой инженеров.
Чем нужно будет заниматься:
- Разрабатывать и развивать сервисы на базе LLM и RAG.
- Участвовать в создании мультиагентных решений и интеграции внешних сервисов.
- Реализовывать function calling, tool use и интеграции с корпоративными системами.
- Разрабатывать и поддерживать data pipeline для AI-продуктов.
- Участвовать в выводе решений в промышленную эксплуатацию.
- Оптимизировать качество, производительность и стоимость работы LLM-сервисов.
Вам предстоит:
— Сбором, преобразованием и стандартизацией данных из различных источников
— Составлением пайплайнов трансформации данных с помощью фреймворка DBT (Greenplum, Clickhouse)
— Написанием Юнит тестов и DQ-тестов
— Документированием собственных разработок
— Работой с задачами по извлечению, трансформации и загрузке данных (ETL, ELT) в стеке Apache Airflow и сервисов «Яндекс облака»
— Участием в проектировании структур хранилища данных и витрин по заданиям от бизнеса
Для нас важны:
— Навыки написания и оптимизации запросов SQL, а также промышленного использования реляционных СУБД (преимущественно Postgres, Greenplum/Clickhouse/MS SQL)
— Базовый уровень владения Python (в области разработки ETL или конвейеров данных), желательно знакомство с библиотеками pandas, numpy, seaborn
— Опыт работы с системами контроля версий (GIT)
— Понимание принципов работы БД NoSQL и МПП
— Будет большим плюсом владение Apache Spark, Presto/Trino, Grafana, Kafka
AI Engineer - универсальный технический специалист (AI-first)
Asuri - B2B SaaS-платформа для AI-агентов, которые под контролем человека выполняют реальную работу через интеграции (Composio) и самообучаются: агент, доказавший себя, "повышается", и это доступно во всех будущих задачах.
Задачи
- Разобраться в продукте и кодовой базе, быстро стать самостоятельным
- Писать код через оркестрацию AI-агентов, а не автодополнение
- Помогать готовить и выкатывать релизы (dev → stage → prod)
- Построить с нуля бизнес-дашборды (выручка/расходы/маржа) — их пока нет, а без них не виден путь к окупаемости
Требования
- Реальный опыт разработки через AI-агентов (AI-first)
- Опыт с бизнес-автоматизациями (n8n/Zapier/Make или agentic-пайплайны)
- Крепкий фулстек на TypeScript/Node.js
- Опыт сборки дашбордов/аналитики
- Разговорный английский - обязательно
Плюсом: Claude Agent SDK или похожие агентные SDK, Composio, Stripe/usage-based биллинг, опыт в стартапах ранней стадии.
Стек: TypeScript, NestJS/Fastify, tRPC, Drizzle/Postgres, Next.js/React, Claude Agent SDK, Docker. Разработка ведётся AI-first - код пишется и ревьюится через оркестрацию агентов Claude Code.
Senior Fullstack Engineer (Python / React / LLM) (платформа Experts)
Мы делаем платформу для скаутинга и поддержки эксперта. Эксперт приходит через партнерскую сеть, проходит проверку по критериям, подписывает договор онлайн и заполняет структурированные формы о своей профессиональной деятельности. Из этих данных собираются базы, которые используют другие наши продукты.
Проект находится на стадии MVP. Первые эксперты должны начать пользоваться продуктом в августе 2026 года, первые клиенты ожидаются ориентировочно в сентябре. Бэклог на следующие 6–12 месяцев ещё формируется, поэтому задачи и приоритеты будут уточняться по мере тестирования продукта.
Ищем двух fullstack-инженеров: первый выходит на старте и закладывает архитектуру, второй присоединяется следом.
Задачи
Предстоит построить платформу с нуля: от регистрации партнера по реферальной ссылке до передачи данных об эксперте в смежные продукты.
1. Проектировать backend, API и структуру данных
2. Разрабатывать личные кабинеты партнера и эксперта на React: формы, прогресс, статусы, возврат на доработку
3. Делать админку: очередь заявок, оповещения, решения по экспертам
4. Собирать контур допуска партнера: видеоуроки, тест, доступ к работе
5. Вести договор в кабинете эксперта
6. Строить KYC-пайплайн на LLM: прием документов, извлечение данных, оценка по критериям, вердикт
7. Отвечать за качество LLM: промты, стабильность результата, разбор расхождений с решением администратора
8. Собирать из форм структурированные данные и отдавать их в смежные продукты через API
9. Строить очереди и фоновые процессы, деплоить и держать стабильность после релиза
Задачи приходят не как готовые технические задания, а как описание процесса и ожидаемого результата. Инженеру нужно самостоятельно уточнить ограничения, сравнить варианты реализации и выбрать решение, подходящее для текущего масштаба, а не для гипотетического. Часть требований к обработке данных на входе будет неполной — их предстоит уточнять вместе
#DWHразработчик #DWHвакансия #вакансия
DWH разработчик ❇️ | Компания ИТСтратегия
🔥 Мы в поиске DWH разработчика в консалтинговую ит компанию
Грейд: middle/Senior
Загрузка: фуллтайм
Оформление:ТК РФ, ИП, ГПХ, самозанятость
ЗП: готовы обговаривать индивидуально
✅ Требования
Уверенное владение SQL, Python
Понимание концепций проектирования DWH
Базовые навыки в области инженерии данных
Опыт работы с оркестраторами (Airflow, Prefect и др.)
Опыт разработки и поддержки etl-процессов
Опыт получения данных из различных типов API
Английский язык (на уровне чтения технической литературы).
📋Задачи
Участие в проектировании и разработке хранилищ данных для систем корпоративной отчетности
Разработка etl-процессов, их поддержка и оптимизация
Участие в R&D для выбора инструментов построения отдельных частей платформы данных
Разработка проектной документации
Привет, в m2 ищем MLE инженеров - у нас удаленка, но по рф(гибрид)(гражданство тоже рф, так как мы работаем с персухой).
Чем предстоит заниматься - нужно будет собирать ML/Data продукты из готовых компонент, выводить их в продуктив, базово следить за экономикой, работать с заказчиком, работать с данными, в обще строить то, что будет приносить пользу исползуя современные компоненты. В целом это не ДС позиция, а больше про то, чтобы довести до продашкена с нужным уровнем качества.
Присылайте резюме @krivdathetriewe ,а чуть позже я выложу более подробное и красивое описание.
Ищем лидера для двух небольших команд data engineering и аналитики, суммарно до 10 человек. Это не greenfield и не роль «поставить красивые дашборды». У нас уже есть работающий, но неоднородный контур: ClickHouse, Kafka, dbt, Airflow/MWAA, AWS, GitLab CI, продуктовая аналитика в PostHog, внешние источники и витрины для продукта, финансов и антифрода. Он растёт быстрее, чем успевают закрепляться контракты, владение и правила эксплуатации. Нужен человек, который наведёт в этом порядок и затем сможет устойчиво развивать команды.
Чем предстоит заниматься
-Вести data engineering и analytics: цели, приоритеты, качество результата, развитие людей
-Описать и закрепить понятные контракты данных: источник, схема, ключи, временная семантика, дедупликация, backfill, SLA и владелец
-Сделать поставку данных предсказуемой: CI/CD для dbt и DAG, контроль версий, проверки до публикации, наблюдаемость и понятные разборы инцидентов
-Довести до эксплуатационного уровня витрины и ingestion-пайплайны на Kafka, ClickHouse, dbt и Airflow
-Выстроить data quality: сверки источника и витрин, идемпотентность, обработка поздних событий, reconciliation и тесты на критичных данных
-Свести потребности продукта, маркетинга, биллинга и антифрода в прозрачную модель приоритетов, а не в бесконечный поток разовых выгрузок
-Самому погружаться в сложные технические узлы, ревьюить решения и поднимать планку инженерной работы команды
Что важно
-Опыт руководства небольшой технической командой или сильного технического лидерства в data-направлении
-Уверенный SQL и практический опыт с ClickHouse: производительность, партиционирование, репликация, дедупликация, materialized views, Kafka Engine
-Опыт с Kafka, dbt и Airflow; понимание эксплуатации пайплайнов, а не только написания SQL-моделей
-Умение разбирать легаси-контур по фактам: код, схемы, логи, данные, потребители, стоимость и риски
-Опыт проектирования витрин для продуктовой, финансовой или риск-аналитики
-Умение превращать размытый запрос в проверяемый контракт и доводить его до работающего результата
-Нормальная управленческая зрелость: давать ясную обратную связь, не прятать проблемы, не подменять результат статусами и презентациями
-Опыт и культура code review: читать и разбирать чужой код, держать инженерные стандарты и качество командных решений
Кому не подойдёт
-Человеку, который хочет управлять большой функцией, не работая с платформой руками
-Аналитику, для которого data engineering заканчивается на постановке задачи
-Инженеру, который считает документацию, качество данных и договорённости необязательной бюрократией
-Кандидату, которому нужен идеальный greenfield вместо сложной, но живой системы
Что можно сделать в первый год
-Зафиксировать границы владения командами и критическими контурами
-Убрать непрозрачные и дублирующиеся поставки данных
-Ввести единый минимальный стандарт для новых источников, витрин, backfill и проверок качества
-Сделать состояние ключевых пайплайнов и данных наблюдаемым
-Сформировать самостоятельную команду, которой не нужен постоянный ручной контроль фаундера
Мы предлагаем
-Полностью удалённую работу из любой точки мира.
-Современное корпоративное оборудование.
-Работу над продуктом с реальной нагрузкой и масштабом.
-Влияние на ключевые продуктовые метрики через рекомендации
Senior ML Engineer с опытом в обучении генеративных моделей: TTS, LLM, CV
Кто мы
Команда синтеза речи (text-to-speech). Мы занимаемся генерацией звука, развиваем свои модели, экспериментируем с архитектурами, красим метрики в зеленый.
Кого ищем
Senior ML engineer с опытом в обучении генеративных моделей: TTS, LLM, CV.
Чем предстоит заниматься
Эксперименты с LLM-based моделями TTS, voice cloning, speech2speech LLM, токенизаторами звука, RL. Обычно комбинируем идеи из разных статей, предлагаем свое, проверяем гипотезы. Пробуем совсем новые подходы почти с нуля.
Будет плюсом
- Опыт обучения мультимодальных LLM.
- Опыт снижения стоимости контекста при обработке видео.
- Опыт расширения контекста LLM.
- Понимание RL-подходов для обучения моделей: RLHF / RLVR, PPO / GRPO / DPO.
- Опыт построения бенчмарков с использованием LLM-as-a-judge.
Условия
- Крупнейшее DS&AI community — более 600 DS-специалистов банка.
- Дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира.
- Возможность быть соавтором НИРов и статей для международных конференций.
- Возможность выбрать удобный формат работы: гибрид или офис.
- Ежегодный пересмотр зарплаты, годовая премия.
- Корпоративный спортзал и зоны отдыха.
- Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
- Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
- Ипотека выгоднее до 7% для каждого сотрудника.
- Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров.
- Вознаграждение за рекомендацию друзей в команду Сбера.
Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.
Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.
Чем предстоит заниматься
- Разрабатывать и улучшать методы online RL.
- Реализовывать и дорабатывать подходы post-training и online RL.
- Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин.
- Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач.
- Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру.
- Строить и развивать инфраструктуру обучения.
- Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели.
- Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций.
- Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест.
- Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять.
- Работать с данными и системой оценки качества.
- Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки.
- Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек.
- Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения.
- Работать в сильной команде.
- Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры.
- Брать на себя ответственность за целые куски системы: от идеи до результата в проде.
- Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.
Для нас важно
- Отличное владение Python и PyTorch.
- Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.
- Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы.
- Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.
- Умение писать чистый, надёжный, production-ready код.
- Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.
- Будет плюсом.
- Опыт работы с reward-моделями, process reward models, LLM-as-a-judge.
- Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
- Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.).
- Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.).
- Публикации, open-source вклад или сильный прикладной track record.
Что предлагаем
- Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
- Прямое влияние на качество модели: результаты твоей работы видны в бенчмарках и в продукте.
- Команду сильных инженеров и исследователей, у которых есть чему поучиться.
- Возможность совмещать инженерную и исследовательскую работу.
- Конкурентную компенсацию, премии и расширенный соцпакет.
🧠😘😀😘😘🥰😀🫢
Middle Data Scientist
Гражданство: РФ
Вилка: 180-200
Загрузка: Fulltime
Длительность: Долгосрочный проект
Основные требования
Развертывание и поддержка LLM-платформы в Kubernetes (Helm, Terraform, K8s Operators)
Настройка CI/CD для ML/AI сервисов (обучение, inference, data pipelines)
Автоматизация ML workflow в Kubeflow
Настройка и поддержка мониторинга моделей (latency, drift, cost metrics)
Управление пайплайнами данных для обучения и inference (Kafka, DataLake, объектное хранилище S3, векторные БД)
Оптимизация работы GPU-кластера (распределённое обучение, эффективное использование ресурсов)
Обеспечение безопасности и комплаенса: изоляция сред, контроль доступа, логирование
Задачи на проекте
Опыт работы с Kubernetes и облачными/on-prem кластерами
Знание Python и инструментов ML Ops (Kubeflow, Airflow)
Опыт настройки CI/CD (Jenkins)
Опыт работы с системами хранения и векторными БД (Weaviate/Qdrant/PGVector)
Знания в области мониторинга и логирования (Prometheus, Grafana, ELK, OpenTelemetry)
Понимание принципов работы LLM/GenAI и RAG-систем будет плюсом
Направить CV
@EkaterinaLiberman
Смотрите также в каталоге
Хотите персональную подборку?
Введите свои критерии — мы отфильтруем вакансии по вашим требованиям
Найти подходящие вакансии →