сбер

Senior DevOps LLM (Инвестиционный бизнес)

сбер · На сервисе с: 12.06.26 17:45

↑ Вакансия с автоподнятием
Зарплата не указанаРоссияг Москва

Мы разрабатываем систему, которая автоматизирует весь жизненный цикл инвестиционной сделки. Наши команды работают над следующими направлениями:

  • алгоритмизированный и AI поиск потенциальных сделок и клиентов
  • управление процессом заключения инвестиционных сделок
  • финансовые расчеты и оценка портфеля
  • построение финансовой и управленческой отчетности по портфелю инвестиций Сбера
  • инвестиционные сервисы для компаний - наших клиентов.

Наша инвестиционная платформа ЮЛ в Сбер - это уникальная разработка на российском рынке для выдачи и сопровождения инвестиционного финансирования юридическим лицам. Такие сделки имеют большое значение для российской экономики, и о них пишут в новостях.

Вы будете работать с микросервисной архитектурой (Kubernetes, Docker, Istio, Kafka).

Мы используем specififcation-driven подход к разработке и активно развиваем эту методологию внутри Сбера.

  • развертывание и конфигурация Open Source LLM (DeepSeek, Qwen и др.) на собственных мощностях

  • настройка высокопроизводительных инференс-серверов (vLLM, TGI, TensorRT-LLM, llama.cpp)

  • оптимизация использования GPU (память, батчинг, quantization) для достижения требуемой пропускной способности и задержек (latency)

  • настройка систем observability для слоя инференса: сбор метрик (количество запросов, время генерации, использование VRAM, throughput, количество активных потоков/запросов)

  • реализация health checks (ready/live probes) для инференс-серверов

  • автоматизация оповещений (alerts) при деградации производительности или падении сервисов

  • настраивать сквозную трассировку (trace_id) по всей цепочке сервисов: от пользовательского интерфейса до агентов и инфраструктуры

  • развивать дашборды в Grafana для мониторинга агентов, инфраструктуры и ключевых компонентов платформы

  • внедрять кастомные метрики для агентов (запросы, статус, P95, LLM-вызовы, токены) без изменения кода агентов

  • обеспечивать корреляцию логов и трейсов для быстрого поиска инцидентов

  • настраивать алерты: технические (Pod OOM, память, ошибки) и качественные (satisfaction rate, регрессии)

  • работать с централизованным Prompt Hub для хранения и обновления промптов без деплоя

  • автоматизировать интеграцию E2E-тестов с системой трассировки

  • поднятие и конфигурация бэкенд-серверов для работы агентов (FastAPI, Node.js или других runtime)

  • контейнеризация (Docker) и оркестрация (Kubernetes / Docker Compose) компонентов системы

  • управление окружениями (dev/stage/prod) и CI/CD пайплайнами для доставки кода агентов и обновлений инфраструктуры

  • разработка агентов в структурированном формате Markdown, следуя принципам Claude/Harness Engineering (явное описание инструментов, контекста, последовательности действий)

  • создание системных промптов, определения инструментов (tools/functions) и четких границ поведения агента

  • интеграция агентов с внешними API, базами данных и DevOps-инструментами (Kubernetes, AWS, CI/CD)

  • разработка и поддержка пайплайнов CI/CD

  • внедрение новых инструментов для автоматизации и мониторинга

  • взаимодействие с командами разработки, тестирования и эксплуатации.

  • опыт развертывания и сопровождения Open Source LLM в продакшене

  • глубокое практическое знание инструментов инференса: vLLM, TGI (Text Generation Inference) или аналогичных (TensorRT-LLM, sglang)

  • понимание внутренних механизмов LLM инференса: KV-cache, continuous batching, quantization (GGUF, GPTQ, AWQ)

  • опыт написания агентов/промптов в продакшн-среде, знакомство с концепцией Harness Engineering (или готовность быстро в нее погрузиться)

  • уверенное владение Python (написание сервисов, скриптов мониторинга, интеграций)

  • экспертный опыт работы с контейнеризацией (Docker)

  • опыт управления кластерами Kubernetes: написание и поддержка манифестов, работа с Helm (чарты)

  • опыт построения и поддержки пайплайнов в Jenkins, GitLab CI

  • уверенная работа с Git (стратегии ветвления, код-ревью)

  • опыт работы с СУБД (PostgreSQL, ClickHouse или аналогичными) в контексте высоконагруженных систем

  • опыт построения observability-стека для микросервисных или агентных систем

  • навыки настройки сквозной трассировки, метрик, логирования и алертинга

  • уверенное владение инструментами: Grafana, Prometheus, Loki, Jaeger, OpenTelemetry

Будет плюсом:

  • опыт работы с фреймворками для агентов (LangChain, LlamaIndex, AutoGen, или собственные решения)

  • знание подходов к fine-tuning и evaluation LLM (например, LoRA/QLoRA, использование Axolotl или Unsloth; оценка качества через MMLU, HumanEval, ROUGE, BERTScore, фреймворки DeepEval или LM Evaluation Harness)

  • опыт управления GPU-инфраструктурой (NVIDIA A100/H100, L40S, работа с MIG, vGPU)

  • навыки администрирования Linux (сети, файловые системы,работа с драйверами NVIDIA).

  • комфортный современный офис рядом с м. Ленинский проспект, ул. Вавилова 19, формат работы - гибрид

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная програма

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Похожие вакансии DevOps

hh.ru
eyes of wonder software llc

Senior DevOps Engineer

eyes of wonder software llcНа сервисе с: 20.08.26 10:51
Зарплата не указанаРоссияМоскваОфис

Хэллоу!

Мы ищем Senior DevOps Engineer для Multilogin. Наша DevOps-практика сейчас в стадии трансформации: мы модернизируем инструменты, процессы и подходы к работе по всей команде, и у тебя будет ключевая роль в том, как это будет развиваться.

Multilogin создает цифровые аватары — браузерные и мобильные профили с уникальными цифровыми отпечатками, локацией и параметрами, которые выглядят как отдельные устройства. Они позволяют управлять десятками аккаунтов в соцсетях, e-commerce и других онлайн-платформах, создавая отдельные цифровые личности для людей, компаний и AI-агентов. Multilogin создает аватары для всех. И для всего.

Чем предстоит заниматься:

График работы: офис, 5/2, с 9-00 до 18-00 (по МСК)

  • Разрабатывать автоматизированные пайплайны для сборки, тестирования и деплоя приложений; создавать, поддерживать и документировать CI/CD-окружения
  • Обеспечивать надёжность и доступность платформы, отказоустойчивость и быстрое восстановление после сбоев
  • Устанавливать стандарты и гайдлайны по конфигурации инфраструктуры и ПО для гладких CI/CD-процессов
  • Предлагать и внедрять улучшения системы: установка, апгрейды/патчинг, разрешение проблем, конфигурейшн-менеджмент и безопасность
  • Участвовать в развитии и масштабировании инфраструктуры нашей delivery-платформы
  • Обеспечивать прозрачность и оптимизацию облачных затрат, встраивать cost-awareness в ежедневную работу вместе с инженерами и финансами
  • Проектировать и эксплуатировать serverless-архитектуры (AWS Lambda, Step Functions, API Gateway или аналоги)
  • Участвовать в трансформации DevOps-практики и обсуждениях трейд-оффов между производительностью, масштабируемостью, стоимостью и time-to-market

Мы предлагаем:

  • Трансформация зрелого продукта с сильной репутацией под реалии мира AI

  • Сильная продуктовая и инженерная экспертиза: над продуктом работает команда с большим опытом автоматизации браузеров и мобильных профилей

  • Доступ к лучшим AI инструментам для повышения эффективности работы

  • Компенсация расходов на профессиональное развитие (профильные курсы, обучение, книги, конференции) в рамках политики обучения компании

  • 28 рабочих дней оплачиваемого отпуска + оплачиваемые больничные

Что мы ожидаем:

  • Продакшн-опыт на одном из крупных облаков (предпочтительно AWS) с Kubernetes, Helm и Docker
  • Уверенное владение Terraform: инфраструктура как версионируемый код
  • Построенные и поддерживаемые CI/CD-пайплайны (GitHub Actions или аналог) и понимание GitOps-доставки
  • Опыт эксплуатации стеков мониторинга и алертинга (Prometheus/Grafana или аналог) и понимание, как выглядит хорошая надёжность
  • Практический опыт с distributed tracing (OpenTelemetry, Jaeger или аналог) и умение внедрять их для более глубокой наблюдаемости
  • Системное мышление: понимание основ сетей, распределённых вычислений и асинхронного обмена сообщениями; автоматизация на Bash и Python вместо повторения рутины
  • Ownership: ты берёшь ответственность за пределами своей задачи и докапываешься до первопричины проблемы в стеке
  • AI-forward подход: ты используешь AI-инструменты руками и имеешь позицию, в чём они сильны, а где пока пасуют — воспринимаешь их как усилитель для senior-инженера, а не как игрушку
  • Cвободный английский от B2

Multilogin - продукт компании Eyes of Wonder, стартап-студии, более 10 лет создающей успешные IT продукты в сфере браузерных и мобильных технологий, веб-автоматизации и AI. Сейчас у нас 3 активных инструмента, которыми пользуются более 20 000 клиентов по всему миру

hh.ru
К

Руководитель управления платформенной инженерии

крупная российская компания с развитым бизнесом и собственными it-решениямиНа сервисе с: 20.08.26 10:27
Зарплата не указанаРоссияМоскваУдалёнка

Крупная российская компания с развитым бизнесом и собственными IT-решениями. Мы создаём и развиваем цифровые продукты, автоматизируем бизнес-процессы и внедряем современные технологии.Работаем над масштабными задачами, где IT напрямую влияет на развитие бизнеса.
Мы ищем сильного технологического лидера, который возглавит управление платформенной инженерии и сформирует надёжную, масштабируемую и предсказуемую платформу для наших продуктов. Роль предполагает стратегическое и операционное управление инженерными решениями, выстраивание функций DevOps, SRE, DBA, а также кросс‑функциональное лидерство в ИТ‑домене.
Вы будете отвечать за архитектуру и эксплуатацию приложений в микросервисной среде, межсервисную авторизацию, интеграционные механизмы, единую модель данных и управление техническим долгом. Ключевая цель — обеспечить надёжность, масштабируемость и экономическую эффективность платформенных решений.

Чем предстоит заниматься

  • Выбирать и обосновывать архитектурные и инфраструктурные решения для эксплуатации приложений на микросервисной архитектуре, включая межсервисную авторизацию и механизмы отказоустойчивости
  • Выстраивать в компании функции DevOps, SRE и DBA: процессы, метрики, SLA, инструменты и практики
  • Прорабатывать архитектуру API, событийной модели и межсистемных интеграций, обеспечивая согласованность и предсказуемость взаимодействий
  • Реализовывать и поддерживать единую модель товарных данных как ключевую часть платформенной стратегии
  • Управлять инженерными решениями, техническим долгом, надёжностью и масштабируемостью систем; внедрять практики, снижающие риски и повышающие устойчивость платформы
  • Формировать технологический roadmap, управлять зависимостями между командами и инициативами, синхронизировать планы с бизнес‑приоритетами
  • Участвовать в формировании ИТ‑бюджета, расчёте TCO и принятии решений по стратегии «build / buy / reuse»
  • Обеспечивать технологическое лидерство кросс‑функциональных ИТ‑команд домена: ставить технические цели, согласовывать подходы, контролировать качество и сроки реализации

Нам важно

  • Опыт руководства инженерной командой от 3 лет, опыт управления платфорненными или инфраструктурными направлениями
  • Глубокое понимание микросервисной архитектуры, принципов отказоустойчивости, наблюдаемости (observability), CI/CD и практик DevOps/SRE
  • Опыт проектирования и внедрения API, событийных моделей и межсистемных интеграций
  • Практический опыт работы с базами данных и понимание роли DBA в платформенной команде
  • Умение формировать технологический roadmap, оценивать TCO, обосновывать выбор между разработкой, покупкой и переиспользованием решений
  • Навыки работы с ИТ‑бюджетом и приоритизацией инициатив на основе бизнес‑ценности и технических рисков
  • Способность вести кросс‑функциональные команды, договариваться и транслировать технические решения бизнесу

Мы предлагаем

  • Конкурентную заработную плату — уровень дохода обсуждаем индивидуально с учётом опыта и экспертизы
  • ДМС — заботимся о здоровье сотрудников и предоставляем расширенные программы
  • Обучение и развитие — доступ к курсам, профессиональным программам и внутреннему обучению
  • Карьерный рост — возможности развиваться в своей специализации и переходить на новые направления
  • Интересные IT-задачи — участие в проектах, которые напрямую влияют на развитие крупного бизнеса
  • Современный стек и технологии — возможность работать с актуальными инструментами и подходами
  • Гибкий формат работы — обсуждаем удобный формат взаимодействия в зависимости от позиции и задач
  • Сильная команда — работа с опытными специалистами из IT и смежных бизнес-направлений
  • Стабильность — крупная компания с масштабными проектами и долгосрочными планами развития
  • Корпоративные бонусы — скидки на продукцию компании и дополнительные программы для сотрудников
  • Комфортные условия работы — современная рабочая среда, необходимые инструменты и всё для эффективной работы
Соц.сети
A

DevOps-инженер

aya_gamesНа сервисе с: 20.08.26 10:15
250k–400k ₽Не указана странаЛокация не указанаУдалёнка

Публикатор: Anthea
Обсуждение: @devops_jobs
#вакансия

Формат работы: удаленка
Занятость: полная
Зарплатная вилка: от 250 000 до 400 000 рублей на руки
Название компании: Aya Games

Привет! Мы разрабатываем Riorise — мобильную MMO RPG. Мы ищем DevOps-инженера, который поможет нам развивать и поддерживать инфраструктуру компании.

Чем предстоит заниматься:
— Поддерживать и развивать инфраструктуру на основе контейнеров (Docker, Kubernetes/аналогичные решения).
— Настраивать CI/CD-процессы для сервисов и автоматизацию рутинных операций.
— Следить за стабильностью и наблюдаемостью систем: метрики, логи, алерты.
— Управлять сетями и понимать, как они устроены: роутинг, балансировка, доступы.
— Участвовать в оптимизации производительности и повышении отказоустойчивости.

Нам важно:
— Опыт работы на позиции DevOps инженера от 5 лет.
— Опыт работы с Linux-серверами и базовые админские навыки.
— Хорошее понимание работы сетей и связанных инструментов.
— Уверенные знания Docker и опыт оркестрации контейнеров (Kubernetes, Docker Swarm, Nomad).
— Навыки настройки систем мониторинга и логирования (Prometheus, Grafana, Loki, ELK или аналоги).
— Понимание принципов CI/CD (GitLab CI, GitHub Actions или другие системы).
Опыт работы с базами данных (MySQL/PostgreSQL) будет плюсом.

У нас:
— Полностью удаленная работа;
— Гибкий график — ориентируемся на результат, а не на часы;
— ДМС после испытательного срока;
— Большая свобода в тестировании гипотез, форматов и подходов;
—Команда, ориентированная на быстрые итерации и масштабирование успешных решений.

Контакты: @aya_games_hr

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.