fortebank

Middle-Senior DevOps Engineer (Python)

Установка, настройка и поддержка GPU-серверов и Kubernetes-кластеров под AI-нагрузки.

fortebank На сервисе с: 08.10.26 12:30

Зарплата не указанаКазахстанАстанаОфис

Обязанности:

  • Установка, настройка и поддержка GPU-серверов и Kubernetes-кластеров под AI-нагрузки.
  • Деплой и сопровождение сервисов инференса моделей (API-шлюзы, балансировка, TLS).
  • Мониторинг доступности и производительности; реагирование на инциденты 24/7.
  • Управление ресурсами: квоты, шедулинг GPU, планирование мощностей.
  • Обновление драйверов, CUDA, ОС и компонентов кластера без простоя сервисов.
  • Настройка и контроль резервного копирования, план DR.
  • Документирование конфигураций, runbook'и для типовых инцидентов.
  • Взаимодействие с ML-командой: помощь с окружениями, доступами, диагностикой проблем производительности.

Требования:

  • Операционные системы и виртуализация
  • Уверенное администрирование Linux (Ubuntu/Debian, RHEL/Rocky): systemd, сети, планирование ресурсов, диагностика производительности (perf, htop, iostat, dmesg).
  • Опыт работы с виртуализацией и контейнеризацией: Docker, containerd, желательно KVM/Proxmox/VMware. Kubernetes и оркестрация
  • Практический опыт эксплуатации Kubernetes в production: деплой, отладка, RBAC, NetworkPolicy, Ingress/Gateway API.
  • Понимание апстрим-сетевого стека: CNI (Calico/Cilium), LB, e — опыт с Envoy Gateway/NGINX Ingress как плюс. Helm, Kustomize; GitOps-подходы (ArgoCD/Flux) — желательно.
  • GPU-инфраструктура (ключевой блок)
  • Опыт администрирования серверов с NVIDIA GPU: установка драйверов, CUDA toolkit, NVIDIA Container Toolkit, диагностика (nvidia-smi, dcgm).
  • Понимание механизмов распределения GPU в Kubernetes: device plugin, MIG, time-slicing, GPU Operator.
  • Знание особенностей GPU-нагрузок: память VRAM, NVLink, RDMA/InfiniBand (для multi-node обучения) — как плюс.
  • Сети и хранение
  • Основы сетей: TCP/IP, DNS, TLS, балансировка, firewall.
  • Опыт с системами хранения: NFS, Ceph/Longhorn/local-path, S3-совместимые хранилища (MinIO).
  • Понимание требований ML-нагрузок к дискам и сети (пропускная способность при загрузке моделей и датасетов).
  • Автоматизация и IaC
  • Скриптинг: Bash, Python на уровне автоматизации рутинных задач.
    Infrastructure as Code: Ansible и/или Terraform.
  • Опыт работы с Git.
  • Мониторинг и надёжность
  • Стек наблюдаемости: Prometheus + Grafana (включая GPU-метрики DCGM Exporter), логирование (Loki/ELK), алертинг (Alertmanager).
  • Понимание SLO/SLA, практика работы с инцидентами, резервное копирование и восстановление.
  • Информационная безопасность
  • Базовый харденинг ОС, управление доступом (SSH-ключи, sudo, LDAP/SSO), secrets management (Vault, Sealed Secrets и аналоги).
  • Обновление ПО и управление уязвимостями.

Став частью команды Forte, ты получишь:

  • Конкурентную заработную плату и бонусы за персональную эффективность;
  • График работы 5/2 с 9:00-18:00 в комфортном офисе;
  • Жизнь внутри компании с ее корпоративными мероприятиями: тимбилдинги, челленджи, спортивные турниры, благотворительные акции;
  • Заботу о здоровье с медицинским страхованием, а также DayOff в честь дня рождения и за выслугу лет;
  • Выгодную рассрочку в крупные фитнес-клубы;
  • Доступ к корпоративной библиотеке для непрерывного обучения и саморазвития.

Похожие вакансии DevOps

hh.ru
банк псб, ит

DevOps-инженер (ML/AI, DevSecOps, MLSecOps)

банк псб, итНа сервисе с: 03.08.26 17:33↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваГибрид

В Блоке Информационной безопасности в Департаменте координации защиты информации в Управлении безопасности инфраструктуры открыта вакансия для DevOps-инженера (ML/AI, DevSecOps, MLSecOps)

Ключевые задачи:

  • Проектирование и сопровождение инфраструктуры для обучения и инференса ML и LLM-моделей
  • Автоматизация CI/CD пайплайнов разработки ПО и DataScience-команды: сборка ПО, тестирование, сборка образов, тестирование моделей, деплой в различные окружения
  • Работа с GPU-инфраструктурой и управление on-premise GPU-серверами: настройка драйверов ОС, мониторинг, оптимизация использования ресурсов
  • Внедрение практик DevSecOps: сканирование уязвимостей в контейнерах (Trivy), SAST/DAST, управление секретами (HashiCorp Vault), политики сетевой безопасности
  • Обеспечение безопасности ML и AI-пайплайнов (MLSecOps): защита данных, контроль доступа к моделям, мониторинг дрейфа и аномалий
  • Мониторинг и логирование инфраструктуры и приложений (Prometheus, Grafana)

Что важно для нас:

  • Опыт администрирования и уверенное владение Linux (AstraLinux)
  • Навыки разработки скриптов автоматизации (bash, python)
  • Опыт конфигурирования и сопровождения СУБД (postgres, clickhouse)
  • Уверенное владение Docker, опыт построения CI/CD (GitLab CI / Jenkins / GitHub Actions)
  • Понимание основ безопасности: управление доступом, сетевые политики, принципы минимальных привилегий
  • Опыт работы с GPU-инстансами, опыт работы с системами мониторинга (Prometheus, Grafana)
  • Базовое понимание жизненного цикла ML-моделей: разница между обучением и инференсом, работа с фреймворками (PyTorch/TensorFlow)
  • Понимание основных элементов AI-инфраструктуры (инфраструктура LLM, AI-агенты, MCP-серверы)
  • Готовность разбираться в требованиях AI-инженеров и ML-разработчиков (DataScience) и предлагать инфраструктурные решения

Будет преимуществом:

  • Опыт конфигурирования кластеров Kubernetes (helm, операторы, написание манифестов)
  • Опыт использования систем управления конфигурацией и знакомство с Infrastructure as code (Ansible, terraform и т.п.)
  • Опыт развертывания и обслуживания LLM (Large Language Models) в продуктивных средах (vLLM, HuggingFace)
  • Мониторинг производительности LLM
  • Знание инструментов MLOps: MLflow, DVC
  • Практический опыт внедрения DevSecOps/MLSecOps

Что предлагаем:

  • Официальное оформление в соответствии с ТК РФ
  • График работы: 5/2 с 9:00 до 18:00, сокращенный рабочий день по пятницам до 16:45.
  • Гибридный формат работы после испытательного срока (1 день в неделю удаленно)
  • Конкурентный уровень дохода
  • Доплата к отпуску и больничному листу
  • «Кафетерий льгот»: ДМС для работника и членов семьи, возмещение затрат на отдых, спортивные услуги, покупки на маркетплейсе «ПСБ Маркет»
  • Дополнительные льготы при заключении брака и рождении детей
  • Материальная поддержка в определенных жизненных ситуациях
  • Бесплатная программа поддержки работников: юридические, финансовые и психологические консультации, помощь в бытовых вопросах, автопомощь, корпоративные скидки, профориентация детей работников
  • Возможность профессионального развития и прохождения внутреннего и внешнего профессионального обучения
  • Корпоративная паритетная пенсионная программа
hh.ru
банк псб, ит

Стажер DevOps-инженер

банк псб, итНа сервисе с: 08.10.26 13:26
Зарплата не указанаРоссияМоскваГибрид
Ключевые задачи:
  • Развитие и поддержка механизмов автоматизированной поставки (CI/CD) на базе GitLab CI
  • Сборка и отладка релизов, их установка на контурах систем Банка
  • Автоматизация рутинных операций по развёртыванию
  • Настройка прикладной части на новых серверах
  • Работа с командами разработки и тестирования
  • Участие в подготовке документации
Что важно для нас:
  • Обучение на ИТ-специальности
  • Знание основ операционной системы Linux
  • Знание основ компьютерных сетей
  • Умение писать простые скрипты на Python и Bash
  • Способность читать техническую документацию на английском языке
  • Будет плюсом опыт работы с Docker, Ansible и Nginx, а также знакомство с системами мониторинга и тестирования API
Что предлагаем:
  • Стажировка длительностью 12 месяцев
  • График работы – 40 часов в неделю
  • Оплата – 90 000 до вычета налогов
  • Возможность дальнейшего трудоустройства
  • Комьюнити стажеров
  • Поддержка опытного наставника
  • Доплата к отпуску и больничному листу
  • Дополнительные льготы при заключении брака и рождении детей
  • Социальная поддержка при сложных жизненных ситуациях
  • Льготное кредитование для сотрудников
  • Обучение в корпоративном университете банка
  • Корпоративная библиотека
Соц.сети
R

SRE-инженер

rambler_co_портал_рамблерНа сервисе с: 08.10.26 13:14
Зарплата не указанаНе указана странаЛокация не указанаГибрид

#senior #удаленка #гибрид #офис

Rambler&Co Портал "Рамблер"
SRE-инженер
Опыт работы: более 6 лет
Полная занятость
График: 5/2
Формат работы: на месте работодателя, удалённо или гибрид

☑️ Чем предстоит заниматься
-Обеспечивать работоспособность и доступность проектов
-Разбирать инциденты и улучшать доступность проектов
-Оптимизировать, улучшать и внедрять новые практики
-Разрабатывать инструменты для автоматизации
-Работать в команде, уметь делиться опытом и перенимать его у коллег

☑️ Наши пожелания к кандидатам
-Уверенное знание linux
-Уверенное знание bash
-Опыт работы с любой системой управления конфигурациями
-Опыт работы с CI/CD инструментами
-Понимание основ стека TCP/IP
-Опыт работы с одним и более продуктом: Saltstack, Ansible, Docker, Nginx
-Уметь работать с git
-Опыт настройки файрвола
-Будет плюсом:
-Знание Kubernetes, LXC, Prometheus
-Знание Python/Golang или любого другого языка
-Умение отладки через strace и tcpdump

Контакты: •••••••• / Telegram ••••••••

🔥 •••••••• / •••••••• / ••••••••

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.