- Поддержка production-кластера OpenStack в режиме 24/7: мониторинг, реакция на алерты, разбор инцидентов;
Неизвестный работодатель · На сервисе с: 11.08.26 15:38
Задачи:
Эксплуатация и поддержка кластера:
- Поддержка production-кластера OpenStack в режиме 24/7: мониторинг, реакция на алерты, разбор инцидентов;
- Диагностика и устранение сбоев на всех уровнях: вычислительные узлы (Nova), сети (Neutron), хранилища (Cinder/Ceph), аутентификация (Keystone), образы (Glance);
- Восстановление сервисов после падений: перезапуск агентов, failover контроллеров, восстановление БД;
- Анализ логов всех компонентов OpenStack и связанной инфраструктуры для выявления root cause;
- Написание и актуализация runbooks - пошаговых инструкций для команды поддержки по типовым и аварийным сценариям.
Производительность и оптимизация:
- Тюнинг производительности OpenStack: оптимизация расписания Nova (scheduler filters, weights), настройка NUMA, CPU pinning, hugepages для ВМ;
- Оптимизация сетевого стека: настройка OVS/OVN, VXLAN offloading, DPDK, SR-IOV для снижения latency;
- Оптимизация хранилищ: тюнинг Ceph (CRUSH map, pg_num, osd_memory_target), настройка multi-backend Cinder, выбор правильного типа томов (SSD/HDD/NVMe);
- Capacity planning: прогнозирование роста ресурсов, анализ трендов потребления CPU/RAM/Storage/Network.
Развёртывание и миграция:
- Развёртывание кластера OpenStack с нуля: проектирование архитектуры, установка, настройка всех сервисов (vanilla или через дистрибутив - Charmed, RHOSP, Mirantis);
- Апгрейд/обновление существующего кластера между версиями OpenStack (например, Yoga → Zed → Antelope) с минимальным downtime;
- Миграция виртуальных машин и данных с VMware vSphere/ Hyper-V/других платформ на OpenStack;
- Расширение кластера: добавление новых вычислительных узлов, контроллеров, хранилищ без прерывания работы сервисов.
Сети и безопасность:
- Проектирование и настройка сетевой топологии в Neutron: tenant networks, provider networks, VLAN/VXLAN, floating IPs, security groups;
- Настройка и отладка L3-агентов, DHCP-агентов, metadata-агентов, LBaaS (Octavia);
- Настройка firewall'ов и сетевой сегментации между проектами/тенантами;
- Интеграция с внешними сетями: BGP, EVPN, физические коммутаторы, аплинки;
- Диагностика сложных сетевых проблем: потеря пакетов, asymmetric routing, ARP-флуд, MTU mismatch, conntrack overflow.
Хранилища и резервное копирование:
- Эксплуатация Ceph-кластера: мониторинг здоровья, rebalance, замена вышедших из строя дисков/узлов, масштабирование;
- Управление блочными томами Cinder: создание типов томов, multi-backend, QoS, encryption;
- Настройка резервного копирования ВМ и томов (например, через Cinder backup, Ceph snapshots, или сторонние инструменты);
- Восстановление данных из бэкапов: откат ВМ, восстановление томов, восстановление БД OpenStack.
Автоматизация и инфраструктура как код:
- Написание Ansible-плейбуков для автоматизации рутинных операций: развёртывание узлов, обновление конфигураций, массовые изменения;
- Управление инфраструктурой через Terraform: создание проектов, сетей, ВМ, балансировщиков как код;
- Автоматизация CI/CD для инфраструктурных изменений: pipeline'ы для тестирования и деплоя конфигураций;
- Разработка скриптов (Python/Bash) для интеграции с API OpenStack, автоматизации биллинга, отчётности.
Мониторинг и observability:
- Построение и поддержка системы мониторинга: Prometheus + Grafana/Zabbix — настройка экспортёров, создание дашбордов, настройка алертов;
- Централизованное логирование: настройка сбора логов со всех компонентов OpenStack в ELK/EFK/Loki;
- Настройка алертинга: определение пороговых значений, настройка escalation, интеграция с PagerDuty/OpsGenie/Slack;
- Проведение анализа инцидентов: корреляция метрик, логов и трейсов для определения root cause;
- Chaos Engineering: планирование и проведение тестов отказоустойчивости (отключение узлов, сетевых линков, дисков).
Безопасность и compliance:
- Управление доступом через Keystone: настройка доменов, проектов, ролей, интеграция с LDAP/AD;
- Аудит и логирование действий пользователей (Ceilometer/Aodh/сторонние решения);
- Настройка шифрования: TLS для API-endpoint'ов, шифрование томов Cinder, шифрование сетевого трафика;
- Управление уязвимостями: патчинг ОС и компонентов OpenStack, реакция на CVE.
Взаимодействие и документирование:
- Коммуникация с заказчиками/внутренними командами: консультации по архитектуре, разбор обращений, эскалация багов вендорам;
- Взаимодействие с вендорами (Red Hat, Canonical, Mirantis): оформление тикетов, предоставление диагностических данных, координация исправлений;
- Написание технической документации: архитектурные схемы, инструкции, post-mortem анализов, рекомендации по улучшению;
- Менторинг middle/junior инженеров: code review, обучение, проведение техдолгов.
Проектирование и архитектура:
- Проектирование отказоустойчивой архитектуры OpenStack: HA-контроллеры, резервирование сетей, Ceph с replication factor 3, multi-region;
- Выбор технологического стека: SDN (OVS vs OVN vs Tungsten Fabric), хранилища (Ceph vs LVM-NFS), гипервизор (KVM vs Xen);
- Оценка рисков при изменениях инфраструктуры и планирование rollback-стратегий;
- Оптимизация затрат: right-sizing ВМ, автоматическое выключение неиспользуемых ресурсов, анализ utilization.
О проекте:
Крупная телеком компания
Локация: Россия
Время работы: UTC+3 (+-3 часа)
Гражданство: РФ
Формат: Удаленно
Срок привлечения: до конца 2026 года (с возможностью продления)
📨 Регистрируйтесь, загружайте резюме на •••••••• и оставляйте отклик на запрос
❗️Все актуальные запросы — ••••••••
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.