Н

Senior DevOps (OpenStack)

- Поддержка production-кластера OpenStack в режиме 24/7: мониторинг, реакция на алерты, разбор инцидентов;

Неизвестный работодатель · На сервисе с: 11.08.26 15:38

Зарплата не указанаРоссияУдалёнка

Задачи:
Эксплуатация и поддержка кластера:
- Поддержка production-кластера OpenStack в режиме 24/7: мониторинг, реакция на алерты, разбор инцидентов;
- Диагностика и устранение сбоев на всех уровнях: вычислительные узлы (Nova), сети (Neutron), хранилища (Cinder/Ceph), аутентификация (Keystone), образы (Glance);
- Восстановление сервисов после падений: перезапуск агентов, failover контроллеров, восстановление БД;
- Анализ логов всех компонентов OpenStack и связанной инфраструктуры для выявления root cause;
- Написание и актуализация runbooks - пошаговых инструкций для команды поддержки по типовым и аварийным сценариям.

Производительность и оптимизация:
- Тюнинг производительности OpenStack: оптимизация расписания Nova (scheduler filters, weights), настройка NUMA, CPU pinning, hugepages для ВМ;
- Оптимизация сетевого стека: настройка OVS/OVN, VXLAN offloading, DPDK, SR-IOV для снижения latency;
- Оптимизация хранилищ: тюнинг Ceph (CRUSH map, pg_num, osd_memory_target), настройка multi-backend Cinder, выбор правильного типа томов (SSD/HDD/NVMe);
- Capacity planning: прогнозирование роста ресурсов, анализ трендов потребления CPU/RAM/Storage/Network.

Развёртывание и миграция:
- Развёртывание кластера OpenStack с нуля: проектирование архитектуры, установка, настройка всех сервисов (vanilla или через дистрибутив - Charmed, RHOSP, Mirantis);
- Апгрейд/обновление существующего кластера между версиями OpenStack (например, Yoga → Zed → Antelope) с минимальным downtime;
- Миграция виртуальных машин и данных с VMware vSphere/ Hyper-V/других платформ на OpenStack;
- Расширение кластера: добавление новых вычислительных узлов, контроллеров, хранилищ без прерывания работы сервисов.

Сети и безопасность:
- Проектирование и настройка сетевой топологии в Neutron: tenant networks, provider networks, VLAN/VXLAN, floating IPs, security groups;
- Настройка и отладка L3-агентов, DHCP-агентов, metadata-агентов, LBaaS (Octavia);
- Настройка firewall'ов и сетевой сегментации между проектами/тенантами;
- Интеграция с внешними сетями: BGP, EVPN, физические коммутаторы, аплинки;
- Диагностика сложных сетевых проблем: потеря пакетов, asymmetric routing, ARP-флуд, MTU mismatch, conntrack overflow.

Хранилища и резервное копирование:
- Эксплуатация Ceph-кластера: мониторинг здоровья, rebalance, замена вышедших из строя дисков/узлов, масштабирование;
- Управление блочными томами Cinder: создание типов томов, multi-backend, QoS, encryption;
- Настройка резервного копирования ВМ и томов (например, через Cinder backup, Ceph snapshots, или сторонние инструменты);
- Восстановление данных из бэкапов: откат ВМ, восстановление томов, восстановление БД OpenStack.

Автоматизация и инфраструктура как код:
- Написание Ansible-плейбуков для автоматизации рутинных операций: развёртывание узлов, обновление конфигураций, массовые изменения;
- Управление инфраструктурой через Terraform: создание проектов, сетей, ВМ, балансировщиков как код;
- Автоматизация CI/CD для инфраструктурных изменений: pipeline'ы для тестирования и деплоя конфигураций;
- Разработка скриптов (Python/Bash) для интеграции с API OpenStack, автоматизации биллинга, отчётности.

Мониторинг и observability:
- Построение и поддержка системы мониторинга: Prometheus + Grafana/Zabbix — настройка экспортёров, создание дашбордов, настройка алертов;
- Централизованное логирование: настройка сбора логов со всех компонентов OpenStack в ELK/EFK/Loki;
- Настройка алертинга: определение пороговых значений, настройка escalation, интеграция с PagerDuty/OpsGenie/Slack;
- Проведение анализа инцидентов: корреляция метрик, логов и трейсов для определения root cause;
- Chaos Engineering: планирование и проведение тестов отказоустойчивости (отключение узлов, сетевых линков, дисков).

Безопасность и compliance:
- Управление доступом через Keystone: настройка доменов, проектов, ролей, интеграция с LDAP/AD;
- Аудит и логирование действий пользователей (Ceilometer/Aodh/сторонние решения);
- Настройка шифрования: TLS для API-endpoint'ов, шифрование томов Cinder, шифрование сетевого трафика;
- Управление уязвимостями: патчинг ОС и компонентов OpenStack, реакция на CVE.

Взаимодействие и документирование:
- Коммуникация с заказчиками/внутренними командами: консультации по архитектуре, разбор обращений, эскалация багов вендорам;
- Взаимодействие с вендорами (Red Hat, Canonical, Mirantis): оформление тикетов, предоставление диагностических данных, координация исправлений;
- Написание технической документации: архитектурные схемы, инструкции, post-mortem анализов, рекомендации по улучшению;
- Менторинг middle/junior инженеров: code review, обучение, проведение техдолгов.

Проектирование и архитектура:
- Проектирование отказоустойчивой архитектуры OpenStack: HA-контроллеры, резервирование сетей, Ceph с replication factor 3, multi-region;
- Выбор технологического стека: SDN (OVS vs OVN vs Tungsten Fabric), хранилища (Ceph vs LVM-NFS), гипервизор (KVM vs Xen);
- Оценка рисков при изменениях инфраструктуры и планирование rollback-стратегий;
- Оптимизация затрат: right-sizing ВМ, автоматическое выключение неиспользуемых ресурсов, анализ utilization.

О проекте:
Крупная телеком компания

Локация: Россия
Время работы: UTC+3 (+-3 часа)
Гражданство: РФ
Формат: Удаленно
Срок привлечения: до конца 2026 года (с возможностью продления)

📨 Регистрируйтесь, загружайте резюме на •••••••• и оставляйте отклик на запрос
❗️Все актуальные запросы —
••••••••

Похожие вакансии DevOps

hh.ru
altcraft

Системный инженер / DevOps Engineer

altcraftНа сервисе с: 24.09.26 16:19
Зарплата не указанаРоссияРязаньОфис

Altcraft — команда увлечённых специалистов, создающих передовую платформу для digital-маркетинга. С 2015 года наш продукт помогает компаниям в России и за рубежом автоматизировать коммуникации с клиентами и анализировать данные.

Нам доверяют Aviasales, «АльфаСтрахование», ЮMoney, RuStore, МАТЧ, LEON и другие крупные компании.

Мы ищем системного инженера, который будет развивать инфраструктуру продукта, автоматизировать её управление и участвовать в решении сложных технических задач.

Нам нужен не человек, который просто «администрирует серверы», а инженер, которому интересно понимать, как устроена система целиком и как сделать её надёжнее, быстрее и проще в эксплуатации.

Наш стек

Linux, Go, Python, Docker, Ansible, Terraform, Jenkins, MongoDB, ClickHouse, PostgreSQL, RabbitMQ, Nginx, Prometheus, Grafana, Alertmanager, Proxmox.

Мы не ожидаем, что кандидат одинаково глубоко знает весь этот стек. Гораздо важнее хорошая инженерная база и способность самостоятельно разобраться в незнакомой технологии.

Чем предстоит заниматься

  • Проектировать, разворачивать и поддерживать инфраструктуру.
  • Автоматизировать управление инфраструктурой.
  • Работать с Linux, контейнерами и виртуализацией.
  • Развивать CI/CD.
  • Работать с MongoDB, ClickHouse, PostgreSQL и RabbitMQ.
  • Настраивать мониторинг, метрики и алертинг.
  • Диагностировать проблемы производительности и доступности сервисов.
  • Участвовать в расследовании production-инцидентов и поиске root cause.
  • Работать с облачной и On-premise инфраструктурой.
  • Проектировать отказоустойчивые решения, резервирование и восстановление.
  • Участвовать в выборе технологий и развитии инженерных стандартов команды.
  • Автоматизировать повторяющиеся операции и постепенно избавляться от ручного администрирования.

Что ждём от кандидата

  • Хорошее знание Linux и понимание того, как работает ОС.
  • Уверенная работа с Docker.
  • Опыт работы с Ansible.
  • Опыт Infrastructure as Code, желательно Terraform.
  • Понимание принципов CI/CD.
  • Хорошее понимание TCP/IP, DNS, HTTP/HTTPS, TLS и сетевого взаимодействия.
  • Опыт работы с reverse proxy и балансировщиками, например Nginx.
  • Понимание принципов работы реляционных и NoSQL-баз данных.
  • Умение диагностировать проблемы CPU, памяти, дисков, I/O и сети.
  • Умение писать скрипты на Bash и/или Python.
  • Понимание принципов построения облачной инфраструктуры.
  • Опыт работы с системами мониторинга и понимание, зачем нужны метрики, логи и алерты.

Будет большим плюсом

  • Опыт с MongoDB Replica Set.
  • Опыт с ClickHouse, PostgreSQL.
  • Опыт с RabbitMQ, Kafka.
  • Опыт с Prometheus, Grafana и Alertmanager.
  • Опыт эксплуатации высоконагруженных систем.
  • Опыт работы с Proxmox, KVM, LXC или другими системами виртуализации.
  • Опыт работы с публичными облаками.
  • Понимание HA, резервирования и Disaster Recovery.
  • Понимание Go и способность читать код сервисов.

Что мы предлагаем

  • Работу с production-инфраструктурой высоконагруженного продукта.
  • Задачи не только по эксплуатации, но и по проектированию и развитию инфраструктуры.
  • Возможность влиять на технические решения и инженерные стандарты.
  • Возможность развиваться в сторону DevOps/SRE и архитектуры.
  • Работу в аккредитованной IT-компании с перспективами роста и развития
  • Официальное трудоустройство по ТК РФ, гарантии и социальные льготы (больничные, отпуска, страховые выплаты)
  • График 5/2 с возможностью выбрать удобное время начала работы (с 09:00 до 11:00)
  • Уютный офис на ул. Каширина с зонами отдыха, цветами и вкусными снеками
  • Всё необходимое для продуктивной работы: современная техника и комфортное рабочее место
  • Дружелюбный коллектив профессионалов, готовых делиться знаниями и поддержкой
  • После прохождения испытательного срока — ДМС со стоматологией для вашего здоровья
  • Бесплатные обеды по вашему выбору
  • Регулярные корпоративные мероприятия, спортивные игры, турниры по шахматам и многое другое
hh.ru
домклик

DevOps Engineer

домкликНа сервисе с: 25.08.26 15:52↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваУдалёнка

Домклик — единственный в России продукт, обеспечивающий полный цикл операций с недвижимостью. Доступен на всех популярных платформах (Web, iOS, Android). Решаем любые вопросы с недвижимостью, делая сложное простым, с заботой о каждом клиенте. Мы ищем единомышленников, чтобы вместе помогать людям исполнять мечту о собственном жилье.

Чем предстоит заниматься:

  • заниматься эксплуатацией и развитием инфраструктурных сервисов;
  • автоматизировать конфигурацию и развертывание на большом парке серверов;
  • поддерживать CI/CD-процессы и участвовать в решении инцидентов;
  • значительная часть работы связана с Linux, Ansible, SaltStack Jenkins и Terraform, а также с написанием внутренней автоматизации на Python или Go;
  • дополнительно предстоит работать с Kubernetes, PostgreSQL, Nginx, Haproxy и системами мониторинга, участвовать в улучшении надежности и эксплуатационных процессов.

Мы ожидаем:

  • опыт работы в роли DevOps инженера от 2-х лет;
  • уверенное знание Linux с опытом траблшутинга;
  • уверенное знание Ansible или Saltstack;
  • практический опыт работы с Docker, Jenkins и Terraform;
  • понимание принципов CI/CD и IaC;
  • знание Python или Golang на уровне написания автоматизации и небольших сервисов;
  • умение самостоятельно проводить диагностику проблем и искать root cause;
  • умение работать с технической документацией и фиксировать принятые технические решения;
  • опыт эксплуатации production-систем с требованиями к высокой доступности.

Будет плюсом:

  • опыт эксплуатации Kubernetes;
  • практический опыт работы с PostgreSQL;
  • опыт работы с VictoriaMetrics/Prometheus, Zabbix;
  • понимание принципов балансировки HTTP\TCP трафика.
Мы предлагаем:
  • работу в аккредитованной IT компании;
  • конкурентную заработную плату;
  • полис ДМС с первого месяца работы;
  • современную технику для работы;
  • корпоративный университет, онлайн-курсы для повышения квалификации, конференции, митапы;
  • фитнес-зал в здании офиса;
  • льготную программу ипотеки для сотрудников;
  • комфортный офис класса А в 5 минутах от станции метро и МЦК Кутузовская;
  • гибкое начало рабочего дня и возможность работать в гибридном или удаленном формате в пределах РФ.
hh.ru
Зарплата не указанаРоссияМоскваУдалёнка
Чем предстоит заниматься:
  • Внедрением, развитием и сопровождением систем Единого Центра Управления оператора связи: мониторинг, технический учет, сервис-деск, коммуникационное ПО;
  • Администрированием баз данных: PostgreSQL и ClickHouse;
  • Поддержанием продуктовых и тестовых зон систем, развертыванием, обновлением и тестированием систем;
  • Администрированием серверов и информационных систем в зоне ответственности;
  • Автоматизацией рутинных действий по текущей эксплуатации систем;
  • Ведением технической документации.
Что мы ожидаем:
  • Знание стека TCP/IP;
  • Знание ОС Linux на уровне продвинутого пользователя;
  • Навыки написания скриптов на Bash, Python;
  • Знания в области систем управления и мониторинга сетей связи / ИТ инфраструктуры (Zabbix, протокол SNMP);
  • Опыт автоматизации (Ansible, Chef, Puppet);
  • Понимание принципов CI/CD;
  • Знание систем виртуализации и контейнеризации (Docker, Kubernetes);
  • Знание принципов построения отказоустойчивых систем;
  • Опыт работы с базами данных PostgeSQL и Clickhouse;
  • Умение работать в условиях многозадачности;
  • Умение диагностировать и устранять технические неисправности на сетевом уровне и уровне ПО.

Будет плюсом:

  • Понимание принципов ITIL;

  • Понимание структуры и принципов построения сотовых и транспортных сетей связи;

  • Опыт работы в телекоммуникационных компаниях.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.