управляющая компания первая

Ведущий инженер облачной инфраструктуры / Senior Cloud Infrastructure Engineer (SRE))

Управляющая компания финансового сектора. Развиваем гибридное облако: собственное частное облако на своих площадках и облако провайдера Cloud.ru. Облачная часть гетерогенная: используем разные платформы провайдера и развиваем связку частно…

управляющая компания первая · На сервисе с: 01.10.26 14:03

Зарплата не указанаРоссияМоскваОфис

Управляющая компания финансового сектора. Развиваем гибридное облако: собственное частное облако на своих площадках и облако провайдера Cloud.ru. Облачная часть гетерогенная: используем разные платформы провайдера и развиваем связку частного и провайдерского облака под задачи. Часть виртуальной инфраструктуры с собственных площадок переносим в облако провайдера. Контур разработки и тестирования в облаке провайдера уже работает. Следующий этап — продуктивная зона и перенос нагрузок.

Инфраструктура разнородная: Linux разных дистрибутивов и поколений, Windows Server, Kubernetes на виртуальных машинах, брокеры сообщений и базы данных.

Под направление собирается команда облачной инфраструктуры. Позиция находится в команде инфраструктуры: архитектор проектирует целевые решения, инженер облачной инфраструктуры отвечает за то, чтобы они были собраны кодом, перенесены без потерь и дальше работали предсказуемо. SRE здесь означает инфраструктурный SRE: надёжность, автоматизация, наблюдаемость. Разработки продуктовых сервисов в роли нет.

Обязанности

- Перенос виртуальных машин и сервисов с собственных площадок в облако: подготовка, репликация, переключение в согласованные окна, проверка после переноса, план отката.

- Подготовка систем к переезду: инвентаризация, фактические зависимости и сетевые взаимодействия, совместимость ОС и ПО, требования к ресурсам и ограничения платформы.

- Описание облачной инфраструктуры кодом (шаблоны ВМ, окружения, типовые конфигурации), хранение в Git.

- Мониторинг, алертинг и сбор логов для облачного контура и его связи с собственными площадками.

- Надёжность облачной инфраструктуры: целевые показатели доступности, разбор инцидентов, устранение причин, сокращение ручного труда.

- Резервное копирование и аварийное восстановление в облаке, реальные тесты восстановления.

- Участие в переносе Kubernetes-кластеров в управляемый Kubernetes облака и в выстраивании их эксплуатации.

- Runbook и эксплуатационная документация, передача практик команде.

- Технические вопросы с облачным провайдером: заявки, проверка возможностей, эскалации.

- Работа в требованиях регулируемой отрасли вместе с информационной безопасностью: доступы, сегментация, журналирование.

Требования

- От 4 лет в эксплуатации инфраструктуры enterprise-масштаба, на senior-уровне.

- Глубокий Linux (RHEL-совместимые и другие дистрибутивы): загрузка, systemd, LVM и файловые системы, сеть, диагностика производительности; опыт одновременной работы с разными дистрибутивами и поколениями ОС.

- Уверенная эксплуатация VMware vSphere.

- Практический опыт переноса продуктивных нагрузок между ЦОД, платформами виртуализации или в облако: план, окна, проверки, откат.

- Windows Server на уровне переноса и проверки работоспособности: сеть, службы, доменная интеграция, журналы.

- Ansible (собственные роли и плейбуки), Bash или Python, Git.

- Настройка мониторинга и логирования: Zabbix и/или Prometheus + Grafana, стек сбора логов.

- Сети на уровне инженера эксплуатации: TCP/IP, маршрутизация, VLAN, NAT, DNS, балансировка, межсетевые экраны.

- Kubernetes на уровне эксплуатации: устройство кластера, диагностика, обновление.

- Письменный разбор инцидентов и runbook, по которым может работать коллега.

- Готовность к работам в согласованные окна, в том числе во внерабочее время.

Будет плюсом:

- Опыт работы с Cloud.ru или другими облачными провайдерами, в том числе с несколькими платформами одновременно и в гибридной связке с собственными площадками.

- Миграции ВМ средствами репликации (VCDA или аналоги).

- Terraform, в том числе для облачных провайдеров.

- Опыт работы с управляемым Kubernetes в облаке.

- SRE-практики: SLO/SLI, бюджет ошибок, blameless postmortem.

- Эксплуатация PostgreSQL и Kafka.

- Схемы аварийного восстановления и тесты восстановления.

- Опыт в финансовом секторе или другой регулируемой отрасли: требования Банка России, 152-ФЗ, ГОСТ Р 57580.

Условия

Офис Москва Сити (м. Деловой центр);

выгодные ипотечные льготные условия кредитования;

бесплатная подписка СберПрайм+;

скидки на продукты компаний-партнеров: Okko, Сбер Маркет, Delivery Club, Самокат, Ситимобил, Сбер Еаптека и другие;

ДМС с первого дня и льготное страхование для близких;

корпоративная пенсионная программа;

детский отдых и подарки за счет Компании;

обучение за счет Компании: онлайн курсы в Виртуальной школе Сбера и неограниченный доступ к библиотеке, обучение в Корпоративном университете, тренинги, митапы и возможность получить новую квалификацию;

реферальная программа для сотрудников: можно пригласить в команду знакомых профессионалов и получить вознаграждение до 100 тыс. рублей;

скидки на отдых в лучшем в мире курортном комплексе «Mriya Resort & SPA» в Ялте

Похожие вакансии DevOps

hh.ru
employcity

Devops Engineer

employcityНа сервисе с: 01.10.26 15:28
Зарплата не указанаРоссияМоскваОфис
Международная продуктовая IT компания, которая занимается разработкой и поддержкой высоконагруженных проектов для крупных компаний, основная часть которых представляет собой развлекательные онлайн-сервисы, в поисках Senior Devops Engineer.

Чем предстоит заниматься:
  • Разрабатывать CI/CD конвееры для разнообразных (в том числе сложных) сервисов и приложений;
  • Настраивать observability для приложений (мониторинг, логирование, трейсинг, алертинг);
  • Готовить приложения к хайлоад;
  • Развивать платформенное решение (шаблонизоварать и автоматизировать разнообразные решения для использования командами тестирования и разработки);
  • Разрабатывать внутренние инструменты (сервисы, боты);
  • Развивать и описывать документацию и процессы.
Какие навыки нужны:
  • Знание основ работы клиент-серверных приложений, горизонтального масштабирования;
  • Опыт построения процессов CI/CD, предпочтительно с использованием Gitlab CI;
  • Уверенные навыки работы с docker, git и сетевыми протоколами (http, tls, s3);
  • Понимание подхода IaC;
  • Опыт работы с Kubernetes в части деплоя и эксплуатации высоконагруженных приложений;
  • Опыт работы с различными инструментами мониторинга и сбор логов;
  • Опыт работы с сервисами доставки сообщений (не telegram).;
  • Развитые софт-скилы;
  • Опыт декомпозиции и оценки задач.
Будет плюсом:
  • Знание паттернов проектирования приложений;
  • Опыт работы с sql/no-sql базами данных;
  • Знание Python/Go на уровне разработки простой автоматизации;
  • Опыт с построением инцидент-менеджмента и работы в парадигме ITSM.
Что компания может предложить Вам:
  • Офисный формат работы;
  • Достойный уровень заработной платы (обсуждается индивидуально и зависит от профессионального уровня кандидата);
  • Поездки на ИТ-конференции, митапы, учебные курсы за счет компании;
  • Опытный коллектив, возможность перенять ценный опыт;
  • Полностью белая заработная плата;
  • Возможность работать в современном и комфортном офисе с удобным рабочим местом, оборудованным современной техникой;
  • Гибкое начало рабочего дня;
  • Оплачиваемые отпускные и больничные;
  • Минимум бюрократии;
  • Отсутствие дресс-кода;
  • 4 day-off в год за счёт компании;
  • Частичная компенсация английского языка или психолога на выбор;
  • ДМС;
  • Частичная компенсация спортзала.
hh.ru
Зарплата не указанаРоссияМоскваУдалёнка

Мы ищем специалиста, который обеспечит стабильную и предсказуемую работу наших информационных систем на базе 1С и MS SQL. Ваша главная цель — не просто «чинить», а системно повышать надёжность: внедрять метрики, автоматизировать обнаружение проблем, проектировать отказоустойчивость и устранять первопричины сбоев. Роль предполагает выделение до 10 % времени команд на задачи по надёжности и улучшению процессов.

Тебе предстоит:

Управление инцидентами и постмортемы

  • Координировать участников «пожарной команды» для оперативного решения критических инцидентов.
  • Собирать информацию о проблеме, контролировать заведение аварии, фиксировать хронометраж и ключевые действия.
  • Писать постмортем‑отчёты (blameless postmortem): фиксировать, что произошло, как реагировали, какие уроки извлечены.
  • Контролировать и ставить задачи по недопущению повторения причин инцидентов (RCA, action items).

​​​​​​​Производительность и доступность

  • Определять и поддерживать SLI/SLO для ключевых сервисов, вести учёт error budget.
  • Настраивать и анализировать ключевые показатели ИС: создавать дашборды, алерты, описывать реакцию на отклонения.
  • Писать инструкции (runbooks) по реакции на отклонения показателей работы от нормы.
  • Анализировать аномалии: рост нагрузки, рост данных, нехарактерные паттерны поведения системы.

Анализ логов и диагностика

  • Анализировать Журнал регистрации (ЖР) и Технологический журнал (ТЖ) на наличие ошибок и узких мест.
  • Сопоставлять данные из разных источников (логи, метрики, трейсы) для точной локализации проблемы.

Масштабирование и отказоустойчивость

  • Участвовать в проектировании и реализации отказоустойчивой архитектуры (кластеризация 1С, Always On для MS SQL, балансировка нагрузки и т. д.).
  • Готовить систему к пиковым нагрузкам: нагрузочное тестирование, планирование ёмкости, проработка сценариев деградации.

Регулярное обслуживание и гигиена данных

  • Выполнять и автоматизировать типовые операции обслуживания: пересчёт итогов, очистка регистров, удаление нулевых записей.
  • Ставить задачи и предлагать решения, чтобы такие операции требовались реже или выполнялись автоматически.

Пожелания по опыту:

  • Опыт разработки на платформе 1С: понимание архитектуры регистров, сеансов, блокировок, умение читать ЖР и ТЖ.
  • Уверенная работа с MS SQL: планы запросов, блокировки, DMV, Extended Events, тюнинг производительности.
  • Практический опыт работы с инструментами мониторинга и наблюдаемости: Zabbix, Prometheus, Grafana, ELK.
  • Понимание SRE‑практик: SLI/SLO, error budget, incident management, blameless postmortem, runbooks.
  • Умение проектировать отказоустойчивые и масштабируемые решения, опыт подготовки к пиковым нагрузкам.
  • Способность формализовать процессы, писать понятные инструкции и ставить задачи смежным командам.

Будет плюсом

  • Опыт внедрения автоматизации для типовых операций обслуживания.
  • Знание практик Capacity Planning и Chaos Engineering на базовом уровне.
  • Опыт работы в кросс‑функциональных командах и проведения ретроспектив по инцидентам.
Соц.сети
Н

DevOps - инженер Senior (сервисы отдела ИБ)

Неизвестный работодательНа сервисе с: 01.10.26 15:36
Зарплата не указанаРоссияМоскваГибрид

DevOps - инженер Senior (cервисы отдела ИБ) в строительный ритейл (ГИБРИД)
Гражданство РФ, локация - Москва и рядом. Срок проекта - ••••••••, возможна пролонгация на след.год. Возраст до 45 лет желательно.

🤑Ставка 2000 (с НДС, отсрочка 35 рабочих дней)

!!️ГИБРИД (Проспект Лихачева), 1 раз в неделю

Описание: сервисы отдела ИБ, на базе Open-Source для обеспечения нужд ИБ отдела

Требования (+/-):
уметь работать с перечисленными технологиями: GitHub/Gitlab, Jfrog Artifactory, SonarQube, Jenkins/GitlabCI , ArgoCD, Helm, Hashicorp Vault, OpenTelemetry, Grafana, Grafana Tempo, Mimir, Prometheus, k8s, StackRox, PKI HashiCorp Vault

Задачи и обязанности:
- Участие в разработке стратегии и архитектуры комплексной DevOps-платформы с нуля, выбор оптимального стека технологий и инструментов;
- Внедрение практик Infrastructure as Code для обеспечения воспроизводимости и масштабируемости сред;
- Развертывание и администрирование контейнерных сред на базе Docker и Kubernetes;
- Настройка комплексных систем мониторинга, алертинга и сбора логов для обеспечения высокой наблюдаемости (Observability) системы;
- Разработка и реализация механизмов резервного копирования, восстановления после сбоев и обеспечения высокой доступности (HA);
- Создание CI/CD пайпланов.
- Управление релизным процессом, проведение, сопровождение релизов.
- Актуализация технической документации.
- Управление инфраструктурой
- Поддержание работоспособности инфраструктурных сервисов.
- Своевременное обновление сервисов и зависимостей.
- Своевременное устранение обнаруженных уязвимостей в исходном коде и подкотрольных сервисах.

Откликнуться на запрос: ••••••••
По вопросам партнерского сотрудничества: ••••••••

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.