U

Миддл / Сеньор DevOps / SRE-инженер (Python)

DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

umbrella · На сервисе с: 09.09.26 12:08

Зарплата не указанаРоссияМоскваУдалёнка

DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

Привет! Меня зовут Эля, я HR компании «Амбрелла».
Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.
Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB.
Основной фокус роли — промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.
Вторая важная зона — MariaDB: эксплуатация, репликация, отказоустойчивость, Galera Cluster, backup/restore, disaster recovery, performance tuning и миграция с master-master-репликации на более надёжную кластерную архитектуру.
Нам нужен инженер, который умеет не просто «поднять базу», а безопасно эксплуатировать production-инфраструктуру с критически важными данными: проверять гипотезы на стендах, оценивать риски, готовить rollback-план, участвовать в расследовании инцидентов и фиксировать результаты в документации.

Чем предстоит заниматься: ClickHouse:
— Администрировать продуктивные и тестовые кластеры ClickHouse;
— Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц;
— Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой;
— Анализировать системные таблицы ClickHouse и состояние кластера;
— Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц;
— Планировать горизонтальное масштабирование ClickHouse-кластера;
— Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера;
— Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище;
— Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям;
— Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;
— Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия;
— Разрабатывать и проверять backup/restore и disaster recovery;
— Настраивать мониторинг, алерты и дашборды по ClickHouse;
— Готовить Ansible playbooks / roles, runbook’и, инструкции, чек-листы и технические отчёты.

MariaDB:
— Администрировать продуктивные и тестовые инсталляции MariaDB;
— контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов;
— Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication;
— Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах;
— Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster;
— Настраивать, сопровождать и диагностировать Galera Cluster;
— Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски;
— Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий;
— Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO;
— Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети;
— Настраивать TLS/SSL для клиентских подключений и репликации;
— Настраивать мониторинг, алерты, дашборды и runbook’и по MariaDB.

Production, автоматизация и взаимодействие:
— Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой;
— Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации;
— Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов;
— Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах;
— Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений;
— Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production;
— Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты;
— Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения.

Обязательные требования:
— Практический опыт промышленной эксплуатации ClickHouse;
— Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family;
— Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;
— Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes;
— Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;
— Опыт настройки TLS/SSL для ClickHouse;
— Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде;
— Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels;
— Опыт настройки и диагностики репликации MariaDB;
— Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации;
— Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий;
—Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO;
— Опыт эксплуатации Linux-серверов;
— Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB;
— Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры;
— Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;
— Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты;
— Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата;
— Умение писать техническую документацию: инструкции, runbook’и, чек-листы, postmortem-отчёты.

Желательные требования:
— Опыт или уверенное понимание Galera Cluster;
— Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем;
— Опыт работы с большими объёмами данных: десятки или сотни ТБ;
— Опыт работы с ClickHouse Keeper или ZooKeeper;
— Опыт эксплуатации ClickHouse / MariaDB на bare metal;
— Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;
— Опыт нагрузочного тестирования ClickHouse и MariaDB;
— Опыт построения процедур disaster recovery;
— Опыт подготовки архитектурных и эксплуатационных документов для заказчиков;
— Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями;
— Опыт проведения регламентных работ с минимальным downtime;
— Опыт аудита продуктивных инсталляций у заказчиков.

Что важно в кандидате:
— Инженерная аккуратность и понимание рисков production-среды;
— Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production;
— Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы;
— Клиентоориентированность и зрелая коммуникация;
— Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках;
— Способность лидировать технические встречи, фиксировать решения и следующие шаги;
— Готовность документировать решения и передавать знания команде.

Условия:
— Постоянная занятость;
— Работа с продуктивной, тестовой и лабораторной инфраструктурой;
— Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;
— Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных.

Эта вакансия также есть на:hh.ru

Похожие вакансии DevOps

hh.ru
нпп баум

SRE-инженер

нпп баумНа сервисе с: 25.08.26 18:32↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваГибрид

Мы — группа компаний, успешно объединяющая экспертизу в IT, проектировании и строительстве. Одно из наших ключевых направлений — сопровождение и развитие корпоративной IT-инфраструктуры и информационной безопасности внешних заказчиков.

Сейчас мы развиваем SRE направление, поэтому ищем опытного инженера, который будет проектировать отказоустойчивую архитектуру и выстраивать процессы.

Чем предстоит заниматься:

  • Проектировать и развивать observability: метрики, логи, трейсинг
  • Настраивать осмысленный алертинг — без шума, с приоритизацией по реальному влиянию на сервис
  • Участвовать в расследовании инцидентов, искать фундаментальную причину проблемы, а не только устранять симптом
  • Готовить структурированные разборы инцидентов и предлагать системные меры для предотвращения повторений
  • Взаимодействовать с инженерами и командами проектов, помогая выстраивать единый подход к мониторингу и надёжности

Что для нас важно:

  • Опыт в роли SRE от ~3 лет с опытом именно построения observability, а не только его поддержки
  • Уверенный опыт с Prometheus/Grafana, опыт работы с логированием и трейсингом (Loki и Tempo)
  • Опыт работы с docker, kubernetes
  • Опыт самостоятельного расследования инцидентов и написания post-mortem с фокусом на корневые причины
  • Готовность выстраивать процессы там, где их пока нет, без готовых шаблонов
  • Уверенный опыт с Linux системами, понимание принципов отказоустойчивости (репликация, кластеризация, балансировка, failover)

Будет плюсом:

  • Опыт внедрения SLI/SLO и работы с error budget на практике
  • Навыки автоматизации (Ansible, Python/Bash)

Мы предлагаем:

  • Надёжность: официальное оформление в штат по ТК РФ, ИТ-аккредитация, достойный прозрачный доход и премии по итогам работы

  • Гибридный формат: возможность совмещать работу из дома и офиса

  • Комфорт: современный офис рядом с м. Волгоградский проспект/Пролетарская

  • Оснащение: вся необходимая современная техника и компенсация корпоративной мобильной связи

  • Забота о здоровье: ДМС со стоматологией после испытательного срока

  • Корпоративные скидки: подключение к программе Best Benefits со скидками от партнеров с первого рабочего дня

  • Развитие: возможности для профессионального роста, открытая коммуникация и сильная команда экспертов

hh.ru
skillstaff

DevOps-инженер (Senior)

skillstaffНа сервисе с: 24.09.26 20:25
Зарплата не указанаРоссияМоскваУдалёнка
Мы ищем опытного DevOps-инженера
Ключевая задача - построить инфраструктуру с нуля. Продукт переезжает в контур и нужен человек, который спроектирует всё правильно с самого начала, настроит CI/CD, поднимет кластер и сделает так, чтобы команды разработки могли работать без "боли". Сейчас оркестрация на Docker Swarm и на время переезда планируется оставить на нём, а после завершения рассматривается переход на Kubernetes.

Стек: Docker, Docker Swarm, GitLab CI/CD, Nginx, PostgreSQL, Percona XtraDB Cluster (MySQL 8.0, Galera), Redis, S3-совместимое хранилище, в перспективе Kubernetes. Мониторинг: Prometheus, Grafana, Loki, Zabbix.
Облако на базе отечественных провайдеров.

Чем предстоит заниматься:

  • Проектировать и разворачивать инфраструктуру с нуля.
  • Настраивать CI/CD пайплайны для фронта и бэка, поднимать и сопровождать кластер Docker Swarm и выстраивать процессы деплоя, а после переезда спроектировать и провести миграцию на Kubernetes.
  • Администрировать кластер Percona XtraDB Cluster (отказоустойчивость, бэкапы, восстановление).
  • Настраивать мониторинг, алертинг и логирование, работать в связке с командами разработки, участвовать в технических переговорах с подрядчиками.

Для нас важно:

  • Опыт коммерческой работы в DevOps или SRE от 5-ти лет.
  • Реальный опыт проектирования инфраструктуры с нуля, а не только поддержка существующей.
  • Опыт работы с Docker Swarm в продакшне, уверенное знание Kubernetes в продакшне.
  • Опыт настройки GitLab CI/CD с раннерами и пайплайнами.
  • Понимание сетевой модели и проксирования через Nginx.
  • Опыт эксплуатации Percona XtraDB Cluster/Galera в продакшне (кворум и split-brain, SST/IST, bootstrap кластера после падения, бэкапы через Percona XtraBackup).
  • Опыт работы с Zabbix.
  • Опыт с отечественными облачными провайдерами (Yandex Cloud) и знание IaC-инструментов (Terraform, Ansible).

Главный принцип SkillStaff - Выбирай!

  • РАЗНООБРАЗИЕ ПРОЕКТОВ. Выбирай из сотен компаний и проектов то, что интересно и полезно для твоего роста. SkillStaff помогает реализовывать ежегодно порядка 500 различных ИТ-проектов для крупного бизнеса.
  • КОМФОРТ. SkillStaff — аккредитованная IT-компания, белая зарплата и удобный график работы. Создавай идеальные условия для своей работы: удаленная работа или возможность работать как в офисе клиента, так и в комфортном офисе SkillStaff в центре Москвы на Воздвиженке.
  • РАЗВИТИЕ. Выбирай сам путь, по которому ты хочешь развиваться. Используй возможность обмена опытом и получение знаний через участие в разных проектах, совместную работу с высококвалифицированными коллегами.
  • КУЛЬТУРА. Нашу культуру создают сами сотрудники – мы их слышим и помогаем развиваться, чтобы #вместе переходить на новый уровень!
hh.ru
bi.zone направление разработка

Инженер систем мониторинга

bi.zone направление разработкаНа сервисе с: 24.09.26 19:18
Зарплата не указанаРоссияМоскваУдалёнка

BI.ZONE создает IT-продукты для обеспечения кибербезопасности: от мобильных приложений до сложных платформ, в основе которых лежат методы машинного обучения. Благодаря нашим решениям жизнь десятков миллионов людей становится лучше и безопаснее.

Сейчас в команду мы ищем инженера аналитика систем мониторинга, который будет развивать системы логирования и мониторинга, администрировать Linux и PostgreSQL, автоматизировать инфраструктуру и выстраивать отказоустойчивые масштабируемые решения.

Чем предстоит заниматься:

  • Развитие систем мониторинга и логирования;
  • Внесение изменений и корректировок в системы мониторинга команды, участие в постановке новых сервисов на мониторинг;
  • Участие в поддержке, оптимизации и развитии инфраструктуры компании;
  • Внедрение и настройка стека технологий мониторинга (Prometheus, Zabbix, Grafana) с учётом требований отказоустойчивости и масштабируемости.
  • Внедрение и настройка стека технологий логирования (VictoriaMetrics, ELK/GrayLog, Syslog) с учётом требований отказоустойчивости и масштабируемости.

Что для нас важно:

  • Глубокие знания, опыт эксплуатации и сопровождения операционных систем семейства Linux (Oracle Linux 8, Debian, Ubuntu);
  • Опыт внедрения и сопровождения IT систем;
  • Опыт развертывания, настройки и администрирования инфраструктурных сервисов (Zabbix, Grafana, Prometheus, ELK, VictoriaMetrics);
  • Знание, опыт работы с PostgreSQL;
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server)
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform);
  • Soft-skills: коммуникативность, развитый time-management, инициативность, адаптируемость, а также желание профессионально и карьерно развиваться

Что нам также важно, но можем рассмотреть кандидатов и без этого:

  • Опыт настройки CI/CD систем (GitLab CI/CD);
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server);
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform).

Мы предлагаем:

Защищенность Все гарантии официального оформления по ТК РФ и преимущества аккредитованной IT-компании


Сообщества Регулярные профессиональные митапы и встречи для обмена опытом. А также сообщества по интересам: спорт, игры, книги, аниме

Гибкий график
Никто не следит, когда сотрудник садится за компьютер, сколько часов проводит в офисе, как часто работает удаленно

Забота о здоровье ДМС со стоматологией c первого месяца работы в компании

Обучение Сертификация, профильные курсы, конференции, митапы, хакатоны, CTF-ы

Свободная атмосфера У нас на «ты», никакого дресс-кода и лишней бюрократии

Самореализация Поддержка креатива и воплощение идей. Можно профессионально расти и развивать личный бренд

Скидки на фитнес, покупки и многое другое

Скидки от BestBenefits, «Фитмост», «СберПрайм+»и других компаний-партнеров для всех сотрудников

Корпоративная жизнь Крутые внутренние мероприятия и участие в спортивных стартах, а еще мерч и подарки

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.