A

Site Reliability Engineer

Формат: удаленно(2 месяца испытательного), обязателен релок после 2 месяцев в Абу Даби

aleria_llc · На сервисе с: 01.07.26 13:05

5 500–8 200 $ (≈ 430k–642k ₽)ОАЭАбу ДабиАбу-ДабиУдалёнка
Локации (удалёнка):Абу ДабиАбу-Даби

Удалённая работа — географически не привязана. Щёлкни по любой из локаций, чтобы открыть оригинальную карточку.

Публикатор: ••••••••
Обсуждение: ••••••••
#вакансия

Ищу SRE себе в команду.

Формат: удаленно(2 месяца испытательного), обязателен релок после 2 месяцев в Абу Даби
Занятость: full-time
Локация: Абу Даби
Вилка: 5500-6.000$ remote, 8.000-8200$ onsite
Компания: Aleria LLC
Контакт: ••••••••

Site Reliability Engineer
Aleria — компания из Абу-Даби, разрабатывающая AI-продукты для клиентов в ОАЭ и по всему миру. Небольшая команда, быстрый рост. Работаем на bare metal, без облака. Нужен инженер, который понимает каждый слой — от NIC до Kubernetes pod — и отвечает за то, чтобы всё это работало стабильно под нагрузкой и не падало посреди ночи.
Чем предстоит заниматься:
Обеспечивать надёжность и доступность сервисов на bare metal с Kubernetes поверх железа
Строить и поддерживать observability (Prometheus, Grafana, Loki): метрики, дашборды, алерты, SLO/SLI
Реагировать на инциденты, проводить post-mortem и устранять причины, а не симптомы
Тюнить PostgreSQL и другие БД под продакшен-нагрузку, искать боттлнеки
Поддерживать CI/CD (GHES, ArgoCD), снижать время и риск деплоев
Сетевая инфраструктура: маршрутизация, сегментация, балансировка нагрузки, безопасность
On-premise и air-gapped поставки (~10%)
Capacity planning и работа над снижением toil
Безопасность, которая не тормозит команду
Взаимодействие с командой разработки и инженерами клиентов
Требования:
Глубокий опыт bare metal — без облачных абстракций
Понимание внутреннего устройства Kubernetes, а не только манифестов
Опыт устранения продакшен-инцидентов под давлением, умение быстро находить root cause
Тюнинг БД под нагрузкой (приоритет — PostgreSQL)
Опыт построения observability и систем алертинга с нуля
Опыт on-prem и air-gapped развёртываний
Сети: L2/L3, routing, firewall, VPN
Продакшен Linux troubleshooting
Подход security-mindset с балансом на скорость доставки
Высокая автономность при работе с незнакомым стеком
Видение инфраструктуры за пределами текущей задачи
Английский B2+
Будет плюсом:
Опыт с GPU-кластерами для AI
Ceph/ZFS/распределённые хранилища
Опыт hardening/compliance для гос. заказчиков
Air-gap CI/CD
Не ищем:
YAML-инженеров, которые только применяют готовые манифесты. Нужен человек, который понимает, что происходит под капотом — и готов первым встать ночью, если что-то упало.

Похожие вакансии DevOps

hh.ru
тантк им.г.м. бериева

Devops инженер

тантк им.г.м. бериеваНа сервисе с: 24.09.26 19:09
55k–70k ₽РоссияТаганрогОфис
Погрузитесь в мир современных технологий и станьте ключевым звеном в организации web серверной архитектуры!

Обязанности
  • Проектирование, развертывание и поддержка серверной инфраструктуры
  • Автоматизация процессов развертывания и мониторинга
  • Обеспечение безопасности и отказоустойчивости систем
  • Оптимизация производительности серверов и приложений
  • Взаимодействие с командами разработки и эксплуатации
Требования
  • Знание Windows/Linux-систем и сетевых технологий
  • Опыт работы с системами автоматизации (Ansible, Terraform и др.)
  • Понимание принципов CI/CD
  • Навыки работы с контейнерами и оркестраторами (Docker, Kubernetes)
  • Умение работать в команде и решать нестандартные задачи
hh.ru
защитаинфотранс, фгуп

Системный администратор инфраструктуры и баз данных ГИС

защитаинфотранс, фгупНа сервисе с: 24.09.26 18:40
Зарплата не указанаРоссияМоскваВладивостокУдалёнка
Локации (удалёнка):МоскваВладивосток

Удалённая работа — географически не привязана. Щёлкни по любой из локаций, чтобы открыть оригинальную карточку.

ФГУП "ЗащитаИнфоТранс" - аккредитованная государственная IT-компания, специализирующаяся на цифровизации и внедрении инноваций в транспортной отрасли, эксперт в области защиты информации и обеспечения транспортной безопасности.

С 1996 года успешно реализовано более 180 масштабных проектов по разработке информационных систем для всей транспортной отрасли.

Приглашаем в команду Ведущего инженера в Отдел эксплуатации инфраструктуры и баз данных Департамента эксплуатации информационных систем.
Работа с государственной информационной системой Электронные перевозочные документы.

Чем предстоит заниматься?

Вы будете центральным звеном технической поддержки системы. Ежедневно вы будете диагностировать и устранять сложные технические проблемы, анализировать метрики и логи, координировать работу с разработчиками и специалистами по информационной безопасности. Вы обеспечите работоспособность контейнеризированных приложений, поддержите интеграции с внешними системами и постоянно актуализируете базу знаний для повышения эффективности команды.

Эта позиция подойдет опытному техническому специалисту, который готов работать с критической государственной инфраструктурой, принимать самостоятельные решения в условиях ограниченного времени и обеспечивать высокий уровень доступности сервисов.

ЗАДАЧИ и ФУНКЦИОНАЛ:

1. Поддержка инцидентов:

  • Прием эскалированных обращений от первой линии поддержки и самостоятельная диагностика сложных технических проблем;
  • Анализ логов и метрик для выявления причин сбоев, применение решений для восстановления работоспособности в рамках SLA;
  • Подготовка полной диагностической информации для передачи на третью линию или производителям при необходимости.

2. Администрирование инфраструктуры и платформ:

  • Управление виртуальной инфраструктурой на облачной платформе ГЕОП (или аналог): жизненный цикл ВМ, базовые сетевые настройки, шаблоны/копии;
  • Администрирование серверов под управлением Linux, администрирование, сервисы ОС, анализ системных журналов;
  • Эксплуатация платформы контейнеризации Kubernetes: управление кластерами, диагностика проблем с приложениями и сервисами;
  • Работа с контейнерами Docker, администрирование веб-серверов Nginx и Apache;

3. Управление базами данных и интеграциями:

  • Администрирование СУБД PostgreSQL: резервное копирование, восстановление, мониторинг производительности и репликации;
  • Поддержка высокодоступных кластеров баз данных с использованием Patroni и etcd;
  • Администрирование системы обмена сообщениями RabbitMQ, контроль очередей и доставки;
  • Поддержка интеграций через REST и SOAP API, работа с межведомственным электронным взаимодействием.

4. Мониторинг и документирование:

  • Отслеживание состояния системы через платформы мониторинга (Zabbix, Prometheus, Grafana) и централизованное логирование (GrayLog);
  • Ведение технической документации, инструкций и базы знаний в Confluence, ITSM системе;
  • Подготовка отчетов по выполненным работам и инцидентам

НЕОБХОДИМЫЕ НАВЫКИ:

Для выполнения данного функционала важен ОПЫТ РАБОТЫ:

  • Не менее 5 лет опыта работы системным администратором или инженером DevOps от 3 лет;
  • Не менее 3 лет опыта на позициях L2/L3 технической поддержки с самостоятельным решением инцидентов;
  • Высшее/ среднее-профессиональное техническое образование.

ТЕХНИЧЕСКИЕ НАВЫКИ:

  • Уверенное администрирование Linux (RHEL/CentOS/Ubuntu/Astra Linux);
  • Практический опыт работы с Kubernetes (от 2 лет): управление узлами, Ingress, Services, диагностика проблем;
  • Работа с Docker: контейнеры, образы, Docker Compose;
  • Администрирование PostgreSQL: резервное копирование, восстановление, мониторинг, понимание репликации;
  • Опыт работы с системами виртуализации (VMware vSphere, KVM) и облачными платформами;
  • Настройка и администрирование веб-серверов Nginx (reverse proxy, балансировка нагрузки) и Apache;
  • Работа с системами мониторинга (Zabbix и/или Prometheus+Grafana) и централизованного логирования;
  • Понимание сетевых технологий (TCP/IP, DNS, HTTP/HTTPS), умение диагностировать проблемы на уровне приложений;
  • Базовые навыки работы с RabbitMQ и REST API;
  • SQL на продвинутом уровне (JOIN, агрегатные функции, создание запросов).

ЛИЧНЫЕ КАЧЕСТВА:

  • Способность принимать самостоятельные решения в стрессовых ситуациях;
  • Умение оформлять результаты: кратко фиксировать причины/действия/рекомендации, передавать задачу в L3 с полной диагностикой.

БУДЕТ ПЛЮСОМ:

  • Практический опыт работы с облачной платформой ГЕОП;
  • Опыт эксплуатации государственных информационных систем;
  • Опыт работы со СМЭВ (система межведомственного электронного взаимодействия);
  • Знание Astra Linux и опыт работы в защищенных контурах;
  • Понимание требований 152-ФЗ, 149-ФЗ и базовые знания требований ФСТЭК/ФСБ;
  • Опыт работы с системами автоматизации (Ansible, Puppet, Chef);
  • Знание методологий ITIL/ITSM и опыт работы с системами учета обращений;
  • Опыт построения отказоустойчивых кластеров PostgreSQL с Patroni в продуктивной среде.

УСЛОВИЯ И ГАРАНТИИ:

  • Официальное оформление в аккредитованной IT компании в соответствии с ТК РФ;
  • График работы 2/2 (удаленно/гибрид/ офис на выбор);
  • Программа ДМС со стоматологией;
  • Возможности для карьерного роста;
  • Выплаты социального характера;
  • Возможность дополнительного обучения за счет компании;
  • Уютный офис с зонами отдыха в одном из корпусов Даниловской мануфактуры. Офис расположен в шаговой доступности от м. Тульская (15 мин.) и МЦК Верхние котлы. От ст. Нагатинская 2 остановки на трамвае (8-10 мин).
hh.ru
нпп баум

SRE-инженер

нпп баумНа сервисе с: 25.08.26 18:32↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваГибрид

Мы — группа компаний, успешно объединяющая экспертизу в IT, проектировании и строительстве. Одно из наших ключевых направлений — сопровождение и развитие корпоративной IT-инфраструктуры и информационной безопасности внешних заказчиков.

Сейчас мы развиваем SRE направление, поэтому ищем опытного инженера, который будет проектировать отказоустойчивую архитектуру и выстраивать процессы.

Чем предстоит заниматься:

  • Проектировать и развивать observability: метрики, логи, трейсинг
  • Настраивать осмысленный алертинг — без шума, с приоритизацией по реальному влиянию на сервис
  • Участвовать в расследовании инцидентов, искать фундаментальную причину проблемы, а не только устранять симптом
  • Готовить структурированные разборы инцидентов и предлагать системные меры для предотвращения повторений
  • Взаимодействовать с инженерами и командами проектов, помогая выстраивать единый подход к мониторингу и надёжности

Что для нас важно:

  • Опыт в роли SRE от ~3 лет с опытом именно построения observability, а не только его поддержки
  • Уверенный опыт с Prometheus/Grafana, опыт работы с логированием и трейсингом (Loki и Tempo)
  • Опыт работы с docker, kubernetes
  • Опыт самостоятельного расследования инцидентов и написания post-mortem с фокусом на корневые причины
  • Готовность выстраивать процессы там, где их пока нет, без готовых шаблонов
  • Уверенный опыт с Linux системами, понимание принципов отказоустойчивости (репликация, кластеризация, балансировка, failover)

Будет плюсом:

  • Опыт внедрения SLI/SLO и работы с error budget на практике
  • Навыки автоматизации (Ansible, Python/Bash)

Мы предлагаем:

  • Надёжность: официальное оформление в штат по ТК РФ, ИТ-аккредитация, достойный прозрачный доход и премии по итогам работы

  • Гибридный формат: возможность совмещать работу из дома и офиса

  • Комфорт: современный офис рядом с м. Волгоградский проспект/Пролетарская

  • Оснащение: вся необходимая современная техника и компенсация корпоративной мобильной связи

  • Забота о здоровье: ДМС со стоматологией после испытательного срока

  • Корпоративные скидки: подключение к программе Best Benefits со скидками от партнеров с первого рабочего дня

  • Развитие: возможности для профессионального роста, открытая коммуникация и сильная команда экспертов

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.