яндекс

DevOps-инженер в Deploy Platform (Python)

Команда Deploy Platform развивает инфраструктурное контейнерное облако, в котором располагаются сервисы, создаваемые тысячами разработчиков Яндекса. Под управлением инфраструктурного облака находятся более 120 тысяч серверов и более 50 тыс…

яндекс · На сервисе с: 20.06.26 11:26

↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМосква

Команда Deploy Platform развивает инфраструктурное контейнерное облако, в котором располагаются сервисы, создаваемые тысячами разработчиков Яндекса. Под управлением инфраструктурного облака находятся более 120 тысяч серверов и более 50 тысяч приложений (около миллиона контейнеров), а также суперкомпьютеры, которые входят в топ-100 мирового рейтинга. Мы создаём, поддерживаем и используем множество сервисов и инструментов, чиним опенсорс-компоненты, отправляем патчи в upstream; стремимся применять лучшие практики SRE, минимизировать рутину и автоматизировать эксплуатацию. Наша цель — сократить время запуска сервиса и снизить стоимость ресурсов облака.

Пользователям мы помогаем запускать и эксплуатировать сервисы: настраиваем балансировку, предоставляем мониторинг поднятых сервисов, собираем логи, поддерживаем интеграцию с CI/CD и т. д. Стремимся сделать из облака единую интегрированную платформу (PaaS) для удобной и качественной разработки сервисов с использованием стандартных механизмов API, UI и подхода Infrastructure as Code.

Ищем опытного DevOps-инженера, который сможет включиться в построение гибридных облаков и обеспечить безопасную эксплуатацию кластера.

Какие задачи вас ждут

Развивать и совершенствовать автоматизацию обновлений облака
Вы будете поддерживать и модернизировать hostmanager — ключевой сервис для управления жизненным циклом хостов в облаке, автоматизировать обновления ОС, ядра, системных компонентов и Kubernetes-нод с минимальным влиянием на работающие сервисы, разрабатывать механизмы безопасного канареечного развёртывания и отката обновлений, интегрировать лучшие практики CI/CD и Infrastructure as Code в процессы эксплуатации инфраструктуры.

Управлять парком хостов (более 100 тысяч единиц)
Необходимо будет обеспечивать высокую доступность и производительность всей инфраструктуры, анализировать метрики, логи и события для выявления и предотвращения инцидентов, участвовать в проектировании систем мониторинга, алертинга и диагностики на уровне хостов и кластеров, работать с распределёнными системами, оптимизировать использование ресурсов и снижать время простоя.

Улучшать безопасность и изоляцию системных компонентов
Вам предстоит работать над изоляцией dom0 и других критических компонентов виртуализации и оркестрации, внедрять механизмы безопасной загрузки (secure boot), контроля целостности и изоляции окружения. Вы будете анализировать уязвимости и участвовать в повышении уровня защищённости инфраструктуры на всех уровнях: от железа до оркестратора.

Развёртывать и развивать bare-metal-кластеры Kubernetes
Вам предстоит проектировать и внедрять решения для развёртывания и эксплуатации крупных bare-metal-кластеров Kubernetes в выделенных дата-центрах, исследовать и адаптировать инфраструктурные сервисы для работы в гибридных средах — на физических серверах и в облаках. Вы будете участвовать в развёртывании критически важных систем в Kubernetes (например, YT — платформы для распределённых вычислений), обеспечивать высокую производительность и отказоустойчивость. Работать с low-level-компонентами: Container Runtime (Porto), CNI, CSI, node agents, системными демонами, а также с настройкой ядра Linux и аппаратной спецификой серверов; разрабатывать собственные инструменты и контроллеры для Kubernetes, автоматизировать рутинные операции.

Мы ждём, что вы

  • Администрировали высоконагруженные сервисы, умеете устранять неполадки
  • Пишете на Go или Python, владеете Bash
  • Знаете и используете ansible/puppet/salt
  • Уверенно администрируете системы Debian / Ubuntu / Red Hat
  • Понимаете, как устроены большие кластеры и как их обслуживать
  • Не боитесь коммуницировать с большим количеством смежных команд, строить и улучшать процессы

Будет плюсом, если вы

  • Разрабатывали на Go, Python или C++
  • Работали с Kubernetes и Helm
  • Занимались сборкой образов с использованием Packer/debootstrap
  • Выстраивали SLO/SLA для сервисов и инфраструктуры
  • Умеете работать с Terraform для управления инфраструктурой
  • Знакомы с процессами инцидент-менеджмента
  • Понимаете принципы работы очередей и распределённых систем
  • Разбираетесь в обеспечении отказоустойчивости серверных приложений

Похожие вакансии DevOps

hh.ru
нпп баум

SRE-инженер

нпп баумНа сервисе с: 25.08.26 18:32↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваГибрид

Мы — группа компаний, успешно объединяющая экспертизу в IT, проектировании и строительстве. Одно из наших ключевых направлений — сопровождение и развитие корпоративной IT-инфраструктуры и информационной безопасности внешних заказчиков.

Сейчас мы развиваем SRE направление, поэтому ищем опытного инженера, который будет проектировать отказоустойчивую архитектуру и выстраивать процессы.

Чем предстоит заниматься:

  • Проектировать и развивать observability: метрики, логи, трейсинг
  • Настраивать осмысленный алертинг — без шума, с приоритизацией по реальному влиянию на сервис
  • Участвовать в расследовании инцидентов, искать фундаментальную причину проблемы, а не только устранять симптом
  • Готовить структурированные разборы инцидентов и предлагать системные меры для предотвращения повторений
  • Взаимодействовать с инженерами и командами проектов, помогая выстраивать единый подход к мониторингу и надёжности

Что для нас важно:

  • Опыт в роли SRE от ~3 лет с опытом именно построения observability, а не только его поддержки
  • Уверенный опыт с Prometheus/Grafana, опыт работы с логированием и трейсингом (Loki и Tempo)
  • Опыт работы с docker, kubernetes
  • Опыт самостоятельного расследования инцидентов и написания post-mortem с фокусом на корневые причины
  • Готовность выстраивать процессы там, где их пока нет, без готовых шаблонов
  • Уверенный опыт с Linux системами, понимание принципов отказоустойчивости (репликация, кластеризация, балансировка, failover)

Будет плюсом:

  • Опыт внедрения SLI/SLO и работы с error budget на практике
  • Навыки автоматизации (Ansible, Python/Bash)

Мы предлагаем:

  • Надёжность: официальное оформление в штат по ТК РФ, ИТ-аккредитация, достойный прозрачный доход и премии по итогам работы

  • Гибридный формат: возможность совмещать работу из дома и офиса

  • Комфорт: современный офис рядом с м. Волгоградский проспект/Пролетарская

  • Оснащение: вся необходимая современная техника и компенсация корпоративной мобильной связи

  • Забота о здоровье: ДМС со стоматологией после испытательного срока

  • Корпоративные скидки: подключение к программе Best Benefits со скидками от партнеров с первого рабочего дня

  • Развитие: возможности для профессионального роста, открытая коммуникация и сильная команда экспертов

hh.ru
skillstaff

DevOps-инженер (Senior)

skillstaffНа сервисе с: 24.09.26 20:25
Зарплата не указанаРоссияМоскваУдалёнка
Мы ищем опытного DevOps-инженера
Ключевая задача - построить инфраструктуру с нуля. Продукт переезжает в контур и нужен человек, который спроектирует всё правильно с самого начала, настроит CI/CD, поднимет кластер и сделает так, чтобы команды разработки могли работать без "боли". Сейчас оркестрация на Docker Swarm и на время переезда планируется оставить на нём, а после завершения рассматривается переход на Kubernetes.

Стек: Docker, Docker Swarm, GitLab CI/CD, Nginx, PostgreSQL, Percona XtraDB Cluster (MySQL 8.0, Galera), Redis, S3-совместимое хранилище, в перспективе Kubernetes. Мониторинг: Prometheus, Grafana, Loki, Zabbix.
Облако на базе отечественных провайдеров.

Чем предстоит заниматься:

  • Проектировать и разворачивать инфраструктуру с нуля.
  • Настраивать CI/CD пайплайны для фронта и бэка, поднимать и сопровождать кластер Docker Swarm и выстраивать процессы деплоя, а после переезда спроектировать и провести миграцию на Kubernetes.
  • Администрировать кластер Percona XtraDB Cluster (отказоустойчивость, бэкапы, восстановление).
  • Настраивать мониторинг, алертинг и логирование, работать в связке с командами разработки, участвовать в технических переговорах с подрядчиками.

Для нас важно:

  • Опыт коммерческой работы в DevOps или SRE от 5-ти лет.
  • Реальный опыт проектирования инфраструктуры с нуля, а не только поддержка существующей.
  • Опыт работы с Docker Swarm в продакшне, уверенное знание Kubernetes в продакшне.
  • Опыт настройки GitLab CI/CD с раннерами и пайплайнами.
  • Понимание сетевой модели и проксирования через Nginx.
  • Опыт эксплуатации Percona XtraDB Cluster/Galera в продакшне (кворум и split-brain, SST/IST, bootstrap кластера после падения, бэкапы через Percona XtraBackup).
  • Опыт работы с Zabbix.
  • Опыт с отечественными облачными провайдерами (Yandex Cloud) и знание IaC-инструментов (Terraform, Ansible).

Главный принцип SkillStaff - Выбирай!

  • РАЗНООБРАЗИЕ ПРОЕКТОВ. Выбирай из сотен компаний и проектов то, что интересно и полезно для твоего роста. SkillStaff помогает реализовывать ежегодно порядка 500 различных ИТ-проектов для крупного бизнеса.
  • КОМФОРТ. SkillStaff — аккредитованная IT-компания, белая зарплата и удобный график работы. Создавай идеальные условия для своей работы: удаленная работа или возможность работать как в офисе клиента, так и в комфортном офисе SkillStaff в центре Москвы на Воздвиженке.
  • РАЗВИТИЕ. Выбирай сам путь, по которому ты хочешь развиваться. Используй возможность обмена опытом и получение знаний через участие в разных проектах, совместную работу с высококвалифицированными коллегами.
  • КУЛЬТУРА. Нашу культуру создают сами сотрудники – мы их слышим и помогаем развиваться, чтобы #вместе переходить на новый уровень!
hh.ru
bi.zone направление разработка

Инженер систем мониторинга

bi.zone направление разработкаНа сервисе с: 24.09.26 19:18
Зарплата не указанаРоссияМоскваУдалёнка

BI.ZONE создает IT-продукты для обеспечения кибербезопасности: от мобильных приложений до сложных платформ, в основе которых лежат методы машинного обучения. Благодаря нашим решениям жизнь десятков миллионов людей становится лучше и безопаснее.

Сейчас в команду мы ищем инженера аналитика систем мониторинга, который будет развивать системы логирования и мониторинга, администрировать Linux и PostgreSQL, автоматизировать инфраструктуру и выстраивать отказоустойчивые масштабируемые решения.

Чем предстоит заниматься:

  • Развитие систем мониторинга и логирования;
  • Внесение изменений и корректировок в системы мониторинга команды, участие в постановке новых сервисов на мониторинг;
  • Участие в поддержке, оптимизации и развитии инфраструктуры компании;
  • Внедрение и настройка стека технологий мониторинга (Prometheus, Zabbix, Grafana) с учётом требований отказоустойчивости и масштабируемости.
  • Внедрение и настройка стека технологий логирования (VictoriaMetrics, ELK/GrayLog, Syslog) с учётом требований отказоустойчивости и масштабируемости.

Что для нас важно:

  • Глубокие знания, опыт эксплуатации и сопровождения операционных систем семейства Linux (Oracle Linux 8, Debian, Ubuntu);
  • Опыт внедрения и сопровождения IT систем;
  • Опыт развертывания, настройки и администрирования инфраструктурных сервисов (Zabbix, Grafana, Prometheus, ELK, VictoriaMetrics);
  • Знание, опыт работы с PostgreSQL;
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server)
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform);
  • Soft-skills: коммуникативность, развитый time-management, инициативность, адаптируемость, а также желание профессионально и карьерно развиваться

Что нам также важно, но можем рассмотреть кандидатов и без этого:

  • Опыт настройки CI/CD систем (GitLab CI/CD);
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server);
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform).

Мы предлагаем:

Защищенность Все гарантии официального оформления по ТК РФ и преимущества аккредитованной IT-компании


Сообщества Регулярные профессиональные митапы и встречи для обмена опытом. А также сообщества по интересам: спорт, игры, книги, аниме

Гибкий график
Никто не следит, когда сотрудник садится за компьютер, сколько часов проводит в офисе, как часто работает удаленно

Забота о здоровье ДМС со стоматологией c первого месяца работы в компании

Обучение Сертификация, профильные курсы, конференции, митапы, хакатоны, CTF-ы

Свободная атмосфера У нас на «ты», никакого дресс-кода и лишней бюрократии

Самореализация Поддержка креатива и воплощение идей. Можно профессионально расти и развивать личный бренд

Скидки на фитнес, покупки и многое другое

Скидки от BestBenefits, «Фитмост», «СберПрайм+»и других компаний-партнеров для всех сотрудников

Корпоративная жизнь Крутые внутренние мероприятия и участие в спортивных стартах, а еще мерч и подарки

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.