
Команда Deploy Platform развивает инфраструктурное контейнерное облако, в котором располагаются сервисы, создаваемые тысячами разработчиков Яндекса. Под управлением инфраструктурного облака находятся более 120 тысяч серверов и более 50 тыс…
яндекс · На сервисе с: 20.06.26 11:26
↑ Вакансия с автоподнятиемКоманда Deploy Platform развивает инфраструктурное контейнерное облако, в котором располагаются сервисы, создаваемые тысячами разработчиков Яндекса. Под управлением инфраструктурного облака находятся более 120 тысяч серверов и более 50 тысяч приложений (около миллиона контейнеров), а также суперкомпьютеры, которые входят в топ-100 мирового рейтинга. Мы создаём, поддерживаем и используем множество сервисов и инструментов, чиним опенсорс-компоненты, отправляем патчи в upstream; стремимся применять лучшие практики SRE, минимизировать рутину и автоматизировать эксплуатацию. Наша цель — сократить время запуска сервиса и снизить стоимость ресурсов облака.
Пользователям мы помогаем запускать и эксплуатировать сервисы: настраиваем балансировку, предоставляем мониторинг поднятых сервисов, собираем логи, поддерживаем интеграцию с CI/CD и т. д. Стремимся сделать из облака единую интегрированную платформу (PaaS) для удобной и качественной разработки сервисов с использованием стандартных механизмов API, UI и подхода Infrastructure as Code.
Ищем опытного DevOps-инженера, который сможет включиться в построение гибридных облаков и обеспечить безопасную эксплуатацию кластера.
Развивать и совершенствовать автоматизацию обновлений облака
Вы будете поддерживать и модернизировать hostmanager — ключевой сервис для управления жизненным циклом хостов в облаке, автоматизировать обновления ОС, ядра, системных компонентов и Kubernetes-нод с минимальным влиянием на работающие сервисы, разрабатывать механизмы безопасного канареечного развёртывания и отката обновлений, интегрировать лучшие практики CI/CD и Infrastructure as Code в процессы эксплуатации инфраструктуры.
Управлять парком хостов (более 100 тысяч единиц)
Необходимо будет обеспечивать высокую доступность и производительность всей инфраструктуры, анализировать метрики, логи и события для выявления и предотвращения инцидентов, участвовать в проектировании систем мониторинга, алертинга и диагностики на уровне хостов и кластеров, работать с распределёнными системами, оптимизировать использование ресурсов и снижать время простоя.
Улучшать безопасность и изоляцию системных компонентов
Вам предстоит работать над изоляцией dom0 и других критических компонентов виртуализации и оркестрации, внедрять механизмы безопасной загрузки (secure boot), контроля целостности и изоляции окружения. Вы будете анализировать уязвимости и участвовать в повышении уровня защищённости инфраструктуры на всех уровнях: от железа до оркестратора.
Развёртывать и развивать bare-metal-кластеры Kubernetes
Вам предстоит проектировать и внедрять решения для развёртывания и эксплуатации крупных bare-metal-кластеров Kubernetes в выделенных дата-центрах, исследовать и адаптировать инфраструктурные сервисы для работы в гибридных средах — на физических серверах и в облаках. Вы будете участвовать в развёртывании критически важных систем в Kubernetes (например, YT — платформы для распределённых вычислений), обеспечивать высокую производительность и отказоустойчивость. Работать с low-level-компонентами: Container Runtime (Porto), CNI, CSI, node agents, системными демонами, а также с настройкой ядра Linux и аппаратной спецификой серверов; разрабатывать собственные инструменты и контроллеры для Kubernetes, автоматизировать рутинные операции.
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.