
Команда Server Infrastructure занимается эксплуатацией быстро растущей инфраструктуры Yandex Cloud в рамках подразделения Cloud Foundation Services. Мы строим надёжную и масштабируемую инфраструктуру, поверх которой запускаются виртуальные…
яндекс На сервисе с: 09.10.26 08:22
Команда Server Infrastructure занимается эксплуатацией быстро растущей инфраструктуры Yandex Cloud в рамках подразделения Cloud Foundation Services. Мы строим надёжную и масштабируемую инфраструктуру, поверх которой запускаются виртуальные машины пользователей и внутренние сервисы. В сервисах реализуем различные сценарии работы с железом: от процессов ввода, вывода, починки до бесшовного обновления ОС на всём кластере.
Наши сервисы работают с большим количеством облачных и общих яндексовых систем, собирают данные о хостах, метрики состояния железа и кластера в целом, чтобы планировать обслуживание серверов и распределять ресурсы. Мы предоставляем сервисы и инструменты, которые упрощают и автоматизируют внутренние процессы, делают инфраструктуру прозрачнее и стабильнее, снимают с инженеров рутинную работу.
Под нашим управлением уже более 20 тыс. серверов в трёх дата-центрах Яндекса, и их количество непрерывно растёт. Мы разрабатываем и постоянно совершенствуем способы мониторинга наших серверов и подходы к нему так, чтобы заранее и автоматически диагностировать неполадки и выполнять обслуживание, не дожидаясь выхода серверов из строя.
В работе мы используем:
* Golang и Python для разработки сервисов и автоматики
* SaltStack и Terraform для описания инфраструктуры
* TeamCity и Spinnaker для процессов CI/CD
Автоматизация жизненного цикла серверов
Вам предстоит развивать систему эксплуатации инфраструктуры Yandex Cloud:
заменять ручные операции автоматикой — от ввода и вывода серверов
до бесшовного обновления ОС на всём кластере.
Разработка системы инвентаризации
Вы будете проектировать и дорабатывать систему инвентаризации, которая
объединяет физическую и логическую информацию обо всём парке железа, —
чтобы хранить и использовать данные об инфраструктуре было проще.
Разработка для Kubernetes
Вы будете участвовать в разработке Kubernetes-операторов и устройств на базе device plugin, а также интегрировать NRI (Node Runtime Interface) — инструменты, через которые облако управляет ресурсами узлов кластера и контейнерами
на хостах.
Разработка сервисов мониторинга
Вы будете заниматься разработкой сервисов-агентов для мониторинга, сбора метрик
и выполнения проверок на хостах — чтобы неполадки диагностировались
автоматически, до выхода сервера из строя.
Развитие инструментов планирования ресурсов
Также вы займётесь поддержкой и развитием инструментов, которые помогают планировать и распределять ресурсы внутри облака.
Больше о том, что под капотом платформы Yandex Cloud, — в канале Inside Yandex Cloud
* Пишете чистый код на Go — либо на Python и готовы быстро освоить Go
* Разрабатывали и поддерживали отказоустойчивые системы
* Выстраивали и эксплуатировали CI/CD-процессы для сервисов, использовали концепцию Infrasructure as Code
* Знаете, как построить идеальный мониторинг
* Любите улучшать процессы и автоматизировать задачи, писали сервисы и утилиты для автоматизации
* Работали с системами контейнеризации и управления конфигурациями: Docker, K8s, SaltStack, Ansible, Terraform
* Разрабатывали операторы и плагины для K8s
* Строили облачные сервисы
* Глубоко знаете Linux
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.