🚀 Ищем Lead DevOps Engineer (Bare Metal / GPU / LLM Infrastructure)
Неизвестный работодатель · На сервисе с: 02.10.26 11:07
🚀 Ищем Lead DevOps Engineer (Bare Metal / GPU / LLM Infrastructure)
📍 Локация: Сербия, Португалия, Испания, Польша, ОАЭ
🌍 Формат работы: удалённый
🗣 Русский язык и английский от B2
Основные задачи:
• Руководство небольшой командой DevOps/Infrastructure Engineers.
• Создание и эксплуатация bare-metal GPU-кластеров.
• Работа с физическими серверами, сетевой инфраструктурой, электропитанием и охлаждением.
• Управление GPU-драйверами, прошивками и оборудованием.
• Работа с Kubernetes, Terraform, ArgoCD и GitLab CI.
• Поддержка AWS и GCP для burst-нагрузок и failover.
• Эксплуатация self-hosted LLM: inference, fine-tuning и RAG-пайплайны.
• Контроль latency, throughput, использования памяти и стабильности сервисов.
• Оптимизация стоимости GPU-часа, токена и утилизации кластеров.
• Развитие мониторинга на базе Prometheus, Grafana и OpenTelemetry.
Требования:
• От 6 лет опыта в DevOps, Infrastructure или Platform Engineering.
• Практический опыт создания и эксплуатации bare-metal/on-premise-инфраструктуры.
• Опыт работы с физическими серверами, стойками, сетевой инфраструктурой и GPU-оборудованием.
• Глубокое понимание работы GPU, памяти и вычислительных ресурсов под нагрузкой.
• Production-опыт эксплуатации self-hosted open-weight LLM на локальных GPU-кластерах.
• Уверенное знание Linux, Docker и Kubernetes.
• Практический опыт с Terraform и ArgoCD или аналогичными GitOps-инструментами.
• Опыт разработки и поддержки GitLab CI/CD-пайплайнов.
• Опыт работы с AWS или GCP.
• Знание Prometheus, Grafana и OpenTelemetry.
• Опыт работы с SLO, error budgets, инцидентами и постмортемами.
• Опыт руководства инженерной командой с сохранением hands-on участия.
• Свободный русский язык и английский от B2.
Будет преимуществом:
• Hugging Face, LoRA или QLoRA.
• Qdrant, Pinecone или Weaviate.
• Ansible или Pulumi.
• Slurm и Kubernetes GPU Operator.
• Опыт работы с GPU-стойками высокой плотности.
• Планирование электропитания и охлаждения для AI/ML-инфраструктуры.
Важно:
Опыт исключительно с managed cloud не подходит. Нам нужен специалист, который лично создавал и эксплуатировал bare-metal/on-premise и GPU-инфраструктуру.
Если вам интересна позиция или вы можете порекомендовать подходящего специалиста, напишите мне в личные сообщения и отправьте резюме Yuliana Barysenka
#hiring #devops #leaddevops #platformengineering #sre #kubernetes #terraform #gpu #baremetal #llm #aiinfrastructure
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.