U

Head of Infrastructure

Unimatch Lab is an AI-driven venture studio from Silicon Valley.

unimatchlab · На сервисе с: 07.09.26 20:33

от 10 000 USDTПольшаКипрВеликобританияГерманияНидерландыИспанияПортугалияСербияСШАЧехияЛюксембургМолдоваЛатвияЧерногорияЛитваШвейцарияЭстонияВенгрияИсландияНорвегияРумынияФинляндияФранцияАвстрияГрецияДанияИталияСловакияУдалёнка

Head of Infrastructure

Location: Europe, MENA, LATAM, USA

Salary: Up to 10000 USDT

Company overview

Unimatch Lab is an AI-driven venture studio from Silicon Valley.

We are building our own AI technology stack and a portfolio of AI-driven assets: from consumer AI products and smart devices to on-prem LLM clusters and foundational layers (memory layer, RAM/VRAM optimization, orchestration, AI software for infrastructure and compute).

This includes R&D in local, distributed, and orbital data centers and distributed computing.

Goal: join the world's top 50 AI companies with a combined asset valuation of $10B+ by 2032.

We are an OKR-driven company: measurable outcomes, speed, transparency, and ownership.

We hire A-players: autonomous, fast, strong execution, high accountability.

Position summary

You own the infrastructure that runs self-hosted open-weight LLMs as production services on local GPU clusters. This is a Principal-level Platform / Infrastructure role: you design the system, ship it, operate it, and stay accountable for the trade-offs between latency, throughput, cost, and memory.

You work across on-prem and cloud (AWS and GCP) and treat inference, fine-tuning, GitOps, and reliability as one platform, not a lab experiment. Time goes into cluster and GPU capacity, inference and training pipelines, IaC and multi-cluster Kubernetes, observability, and the security boundary around models, secrets, and supply chain.

The load is high. You make architecture calls with incomplete information and own the outcome. English is the working language, written and spoken.

Key responsibilities

LLM as a production service

  • Deploy, operate, and evolve self-hosted open-weight LLMs on local GPU clusters, including inference and fine-tuning pipelines
  • Design RAG pipelines and model-serving paths that hold SLO under production traffic
  • Choose and justify latency, throughput, cost, and memory trade-offs, and keep those numbers visible in production

GPU and compute platform

  • Build and run GPU infrastructure with CUDA-level reasoning: scheduling, utilization, memory, and failure modes
  • Plan capacity for high-density compute and keep hybrid paths (on-prem and cloud) operable as one system

Infrastructure, GitOps, and delivery

  • Own production-scale Kubernetes (including multi-cluster), Terraform, and ArgoCD as the default change path
  • Design GitLab CI and custom pipelines so platform changes are reviewable, repeatable, and reversible
  • Keep Linux, networking, and performance work at the depth the cluster actually needs

Reliability, observability, and security

  • Run Prometheus, Grafana, and OpenTelemetry (logs, traces, metrics) against SLOs, SLAs, and error budgets
  • Lead incident response and postmortems for the LLM and platform surface
  • Own IAM, RBAC, zero-trust controls, and secrets (Vault / KMS / SSM), including secure CI/CD and supply-chain security

Required qualifications

  • 10+ years in DevOps, Infrastructure, or Platform Engineering, with confirmed work building and running large infrastructure in enterprise or large corporations
  • Production experience operating self-hosted open-weight LLMs on local GPU clusters: inference, fine-tuning, and day-2 operations as a live service
  • Architectural ownership: you make the call, write it down, and live with the production result
  • Comfortable working with high accountability and incomplete information
  • Hands-on with Hugging Face, LoRA / QLoRA, and RAG pipelines in production
  • Deep Linux (internals, networking, performance), Docker, and production-scale Kubernetes, including multi-cluster
  • Terraform as a default; Ansible or Pulumi in real use
  • GitLab CI and custom pipelines you have designed and run in production
  • Enterprise-level AWS and GCP
  • GPU infrastructure with CUDA-level thinking; you can reason about compute and memory under load
  • Vector databases in production paths: Qdrant, Pinecone, or Weaviate
  • Prometheus, Grafana, OpenTelemetry; SLO / SLA / error budgets; incident response and postmortems
  • IAM, RBAC, zero-trust, secrets management (Vault / KMS / SSM), secure CI/CD and supply-chain security
  • English B2, written and spoken

Preferred qualifications

  • STEM degree (science, technology, engineering, or mathematics)
  • Strong foundation in mathematics, physics, computer science, or engineering
  • Bare metal, on-prem, and hybrid infrastructure
  • Data center operations and high-density compute
  • Distributed computing
  • Tenure in Big Tech or large enterprise
  • Infrastructure built specifically for AI-first products and AI compute

Technology stack

  • Linux, Docker, Kubernetes (production-scale, multi-cluster)
  • Terraform (required), Ansible / Pulumi
  • GitOps: ArgoCD (required)
  • CI/CD: GitLab CI, custom pipelines
  • Multi-cloud: AWS and GCP (enterprise-level)
  • GPU infrastructure, CUDA, self-hosted LLM (inference and fine-tuning)
  • Hugging Face, LoRA / QLoRA, RAG pipelines
  • Vector databases: Qdrant / Pinecone / Weaviate
  • Prometheus, Grafana, OpenTelemetry
  • Vault / KMS / SSM, IAM, RBAC

Похожие вакансии DevOps

Другие площадки
agima

Senior DevOps-инженер

agimaНа сервисе с: 25.09.26 16:29
Зарплата не указанаРоссияМоскваОфис

AGIMA — крупнейший интегратор диджитал-решений в России с одной из сильнейших команд разработки. С 2006 года мы выпустили более 800 крупных проектов. Среди наших заказчиков Avito, Сбер, МегаФон, Финам, АльфаСтрахование, X5 Retail Group, Лемана ПРО, Ozon, Магнит и многие другие.

Принципы нашей работы:

  • Любим работать, умеем отдыхать.

  • Компания — для людей, а не люди для компании.

  • Если правила не работают — меняем.

  • Вторые роли нам не подходят.

  • Играем на стороне клиента.

Мы ищем DevOps-инженера в команду, которая занимается проектом крупнейшего производителя ювелирной продукции.

Что нам важно:

  • коммерческий опыт в DevOps или SRE от 4 лет;

  • реальный опыт проектирования и построения инфраструктуры с нуля;

  • опыт эксплуатации Docker Swarm в production;

  • уверенное знание и production-опыт Kubernetes;

  • опыт настройки GitLab CI/CD, раннеров и пайплайнов для фронтенда и бэкенда;

  • понимание сетевой модели и проксирования через Nginx;

  • опыт эксплуатации Percona XtraDB Cluster / Galera в production: кворум и split-brain, SST/IST, bootstrap после падения, бэкапы через Percona XtraBackup;

  • опыт работы с Docker, PostgreSQL, Redis и S3-совместимым хранилищем;

  • опыт настройки Prometheus, Grafana, Loki и Zabbix;

  • готовность участвовать в архитектурных решениях, работе с командами разработки и технических переговорах с подрядчиками.

Что предлагаем:

  • гибридный формат работы в Москве;

  • теплая атмосфера: клубы по интересам, летний выезд на природу AGIMA Camp и корпоративные вечеринки, куда можно приглашать и свою семью;

  • сильная команда: открытость к решению любых вопросов и поддержка в создании вашего личного бренда для профессионального роста;

  • особые бонусы: бесплатные билеты на культовый забег для IT-специалистов RUNIT;

  • профессиональное развитие: участие в профильных конференциях — оплатим дорогу и участие, если выступаете как спикер;

  • обучение: доступ к разработанным нами курсам по UX-дизайну, проджект-менеджменту, тимлидингу и другим направлениям.

hh.ru
Зарплата не указанаКазахстанАстанаОфис

Обязанности:
Администрирование и сопровождение платформы OpenStack.
Мониторинг доступности и производительности облачной инфраструктуры.
Диагностика и устранение инцидентов OpenStack, Linux, виртуализации и сетевой инфраструктуры.
Управление вычислительными ресурсами, виртуальными сетями и системами хранения.
Участие в развертывании, обновлении и масштабировании OpenStack.
Автоматизация типовых операций и процессов сопровождения.
Взаимодействие с командами сетевой инфраструктуры, систем хранения, информационной безопасности и разработчиками.
Поддержка технической документации и эксплуатационных инструкций.
Требования:
Практический опыт эксплуатации OpenStack.
Хорошее понимание Linux и принципов виртуализации.
Понимание архитектуры OpenStack и взаимодействия его основных компонентов.
Знание принципов построения виртуальных и физических сетей.
Понимание систем хранения данных и подключения дисковых ресурсов к виртуальным машинам.
Навыки поиска и устранения неисправностей.
Понимание принципов отказоустойчивости и высокой доступности.
Умение анализировать технические проблемы и самостоятельно находить их причину.
Навыки командной работы и взаимодействия со смежными техническими подразделениями.
Знание языков:
Казахский, Русский — свободное владение.
Английский — на уровне чтения технической документации и переписки по
Будет преимуществом:
опыт работы с Ceph;Kubernetes;VMware vSphere или Proxmox;Terraform;Fibre Channel / iSCSI / SAN; опыт эксплуатации OpenStack в production-среде;
Опыт обновления и масштабирования OpenStack;
Опыт работы с bare-metal серверами, PXE, IPMI/Redfish;
сертификаты Linux, OpenStack, Red Hat, Kubernetes или аналогичные.
Опыт работы в системном администрировании, Cloud/Infrastructure Engineering или DevOps — от 3 лет.
Практический опыт работы с OpenStack — желательно от 2 лет.
Опыт сопровождения production-инфраструктуры будет преимуществом.
Linux.
OpenStack: Nova, Neutron, Cinder, Keystone, Glance.
KVM/QEMU, libvirt. Open vSwitch. TCP/IP, VLAN, VXLAN, маршрутизация, Floating IP. Ansible. Git.Kolla-Ansible / Kayobe или аналогичные инструменты развертывания OpenStack. Prometheus, Grafana. Bash. Базовые знания Python.
Навыки работы с tcpdump, ip, ss, journalctl, systemctl и другими средствами диагностики Linux.
Работа с OpenStack, private cloud, виртуализацией и инфраструктурными платформами.
Приветствуется опыт работы в приоритетных отраслях:
телеком-операторы и провайдеры;
облачные провайдеры и дата-центры;
крупные системные интеграторы;
банки и крупные финансовые организации.

Условия:
Режим работы с 09:00 до 18:30 ч.
Мед.страхование
Развозка

hh.ru
инфосистемы джет

DevOps-инженер

инфосистемы джетНа сервисе с: 25.09.26 15:10
Зарплата не указанаРоссияМоскваУдалёнка

Инфосистемы Джет — технологический партнер крупнейших компаний в России. Мы строим, центры обработки данных, проектируем вычислительную инфраструктуру, оказываем сервис и поддерживаем работу десятков тысяч сотрудников наших клиентов по всех стране, внедряем прикладные решения в том числе на базе искусственного интеллекта.

Мы хотим усилить нашу команду, поэтому в поисках ​​​​​​​DevOps-инженера, который помог бы нам сопровождать платформы оркестрации и автоматизации ИТ-инфраструктуры у наших заказчиков: внедрение платформ оркестрации; реализации и сопровождение CI/CD Pipeline, миграция систем и сервисов; поддержание решений по высокой доступности и отказоустойчивости; реализация дополнительного функционала к платформе контейнеризации (Persistent Storage, backup, мониторинг, сети).

Чем предстоит заниматься:

поддерживать архитектуру DevOps решений у крупных корпоративных заказчиков, планировать и сопровождать миграции систем, решать проблемы производительности систем.


Что мы ожидаем от кандидата:

  • Высшее техническое образование.
  • Релевантный опыт работы от двух лет. Приветствуется опыт работы в поддержке высокодоступных систем 24/7.

  • Опыт работы с Kubernetes либо с OKD/Openshift, российскими аналогами.

  • Опыт работы с Nginx, Linux, Ansible, git.

  • Опыт написания скриптов на bash/python/go или др.

  • Понимание общих принципов работы ИТ-систем, сетевого стека, балансировки нагрузки.

  • Глубокое понимание механизмов работы оркестраторов, опыт диагностики проблем, возникающих внутри кластера.

  • Опыт внедрения/поддержки/развития средства автоматизации процессов доставки приложений (CI/CD).

Будет плюсом:

  • опыт работы с распределенными хранилищами Ceph;
  • опыт работы с Kafka, ELK, Promehteus, Grafana;
  • опыт работы с OKD/Openshift;
  • наличие сертификата Certified Kubernetes Administrator.

У нас:

  • Аккредитованная ИТ-компания. Мы на рынке уже 35 лет, постоянно развиваемся и не планируем останавливаться.
  • Формат работы. график 5/2 с 10:00 до 18:30.
  • Гибкий социальный пакет после испытательного срока. Выбирайте из ДМС, компенсации фитнеса и изучения иностранных языков.
  • Забота о вас и ваших близких. С первого дня компенсируем до 100% оклада 10 рабочих дней больничного в год. Соц. поддержка в сложных жизненных ситуациях, масштабные выездные мероприятия для сотрудников и их семей и круглосуточные медицинские консультации (очно и онлайн).
  • Возможность роста и обмена опытом. Регулярные обучения, курсы и сертификации за счёт компании.
  • Участие в ключевых профильных мероприятиях ИТ-рынка.
  • Необходимая техника для комфортной работы.
  • Онлайн-клубы по интересам. Jet Movies, Jet Travel, Jet Зверушки, сноуборд и горные лыжи, English Speaking Club, Фотоклуб.
  • Корпоративные скидки на всё, что можно оплатить онлайн: от электроники до салонов красоты, от ресторанов до авиабилетов.
  • Команда и атмосфера. Люди, которые любят своё дело. Мы про поддержку, взаимопомощь, «культуру плеча» и профессиональное комьюнити.
  • Оцениваем по результату и делаем проекты, которые другим кажутся невозможными.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.