Рабочие задачи:
- Администрирование Linux: Управление кластерами серверов (Ubuntu), настройка ядра, дисковых подсистем (LVM), сетевых интерфейсов и iptables.
- CI/CD и автоматизация: Проектирование пайплайнов в GitLab CI, написание скриптов на Bash/Python для развертывания и обновления LLM-сервисов.
- Контейнеризация и оркестрация: Полный цикл работы с Kubernetes (деплой, обновления, масштабирование, Ingress, Network Policies, Helm).
- IaC: Управление инфраструктурой через Terraform и AWX (Ansible).
- Мониторинг и Observability: Настройка Prometheus + Grafana, ELK-стека, сбор метрик GPU (DCGM) и логов инференс-серверов.
- LLM-инфраструктура:
- Развертывание и обслуживание инференс-движков (vLLM, llama.cpp) в K8s с оптимизацией под GPU.
- Настройка единой точки входа к моделям через LiteLLM (прокси, роутинг, управление ключами и лимитами).
- Развертывание пользовательского интерфейса Open WebUI для тестирования и демонстрации моделей.
- Разработка вспомогательной обвязки (harness): скриптов и микросервисов для обработки запросов, валидации ответов, логирования диалогов и интеграции с внутренними системами.
Мы ожидаем, что вы имеете:
- Опыт администрирования Linux от 3-х лет: сети (iptables, routing), диски (LVM, файловые системы), systemd.
- Знание Python (автоматизация, работа с REST API, написание операторов для K8s, обработка потоковых данных).
- Опыт с Kubernetes в продакшене от 2-х лет (Helm, операторы, политики безопасности).
- Стек: GitLab CI, Git, Docker, Ansible, облачные провайдеры (AWS / Yandex Cloud).
Будет большим плюсом:
- Опыт развертывания vLLM или llama.cpp в кластере с GPU (понимание параметров квантования, batch-обработки, управления памятью).
- Навыки настройки LiteLLM (конфигурация моделей, прокси, rate limiting, логирование затрат).
- Опыт работы с Open WebUI или аналогичными чат-интерфейсами.
- Умение работать с GPU-инфраструктурой: установка NVIDIA драйверов, CUDA, NVIDIA GPU Operator, MIG (Multi-Instance GPU).
- Понимание принципов построения RAG-систем (Retrieval-Augmented Generation): как работает ретривер, эмбеддинги, чанкинг документов, интеграция с LLM для ответов на основе контекста.
- Понимание принципов 12-factor app.
Мы предлагаем:
- Гибридный офис или возможность работать полностью удаленно;
- Работу в команде единомышленников;
- Фиксированный график 5/2, пн-пт 10:00 – 18:30;
- Трудоустройство в штат по ТК РФ;
- Комфортная атмосфера: культура поддержки и внутренние конкурсы;
- Корпоративная программа лояльности, скидки на товары и услуги партнёров;
- Обучение и развитие: курсы английского и других иностранных языков.