A

Senior SRE Engineer (Python)

We currently have several large-scale projects and are expanding our infrastructure team. Our product is an advanced platform for creating and managing AI agents. It can be deployed directly inside a customer’s infrastructure and delivered…

acclaim · На сервисе с: 26.06.26 11:45

Зарплата не указанаНе указана странаЛокация не указанаУдалёнка

We currently have several large-scale projects and are expanding our infrastructure team. Our product is an advanced platform for creating and managing AI agents. It can be deployed directly inside a customer’s infrastructure and delivered as an enterprise solution, while also being available as a SaaS version.

Under the hood, there is real-time voice and telephony, GPU and LLM inference, streaming analytics, and all of this runs both in the cloud and on-prem, including in banking environments. There is a lot of infrastructure; it is complex, interesting, and sometimes at the edge of what is possible. That is why we are looking for a strong SRE who, like us, cares about making systems transparent, reliable, and built the right way.

This is a role for a strong, independent engineer. A Senior SRE  with real influence and a voice in how things are built and operated.

You will also handle DevOps tasks for the team, but your main focus and area of expertise should be SRE: reliability, observability, incident management, and performance under load.

What you will be doing

  • You will be responsible for the reliability of our services: SLIs/SLOs, availability, and identifying and eliminating bottlenecks across the system.

  • You will set up monitoring for services, metrics, alerts, and dashboards. This will rarely come as a clearly defined task; more often, you will decide what is important to measure and bring it to a clear, usable view.

  • You will build and maintain Grafana dashboards that people actually use, both our team and our customers.

  • You will run load testing, analyze the results, and provide recommendations on resources and scaling.

  • You will investigate incidents, participate in on-call rotations, write and lead postmortems, and ensure the same failure does not happen again.

  • You will work closely with developers: communicate and defend your position, challenge technical decisions, and find win-win solutions.

  • You will develop and support Kubernetes-based infrastructure across our clouds, including GCP and AWS, automate routine work, and help with CI/CD and general team tasks.

  • You will take part in delivering and supporting the platform for customers, including on-prem deployments.

  • You will mentor colleagues and help raise the engineering bar across the team.

Requirements: technical hard skills

  • 5+ years in SRE/DevOps. You have not just seen production; you have been responsible for the reliability of high-load production systems.

  • Deep, practical understanding of Docker and Kubernetes. You have operated them in production, not just used them in tutorials.

  • Mature understanding of metrics and alerts, with real hands-on experience writing, tuning, and maintaining them.

  • Practical experience with Prometheus, Alertmanager, and Grafana.

  • Ability and willingness to build dashboards and make them clear, useful, and easy to work with.

  • Experience with SLIs/SLOs, reliability management, incident investigation, and postmortems.

  • Experience with load testing and basic capacity planning.

  • Python: you can write code and confidently read and modify other people’s code for automation, exporters, tooling, and related tasks.

  • Cloud experience with GCP and/or AWS, strong Linux skills, and solid networking knowledge at an operational level.

  • DevOps fundamentals: CI/CD and infrastructure as code, including GitHub Actions, Terraform, Ansible, and similar tools.

  • Willingness to understand and support the product in customer environments, including on-prem deployments.

Requirements, soft skills

  • Ownership mindset: you take responsibility for a task, drive it to completion, and think one step ahead.

  • Friendly, non-toxic, and pleasant to work with.

  • Strong communication with developers: you can clearly and constructively explain your position, defend it when needed, and find common ground.

  • Willingness and ability to mentor, teach, and share knowledge with others.

  • Analytical mindset: you dig down to the root cause instead of just treating symptoms.

  • Proactivity: you would rather prevent an outage than heroically fight it later.

  • Strong attention to detail and reliability.

Nice to have

  • Experience using AI agents for routine and recurring tasks.

  • Real-time telephony: SIP, FreeSWITCH, RTP, WebRTC.

  • GPU/ML serving: Triton, vLLM, RunPod, Nebius, Lambda, run:ai, DCGM; understanding of the specifics of deploying LLM/ML models.

  • Streaming data and analytics: Kafka, ClickHouse.

  • Deep experience with IaC and GitOps, such as Terraform, Ansible, ArgoCD; logging with Loki/ELK; gRPC.

  • Experience working in isolated and highly secure environments.

  • Experience preparing systems for significant growth in load.


    What we offer

  • The team has built award-winning AI products for tech corporations — devices, voice assistants, products that are actually in the world 

  • Cutting-edge tech stack: Speech Technologies, NLP, Generative AI (LLMs, diffusion models), voice-first agentic architecture with privacy-first and on-premises deployment

  • High engineering bar and real ownership — the team cares about what actually works in production, not what looks good in a demo, and you'll see the impact of your work directly 

  • Fast career progression — a senior-heavy team and a high volume of real problems means you grow faster than you would anywhere else 

  • Startup pace with enterprise stability — real clients, real revenue, no bureaucracy 

  • Fully remote across Europe

  • 21 vacation days + public holidays + 5 sick days 

  • Private English lessons via Preply

Похожие вакансии DevOps

hh.ru
нпп баум

SRE-инженер

нпп баумНа сервисе с: 25.08.26 18:32↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваГибрид

Мы — группа компаний, успешно объединяющая экспертизу в IT, проектировании и строительстве. Одно из наших ключевых направлений — сопровождение и развитие корпоративной IT-инфраструктуры и информационной безопасности внешних заказчиков.

Сейчас мы развиваем SRE направление, поэтому ищем опытного инженера, который будет проектировать отказоустойчивую архитектуру и выстраивать процессы.

Чем предстоит заниматься:

  • Проектировать и развивать observability: метрики, логи, трейсинг
  • Настраивать осмысленный алертинг — без шума, с приоритизацией по реальному влиянию на сервис
  • Участвовать в расследовании инцидентов, искать фундаментальную причину проблемы, а не только устранять симптом
  • Готовить структурированные разборы инцидентов и предлагать системные меры для предотвращения повторений
  • Взаимодействовать с инженерами и командами проектов, помогая выстраивать единый подход к мониторингу и надёжности

Что для нас важно:

  • Опыт в роли SRE от ~3 лет с опытом именно построения observability, а не только его поддержки
  • Уверенный опыт с Prometheus/Grafana, опыт работы с логированием и трейсингом (Loki и Tempo)
  • Опыт работы с docker, kubernetes
  • Опыт самостоятельного расследования инцидентов и написания post-mortem с фокусом на корневые причины
  • Готовность выстраивать процессы там, где их пока нет, без готовых шаблонов
  • Уверенный опыт с Linux системами, понимание принципов отказоустойчивости (репликация, кластеризация, балансировка, failover)

Будет плюсом:

  • Опыт внедрения SLI/SLO и работы с error budget на практике
  • Навыки автоматизации (Ansible, Python/Bash)

Мы предлагаем:

  • Надёжность: официальное оформление в штат по ТК РФ, ИТ-аккредитация, достойный прозрачный доход и премии по итогам работы

  • Гибридный формат: возможность совмещать работу из дома и офиса

  • Комфорт: современный офис рядом с м. Волгоградский проспект/Пролетарская

  • Оснащение: вся необходимая современная техника и компенсация корпоративной мобильной связи

  • Забота о здоровье: ДМС со стоматологией после испытательного срока

  • Корпоративные скидки: подключение к программе Best Benefits со скидками от партнеров с первого рабочего дня

  • Развитие: возможности для профессионального роста, открытая коммуникация и сильная команда экспертов

hh.ru
skillstaff

DevOps-инженер (Senior)

skillstaffНа сервисе с: 24.09.26 20:25
Зарплата не указанаРоссияМоскваУдалёнка
Мы ищем опытного DevOps-инженера
Ключевая задача - построить инфраструктуру с нуля. Продукт переезжает в контур и нужен человек, который спроектирует всё правильно с самого начала, настроит CI/CD, поднимет кластер и сделает так, чтобы команды разработки могли работать без "боли". Сейчас оркестрация на Docker Swarm и на время переезда планируется оставить на нём, а после завершения рассматривается переход на Kubernetes.

Стек: Docker, Docker Swarm, GitLab CI/CD, Nginx, PostgreSQL, Percona XtraDB Cluster (MySQL 8.0, Galera), Redis, S3-совместимое хранилище, в перспективе Kubernetes. Мониторинг: Prometheus, Grafana, Loki, Zabbix.
Облако на базе отечественных провайдеров.

Чем предстоит заниматься:

  • Проектировать и разворачивать инфраструктуру с нуля.
  • Настраивать CI/CD пайплайны для фронта и бэка, поднимать и сопровождать кластер Docker Swarm и выстраивать процессы деплоя, а после переезда спроектировать и провести миграцию на Kubernetes.
  • Администрировать кластер Percona XtraDB Cluster (отказоустойчивость, бэкапы, восстановление).
  • Настраивать мониторинг, алертинг и логирование, работать в связке с командами разработки, участвовать в технических переговорах с подрядчиками.

Для нас важно:

  • Опыт коммерческой работы в DevOps или SRE от 5-ти лет.
  • Реальный опыт проектирования инфраструктуры с нуля, а не только поддержка существующей.
  • Опыт работы с Docker Swarm в продакшне, уверенное знание Kubernetes в продакшне.
  • Опыт настройки GitLab CI/CD с раннерами и пайплайнами.
  • Понимание сетевой модели и проксирования через Nginx.
  • Опыт эксплуатации Percona XtraDB Cluster/Galera в продакшне (кворум и split-brain, SST/IST, bootstrap кластера после падения, бэкапы через Percona XtraBackup).
  • Опыт работы с Zabbix.
  • Опыт с отечественными облачными провайдерами (Yandex Cloud) и знание IaC-инструментов (Terraform, Ansible).

Главный принцип SkillStaff - Выбирай!

  • РАЗНООБРАЗИЕ ПРОЕКТОВ. Выбирай из сотен компаний и проектов то, что интересно и полезно для твоего роста. SkillStaff помогает реализовывать ежегодно порядка 500 различных ИТ-проектов для крупного бизнеса.
  • КОМФОРТ. SkillStaff — аккредитованная IT-компания, белая зарплата и удобный график работы. Создавай идеальные условия для своей работы: удаленная работа или возможность работать как в офисе клиента, так и в комфортном офисе SkillStaff в центре Москвы на Воздвиженке.
  • РАЗВИТИЕ. Выбирай сам путь, по которому ты хочешь развиваться. Используй возможность обмена опытом и получение знаний через участие в разных проектах, совместную работу с высококвалифицированными коллегами.
  • КУЛЬТУРА. Нашу культуру создают сами сотрудники – мы их слышим и помогаем развиваться, чтобы #вместе переходить на новый уровень!
hh.ru
bi.zone направление разработка

Инженер систем мониторинга

bi.zone направление разработкаНа сервисе с: 24.09.26 19:18
Зарплата не указанаРоссияМоскваУдалёнка

BI.ZONE создает IT-продукты для обеспечения кибербезопасности: от мобильных приложений до сложных платформ, в основе которых лежат методы машинного обучения. Благодаря нашим решениям жизнь десятков миллионов людей становится лучше и безопаснее.

Сейчас в команду мы ищем инженера аналитика систем мониторинга, который будет развивать системы логирования и мониторинга, администрировать Linux и PostgreSQL, автоматизировать инфраструктуру и выстраивать отказоустойчивые масштабируемые решения.

Чем предстоит заниматься:

  • Развитие систем мониторинга и логирования;
  • Внесение изменений и корректировок в системы мониторинга команды, участие в постановке новых сервисов на мониторинг;
  • Участие в поддержке, оптимизации и развитии инфраструктуры компании;
  • Внедрение и настройка стека технологий мониторинга (Prometheus, Zabbix, Grafana) с учётом требований отказоустойчивости и масштабируемости.
  • Внедрение и настройка стека технологий логирования (VictoriaMetrics, ELK/GrayLog, Syslog) с учётом требований отказоустойчивости и масштабируемости.

Что для нас важно:

  • Глубокие знания, опыт эксплуатации и сопровождения операционных систем семейства Linux (Oracle Linux 8, Debian, Ubuntu);
  • Опыт внедрения и сопровождения IT систем;
  • Опыт развертывания, настройки и администрирования инфраструктурных сервисов (Zabbix, Grafana, Prometheus, ELK, VictoriaMetrics);
  • Знание, опыт работы с PostgreSQL;
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server)
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform);
  • Soft-skills: коммуникативность, развитый time-management, инициативность, адаптируемость, а также желание профессионально и карьерно развиваться

Что нам также важно, но можем рассмотреть кандидатов и без этого:

  • Опыт настройки CI/CD систем (GitLab CI/CD);
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server);
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform).

Мы предлагаем:

Защищенность Все гарантии официального оформления по ТК РФ и преимущества аккредитованной IT-компании


Сообщества Регулярные профессиональные митапы и встречи для обмена опытом. А также сообщества по интересам: спорт, игры, книги, аниме

Гибкий график
Никто не следит, когда сотрудник садится за компьютер, сколько часов проводит в офисе, как часто работает удаленно

Забота о здоровье ДМС со стоматологией c первого месяца работы в компании

Обучение Сертификация, профильные курсы, конференции, митапы, хакатоны, CTF-ы

Свободная атмосфера У нас на «ты», никакого дресс-кода и лишней бюрократии

Самореализация Поддержка креатива и воплощение идей. Можно профессионально расти и развивать личный бренд

Скидки на фитнес, покупки и многое другое

Скидки от BestBenefits, «Фитмост», «СберПрайм+»и других компаний-партнеров для всех сотрудников

Корпоративная жизнь Крутые внутренние мероприятия и участие в спортивных стартах, а еще мерч и подарки

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.