G

Senior Site Reliability Engineer (Python, TypeScript)

Garner is on a mission to transform the U.S. healthcare system — and we’re the only proven player doing exactly that. We partner with employers to redesign how healthcare works: applying 550+ proprietary clinical metrics across 80+ special…

garner_health · На сервисе с: 20.08.26 18:12

Зарплата не указанаСШАУдалёнка

What you’ll be part of

Garner is on a mission to transform the U.S. healthcare system — and we’re the only proven player doing exactly that. We partner with employers to redesign how healthcare works: applying 550+ proprietary clinical metrics across 80+ specialties to a dataset of 320M+ patients to identify the best-performing doctors, then using compelling incentives to steer members to the care that helps them get healthier, faster.

The result is a rare “win win” — better care and lower costs for both members and employers. In just five years, our work has helped over 2.5 million people access higher-quality care and saved $1B in healthcare costs. We recently raised our Series E and have doubled five years running. If you've ever wanted your work to solve a problem that touches every person in this country, this is the opportunity to do exactly that. You'd be joining a team fundamentally reimagining healthcare in the U.S. — and using AI to scale that impact further and faster than anyone else can.

About the role:

We are seeking a Senior Site Reliability Engineer to own the reliability, performance, and resilience of the cloud infrastructure powering Garner’s products and AI/ML workloads. This role sits on our Platform Engineering team. You will run the machine: defining and upholding SLOs, leading incident response, and driving the automation and standards that let every Garner engineer ship faster and more reliably. Because our systems directly influence health outcomes for millions of patients, maintaining the highest standards of production quality is imperative. This is an automation-first role: you will use AI tools to continuously convert manual operational work into monitored, hands-free processes, so the role gets more leveraged as you build.

Where you will work:

Garner is headquartered in NYC, but this position is available for individuals who are comfortable with remote work and occasional travel to HQ. 

What you will do:

  • Run the Machine: Own the end-to-end reliability, performance, and resilience of Garner’s cloud environments (AWS, Kubernetes), including those powering AI/ML workloads; define, measure, and uphold SLOs across our critical services
  • Lead Incident Response: Serve in the on-call rotation, lead incident response, and drive deep-dive root cause analysis, seeing corrective actions through to resolution and rigorously reviewing infrastructure changes
  • Own Observability: Build and maintain the monitoring, alerting, and observability systems that let us detect and resolve issues before users feel them
  • Scale & Optimize: Translate ambiguous, high-performance scaling requirements into well-defined, automated, and composable infrastructure-as-code deliverables (Terraform); proactively identify and implement cost-efficiency and performance gains across the stack to maximize cloud ROI
  • Automate Away Toil: Pay down impactful tech debt and reduce operational toil, using AI tools and automation to convert repetitive operational work into hands-free, monitored processes, and holding our internal platform to the same rigorous standards as our customer-facing products
  • Enable Engineering: Build and maintain the deployment and observability standards that empower the broader engineering team to ship AI features faster and more reliably; communicate complex cloud and reliability concepts clearly to technical and non-technical stakeholders
  • Uphold Security & Compliance: Ensure our infrastructure and operations meet Garner’s security and HIPAA compliance obligations

The ideal candidate has:

  • 4+ years of hands-on experience operating production cloud infrastructure at scale in an SRE, DevOps, or platform engineering role
  • Deep expertise with Kubernetes and Terraform in a cloud-first environment (AWS preferred)
  • A strong track record with production observability: defining SLOs, building monitoring and alerting, and leading incident response and blameless post-incident reviews
  • Strong software engineering fundamentals in Python or Go, applied to infrastructure automation (experience with Kubernetes APIs a plus)
  • Experience driving cloud cost-efficiency and performance optimization across compute, storage, and networking
  • Experience supporting AI/ML or data-intensive workloads in production is a plus
  • Experience operating in a security-conscious or regulated environment (HIPAA, SOC 2) is a plus
  • Fluency with AI tools (e.g., Claude) applied to real engineering and operations workflows, or strong motivation to build it fast
  • A desire to be a part of a high-performing, mission-driven team that operates with intense urgency, a strong sense of individual accountability, and a commitment to authentic feedback

Technologies we use:

  • AWS, Kubernetes, Terraform, Istio, Python, Go, TypeScript, Postgres, NATS, Datadog, GitLab

This is a unique opportunity to join a fast-growing company in a transformative role, helping shape the future of healthcare.

We are unable to sponsor or take over sponsorship of an employment visa at this time.

Compensation Transparency:

The target range for this position is $191,000 - $226,000. Individual compensation for this role will depend on various factors, including qualifications, skills, and applicable laws. In addition to base compensation, this role is eligible to participate in our equity incentive and competitive benefits plans, including but not limited to: flexible PTO, Medical/Dental/Vision plan options, 401(k) with company match, flexible spending accounts, Teladoc Health and more.

Fraud and Security Notice: 

Please be aware of recent job scam attempts. Our recruiters use getgarner.com and garnerhealth.com email domains exclusively. If you have been contacted by someone claiming to be a Garner recruiter or a hiring manager from a different domain about a potential job, please report it to law enforcement here and to candidateprotection@garnerhealth.com.

Equal Employment Opportunity:

Garner Health is proud to be an Equal Employment Opportunity employer and values diversity in the workplace. We do not discriminate based upon race, religion, color, national origin, sex (including pregnancy, childbirth, reproductive health decisions, or related medical conditions), sexual orientation, gender identity, gender expression, age, status as a protected veteran, status as an individual with a disability, genetic information, political views or activity, or other applicable legally protected characteristics.

Garner Health is committed to providing accommodations for qualified individuals with disabilities in our recruiting process. If you need assistance or an accommodation due to a disability, you may contact us at talent@garnerhealth.com. 

Похожие вакансии DevOps

hh.ru
нпп баум

SRE-инженер

нпп баумНа сервисе с: 25.08.26 18:32↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМоскваГибрид

Мы — группа компаний, успешно объединяющая экспертизу в IT, проектировании и строительстве. Одно из наших ключевых направлений — сопровождение и развитие корпоративной IT-инфраструктуры и информационной безопасности внешних заказчиков.

Сейчас мы развиваем SRE направление, поэтому ищем опытного инженера, который будет проектировать отказоустойчивую архитектуру и выстраивать процессы.

Чем предстоит заниматься:

  • Проектировать и развивать observability: метрики, логи, трейсинг
  • Настраивать осмысленный алертинг — без шума, с приоритизацией по реальному влиянию на сервис
  • Участвовать в расследовании инцидентов, искать фундаментальную причину проблемы, а не только устранять симптом
  • Готовить структурированные разборы инцидентов и предлагать системные меры для предотвращения повторений
  • Взаимодействовать с инженерами и командами проектов, помогая выстраивать единый подход к мониторингу и надёжности

Что для нас важно:

  • Опыт в роли SRE от ~3 лет с опытом именно построения observability, а не только его поддержки
  • Уверенный опыт с Prometheus/Grafana, опыт работы с логированием и трейсингом (Loki и Tempo)
  • Опыт работы с docker, kubernetes
  • Опыт самостоятельного расследования инцидентов и написания post-mortem с фокусом на корневые причины
  • Готовность выстраивать процессы там, где их пока нет, без готовых шаблонов
  • Уверенный опыт с Linux системами, понимание принципов отказоустойчивости (репликация, кластеризация, балансировка, failover)

Будет плюсом:

  • Опыт внедрения SLI/SLO и работы с error budget на практике
  • Навыки автоматизации (Ansible, Python/Bash)

Мы предлагаем:

  • Надёжность: официальное оформление в штат по ТК РФ, ИТ-аккредитация, достойный прозрачный доход и премии по итогам работы

  • Гибридный формат: возможность совмещать работу из дома и офиса

  • Комфорт: современный офис рядом с м. Волгоградский проспект/Пролетарская

  • Оснащение: вся необходимая современная техника и компенсация корпоративной мобильной связи

  • Забота о здоровье: ДМС со стоматологией после испытательного срока

  • Корпоративные скидки: подключение к программе Best Benefits со скидками от партнеров с первого рабочего дня

  • Развитие: возможности для профессионального роста, открытая коммуникация и сильная команда экспертов

hh.ru
skillstaff

DevOps-инженер (Senior)

skillstaffНа сервисе с: 24.09.26 20:25
Зарплата не указанаРоссияМоскваУдалёнка
Мы ищем опытного DevOps-инженера
Ключевая задача - построить инфраструктуру с нуля. Продукт переезжает в контур и нужен человек, который спроектирует всё правильно с самого начала, настроит CI/CD, поднимет кластер и сделает так, чтобы команды разработки могли работать без "боли". Сейчас оркестрация на Docker Swarm и на время переезда планируется оставить на нём, а после завершения рассматривается переход на Kubernetes.

Стек: Docker, Docker Swarm, GitLab CI/CD, Nginx, PostgreSQL, Percona XtraDB Cluster (MySQL 8.0, Galera), Redis, S3-совместимое хранилище, в перспективе Kubernetes. Мониторинг: Prometheus, Grafana, Loki, Zabbix.
Облако на базе отечественных провайдеров.

Чем предстоит заниматься:

  • Проектировать и разворачивать инфраструктуру с нуля.
  • Настраивать CI/CD пайплайны для фронта и бэка, поднимать и сопровождать кластер Docker Swarm и выстраивать процессы деплоя, а после переезда спроектировать и провести миграцию на Kubernetes.
  • Администрировать кластер Percona XtraDB Cluster (отказоустойчивость, бэкапы, восстановление).
  • Настраивать мониторинг, алертинг и логирование, работать в связке с командами разработки, участвовать в технических переговорах с подрядчиками.

Для нас важно:

  • Опыт коммерческой работы в DevOps или SRE от 5-ти лет.
  • Реальный опыт проектирования инфраструктуры с нуля, а не только поддержка существующей.
  • Опыт работы с Docker Swarm в продакшне, уверенное знание Kubernetes в продакшне.
  • Опыт настройки GitLab CI/CD с раннерами и пайплайнами.
  • Понимание сетевой модели и проксирования через Nginx.
  • Опыт эксплуатации Percona XtraDB Cluster/Galera в продакшне (кворум и split-brain, SST/IST, bootstrap кластера после падения, бэкапы через Percona XtraBackup).
  • Опыт работы с Zabbix.
  • Опыт с отечественными облачными провайдерами (Yandex Cloud) и знание IaC-инструментов (Terraform, Ansible).

Главный принцип SkillStaff - Выбирай!

  • РАЗНООБРАЗИЕ ПРОЕКТОВ. Выбирай из сотен компаний и проектов то, что интересно и полезно для твоего роста. SkillStaff помогает реализовывать ежегодно порядка 500 различных ИТ-проектов для крупного бизнеса.
  • КОМФОРТ. SkillStaff — аккредитованная IT-компания, белая зарплата и удобный график работы. Создавай идеальные условия для своей работы: удаленная работа или возможность работать как в офисе клиента, так и в комфортном офисе SkillStaff в центре Москвы на Воздвиженке.
  • РАЗВИТИЕ. Выбирай сам путь, по которому ты хочешь развиваться. Используй возможность обмена опытом и получение знаний через участие в разных проектах, совместную работу с высококвалифицированными коллегами.
  • КУЛЬТУРА. Нашу культуру создают сами сотрудники – мы их слышим и помогаем развиваться, чтобы #вместе переходить на новый уровень!
hh.ru
bi.zone направление разработка

Инженер систем мониторинга

bi.zone направление разработкаНа сервисе с: 24.09.26 19:18
Зарплата не указанаРоссияМоскваУдалёнка

BI.ZONE создает IT-продукты для обеспечения кибербезопасности: от мобильных приложений до сложных платформ, в основе которых лежат методы машинного обучения. Благодаря нашим решениям жизнь десятков миллионов людей становится лучше и безопаснее.

Сейчас в команду мы ищем инженера аналитика систем мониторинга, который будет развивать системы логирования и мониторинга, администрировать Linux и PostgreSQL, автоматизировать инфраструктуру и выстраивать отказоустойчивые масштабируемые решения.

Чем предстоит заниматься:

  • Развитие систем мониторинга и логирования;
  • Внесение изменений и корректировок в системы мониторинга команды, участие в постановке новых сервисов на мониторинг;
  • Участие в поддержке, оптимизации и развитии инфраструктуры компании;
  • Внедрение и настройка стека технологий мониторинга (Prometheus, Zabbix, Grafana) с учётом требований отказоустойчивости и масштабируемости.
  • Внедрение и настройка стека технологий логирования (VictoriaMetrics, ELK/GrayLog, Syslog) с учётом требований отказоустойчивости и масштабируемости.

Что для нас важно:

  • Глубокие знания, опыт эксплуатации и сопровождения операционных систем семейства Linux (Oracle Linux 8, Debian, Ubuntu);
  • Опыт внедрения и сопровождения IT систем;
  • Опыт развертывания, настройки и администрирования инфраструктурных сервисов (Zabbix, Grafana, Prometheus, ELK, VictoriaMetrics);
  • Знание, опыт работы с PostgreSQL;
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server)
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform);
  • Soft-skills: коммуникативность, развитый time-management, инициативность, адаптируемость, а также желание профессионально и карьерно развиваться

Что нам также важно, но можем рассмотреть кандидатов и без этого:

  • Опыт настройки CI/CD систем (GitLab CI/CD);
  • Опыт работы с платформой виртуализации VMware vSphere(ESXi, vCenter Server);
  • Опыт работы с системами автоматизации инфраструктуры и контроля версий(GitLab, Ansible, Docker, Terraform).

Мы предлагаем:

Защищенность Все гарантии официального оформления по ТК РФ и преимущества аккредитованной IT-компании


Сообщества Регулярные профессиональные митапы и встречи для обмена опытом. А также сообщества по интересам: спорт, игры, книги, аниме

Гибкий график
Никто не следит, когда сотрудник садится за компьютер, сколько часов проводит в офисе, как часто работает удаленно

Забота о здоровье ДМС со стоматологией c первого месяца работы в компании

Обучение Сертификация, профильные курсы, конференции, митапы, хакатоны, CTF-ы

Свободная атмосфера У нас на «ты», никакого дресс-кода и лишней бюрократии

Самореализация Поддержка креатива и воплощение идей. Можно профессионально расти и развивать личный бренд

Скидки на фитнес, покупки и многое другое

Скидки от BestBenefits, «Фитмост», «СберПрайм+»и других компаний-партнеров для всех сотрудников

Корпоративная жизнь Крутые внутренние мероприятия и участие в спортивных стартах, а еще мерч и подарки

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.