яндекс

Разработчик системы трейсинга

Мы — команда, которая отвечает за разработку и развитие распределённой системы трассировки внутри observability-платформы. Наша система используется повсеместно в Яндексе и Yandex Cloud: она помогает инженерам анализировать производительно…

яндекс · На сервисе с: 17.09.26 13:21

Зарплата не указанаНе указана странаЛокация не указана

Мы — команда, которая отвечает за разработку и развитие распределённой системы трассировки внутри observability-платформы. Наша система используется повсеместно в Яндексе и Yandex Cloud: она помогает инженерам анализировать производительность, выявлять инциденты и понимать поведение сложных распределённых систем.

Это критически важная и высоконагруженная инфраструктура, через которую ежедневно проходят миллиарды трассировок от сотен микросервисов. Надёжность и производительность нашего решения напрямую влияют на устойчивость ключевых сервисов Яндекса.

Трейсинг в числах:

* 20 ГБ/с поток на запись

* Миллиарды трассировок в день

* Кластер обработки данных: 600 контейнеров, 3600 CPU, 9 ТБ RAM

* 5 ПБ хранилище в ClickHouse

Технологический стек:

* Язык: Golang

* Протоколы: gRPC, HTTP, Protobuf

* Хранение: ClickHouse, YDB

* Observability: OpenTelemetry, Jaeger

* Оркестрация: Kubernetes, внутренняя облачная инфраструктура Яндекса

Масштабирование и повышение доступности системы

Необходимо обеспечить стабильную работу системы распределённого трассирования в условиях роста нагрузки. Это включает в себя анализ текущих узких мест, проектирование и внедрение решений для горизонтального масштабирования, отказоустойчивости и балансировки нагрузки. Вам предстоит работать с распределённым хранилищем трасс, компонентами ingestion и обработки, а ещё вместе с командой создавать стратегию обеспечения высокой доступности (high availability) всей системы.

Разработка горячего хранилища

Вы будете участвовать в разработке подсистемы горячего хранения трассировок, в которой данные временно накапливаются в памяти до их перекладывания в холодное хранилище. Эта подсистема должна обеспечивать высокую скорость приёма трасс, хранение в оперативной памяти и выполнение вычислений — агрегация, расчёт метрик, выделение аномалий — и других форм аналитики. По итогам обработки данные структурируются и отправляются в долговременное (холодное) хранилище. Важно обеспечить стабильную работу при высоких объёмах данных и реализовать гибкие механизмы управления жизненным циклом трассировок в памяти.

Развитие пользовательских сценариев для ускорения получения инсайтов

Вам предстоит улучшать пользовательский опыт при работе с системой трассировки: разрабатывать сценарии, позволяющие быстрее выявлять причины деградаций, ошибок и аномалий. Это подразумевает создание механизмов фильтрации и группировки трассировок, построение автоматических срезов (например, «медленные запросы», «ошибочные трассы», «редкие паттерны»), а также интеграцию с другими источниками информации: логами, метриками, алертами. Цель — свести к минимуму время между обнаружением проблемы и её пониманием.

Применение AI/ML к трассировкам: генерация и проверка гипотез, создание MVP

Нужно будет активно участвовать в исследовании возможностей применения AI/ML к данным трассировок. То есть как генерировать собственные идеи, так и проверять уже сформулированные гипотезы — от автоматического выявления аномалий до объяснения причин инцидентов с помощью моделей. Особое внимание будет уделено созданию MVP-инструментов, использующих большие языковые модели (BLM) для анализа и интерпретации трассировок, генерации кратких описаний, ответов на запросы инженеров и построения пользовательских сценариев. Задача требует инициативности, способности быстро собирать прототипы, работы с реальными данными и совместной итерации с ML-экспертами и продуктовыми командами.

Участие в развитии observability-платформы

Система трассировки — ключевой компонент широкой observability-платформы, включающей в себя также логи, метрики, алерты и пользовательские сценарии. Вам предстоит участвовать в архитектурной и технической проработке решений на стыке этих направлений: обеспечивать корреляцию трасс с логами и метриками, участвовать в унификации пользовательского интерфейса и API, выстраивать единые принципы хранения, навигации и анализа данных. Важна способность мыслить в масштабе всей платформы, видеть связи между подсистемами и предлагать решения, повышающие наблюдаемость сложных распределённых систем в целом.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Уверенно владеете Golang
* Разрабатывали высоконагруженные распределённые системы
* Понимаете принципы observability: трассировка, метрики, логи
* Умеете работать в команде, принимать технические решения и брать на себя ответственность
* Хотите решать сложные задачи, которые напрямую влияют на весь Яндекс

* Работали с различными инструментами трейсинга
* Работали с базами данных, аналогичными ClickHouse

Смотрите другие вакансии направления Yandex Cloud Observability Platform по ссылке.

Похожие вакансии Go

Соц.сети
Н

Senior Backend Developer

Неизвестный работодательНа сервисе с: 24.09.26 21:03
Зарплата не указанаКазахстанАлматыОфис

Senior Backend Developer

Местоположение: Алматы
Формат работы: Офис
Опубликована: ••••••••

Требования:
• 5+ лет коммерческой backend-разработки
• Сильный опыт Go, построения high-load, конкурентных и асинхронных сервисов
• Опыт с Python (FastAPI, Pydantic, SQLAlchemy, asyncio)
• Опыт с реляционными БД и MySQL: схемы, индексы, сложный SQL и оптимизация запросов

Контакт: ••••••••

•••••••• опубликована в ••••••••

Соц.сети
Н

Senior Payment Engineer

Неизвестный работодательНа сервисе с: 24.09.26 20:37
Зарплата не указанаВесь мирУдалёнка

Senior Payment Engineer

Местоположение: Весь мир
Формат работы: Удаленно
Опубликована: ••••••••

Требования:
• Senior backend-инженер с 5+ годами коммерческой разработки и сильным Go или Node.js/TypeScript
• Практический опыт payment orchestration и карточной токенизации, понимание PCI DSS
• Опыт нескольких PSP/эквайеров, recurring payments, обработки отказов и идемпотентности
• Опыт стартапов и самостоятельного ведения задач от технического решения до запуска

О компании:
Стартап создаёт AI-native commerce-платформу для DTC-бизнесов с подписочной моделью; проект финансируют фаундеры, построившие портфель e-commerce-бизнесов с годовой выручкой $100M+.

Контакт: ••••••••

•••••••• опубликована в ••••••••

hh.ru
гарда технологии

Senior Golang Developer

гарда технологииНа сервисе с: 24.09.26 19:10
Зарплата не указанаРоссияНижний НовгородУдалёнка

Немного о проекте:

Гарда DSPM – система аудита и управления безопасностью данных в инфраструктуре заказчика.

Основные задачи: непрерывное обнаружение и инвентаризация чувствительных данных в инфраструктуре заказчика, автоматическая классификация (персональные данные, коммерческая, государственная тайна), оценка доступов, расчет рисков, построение единой карты активов с рекомендациями по устранению наиболее критичных рисков.

Чем предстоит заниматься:

- участвовать во всех этапах разработки: проектирование, реализация, ревью и стабилизация;

- проводить качественное ревью кода коллег анализируя полноту реализации и соответствие ее требованиям задачи;

- проводить рефакторинг уже имеющихся подсистем.

На Go мы ведем разработку сервисных модулей системы, осуществляющих обработку данных, управление задачами, двунаправленная коммуникация со сторонними продуктами внутри компании и внешними системами. Мы работаем по Agile в кросс-функциональных scrum командах. Код в Gitlab, задачи в Jira.

Наш стек:
  • понимание процесса промышленной разработки и мышление целями бизнеса;

  • активная жизненная позиция, высокий уровень самоорганизации;

  • английский на уровне чтения технической документации;

  • опыт работы по Scrum;

  • опыт разработки продуктов на языке Go от 3 лет;

  • понимание основ микросервисной архитектуры;

  • опыт разработки REST и gRPC сервисов;

  • знание основных структур данных, алгоритмов, паттернов проектирования;

  • опыт разработки многопоточных систем, понимание проблемы синхронизации и механизмов ее решения.

Будет плюсом:
  • умение работать с docker, kubernetes;

  • опыт работы с брокерами и кешами: Kafka, NATS, RabbitMQ, Redis, ELK;

  • опыт проектирования и/или разработки систем требовательных к производительности;

  • опыт отладки сценариев с высокой нагрузкой / большим объемом данных.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.