
Поиск — первый и ключевой сервис Яндекса. За много лет из простой поисковой программы он развился в высоконагруженную и нетривиальную систему. Поиск большой: им пользуются сотни миллионов пользователей, сотни тысяч ядер обрабатывают миллиа…
яндекс · На сервисе с: 11.08.26 19:43
↑ Вакансия с автоподнятиемПоиск — первый и ключевой сервис Яндекса. За много лет из простой поисковой программы он развился в высоконагруженную и нетривиальную систему. Поиск большой: им пользуются сотни миллионов пользователей, сотни тысяч ядер обрабатывают миллиарды запросов в сутки, а некоторые микросервисы держат десятки миллионов RPS, обрабатывая петабайты горячих данных. Такой масштаб и критичность накладывает серьёзные требования на надёжность.
Наша команда работает над всей инфраструктурой основного веб-поиска и поиска по картинкам. Мы ищем SRE, способных внедрять современные SRE-подходы и процессы. Роль SRE — одна из ключевых в продукте.
Автоматизация непрерывной поставки
Вы будете разрабатывать и улучшать механизмы автоматической приёмки и выкатки релизов, минимизируя участие сервисных команд. Это позволит одновременно как повысить надёжность, так и соптимизировать time to market различных внедрений.
Разработка инструментов наблюдаемости
У Поиска из-за большого масштаба много специфичных инструментов для обеспечения наблюдаемости на всех стадиях. Это распределённый трейсинг, инструментарий для анализа инцидентов и так далее. Вам предстоит как использовать эти инструменты, так и развивать их.
Улучшение процессов координации инцидентов
С появлением LLM можно автоматизировать и упростить значительную часть координации инцидентов. Вы будете улучшать процессы починки аварий, упрощать дебаг сложных инцидентов и ускорять починку.
Больше о разработке в Яндексе — в канале Yandex for Developers
* Работали с системами мониторинга и управления конфигурациями
* Уверенно владеете Linux, имеете крепкую ментальную модель разных подсистем
* Понимаете принципы работы TCP/IP и умеете диагностировать сетевые проблемы
* Разбираетесь в построении распределённых и отказоустойчивых веб-сервисов
* Знакомы с подходами Infrastructure as Code
* На хорошем уровне владеете Python или Go
* Разрабатывали на системном языке программирования (в идеале C++)
* Читали SRE book, понимаете принципы SRE
* Понимаете принципы работы очередей и распределённых систем
* Умеете анализировать coredumps
* Уверенно владеете современными подходами к AI в разработке и поддержке
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.