Система ID построена на нескольких критически важных инфраструктурных компонентах — среди них Паспорт, Blackbox, TVM и прокси. Уровень надёжности таких систем должен быть очень высоким: мы стремимся довести доступность до 99,99–99,999% там, где это возможно технически. А в тех случаях, когда это неосуществимо, — разобраться в фундаментальных ограничениях и сделать реальную надёжность как можно выше.
Мы ищем опытного технического лидера. Вместе с CTO Яндекс ID вам предстоит работать над повышением надёжности платформы. Роль сочетает в себе глубокую инженерную работу, практику SRE и задачи технического лидерства. Вам нужно будет участвовать в формировании архитектуры систем, совершенствовать инженерные практики команды и развивать подходы к обеспечению надёжности критичных сервисов ID.
Какие задачи вас ждут:
Обеспечение надёжности Паспорта
Вы будете техническим партнёром CTO по вопросам надёжности. Вам предстоит помогать принимать архитектурные решения, выявлять системные риски, разбирать сложные инциденты и оценивать, какие инвестиции в надёжность принесут наибольший эффект. Также вы станете ментором и дополнительным экспертом для команд, которые отвечают за критически важные компоненты ID.
Надёжность компонентов Яндекс ID
Вы будете детально изучать работу Blackbox, TVM, Паспорта и прокси. Вам нужно будет выявить основные причины сбоев и ограничения текущей архитектуры, а затем разработать программу, которая повысит их надёжность. Цель — добиться доступности критичных компонентов на уровне 99,99–99,999% там, где это возможно технически. При этом главное — не просто достичь высоких показателей, а обеспечить реальную надёжность: чтобы система устойчиво работала при сбоях инфраструктуры и зависимостей, позволяла локализовать аварии, продолжала функционировать при частичных отказах и автоматически восстанавливала работу.
Развитие SRE‑подхода
Вы будете вместе с командой развивать подходы к обеспечению надёжности критичных сервисов Яндекс ID: автоматизировать эксплуатационные задачи, улучшать инструменты и процессы, развивать инфраструктурную разработку. Важно помогать команде находить системные решения проблем надёжности, сокращать объём ручной работы и постепенно наращивать инженерные практики и экспертизу внутри службы.
Больше о бэкенде в Яндексе — в канале Yandex for Backend
Мы ждем, что вы:
- Работали с SRE-практиками
- Обладаете сильным инженерным бэкграундом и работали с высоконагруженными распределёнными системами
- Глубоко понимаете принципы построения отказоустойчивых систем и умеете находить не только отдельные проблемы, но и системные ограничения надёжности
- Можете самостоятельно погрузиться в большую существующую систему и разобраться в её архитектуре, зависимостях и классах отказов
- Знаете, что такое техническое лидерство, и можете влиять на несколько команд без необходимости напрямую управлять каждым инженером
- Умеете превращать большие и плохо определённые проблемы в конкретную инженерную программу
- Можете одновременно работать на уровне архитектуры системы и погружаться в детали конкретного инцидента или компонента
- Умеете аргументировать технические решения и договариваться с сильными инженерами и руководителями
Будет плюсом:
- Отвечали за надёжность критичных инфраструктурных систем
- Строили системы с требованиями доступности 99,99% и выше
- Работали над разработкой инфраструктурных систем и хорошо пишете код
О компании
Яндекс ID
Яндекс ID - это инфраструктура, которая отвечает за доступ миллионов пользователей к их данным