Главная Вакансии Компании Рейтинги О портале

Site Reliability Engineer

Middle Москва От 1 года до 3 лет
Опыт
От 1 года до 3 лет
Город
Москва
Опубликована
17.07.2026

О роли

Мы ищем того, кто готов решать сложные задачи, погружаться в детали, быть хранителем стабильности и надежности наших сервисов. Если ты считаешь, что совершенство — это не цель, а путь, готов предлагать новые решения и внедрять передовые технологии, мы будем рады видеть тебя в нашей команде.

Почему это важно

Наша главная цель — поддерживать такие условия, при которых пользователи могут наслаждаться стабильностью и надежностью наших сервисов, открывая для себя новые горизонты звука.


Чем предстоит заниматься:

  • Надежность и инциденты: Работа с инцидентом на всех этапах. Учавствовать в активных инцидентах в качестве координатора и/или инженера починки. Расследовать инциденты, проводить Post-mortem встречи с командами Dev/QA/OPS. Разрабатывать и актуализировать: планы восстановления, инструкции для дежурных, DRP. Проводить мероприятия на снижение MTTR, количество инцидентов. Участие в коммуникации с партнерами в рамках общих инцидентов;
  • SLA/SLO и Error Budget: Внедрять и контролировать метрики надежности SLI/SLO/SLA внутренние и внешние. Участвовать в приоритизации бэклога разработки на основе анализа Error Budget;
  • Observability (Наблюдаемость): Развивать системы мониторинга и трейсинга совместно с подразделением мониторинга (настраивать сбор метрик, дашборды в Grafana);
  • Инфраструктура и K8s: Администрировать Kubernetes кластеры (ресурсы, автоскейлинг). Управлять сервис-мешем (Istio): настраивать сетевые политики, traffic routing, rate limiting, circuit breakers. Управление конфигурацией location nginx;
  • Дежурства в рабочее время: контроль сетки релизов, реагирование на обращения коллег DEV по проблемам в межсервисном взаимодействии. Анализировать логи и трейсы в Jaeger/Tempo, Kibana/Loki;
  • Дежурства в НЕрабочее время: реагирование и подключение на инциденты во внерабочее время. На текущем этапе команда переходит от добровольной к плановой системе дежурств. Нужно быть готовым к дежурствам в праздничные дни и каникулы. Все часы дежурств и вызовов во внерабочее время оплачиваются дополнительно.

Успех в роли обеспечат:

  • Опыт в SRE / DevOps от 2-3 лет. Понимание идеологии SRE, опыт работы с SLI/SLO/SLA и Error Budget на практике. Опыт работы в production окружениях;
  • уверенное администрирование. Понимание того, как работают операторы, сетевые модели и механизмы отказоустойчивости на уровне Pod/Deployment;
  • опыт участия в дежурствах или роли Incident Commander. Умение не просто «тушить пожары», а системно устранять их первопричины;
  • опыт настройки алертинга, опыт написания инструкций и DRP;
  • уверенное написание скриптов и небольших сервисов/ботов на Go или Python и Bash.
Как работается в Звук
Трудоустройство и онбординг
7.5
Финансовое вознаграждение
8
Рабочая среда и культура
8.5
Карьерная ценность
8.5
Другие вакансии Звук
Инженер технической поддержки B2B-клиентов (Junior)
Санкт-Петербург
Senior Site Reliability Engineer
Москва
Android-разработчик в направление Disrupt
Москва
System analyst (Expansion)
Москва