По этой профессии сейчас мало активных вакансий, поэтому рыночные цифры на странице ориентировочны. Путь входа, навыки и типовые ошибки от объёма выборки не зависят.
Как стать SRE-инженером: путь от нуля до первого оффера
Не «стань разработчиком за 3 месяца» — реальный путь входа на основе данных по 49 вакансий.
Можно ли стать SRE-инженером с нуля
Да. По данным SkillStat, 2% вакансий SRE-инженера — уровня junior или стажёр. Это 1 вакансия прямо сейчас.
«С нуля» у SRE-инженера — самая неудобная формулировка в инфраструктуре. Надёжность нельзя потренировать на пустом месте: чтобы удержать сервис, нужен сервис, который кто-то ломает не по твоему сценарию. Отсюда картина среза: 1 вакансия уровня junior из 49 и 11 senior на одного новичка. Медиана требований — 14 навыков, и половина из них не про инструменты, а про поведение при сбое.
На практике SRE — вторая профессия. Приходят из эксплуатации, DevOps, администрирования или бэкенда. Инструменты знакомые: Kubernetes (87.8%), Linux (83.7%), Grafana (55.1%), Prometheus (53.1%). Новое здесь — способ думать: не «как починить», а «сколько сбоев в месяц мы согласны терпеть и что делаем, когда бюджет ошибок кончился».
Как стать SRE-инженером: короткий план
Пять шагов от чтения логов до дежурства, на котором ты знаешь, что делать.
Что учить SRE-инженеру первым
Не всё сразу. Вот очерёдность по частотности в вакансиях — от самого нужного к менее срочному.
| Навык | Все вакансии |
|---|---|
| Kubernetes | 87.8% |
| Linux | 83.7% |
| Python | 67.3% |
| CI/CD | 65.3% |
| Ansible | 59.2% |
| Grafana | 55.1% |
| Prometheus | 53.1% |
| PostgreSQL | 44.9% |
| Docker | 40.8% |
| Nginx | 34.7% |
«Все вакансии» — доля из 49 вакансий. Обновлено 12 августа 2026.
Полный список навыков с частотностью, связками и зарплатной премией — навыки SRE-инженера →
Roadmap SRE-инженера: от нуля до junior
Порядок опирается на частотность навыков по данным вакансий. Первые 4–5 этапов — минимум для первого оффера.
- 01Linux и сети 83.7% вакансий
Уверенная работа с Linux: файловая система, процессы, bash-скрипты, сетевые команды.
Подробнее → - 02Скриптинг 67.3% вакансий
Bash, Python или Go — автоматизация операций и написание инструментов.
Подробнее → - 03
- 04CI/CD 24.5% вакансий
Непрерывная интеграция и доставка: GitLab CI, GitHub Actions, Jenkins.
Подробнее → - 05IaC: Terraform и Ansible 28.6% вакансий
Инфраструктура как код — воспроизводимое управление окружениями.
Подробнее → - 06Kubernetes 87.8% вакансий middle+
Оркестрация контейнеров: Pod, Deployment, Service, Ingress, Helm.
Подробнее → - 07Мониторинг и observability 53.1% вакансий middle+
Prometheus, Grafana, ELK/Loki — сбор метрик, логов, алертинг.
Подробнее → - 08Облачные платформы middle+
AWS, GCP, Azure или Yandex Cloud — базовые сервисы: compute, storage, network.
Подробнее → - 09
Junior-вакансии SRE-инженера: что реально требуют работодатели
Срез построен на 49 активных вакансий.
Какие проекты сделать для портфолио
Портфолио SRE-инженера — это не проект, а разбор. Один небольшой сервис на стенде, у которого измерена надёжность, случился сбой, было восстановление и остался письменный след: что сломалось, как узнали, что сделали, что изменили, чтобы не повторилось.
Как оформить GitHub и резюме
- Постмортем в репозитории сильнее любого конфига: разбор сбоя показывает ход мысли, конфиг — только результат
- SLO текстом: какой сигнал, какая цель, откуда бюджет ошибок. Одна страница, а не презентация
- Дашборды и алерты — картинкой в README, правила файлом рядом
- Хронология инцидента с временными метками: видно, как быстро замечаешь и как рассуждаешь под нагрузкой
- Если случай по мотивам работы — убери названия сервисов, клиентов и суммы, оставь механику сбоя
- Надёжность — в первую строку: «держал сервис», «дежурил», «разбирал инциденты» весомее списка инструментов
- Дежурства — прямой опыт: сколько было в графике, что чаще всего будило, что после этого автоматизировал
- По каждому случаю: симптом, время до обнаружения, что изменил, чтобы не повторилось
- Навыки — рабочие: Kubernetes, Linux. «Знаком с Prometheus» без правил алертов читается как ноль
- Опыт поддержки и администрирования — валюта, а не балласт: ты уже видел, как сервис ломается в реальности
«Настраивал мониторинг в Prometheus и Grafana, знаком с Kubernetes, участвовал в поддержке»
«Держал сервис оформления заказов: выбрал сигналы надёжности, поставил цель по доле успешных ответов, посчитал бюджет ошибок. Убрал шумные алерты — ночных срабатываний стало втрое меньше, пропущенных сбоев не прибавилось. После падения узла написал разбор и закрыл причину: повторов не было. Постмортем: [ссылка]»
Самостоятельно, курсы или вуз — какой путь выбрать
Курсы для SRE-инженера
Сопоставили программы с реальным стеком из 49 вакансий — оценка соответствия рассчитана автоматически, это не реклама.
Когда начинать искать первую работу
Готов, когда можешь взять незнакомый сервис, за час назвать три сигнала, по которым видно, что ему плохо, объяснить, какой сбой пользователь простит, а какой нет, и рассказать, что будешь делать в первые десять минут инцидента. Инструменты к этому прикладываются.
- → Внутренний переход — главный путь: если держишь сервисы в своей компании, попросись в дежурство и в разборы. Роль часто получают до того, как меняют строчку в трудовой
- → hh.ru: кроме SRE смотри «инженер эксплуатации», «инженер поддержки платформы» и DevOps в продуктовых компаниях — та же работа под другим названием
- → Крупные продукты с настоящей нагрузкой: маркетплейсы, банки, телеком, облачные провайдеры. Надёжность становится отдельной ролью там, где сбой стоит денег
- → Команды дежурства и первой линии: берут проще, а инциденты видишь с первого месяца
- → «Опыт от 3 лет» у SRE-инженера читается как «дежурил и отвечал за сервис». Постмортем в портфолио частично закрывает пункт, но дежурство не заменяет
- → Медиана требований — 14 навыков. Список короче, чем у DevOps, но глубже: спросят не «знаешь ли», а «что делал, когда легло»
- → Go (32.7%) и Python (67.3%) в требованиях — не про разработку сервисов: ждут инструментов и автоматизации восстановления
- → Ищи в описании дежурство и SLO. Если их нет, а есть только мониторинг — это вакансия админа под модным названием
Что спрашивают на собеседовании
SLI, SLO и бюджет ошибок
- ·Чем SLI отличается от SLO
- ·Как выбрать сигнал надёжности для сервиса оформления заказов
- ·Бюджет ошибок кончился в середине месяца — что происходит с релизами
- ·Зачем ставить цель ниже стопроцентной доступности
SLO из портфолио: объясни, почему выбрал именно эту цель
Инциденты и дежурство
- ·Первые десять минут инцидента — что делаешь
- ·Кто объявляет инцидент и когда его закрывают
- ·Как ведёшь коммуникацию, пока причина неизвестна
- ·Чем разбор без обвинений отличается от поиска виноватого
Постмортем: покажи хронологию и решение, которое закрыло причину
Наблюдаемость и алерты
- ·Чем метрика отличается от лога и трассировки
- ·Как сделать алерт, который не отключат через неделю
- ·Сервис лежит, алерт не сработал — что чинишь первым
- ·Что показывать на дашборде дежурного, а что убрать
Дашборд и правила алертов из портфолио
Отказы распределённых систем
- ·Что произойдёт с сервисом, если база отвечает на секунду дольше
- ·Зачем таймаут и что бывает без него
- ·Чем опасен ретрай без ограничения
- ·Как один медленный сервис кладёт всю цепочку
Стенд с внесённой задержкой: покажи, что показали метрики
Kubernetes и эксплуатация
- ·Под перезапускается по кругу — порядок проверки
- ·Что делает лимит памяти и что произойдёт при его превышении
- ·Как выкатить изменение так, чтобы сбой задел часть пользователей, а не всех
- ·Узел выпал из кластера — что с трафиком
Разбор сбоя на стенде: почему кластер не спас
Сколько времени нужно, чтобы стать SRE-инженером
Почему сроки длиннее, чем у DevOps. Пайплайн можно собрать дома за месяц и показать. Надёжность так не показывается: нужен сервис, который ломается не по твоему сценарию, и ночь, когда ты за него отвечаешь. Это время не ускоряется курсом — только рабочей эксплуатацией.
Что реально сокращает путь: дежурство в текущей компании, участие в чужих разборах и привычка читать публичные постмортемы крупных сервисов. Через полгода такого чтения начинаешь видеть в сбое систему, а не случайность.
Ошибки новичков
Строят мониторинг вместо надёжности
Почему мешает: Дашборд показывает загрузку процессора, а пользователь жалуется на оплату. Метрики есть, надёжности нет
Как исправить: Начинай с сигнала, который чувствует пользователь: успешный ответ, задержка, завершённый сценарий
Ставят цель в стопроцентную доступность
Почему мешает: Абсолютная доступность стоит бесконечно и убивает релизы. Бюджет ошибок существует, чтобы его тратить
Как исправить: Выбери цель, которую бизнес готов оплатить, и договорись, что происходит, когда бюджет кончился
Гонятся за алертами на всё
Почему мешает: Шумный алерт выключают через неделю, и вместе с ним пропускают настоящий сбой
Как исправить: Правило одно: алерт будит человека, только если нужен человек. Остальное — в отчёт
Ищут виноватого в разборе
Почему мешает: Как только в постмортеме появляется фамилия, факты исчезают: люди защищаются, а причина остаётся
Как исправить: Пиши хронологию и системные причины. Вопрос не «кто», а «почему это было возможно»
Чинят симптом и закрывают инцидент
Почему мешает: Перезапуск возвращает сервис и ничего не меняет: тот же сбой придёт следующей ночью
Как исправить: После восстановления — отдельная задача на причину. Инцидент закрыт, когда закрыта причина
Пропускают сети и базы
Почему мешает: DNS — в 22.4% вакансий, TCP/IP — в части, PostgreSQL — в 44.9%. Большая часть загадочных сбоев живёт именно там
Как исправить: Разбери таймауты, ретраи, пулы соединений и что делает медленный запрос с очередью
Копят ручные операции
Почему мешает: Каждая ночная операция руками — это будущий сбой и выгоревший дежурный
Как исправить: Python (67.3%) и Ansible (59.2%) для того и в требованиях: сделал дважды — автоматизируй
Ждут вакансию junior SRE
Почему мешает: Таких позиций в срезе 1 из 49. Ждать можно долго
Как исправить: Иди в эксплуатацию или DevOps, бери дежурство и переходи внутри компании
Как SkillStat считает данные
Источник: 49 вакансий в московском сегменте. Навыки и грейды извлекаются автоматически из текста каждой вакансии.
Грейды: определяются по требованиям вакансии — уровню опыта, упоминанию «junior», «intern», «стажёр». Это рыночная оценка объявления.
Сложность входа: рассчитывается по доле junior-вакансий и медиане навыков на junior-уровне. Это индикатор, а не гарантия.
Обновление: данные пересчитываются регулярно. Текущий срез — 12 августа 2026.