개요
SRE는 Site Reliability Engineering의 줄임말로, 소프트웨어 엔지니어링 방식으로 서비스의 안정성, 가용성, 성능, 운영 자동화를 다루는 분야이다.
전통적인 운영 업무를 수작업으로 반복하기보다, 코드와 자동화, 모니터링, 장애 대응 절차를 통해 서비스 신뢰성을 관리한다.
핵심 개념
- SLI: 서비스 상태를 보여 주는 지표
- SLO: 달성해야 할 신뢰성 목표
- 에러 예산: 허용 가능한 장애나 지연의 범위
- 온콜: 장애 발생 시 대응하는 근무 체계
- 포스트모템: 장애 이후 원인과 개선점을 기록하는 절차
접근성 관점
접근성 서비스도 신뢰성이 필요하다. 로그인, 인증, 문서 다운로드, 자막, 화면 읽기 호환 기능이 장애 상황에서 먼저 깨지면 특정 사용자에게 더 큰 피해가 간다.
따라서 접근성은 디자인·개발 단계뿐 아니라 운영 지표와 장애 대응에도 포함되어야 한다. 예를 들어 접근성 검사 자동화, 보조기술 회귀 테스트, 사용자 신고 경로 모니터링도 넓은 의미의 신뢰성 관리에 들어간다.
