이상을 발견하고,
복구까지 이어갑니다.
서비스 상태와 관측 가능 여부를 구분하고, 사고가 생기면 담당자 확인부터 복구 기록까지 한 흐름으로 이어갑니다.
- 서비스별 상태와 응답 시간 확인
- 관측 불가와 장애를 명확히 구분
- 사고 담당자와 처리 이력 기록
서비스 상태를 골라 사고 흐름을 확인하세요.
주요 기능이 어떻게 이어지는지 직접 확인해 보세요.
서비스 상태
상태를 확인하고 담당자에게 전달할 수 있습니다.
구현 화면을 살펴보세요.
설계 내용을 바탕으로 구현한 프로토타입에서 메인 화면과 핵심 업무 흐름을 확인할 수 있습니다.
관측부터 장애 복구까지 이어지는 운영
서비스와 서버 상태를 한곳에서 확인하고 이상 징후 발견부터 장애 대응까지 관리합니다. 여러 시스템의 상태와 장애 대응 과정을 함께 관리해야 하는 운영팀을 위한 프로젝트입니다.
서비스 상태 확인전체 현황에서 주의가 필요한 서비스를 찾습니다.완료
사고 내용 파악영향 범위와 발생 시점, 담당자를 확인합니다.진행
복구와 기록조치 결과를 남기고 운영 리포트에 반영합니다.진행
왜 만들었고,
어떻게 검증했는지.
문제를 바라본 기준
모니터링 화면이 초록색인지 확인하는 것만으로는 수집기가 멈춘 상태와 서비스가 정상인 상태를 구분할 수 없습니다. 장애가 생긴 뒤 담당자와 조치 내용이 메신저에만 남는 문제도 함께 다뤘습니다.
서비스 상태, 관측 가능 여부, 경보와 사고 대응을 구분하되 하나의 타임라인으로 이어지도록 설계했습니다.
핵심 설계 판단
관측 불가를 별도 상태로
데이터가 없다는 이유로 정상으로 표시하지 않고 수집 실패를 명확히 드러냅니다.
경보와 사고 분리
일시적인 임계치 초과와 담당자 대응이 필요한 사고를 구분해 경보 피로를 줄입니다.
복구 기록까지 한 흐름
담당자 지정, 조치, 복구 시각과 회고를 같은 사고 기록에 남깁니다.
확인하고 검증한 내용
상태별 시각 구분
정상, 주의, 장애와 관측 불가가 색상뿐 아니라 문구와 아이콘으로도 구분되는지 점검했습니다.
사고 처리 단계
발견부터 확인, 조치와 종료까지 상태 전이가 끊기지 않는지 검증했습니다.
반응형 운영 화면
모바일에서도 핵심 상태와 담당자, 최근 조치를 우선 확인할 수 있게 점검했습니다.
- 실제 지표 수집기 연동 확대
- 서비스별 동적 임계치 검증
- 장애 회고와 개선 작업 연결
화면을 넘어,
업무의 흐름까지 설계했습니다.
서비스와 서버 상태를 한곳에서 확인하고 이상 징후 발견부터 장애 대응까지 관리합니다. 여러 시스템의 상태와 장애 대응 과정을 함께 관리해야 하는 운영팀을 위한 프로젝트입니다.
상태를 한눈에
서비스·서버·수집 상태를 하나의 현황 화면에서 확인합니다.
- 서비스 맵
- 서비스·서버·수집 상태를 하나의 현황 화면에서 확인합니다.
- 필요한 정보와 다음 행동을 같은 흐름에서 확인합니다.
이상을 먼저 발견
관측 불능과 장애 징후를 구분해 중요한 변화부터 보여줍니다.
- 지표 상세
- 관측 불능과 장애 징후를 구분해 중요한 변화부터 보여줍니다.
- 필요한 정보와 다음 행동을 같은 흐름에서 확인합니다.
대응 과정을 연결
담당자 확인, 조치 기록, 가용률 리포트까지 이어서 관리합니다.
- 사고 타임라인
- 담당자 확인, 조치 기록, 가용률 리포트까지 이어서 관리합니다.
- 필요한 정보와 다음 행동을 같은 흐름에서 확인합니다.
- 경보 임계치는 서비스별 정상 범위를 확인해 지속적으로 조정해야 합니다.
프로젝트 정보
서비스 상태: 시연 가능