로그, 메트릭, 트레이스는 각각 어떤 역할을 하나요?
답변 포인트
문제가 발생했을 때 사건 기록, 수치 변화, 요청 경로를 어떻게 보는지 나눠보세요.
정답 및 해설
빠른 요약
로그는 개별 사건과 맥락을 기록하고, 메트릭은 시스템 상태를 시간에 따른 숫자로 보여주며, 트레이스는 하나의 요청이 여러 서비스와 컴포넌트를 거치는 경로와 시간을 보여줍니다. 세 가지를 함께 써야 장애 원인 파악이 빨라집니다.
로그는 개별 사건과 맥락을 기록하고, 메트릭은 시스템 상태를 시간에 따른 숫자로 보여주며, 트레이스는 하나의 요청이 여러 서비스와 컴포넌트를 거치는 경로와 시간을 보여줍니다. 세 가지를 함께 써야 장애 원인 파악이 빨라집니다.
핵심 개념
핵심 기준은 사건, 수치, 요청 흐름의 상호 보완입니다. 이 개념은 단순히 용어를 외우는 것보다, 어떤 문제를 줄이기 위해 등장했는지와 실제 코드나 운영 환경에서 어떤 trade-off를 만드는지 함께 이해하는 것이 중요합니다.
문제가 발생했을 때 사건 기록, 수치 변화, 요청 경로를 어떻게 보는지 나눠보세요.
동작 흐름
- 먼저 문제가 발생하는 조건과 입력을 확인합니다.
- 관련된 런타임, 브라우저, 서버, 데이터 저장소의 책임을 나눠 봅니다.
- 가장 작은 범위에서 안전한 해결책을 적용합니다.
- 로그, 테스트, 모니터링으로 실제로 문제가 줄었는지 확인합니다.
실제 예시
에러율 메트릭이 급증하면 관련 trace로 느린 구간을 찾고, 해당 서비스 로그로 구체적 예외를 확인합니다.
실무에서 적용하는 방법
요청 id나 trace id를 로그에 포함해 세 데이터를 연결하고, SLO 기준의 알림을 설정합니다.
실무에서 주의할 점
- 민감 정보를 로그에 남기면 보안 사고가 될 수 있습니다.
- 너무 많은 로그는 비용을 키우고 중요한 신호를 묻어버립니다.
- 개념을 적용하기 전에 현재 시스템의 규모, 병목, 장애 영향도를 함께 확인해야 합니다.
- 팀 규칙이나 프레임워크 기본 동작과 충돌하지 않는지도 점검하는 것이 좋습니다.
함께 연결해서 보면 좋은 키워드
운영, Observability, 로그, 모니터링
면접에서 짚으면 좋은 포인트
- 정의만 말하기보다 어떤 문제를 줄이기 위한 개념인지 먼저 설명하면 좋습니다.
- 장점과 함께 비용, 한계, 적용하지 않아도 되는 상황을 같이 말하면 실무 이해도가 드러납니다.
정리
한 줄로 정리하면, 로그는 개별 사건과 맥락을 기록하고, 메트릭은 시스템 상태를 시간에 따른 숫자로 보여주며, 트레이스는 하나의 요청이 여러 서비스와 컴포넌트를 거치는 경로와 시간을 보여줍니다. 세 가지를 함께 써야 장애 원인 파악이 빨라집니다. 실무에서는 개념을 적용하는 조건과 적용하지 않았을 때 생기는 문제까지 함께 이해하는 것이 중요합니다.