전체 목록
운영Medium#377

로그, 메트릭, 트레이스는 각각 어떤 역할을 하나요?

#운영#Observability#로그#모니터링

답변 포인트

문제가 발생했을 때 사건 기록, 수치 변화, 요청 경로를 어떻게 보는지 나눠보세요.

정답 및 해설

빠른 요약

로그는 개별 사건과 맥락을 기록하고, 메트릭은 시스템 상태를 시간에 따른 숫자로 보여주며, 트레이스는 하나의 요청이 여러 서비스와 컴포넌트를 거치는 경로와 시간을 보여줍니다. 세 가지를 함께 써야 장애 원인 파악이 빨라집니다.

로그는 개별 사건과 맥락을 기록하고, 메트릭은 시스템 상태를 시간에 따른 숫자로 보여주며, 트레이스는 하나의 요청이 여러 서비스와 컴포넌트를 거치는 경로와 시간을 보여줍니다. 세 가지를 함께 써야 장애 원인 파악이 빨라집니다.

핵심 개념

핵심 기준은 사건, 수치, 요청 흐름의 상호 보완입니다. 이 개념은 단순히 용어를 외우는 것보다, 어떤 문제를 줄이기 위해 등장했는지와 실제 코드나 운영 환경에서 어떤 trade-off를 만드는지 함께 이해하는 것이 중요합니다.

문제가 발생했을 때 사건 기록, 수치 변화, 요청 경로를 어떻게 보는지 나눠보세요.

동작 흐름

  1. 먼저 문제가 발생하는 조건과 입력을 확인합니다.
  2. 관련된 런타임, 브라우저, 서버, 데이터 저장소의 책임을 나눠 봅니다.
  3. 가장 작은 범위에서 안전한 해결책을 적용합니다.
  4. 로그, 테스트, 모니터링으로 실제로 문제가 줄었는지 확인합니다.

실제 예시

에러율 메트릭이 급증하면 관련 trace로 느린 구간을 찾고, 해당 서비스 로그로 구체적 예외를 확인합니다.

실무에서 적용하는 방법

요청 id나 trace id를 로그에 포함해 세 데이터를 연결하고, SLO 기준의 알림을 설정합니다.

실무에서 주의할 점

  • 민감 정보를 로그에 남기면 보안 사고가 될 수 있습니다.
  • 너무 많은 로그는 비용을 키우고 중요한 신호를 묻어버립니다.
  • 개념을 적용하기 전에 현재 시스템의 규모, 병목, 장애 영향도를 함께 확인해야 합니다.
  • 팀 규칙이나 프레임워크 기본 동작과 충돌하지 않는지도 점검하는 것이 좋습니다.

함께 연결해서 보면 좋은 키워드

운영, Observability, 로그, 모니터링

면접에서 짚으면 좋은 포인트

  • 정의만 말하기보다 어떤 문제를 줄이기 위한 개념인지 먼저 설명하면 좋습니다.
  • 장점과 함께 비용, 한계, 적용하지 않아도 되는 상황을 같이 말하면 실무 이해도가 드러납니다.

정리

한 줄로 정리하면, 로그는 개별 사건과 맥락을 기록하고, 메트릭은 시스템 상태를 시간에 따른 숫자로 보여주며, 트레이스는 하나의 요청이 여러 서비스와 컴포넌트를 거치는 경로와 시간을 보여줍니다. 세 가지를 함께 써야 장애 원인 파악이 빨라집니다. 실무에서는 개념을 적용하는 조건과 적용하지 않았을 때 생기는 문제까지 함께 이해하는 것이 중요합니다.

관련 질문

같은 카테고리/태그 기준