본문으로 바로가기
리옵트 핸드북
리옵트 핸드북
LLMOps·AgentOps 프로덕션

아키텍처·릴리즈

Ch1. 시스템 아키텍처Ch2. 버저닝·릴리즈Ch3. 평가 프레임워크

운영 안정성

Ch4. 온라인 가드레일Ch5. 관측성·SLOCh6. 비용·지연시간 최적화

성장·대응

Ch7. 실험 운영 체계Ch8. 사고 관리 런북

검증

검증 리포트검증 아카이브업데이트 내역
핸드북›LLMOps AgentOps›Ch8. 사고 관리 런북
한국어English

Ch8. 사고 관리 런북

품질 회귀·비용 폭증·정책 우회·MCP 침해 사고를 분류하고, 격리 순서와 자격증명 회수·SEV 연계로 표준화한 LLMOps 사고 대응 런북

핵심 요약

  • LLM 사고는 "정상처럼 보이는 실패"가 많아 품질·비용·정책 관점으로 분류하고 즉시 조치와 재발 방지 통제를 함께 표준화한다.
  • 사고 유형별 즉시 조치가 다르다: 품질 회귀는 롤백, 비용 폭증은 경량 모델 라우팅, 정책 우회는 승인 모드 전환, MCP/Skill 침해는 서버 disable·token revoke다.
  • 격리는 영향 scope 축소 → side effect 경로 중단 → token·연결 회수 → fallback 활성화 → trace·approval 증거 보존 순으로 진행한다.
  • LLMOps 사고는 보안 사고와 통합 관리되며 품질 회귀 SEV-2/3, 정책 우회 SEV-1/2로 분류해 에스컬레이션한다.
  • 자동 복구는 블래스트 레디우스가 제한된 사고에 먼저 적용하고 SEV-1급은 사람 승인 후 실행하며, 회고는 책임 추적보다 실패를 허용한 시스템 조건 제거에 집중한다.

LLM 서비스 사고는 전통적인 장애와 달리 "정상처럼 보이는 실패"가 많습니다.
그래서 품질/비용/정책 관점으로 사고를 분류하고, 즉시 조치와 재발 방지 통제를 함께 표준화합니다.

사고 유형

유형탐지 신호즉시 조치
품질 회귀Task Success 급락, judge score 하락이전 prompt/model/tool policy로 롤백
비용 폭증요청당 원가 급등, cache hit 급락경량 모델 라우팅, tool call 제한, batch 전환
정책 우회위반 응답 증가, guardrail bypass승인 모드 전환, 정책 pack hotfix
MCP/Skill compromiseshadow server, 미승인 scope, 이상 egress서버 disable, token revoke, sandbox 격리
A2A abusewebhook SSRF, 인증 전 리소스 노출peer block, push notification 중지
Voice/realtime 저하first-audio latency, interruption looptext fallback, session 재생성, low-latency model 전환

대응 흐름

사후 분석 항목

  • 탐지 지연 원인(MTTD)
  • 격리 지연 원인(Containment time)
  • 자동화 가능한 수동 단계
  • 동일 유형 재발 방지 통제
  • 관련 trace_id, approval_id, MCP server ID, skill version
  • 고객 영향 범위와 공지 필요 여부

통합 사고 분류 체계와의 연계

LLMOps 사고는 보안 사고와 함께 통합 관리됩니다:

  • 품질 회귀: SEV-2/3로 분류, ML Platform Lead 에스컬레이션
  • 비용 폭증: SEV-2/3로 분류, Finance + Platform 공동 대응
  • 정책 우회: SEV-1/2로 분류, Security + Compliance 즉시 개입

데이터 보안 사고 발생 시 즉시 보안팀과 공조하여 SEV-1 대응 체계로 전환합니다.

PagerDuty AI 에이전틱 운영

2026년 PagerDuty는 AI integration ecosystem을 확장해 LLMOps, agent governance, agentic cloud operations를 incident workflow에 연결합니다. 운영 관점에서 이건 "AI가 전부 자동 복구"한다는 뜻이 아니라 관측 신호, runbook, 승인 경계, 에스컬레이션을 하나의 사고 루프로 묶는 변화입니다.

기능설명
에이전틱 탐지AI 에이전트가 이상 패턴을 자율 탐지, 사고 유형 자동 분류
자동 복구사전 정의된 런북 기반 자동 격리·복구 실행
에스컬레이션 AI사고 심각도·영향 범위 분석 후 적합한 대응팀 자동 할당
사후 분석 생성사고 타임라인·근본 원인 초안 자동 생성

격리 순서

영향 scope를 좁힙니다: tenant, channel, model version, prompt version, MCP server, skill version.
side effect 경로를 멈춥니다: 결제, 환불, 배포, 외부 발송, 파일 쓰기, shell/code execution.
token과 연결을 회수합니다: MCP/A2A credential, webhook secret, long-lived API key.
fallback을 켭니다: 이전 버전, 제한 응답, text-only, human review, read-only mode.
trace와 approval evidence를 보존한 뒤 postmortem과 regression eval을 생성합니다.

자격증명 회전·A2A 차단 예시

containment_playbook:
  trigger: mcp_or_a2a_compromise
  steps:
    - disable_mcp_server: github-readonly-prod
    - revoke_token_audience: mcp://github-readonly-prod
    - block_a2a_peer:
        agent_card_url: https://partner.example.com/.well-known/agent-card.json
        reason: webhook_ssrf_attempt
    - rotate_webhook_secret: a2a_push_notifications
    - set_runtime_mode: read_only
    - preserve_evidence:
        - trace_id
        - approval_id
        - mcp_server_logs
        - webhook_request_headers

자동 복구 적용 기준

자동 복구는 블래스트 레디우스가 제한된 사고(단일 테넌트, 경량 모델 폴백 등)에 먼저 적용하고, SEV-1급 사고는 사람 승인을 거쳐 실행하길 권장합니다.

원칙

회고는 개인의 책임을 추적하기보다, 실패를 허용한 시스템 조건을 제거하는 데 집중합니다.

기준일과 근거

항목기준일재확인 권장1차 출처
OWASP MCP 사고 위험2026-05-172026-06-16https://owasp.org/www-project-mcp-top-10/
OWASP Agentic Skills 사고 위험2026-05-172026-06-16https://owasp.org/www-project-agentic-skills-top-10/
PagerDuty AI operations ecosystem2026-05-172026-06-16https://www.pagerduty.com/newsroom/pagerduty-expands-ai-ecosystem-to-supercharge-ai-agents/

관련 문서

Ch7. 사고 대응

AI 보안·컴플라이언스 운영 · SEV 등급·초기 60분 워룸 운영·MTTD/MTTR 지표로 AI 보안사고를 탐지부터 복구·재발방지까지 처리하는 사고 대응 런북

검증 리포트

LLMOps·AgentOps 프로덕션 핸드북의 구조·링크·지표·논리 정합성 검증

MCP와 에이전트 간 프로토콜

AI 에이전트 오케스트레이션 패턴 · MCP 서버 설계, A2A 프로토콜, AG-UI 프로토콜, Agent Card, 3-프로토콜 스택, 구현 예시

Ch8. 경영진 보고 체계

AI 보안·컴플라이언스 운영 · ALE·ROI·Security Posture Index와 에스컬레이션 매트릭스로 기술 보안 지표를 재무·사업 리스크 언어로 번역해 이사회에 보고하는 프레임

업데이트 내역

LLMOps·AgentOps 프로덕션 핸드북 변경 로그

Ch7. 실험 운영 체계

프롬프트·모델·워크플로우 실험을 Decision Score로 판정하고, 동시 실험 제한·실험 창·trace 회귀 반영으로 안전하게 반복하는 운영 규율

검증 리포트

LLMOps·AgentOps 프로덕션 핸드북의 구조·링크·지표·논리 정합성 검증

On this page

사고 유형대응 흐름사후 분석 항목통합 사고 분류 체계와의 연계PagerDuty AI 에이전틱 운영격리 순서자격증명 회전·A2A 차단 예시기준일과 근거