본문으로 바로가기
리옵트 핸드북
리옵트 핸드북
LLMOps·AgentOps 프로덕션

아키텍처·릴리즈

Ch1. 시스템 아키텍처Ch2. 버저닝·릴리즈Ch3. 평가 프레임워크

운영 안정성

Ch4. 온라인 가드레일Ch5. 관측성·SLOCh6. 비용·지연시간 최적화

성장·대응

Ch7. 실험 운영 체계Ch8. 사고 관리 런북

검증

검증 리포트검증 아카이브업데이트 내역
핸드북›LLMOps AgentOps
한국어English

LLMOps·AgentOps 프로덕션

실험 단계의 AI 기능을 신뢰 가능한 프로덕션 서비스로 운영하기 위한 표준 운영체계

최근 수정된 챕터

  • Ch5. 관측성·SLO2026.07.01

    모델/툴/정책 실행을 추적 가능한 신호로 수집하고 SLO로 운영하는 방식

  • Ch3. 평가 프레임워크2026.06.20

    품질·안전·효율·안정성 4축과 Composite Score, trace-first 평가 루프, hard gate로 LLM 릴리즈 합격 여부를 판정하는 평가 체계

  • Ch7. 실험 운영 체계2026.06.20

    프롬프트·모델·워크플로우 실험을 Decision Score로 판정하고, 동시 실험 제한·실험 창·trace 회귀 반영으로 안전하게 반복하는 운영 규율

  • Ch8. 사고 관리 런북2026.06.20

    품질 회귀·비용 폭증·정책 우회·MCP 침해 사고를 분류하고, 격리 순서와 자격증명 회수·SEV 연계로 표준화한 LLMOps 사고 대응 런북

  • Ch4. 온라인 가드레일2026.06.20

    Input·Intent·Tool·Output 4계층 가드, fail-open 금지, 재개 가능한 인간 승인 루프, MCP·Skill 공급망 통제로 실시간 사업 리스크를 제한하는 설계

AI 기능이 동작하는 것과 운영 가능한 것은 다릅니다.
프로덕션에서는 모델 품질뿐 아니라 릴리즈 통제, SLO, 비용 안정성, 사고 대응이 동시에 충족되어야 합니다.

이 핸드북은 LLMOps와 AgentOps를 따로 떼어 보지 않습니다. 둘을 하나의 서비스 운영 체계로 묶는 실전 패턴을 다룹니다.

핵심 목표

모델 교체, 프롬프트 변경, 툴 확장이 반복돼도 품질·비용·보안이 흔들리지 않는 운영 기반을 만듭니다.

관련 읽기

작업 환경, 역할 분리, 평가 루프 자체를 설계하는 관점이 필요하다면 하네스 엔지니어링을 함께 읽으면 좋습니다. 이 책은 운영 체계에 무게를 두고, 하네스 책은 에이전트가 일하는 시스템 설계를 더 깊게 다룹니다.

2026년 5월 업데이트

  • A2A latest v1.0.0, MCP 2025-11-25 보안 요구사항(OAuth 2.1, audience binding, token passthrough 금지) 반영 (Ch1)
  • Trace-first evaluation, agent workflow trace grading, production trace → dataset/eval 루프 보강 (Ch3, Ch5)
  • Human review, resumable approval state, hosted/private MCP 신뢰 경계, Agentic Skills 공급망 보안 추가 (Ch4)
  • OTel GenAI Development 상태와 OWASP AOS work-in-progress 상태를 명확히 정리 (Ch5)
  • GPT-5.5/GPT-5.4/GPT-5.4 mini, Claude 4.7/4.6/4.5, DeepSeek V4 가격 기준일 갱신 (Ch6)
  • 사고 대응에 MCP/skill compromise, A2A webhook abuse, 자동 복구 승인 경계 추가 (Ch8)

핵심 운영식

Unit Cost per Task=∑i(Tokeni×Pricei)+Tool Cost+Infra Cost\text{Unit Cost per Task} = \sum_i(\text{Token}_i \times \text{Price}_i) + \text{Tool Cost} + \text{Infra Cost}Unit Cost per Task=i∑​(Tokeni​×Pricei​)+Tool Cost+Infra Cost Error Budget Burn Rate=현재 오류율허용 오류율\text{Error Budget Burn Rate} = \frac{\text{현재 오류율}}{\text{허용 오류율}}Error Budget Burn Rate=허용 오류율현재 오류율​

운영 성숙도 모델

레벨상태특징승격 조건
L1 Prototype데모 중심수동 프롬프트/임시 운영로그 표준화
L2 Controlled기본 운영버저닝·릴리즈 통제 도입오프라인 평가 체계
L3 Reliable안정 운영SLO/가드레일/폴백 자동화비용·품질 동시 최적화
L4 Adaptive감독형 적응Drift 감지·정책 튜닝·자동 복구변경 증거와 승인 로그 유지

Go-Live 게이트(요약)

게이트합격 기준(예시)
품질 게이트핵심 태스크 성공률 95% 이상
안전 게이트정책 위반률 0.2% 이하
성능 게이트p95 지연시간 예산 내
비용 게이트요청당 원가 예산 +5% 이내

운영 구조

목차

Ch1. 시스템 아키텍처

Control Plane/Data Plane 분리와 에이전트 런타임 설계

Ch2. 버저닝·릴리즈

프롬프트/모델/툴 변경을 안전하게 배포하는 릴리즈 전략

Ch3. 평가 프레임워크

오프라인·온라인 평가를 연결한 품질 보증 체계

Ch4. 온라인 가드레일

정책 집행, 차단, 폴백, 사람 승인 기반의 안전장치

Ch5. 관측성·SLO

트레이스/토큰/지연시간/품질 신호를 통합 관측

Ch6. 비용·지연시간

단가 예산과 p95 예산을 동시에 만족시키는 튜닝 전략

Ch7. 실험 운영

프롬프트·모델·워크플로우 실험을 안전하게 반복하는 방식

Ch8. 사고 관리

품질 저하·비용 폭증·정책 우회 사고의 통합 런북

부록. 검증 리포트

링크·정합성·용어 기준 검증 결과

부록. 업데이트 내역

변경 로그 및 반영 근거 관리

함께 보면 좋은 핸드북

B2B SaaS 세일즈·고객성공

수주부터 온보딩·확장·갱신까지 ARR 중심으로 운영하는 GTM 실행 핸드북

Vercel 엔터프라이즈 AI 플랫폼

AI SDK, AI Gateway, Workflow, Sandbox, Queues를 중심으로 엔터프라이즈급 AI 제품을 설계·운영하는 완전판 가이드

AI 보안·컴플라이언스 운영

AI 제품을 안전하고 감사 가능하게 운영하기 위한 CISO/CTO 실전 프레임워크

Prisma Production Guardrails

Prisma Postgres를 사용하는 시니어 Backend·SRE·DevOps·DBA를 위한 프로덕션 운영 핸드북

Ch1. 시스템 아키텍처

Control Plane과 Data Plane을 분리해 안정성과 변경속도를 동시에 확보하는 방법

On this page

핵심 운영식운영 성숙도 모델Go-Live 게이트(요약)운영 구조목차