본문으로 바로가기
리옵트 핸드북
리옵트 핸드북
Vercel 엔터프라이즈 AI 플랫폼

플랫폼 기초

플랫폼 아키텍처AI SDK 런타임AI Gateway 제어면

실행 런타임

Workflow 장기 실행Sandbox 실행 격리MCP 데이터 계층Queues & 비동기 작업 관리

프롬프트 & 품질

프롬프트 엔지니어링 & 가드레일RAG & 검색 증강 생성관측성·평가

운영 체계

보안·거버넌스비용·안정성배포 전략 & AI CI/CD

실전 시나리오

고객지원 에이전트 아키텍처내부 리서치 에이전트 아키텍처승인형 백오피스 자동화코딩 오케스트레이션

오케스트레이션 패턴

그래프 중심 오케스트레이션실무 오케스트레이션 플레이북멀티 에이전트 아키텍처

부록

마이그레이션 가이드레퍼런스검증 리포트업데이트 내역
핸드북›Vercel 엔터프라이즈 AI›관측성·평가
한국어English

관측성·평가

AI Gateway, Workflow, Vercel Observability, AI SDK telemetry를 연결해 품질과 운영 신호를 하나의 루프로 관리하는 방법을 정리합니다.

핵심 요약

  • 평가는 별도 연구 환경이 아니라 운영 신호의 일부로 취급해 App trace·Gateway usage·Workflow state·AI SDK telemetry를 같은 리뷰 루프에 연결합니다.
  • 정답률 하나가 아니라 TTFT·총 지연시간·step retry·tool/schema failure·spend·approval rate를 함께 봅니다.
  • 평가 루프는 offline eval → canary → human review → production monitor로 이어지며 rollback 또는 확대 결정을 내립니다.
  • 실패는 retrieval·tool·reasoning·contract·governance 유형으로 분류해 각각 다른 조치를 연결합니다.
  • 실시간·품질·비용·안정성 대시보드를 주기별로 나눠 운영 신호를 따로 관리합니다.

LLM 서비스는 "정답률" 하나로 운영되지 않습니다.
실제 운영에서는 TTFT, 총 지연시간, step retry, tool failure, schema failure, spend, approval rate가 같이 움직입니다. 평가 체계도 이 신호들 위에서 굴러가야 합니다.

어떤 신호를 봐야 하는가

계층핵심 지표질문
Apprequest latency, stream drop rate사용자가 느리다고 느끼는가
AI Gatewayspend, request count, model usage, TTFT어떤 모델이 비싸고 느린가
Workflowstep duration, retry count, stuck executions장기 작업이 어디서 멈추는가
Tool / Sandboxcommand failure, policy denialtool surface가 안전한가
Output Qualityschema failure, human escalation, offline eval score서비스 품질이 유지되는가

통합 관측 구조

운영 대시보드 권장 구성

보드포함할 것주기
실시간 운영 보드p95 latency, Gateway spend, workflow backlog실시간
품질 보드schema success, human escalation, top failure classes일간
비용 보드model별 spend, customer tier별 cost주간
안정성 보드incident count, timeout rate, retry burn주간

평가 루프

단계입력출력
Offline evalgolden set, regression setprompt/model candidate 점수
Canary실사용 일부 트래픽latency / spend / failure rate
Human reviewlow confidence, approval-required tasks정책 보완 포인트
Production monitortrace + logs + budgetsrollback 또는 확대

AI SDK telemetry와 Vercel observability의 연결

기능목적적용 포인트
AI SDK telemetrygeneration/tool 단계 추적route handler, worker
AI SDK DevTools개발 중 trace 확인local/preview
Vercel Observability앱 레벨 trace와 runtime 신호prod
Gateway observability모델/비용 시야 확보모든 호출

실무 해석

엔터프라이즈에서 평가는 별도 랩 환경이 아니라 운영 신호의 일부여야 합니다. 모델을 바꿨는데 latency, spend, approval rate가 같이 보이지 않으면 실제 영향은 알 수 없습니다.

실패 분류 기준 예시

실패 유형예시조치
Retrieval failure필요한 문맥을 못 찾음resource 품질 개선
Tool failureAPI timeout, sandbox denialretry/policy 개선
Reasoning mismatch요약/판단 오류prompt/model reevaluation
Contract failureJSON schema 미준수structured output 강화
Governance failure승인 없는 action 시도rule/approval 강화

ADR 스타일 결론

Decision

평가는 별도 연구 환경이 아니라 운영 신호의 일부로 취급합니다. App trace, Gateway usage, Workflow state, AI SDK telemetry를 같은 리뷰 루프에 연결합니다.

실무 체크리스트

  • App, Gateway, Workflow 지표를 같은 대시보드에서 볼 수 있는가
  • schema failure와 human escalation이 품질 지표에 포함되는가
  • canary와 production의 비용/지연시간 차이를 비교할 수 있는가
  • 실패 유형이 retrieval, tool, reasoning, governance로 분류되는가

관련 문서

  • Observability
  • Tracing
  • AI SDK Telemetry
  • AI SDK DevTools
  • AI Gateway Overview

관련 문서

비용·안정성

비용, 지연시간, 에러 버짓을 함께 관리해 엔터프라이즈 AI 제품의 운영 연속성을 확보하는 방법을 정리합니다.

마이그레이션 가이드

LangChain, LangGraph, 커스텀 오케스트레이션에서 Vercel AI 스택으로 전환할 때의 개념 매핑과 전환 전략을 정리합니다.

에러 처리와 복구 전략

AI 에이전트 오케스트레이션 패턴 · 재시도/폴백/서킷브레이커, 에이전트 실패 격리, Human-in-the-Loop, 부분 실패 복구

Ch12. Evals와 품질 게이트

엔터프라이즈 Eve 에이전트 개발 · Eve eval runner와 assertion surface를 활용해 에이전트 회귀를 막는 품질 게이트를 설계한다.

실행 토폴로지와 러너 아키텍처

에이전틱 테스트 환경 엔지니어링 · 브라우저 러너, 서비스 클라이언트, 증거 수집기, 판정기를 어떤 구조로 분리해야 하는지 설명합니다.

RAG & 검색 증강 생성

Vercel 환경에서 RAG 파이프라인을 설계하고 운영하는 방법을 정리합니다.

보안·거버넌스

OIDC, API key, BYOK, ZDR, WAF, BotID, approval을 결합해 엔터프라이즈 AI 운영 통제를 설계하는 방법을 정리합니다.

On this page

어떤 신호를 봐야 하는가통합 관측 구조운영 대시보드 권장 구성평가 루프AI SDK telemetry와 Vercel observability의 연결실패 분류 기준 예시ADR 스타일 결론실무 체크리스트관련 문서