Strands Evals SDK 개요
Case·Experiment·Evaluator 3요소, 결정론적 vs LLM-as-Judge
에이전트 품질을 코드로 보장한다
테스트·평가·카오스 엔지니어링으로 에이전트 신뢰성 확보
📐
평가 체계 개요
3요소 · 파이프라인 · 환경별 전략
PART 1 · 평가 체계 개요
평가 파이프라인 4단계
Case 정의 → 실행 → 평가 → 리포트, 그리고 다시 Case로 — 반복 가능한 품질 루프
PART 1 · 평가 체계 개요
평가 3요소
Test Case · Evaluator · Experiment — 품질 시스템의 구성 단위
Test Case
입력 + 기대 출력 + 평가 기준을 묶은 단일 검증 단위
Evaluator
에이전트 출력을 채점하는 클래스 — 빌트인 20종+ + Custom
Experiment
Case Set + Evaluator Set + Agent Config를 묶은 실행 단위
takeaway
Case가 문제, Evaluator가 채점 기준, Experiment가 시험 실행 — 세 요소의 조합이 곧 평가 파이프라인입니다.
PART 1 · 평가 체계 개요
환경별 평가 전략
개발 · CI/CD · 프로덕션 — 각 환경에 최적화된 평가 방식
| 환경 | 목적 | 평가 방식 | Case 수 | 빈도 |
| 개발 (로컬) | 빠른 피드백 | ToolSimulator + 소수 Case | 10~30개 | 코드 변경 시마다 |
| CI/CD | 회귀 방지 | 전체 Suite + 임계값 게이트 | 100~500개 | PR/머지마다 |
| 프로덕션 | 드리프트 감지 | Shadow 실행 + 샘플링 평가 | 실 트래픽 1~5% | 상시 (비동기) |
takeaway
환경마다 목적이 다릅니다 — 개발은 빠른 피드백, CI/CD는 회귀 방지, 프로덕션은 드리프트 감지
측정하지 않으면 개선할 수 없습니다.
Case · Experiment · Evaluator · Chaos — 에이전트 품질 보장의 4요소