Home / Strands 테스팅과 평가 / Strands Evals SDK
Note

Strands Evals SDK

Case·Experiment·Evaluator 3요소, 결정론적 vs LLM-as-Judge

⏱ 20분 149 / 189

Strands Evals SDK 개요

Case·Experiment·Evaluator 3요소, 결정론적 vs LLM-as-Judge

에이전트 품질을 코드로 보장한다

테스트·평가·카오스 엔지니어링으로 에이전트 신뢰성 확보

평가 체계 개요

3요소 · 파이프라인 · 환경별 전략

PART 1 · 평가 체계 개요

평가 파이프라인 4단계

Case 정의 → 실행 → 평가 → 리포트, 그리고 다시 Case로 — 반복 가능한 품질 루프

PART 1 · 평가 체계 개요

평가 3요소

Test Case · Evaluator · Experiment — 품질 시스템의 구성 단위

Test Case

입력 + 기대 출력 + 평가 기준을 묶은 단일 검증 단위

Evaluator

에이전트 출력을 채점하는 클래스 — 빌트인 20종+ + Custom

Experiment

Case Set + Evaluator Set + Agent Config를 묶은 실행 단위

takeaway

Case가 문제, Evaluator가 채점 기준, Experiment가 시험 실행 — 세 요소의 조합이 곧 평가 파이프라인입니다.

PART 1 · 평가 체계 개요

환경별 평가 전략

개발 · CI/CD · 프로덕션 — 각 환경에 최적화된 평가 방식

환경목적평가 방식Case 수빈도
개발 (로컬)빠른 피드백ToolSimulator + 소수 Case10~30개코드 변경 시마다
CI/CD회귀 방지전체 Suite + 임계값 게이트100~500개PR/머지마다
프로덕션드리프트 감지Shadow 실행 + 샘플링 평가실 트래픽 1~5%상시 (비동기)
takeaway

환경마다 목적이 다릅니다 — 개발은 빠른 피드백, CI/CD는 회귀 방지, 프로덕션은 드리프트 감지

측정하지 않으면 개선할 수 없습니다.

Case · Experiment · Evaluator · Chaos — 에이전트 품질 보장의 4요소