Home / Amazon Bedrock Evaluations / Bedrock Evaluations — 모델 평가
Lab

Bedrock Evaluations — 모델 평가

LLM-as-a-Judge로 Claude vs Nova를 같은 데이터셋으로 비교하고 평가 방법별 전략을 정리합니다

⏱ 40분 36 / 189

실습 — Bedrock Evaluations

감이 아니라 숫자로 평가한다

모델과 RAG의 품질을 서버리스로 채점하는 관리형 평가 서비스

⏱ 40분

LLM-as-a-Judge로 Claude와 Nova를 같은 데이터셋으로 비교 평가합니다

학습 목표

  • 평가 데이터셋(JSONL) 준비와 S3 업로드
  • Model Evaluation 잡 생성 — LLM-as-a-Judge
  • 평가 방법 비교와 전략 정리
측정해야 개선할 수 있고, 같은 잣대여야 비교할 수 있습니다.

데이터셋 하나를 잣대로 — 평가 → 진단 → 조정 → 재평가의 루프