Bedrock Evaluations — 모델 평가
LLM-as-a-Judge로 Claude vs Nova를 같은 데이터셋으로 비교하고 평가 방법별 전략을 정리합니다
실습 — Bedrock Evaluations
감이 아니라 숫자로 평가한다
모델과 RAG의 품질을 서버리스로 채점하는 관리형 평가 서비스
데이터셋 하나를 잣대로 — 평가 → 진단 → 조정 → 재평가의 루프
LLM-as-a-Judge로 Claude vs Nova를 같은 데이터셋으로 비교하고 평가 방법별 전략을 정리합니다
감이 아니라 숫자로 평가한다
모델과 RAG의 품질을 서버리스로 채점하는 관리형 평가 서비스
데이터셋 하나를 잣대로 — 평가 → 진단 → 조정 → 재평가의 루프