Home / Bedrock Guardrails / Guardrails
Note

Guardrails

Guardrails 정책 6종 개요와 에이전트 연동

⏱ 30분 79 / 189

Guardrails 개요

Guardrails 정책 6종 개요와 에이전트 연동

LLM 출력을 안전하게 제어한다

8가지 보호 메커니즘으로 생성형 AI의 위험을 관리하는 서비스

Guardrails 개요

모델 한계 · 8가지 메커니즘 · 적용 흐름

PART 1 · Guardrails 개요

LLM 출력의 3가지 위험

강력한 모델일수록 커지는 통제 장치의 필요성

유해 콘텐츠

혐오, 폭력, 성적 콘텐츠를 생성할 수 있음. 브랜드 리스크

정보 유출

프롬프트에 포함된 PII(이름, 전화번호)를 답변에 노출

환각 (Hallucination)

검색 결과에 없는 내용을 자신 있게 생성. 잘못된 정보 전달

takeaway

강력한 모델일수록 통제 장치의 필요성도 커집니다 — 8가지 보호 메커니즘이 이 세 위험에 대한 답입니다.

PART 1 · Guardrails 개요

입력·출력 양방향 적용

사용자 입력도, 모델 출력도 모두 검사

입력 검사 (Input)

  • 사용자 프롬프트를 모델 호출 전 검사
  • Prompt Attack·Denied Topics 조기 차단
  • 차단 시 모델 호출 자체를 생략 — 비용 절감

출력 검사 (Output)

  • 모델 응답을 사용자 전달 전 검사
  • PII 마스킹 · Contextual Grounding 검증
  • 차단 시 사전 정의한 메시지로 대체

입력과 출력에 서로 다른 필터 강도를 설정할 수 있습니다 — 입력은 공격 차단, 출력은 정보 보호에 무게를 둡니다.

PART 1 · Guardrails 개요

8가지 보호 메커니즘

6대 보호 필터 + 2대 거버넌스 기능

카테고리메커니즘역할
콘텐츠Content Filters유해 카테고리 5종 + Prompt Attack 임계값 차단
콘텐츠Denied Topics자연어로 정의한 금지 주제
콘텐츠Word Filters정확한 키워드/구문 차단
정보PII Filters31개 개인정보 엔티티 감지·마스킹
검증Contextual Grounding답변의 근거 충실도 점수 검증
검증Automated Reasoning정형 논리로 정책 위반 수학적 증명
거버넌스Selective Guarding메시지 역할별 차등 적용
거버넌스Cross-AccountOrganizations 전체 자동 강제
takeaway

6대 보호 필터 + 2대 거버넌스 기능의 구성입니다 — 콘텐츠·정보·검증·거버넌스가 각자의 층을 지킵니다.

Guardrails는 선택이 아니라 프로덕션의 안전벨트입니다.

콘텐츠·정보·논리·조직 4개 층의 방어