Guardrails 보호 메커니즘
Content Filters, PII, Contextual Grounding, Automated Reasoning 상세
보호 메커니즘
Content Filters, PII, Contextual Grounding, Automated Reasoning 상세
LLM 출력을 안전하게 제어한다
8가지 보호 메커니즘으로 생성형 AI의 위험을 관리하는 서비스
콘텐츠 필터링
Content Filters · Denied Topics · Word Filters · 이미지 검사
콘텐츠 필터링
카테고리 · 주제 · 키워드 — 3겹의 콘텐츠 방어
콘텐츠 방어 3겹
Content Filters가 유해 카테고리를, Denied Topics가 금지 주제를, Word Filters가 키워드를 막습니다 — 텍스트와 이미지에 함께 적용됩니다.
- Content Filters — 유해 카테고리 5종 + Prompt Attack
- Denied Topics — 자연어로 정의한 금지 주제
- Word Filters — 정확한 키워드/구문 차단
- 이미지 검사 — 텍스트 기준과 동일 임계값
Word Filters는 정확한 키워드를, Denied Topics는 우회 표현까지 의미 기반으로 차단합니다 — 두 기능의 조합 사용을 권장합니다.
Content Filters — 유해 카테고리 5종
각 카테고리별 임계값(NONE/LOW/MEDIUM/HIGH)을 설정
HATE
인종, 성별, 종교 등 혐오 표현 감지 및 차단
VIOLENCE
폭력적 행위, 위협, 자해 관련 콘텐츠 감지
SEXUAL
성적 콘텐츠, 부적절한 표현 감지
INSULTS
모욕적 표현, 비하, 인신공격 감지
MISCONDUCT
불법 행위 조장, 사기, 비윤리적 조언 감지
ApplyGuardrail API에서는 Prompt Attack(인젝션·탈옥 탐지)도 Content Filter의 한 축으로 함께 검사됩니다 — 입력 검사에서 특히 중요합니다.
Denied Topics — 자연어 금지 주제
키워드가 아닌 의미 기반으로 주제를 차단
정의 방법
- 자연어로 금지 주제를 서술
- 예: "투자 조언이나 금융 상품 추천"
- 금지 주제를 복수로 정의 가능
- 샘플 문장을 함께 등록해 탐지 정밀도 향상
vs Word Filters 차이
- Word Filters = 정확한 키워드 매칭
- Denied Topics = 의미 기반 분류
- 우회 표현도 차단 (예: "주식 좀 골라줘")
- 두 기능 조합 사용 권장
"주식 좀 골라줘" 같은 우회 표현도 의미 기반으로 차단합니다 — 샘플 문장을 함께 등록하면 탐지 정밀도가 올라갑니다.
텍스트 + 이미지 동시 검사
멀티모달 입출력에도 동일한 가드레일 적용
텍스트 검사
- Content Filter 유해 카테고리 5종
- Denied Topics 의미 분류
- Word Filters 키워드 매칭
- PII 엔티티 감지
이미지 검사
- 유해 이미지 카테고리 탐지
- 텍스트 기준과 동일 임계값
- 이미지 + 텍스트 조합 분석
- 멀티모달 모델 출력 검사
멀티모달 입출력에도 동일한 가드레일이 적용됩니다 — 이미지도 텍스트 기준과 동일한 임계값으로 검사합니다.
민감 정보와 환각 방지
PII Filters · Contextual Grounding · Automated Reasoning
민감 정보와 환각 방지
정보 유출과 환각 — 두 위험에 대한 세 가지 방어선
정보 유출과 환각의 방어선
PII는 자동 감지와 마스킹으로, 환각은 근거 점수 검증과 수학적 증명으로 막습니다.
- PII Filters — 31개 엔티티 · BLOCK/MASK
- Contextual Grounding — Grounding · Relevance 점수 검증
- Automated Reasoning — 정형 논리로 정책 위반 증명
환각 대응은 두 겹입니다 — Grounding이 소스 근거를 점수로 검증하고, Automated Reasoning이 정책 위반을 논리로 증명합니다.
PII Filters — 개인정보 보호
31개 엔티티 유형을 자동 감지하여 차단 또는 마스킹
동작 모드
- BLOCK — PII 감지 시 전체 응답 차단
- MASK — PII 부분만
[NAME],[PHONE]으로 대체 - 커스텀 Regex로 사내 고유 패턴도 추가 가능
주요 엔티티
- 이름, 이메일, 전화번호
- 신용카드, 은행계좌
- IP 주소, AWS 계정 ID
- 여권번호 — 빌트인은 US_PASSPORT_NUMBER만
- 주민등록번호 · 사내 직원 ID (커스텀 Regex)
BLOCK은 전체 응답 차단, MASK는 해당 부분만 대체 — 주민등록번호처럼 빌트인에 없는 유형은 커스텀 Regex로 추가합니다.
Contextual Grounding — 환각 탐지
답변이 검색 결과에 근거하는지 점수로 검증
-
1
소스 청크 수집
RAG 검색 결과(Reference) 자동 전달.
-
2
Grounding 점수
답변 문장별로 소스 대비 근거 점수 계산.
-
3
Relevance 점수
답변이 질문에 관련 있는지 점수 계산.
-
4
임계값 판정
점수가 설정 임계값 미만이면 차단.
Grounding은 "답변이 소스에 있는 말인가?", Relevance는 "답변이 질문에 대한 답인가?"를 각각 검사합니다.
Automated Reasoning — 수학적 증명
정형 논리(Formal Logic)로 정책 위반을 증명 — LLM 판단의 불확실성 제거
동작 원리
자연어 정책을 논리식으로 변환 → 모델 출력을 대입 → 위반 여부를 수학적으로 증명
장점
LLM 판단의 불확실성 제거. "틀렸다"를 확실히 증명 가능. 수학적 검증 기반 환각 탐지
Policy Refinement
테스트 결과에서 자동으로 정책 개선점을 추론. 모호한 표현 자동 정제
LLM 판단의 불확실성을 정형 논리로 대체합니다 — 모호한 정책 표현은 Policy Refinement가 자동 정제합니다.
콘텐츠·정보·논리·조직 4개 층의 방어