개요
100+ 파운데이션 모델, 서버리스, 기능 맵 8영역, 보안과 데이터 프라이버시, 엔드포인트 3종과 API 5종
Amazon Bedrock 개요
100+ 파운데이션 모델 · 기능 맵 · 카탈로그 · 특징 · 엔드포인트와 API
생성형 AI, 인프라 없이 시작하기
100+ 파운데이션 모델을 단일 API로 호출하는 완전관리형 플랫폼
Amazon Bedrock이란
완전관리형 생성형 AI 플랫폼
Amazon Bedrock이란
서비스의 정체 — 인프라가 아니라 API
100+ 파운데이션 모델을 단일 API로
AWS 완전관리형 생성형 AI 플랫폼 — 모델 호출부터 프로덕션 운영까지
- 100+ 파운데이션 모델
- 서버리스
- 단일 API
- On-Demand 과금
- VPC 데이터 격리
인프라를 세우는 서비스가 아니라, 모델을 호출하는 API 서비스입니다.
직접 구축과의 차이
GPU 클러스터 직접 운영 대비 시작 · 비용 · 확장 · 보안 · 모델 다섯 가지 전환
SageMaker Endpoint와의 경계
같은 추론이라도 운영 책임의 위치가 다른 두 서비스
SageMaker Endpoint
내가 배포하는 모델 서버
- 모델을 인스턴스에 직접 배포
- 스케일링 정책·패치를 직접 관리
- 커스텀 모델·자체 가중치에 적합
- 인스턴스 단위 시간 과금
Amazon Bedrock
AWS가 서빙하는 모델 API
- 배포 없이 API 호출 즉시 추론
- 스케일링·패치 전부 AWS 책임
- 상용 파운데이션 모델을 빠르게 쓰는 데 적합
- 토큰 단위 종량 과금
기능 맵
추론부터 프로덕션까지 8개 영역
Bedrock 기능 맵
모두 서버리스 — 인프라 프로비저닝 없이 켜서 쓰는 8개 영역
대표 영역 넷
여덟 영역 중 실무에서 가장 먼저 만나는 넷
추론 API
Converse · InvokeModel — 100+ 모델을 단일 API로 호출
모든 기능의 출발점 — 스트리밍 · Tool Use 포함
RAG
Knowledge Bases — 사내 문서를 검색해 응답에 근거 주입
환각 · 지식 단절 대응의 표준 패턴
에이전트
Agents · AgentCore — 도구 호출 · 메모리 · 오케스트레이션
모델을 실행 환경과 결합해 자율 작업 수행
안전
Guardrails — 콘텐츠 필터 · PII 마스킹 · 근거 검증
입력과 출력 양쪽에 정책 적용
나머지 네 영역(추론 인프라 · 평가 · 커스터마이징 · 모델 서빙)까지 여덟 영역 모두 전용 모듈에서 심화합니다.
파운데이션 모델 카탈로그
100+ 모델 탐색 · 비교 · 선택
100+ 모델의 지형도
프로바이더 × 라이선스 두 축으로 탐색하는 Model Catalog
갈래별 대표 라인업
텍스트 · 멀티모달 · 오픈웨이트 세 갈래의 출발점
Claude 계열
실습 기본 모델 — 범용 텍스트·에이전틱의 기준선
- Sonnet 4.6 — 실습 기본, 1M 컨텍스트
- Opus 5 — 최신 플래그십, 에이전틱 · 장문
- Fable 5 — 멀티데이 자율 작업 최상위
Amazon Nova 2
멀티모달 축 — 텍스트·이미지·비디오·음성
- Nova 2 Lite — 1M 컨텍스트, 영상 입력
- Nova 2 Pro — 멀티스텝 추론
- Nova 2 Sonic — 음성 대화 (한국어 미지원)
오픈웨이트
개방 라이선스 축 — 비용·규제 유연성
- Llama — Meta, 128K 컨텍스트
- Gemma 4 — Google, 3종 GA
- gpt-oss — OpenAI, 120B/20B
출발점은 셋입니다 — 범용 텍스트는 Claude, 멀티모달은 Nova 2, 개방 라이선스는 오픈웨이트에서 시작합니다.
모델 선택 기준 다섯 가지
정확도 vs 비용 · 컨텍스트 · 멀티모달 · 리전 · 라이선스 — 용도에 맞는 모델을 고르는 다섯 축
정확도 vs 비용
- Opus — 정확·고가
- Haiku · Nova Lite — 빠르고 저렴
언제 — 품질 요구와 예산의 균형
컨텍스트 윈도우
- Claude Sonnet 4+ — 1M 토큰
- Llama — 128K
언제 — 긴 문서·긴 대화 처리
멀티모달
- 이미지·비디오 입력 필요 시
- Nova 또는 Claude
언제 — 텍스트 외 입력 여부
리전 가용성
- 모든 모델이 모든 리전에 있지 않음
- 카탈로그에서 리전별 확인
언제 — 서비스 리전 제약
라이선스 · 규제
- 오픈웨이트(Llama · Gemma) ↔ 독점(Claude · Nova)
- 데이터 주권 요건 확인
언제 — 규제·주권 요건
단일 리전 ID 대신 us.anthropic.claude-sonnet-4-6 같은 프로파일을 쓰면 트래픽 급증 시 여러 리전으로 분산되어 429 스로틀링을 예방합니다.
Bedrock 특징
데이터 프라이버시 · 과금 · 리전 전략
내 데이터의 행방
호출 데이터의 생애 — 지리적 경계 안에서 처리되고 사라지는 흐름
🖥️
내 애플리케이션
요청 전송
🔒 TLS 1.2+
→
전송 구간 암호화
🌍 지리적 경계 — US / EU / APAC
🪨
리전 내 추론
기본은 호출 리전에서 처리
GEO 프로파일(us./eu./apac.)은 이 경계를 넘지 않음 — global.은 예외
📤 응답 반환
→
생성 결과 회신
🗑️
즉시 폐기
입력·출력 영구 보관 없음
응답 직후 요청·응답 데이터가 사라집니다 — Bedrock에 남는 건 없고, 로깅은 직접 켠 경우(옵트인)만 내 계정의 S3·CloudWatch에 저장됩니다
데이터 프라이버시 4대 약속
학습 미사용 · 경계 내 라우팅 · 임시 처리 · 고객 관리 키 — AWS의 공식 약속
학습 미사용
입력·출력이 파운데이션 모델 학습에 절대 사용되지 않음 — AWS 공식 약속
경계 내 라우팅
GEO 프로파일(us./eu./apac.)은 지리적 경계 안에서만 이동 — global.은 전 리전 분산
임시 처리
추론 입력·출력은 영구 보관되지 않음 — 로깅을 직접 켠 경우만 예외
고객 관리 키
Knowledge Bases · Fine-tuning 저장 데이터는 KMS CMK로 암호화
핵심은 첫 번째 약속입니다 — 내 데이터가 모델 학습에 쓰이지 않는다는 것이 규제 환경 도입의 전제입니다.
과금 모델 고르기
기본은 토큰 종량 On-Demand — 물량·긴급도에 따라 Batch·예약으로 확장
On-Demand 추천
입력·출력 토큰 종량 과금
- 선납금 · 최소 요금 없음
- Claude Sonnet 4.6 기준 $3 / $15 per MTok (입력/출력)
언제 — 기본값 — 대부분의 시작점
Batch Inference
On-Demand 대비 50% 할인
- 비동기 대량 처리
- 실시간 응답이 필요 없는 작업
언제 — 야간 대량 요약 · 분류 작업
Provisioned Throughput
MU 단위 예약 · 시간당 고정 과금
- 처리량 보장 — 레거시 모델 전용 (신형 Claude 미지원)
- 신형 모델 예약은 Service Tiers Reserved 티어
언제 — 예측 가능한 대규모 프로덕션
Service Tiers·Batch·Provisioned의 설정과 적용 전략은 Amazon Bedrock 추론 인프라 모듈에서 다룹니다.
리전 전략 — 기준점과 우회
신모델은 us-east-1부터 — 리전 격차는 Cross-Region 프로파일로 우회하는 전략
us-east-1이 기준점
가장 많은 모델 지원 — 새 모델은 us-east-1 · us-west-2에 먼저 출시
확장은 수 주 후
타 리전(서울 포함)은 출시 후 수 주 간격으로 확대 — 카탈로그에서 리전별 확인
Cross-Region으로 우회
us. / eu. / apac. 프로파일이면 단일 리전 제약과 스로틀링을 동시에 우회
리전·처리량 전략은 추론 인프라 모듈에서 심화합니다.
엔드포인트와 API
엔드포인트 3종 · API 5종 · 선택 기준
엔드포인트 3종 — 관리 · 호출 · 호환
역할과 인증 방식이 다른 3개 엔드포인트가 하나의 모델 풀을 감싸는 구조
관리는 bedrock, 호출은 bedrock-runtime, 기존 SDK 재사용은 bedrock-mantle입니다 — 역할과 인증 방식이 엔드포인트를 결정합니다.
5가지 API — 같은 모델 풀, 다른 인터페이스
같은 모델이면 어느 API로 불러도 성능·가격 동일 — 차이는 인터페이스와 SDK 호환성
| API | 엔드포인트 | SDK | 특징 | 적합한 상황 |
|---|---|---|---|---|
| Converse | bedrock-runtime | boto3 | Runtime 모델 통합, 멀티모달, Tool Use (Mantle 전용 모델 ❌) | AWS 기반 인프라, boto3 표준 |
| Invoke | bedrock-runtime | boto3 | 모델별 네이티브 JSON 직접 호출 | 이미지 생성·특화 기능 (비디오는 StartAsyncInvoke) |
| Responses | bedrock-mantle | OpenAI SDK | OpenAI 호환, Stateful 세션 (GPT-5.x·gpt-oss 등 — Claude ❌) | OpenAI 코드 마이그레이션, 신규 추천 |
| Messages | bedrock-mantle | Anthropic SDK | Anthropic 네이티브 (Sonnet 5·Opus 5 등 — Sonnet 4.6 ❌) | Anthropic 코드 마이그레이션 |
| Chat Completions | bedrock-mantle | OpenAI SDK | OpenAI 호환, Stateless 채팅 (gpt-oss 등 — GPT-5.x·Claude ❌) | 경량 작업, 간단한 채팅 |
결정 축은 두 개입니다 — 어떤 SDK를 쓰고 있는가, 어떤 기능이 필요한가. 상세 호출법은 Runtime API·Mantle API 모듈에서 심화합니다.
API 선택 질문 순서
기존 SDK 호환을 먼저, 기능 요구를 다음에 — 질문 두세 개면 충분
API 선택은 모델 성능이 아니라 기존 코드베이스 + 필요 기능으로 결정됩니다.
Amazon Bedrock Playground
콘솔에서 파운데이션 모델을 직접 호출해 보는 첫 실습
Playground에서 모델을 골라 프롬프트를 실험하고, Temperature 등 파라미터 변화에 따른 응답 차이를 관찰합니다.
학습 목표
- Model Catalog에서 모델을 탐색하고 비교합니다
- Playground에서 프롬프트를 실험합니다
- 추론 파라미터가 응답에 주는 영향을 관찰합니다
다음 모듈에서 Runtime API 호출을 심화합니다.