OpenAI는 GPT-5.6을 gpt-5.6-sol / terra / luna 세 API slug로 나눴지만, ChatGPT 경험이나 GPT-5.5의 gpt-5.5-pro 그대로 API를 호출하는 경우가 많습니다——403이 뜨거나 월말 청구서에서야 알게 되죠.아래에서 검증할 내용: Responses vs Chat Completions, 세 모델 선택, Pro 모드에 별도 slug가 필요한지.
2026년 2월 출시된 GPT-5.6은 복잡한 추론과 에이전트 코딩용입니다. API Key 발급부터 전체 가격표까지, 「실행 → 선택 → 비용 관리」 순으로 Python/cURL 예제와 흔한 함정을 정리했습니다.
1. GPT-5.6이란? GPT-5.5와 무엇이 다른가
GPT-5.6은 OpenAI 2026년 2월 16일 지식 기준일의 frontier 시리즈로, 복잡한 추론, Agent 코딩, 멀티모달 작업을 위해 설계되었습니다. GPT-5.5 대비 공식적으로 강조하는 세 가지는 다음과 같습니다.
| 항목 | GPT-5.5 | GPT-5.6 |
|---|---|---|
| 명명 | 단일 gpt-5.5 + 별도 gpt-5.5-pro |
Sol / Terra / Luna 3단계 + gpt-5.6 별칭 |
| Pro 모드 | gpt-5.5-pro 모델로 교체 |
동일 모델 + reasoning.mode: "pro" |
| Token 효율 | 기준 | 공식적으로 token 절약, 동일 작업에서 max_output_tokens를 약간 낮출 수 있음 |
| 컨텍스트 | 모델마다 상이 | 세 모델 모두 최대 약 105만 tokens 입력, 128K 출력 지원 |
커뮤니티 벤치마크에서 GPT-5.6 Sol은 Terminal-Bench 2.1(Agent 코딩) 등 지표에서 1티어에 속합니다——하지만 프로덕션 선택은 벤치마크만 보지 말고 작업 지연 시간, 청구서, 컴플라이언스를 기준으로 결정해야 합니다.
2. 지원 모델은? 한 표로 정리
| 모델 slug | 포지셔닝 | 입력가(짧은 컨텍스트) | 출력가(짧은 컨텍스트) | 적합한 시나리오 |
|---|---|---|---|---|
gpt-5.6-sol |
플래그십, 복잡한 전문 작업 | $5.00 / 1M | $30.00 / 1M | 아키텍처 설계, 어려운 버그, 긴 추론 체인, 핵심 Agent |
gpt-5.6-terra |
지능과 비용의 균형 | $2.50 / 1M | $15.00 / 1M | 일상 RAG, 고객 지원, 중간 수준 코드 작업 |
gpt-5.6-luna |
비용 민감, 고동시성 | $1.00 / 1M | $6.00 / 1M | 분류, 추출, 대량 요약 |
gpt-5.6(별칭) |
→ Sol로 라우팅 | Sol과 동일 | Sol과 동일 | 선택 귀찮을 때 기본값 |
공통 기능(세 모델 동일):
- 텍스트 + 이미지 입력, 텍스트 출력
- 다국어 및 시각 이해
v1/responses,v1/chat/completions,v1/batch지원reasoning.effort:none/low/medium/high/xhigh/max(기본값medium)
선택 한 줄 요약:
- 확실하지 않으면 → 먼저
gpt-5.6-terra로 부하 테스트, 부족하면 Sol로 업그레이드 - 비용이 지능보다 민감하면 → Luna
- 한 번의 요청이 분기 방향을 결정한다면 → Sol, 필요 시 Pro 추론 모드 활성화
3. GPT-5.6 endpoint: 어떤 API를 써야 하나?
OpenAI에는 현재 두 가지 주요 경로가 있으며, 신규 기능은 Responses API를 우선합니다.
| Endpoint | URL | 사용 시점 |
|---|---|---|
| Responses API(권장) | POST /v1/responses |
다중 턴 상태, 도구 호출, 추론 모드, 구조화 출력 |
| Chat Completions(호환) | POST /v1/chat/completions |
기존 OpenAI SDK 코드, 빠른 마이그레이션 |
| Batch | POST /v1/batch |
오프라인 대량 처리, 비실시간 |
Base URL은 모두 다음과 같습니다.
https://api.openai.com/v1
인증 헤더(두 API 동일):
Authorization: Bearer $OPENAI_API_KEY
Content-Type: application/json
GPT-5.6 endpoint에는 별도 서브도메인이 없습니다——일반 OpenAI API와
api.openai.com을 공유하며, 차이는 요청 본문의model필드에 있습니다.
4. 빠른 시작: API Key부터 첫 응답까지
4.1 개통 및 Key
- OpenAI Platform에 로그인
- Settings → API keys에서 Secret Key 생성(한 번만 표시되므로 반드시 저장)
- Billing에서 결제 수단 등록; GPT-5.6은 token 기준 후불이며 「월정액 무제한 API」는 없음
- 엔터프라이즈 사용자는 조직 단위로 Spend limits와 프로젝트별 Key 설정 가능
환경 변수(권장):
export OPENAI_API_KEY="sk-..."
4.2 Responses API(권장 방식)
cURL:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-terra",
"input": "세 문장으로 GPT-5.6 Terra와 Sol 모델 선택 차이를 설명해 주세요.",
"max_output_tokens": 512
}'
Python(공식 SDK ≥ 1.x):
from openai import OpenAI
client = OpenAI() # OPENAI_API_KEY 읽기
response = client.responses.create(
model="gpt-5.6-terra",
input="세 문장으로 GPT-5.6 Terra와 Sol 모델 선택 차이를 설명해 주세요.",
max_output_tokens=512,
)
print(response.output_text)
Node.js:
import OpenAI from "openai";
const client = new OpenAI();
const response = await client.responses.create({
model: "gpt-5.6-terra",
input: "세 문장으로 GPT-5.6 Terra와 Sol 모델 선택 차이를 설명해 주세요.",
max_output_tokens: 512,
});
console.log(response.output_text);
4.3 Chat Completions(기존 코드 호환)
curl https://api.openai.com/v1/chat/completions \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"messages": [
{"role": "user", "content": "Hello, GPT-5.6!"}
],
"max_tokens": 256
}'
마이그레이션 시 model을 gpt-5.5에서 gpt-5.6-sol / terra / luna로 바꾸면 됩니다. 응답 구조는 동일합니다.
4.4 스트리밍 출력(SSE)
Responses API에 "stream": true를 추가하면 채팅 UI와 긴 답변에 적합합니다.
stream = client.responses.create(
model="gpt-5.6-luna",
input="클라우드 네이티브를 주제로 한 오언절시를 지어 주세요.",
stream=True,
)
for event in stream:
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
Chat Completions 쪽은 stream=True에 대응하며, choices[0].delta.content를 파싱합니다.
5. 핵심 파라미터: reasoning, 도구, 멀티모달
5.1 추론 깊이: reasoning.effort
모델이 「얼마나 오래 생각할지」를 제어합니다——깊을수록 지연 시간과 token 소비가 일반적으로 증가합니다.
| 값 | 일반적인 용도 |
|---|---|
none |
매우 빠른 응답, 거의 추론 없음 |
low / medium |
기본 단계, 일상 대화와 가벼운 코드 |
high / xhigh / max |
수학, 복잡한 디버깅, 다단계 계획 |
생략 시 GPT-5.6 기본값은 medium입니다.
5.2 Pro 모드: reasoning.mode
GPT-5.5 시대에는 gpt-5.5-pro 모델로 교체했습니다. GPT-5.6에서는 동일 slug에서 Pro를 켜고 끕니다.
{
"model": "gpt-5.6-sol",
"input": "멀티 테넌트를 지원하는 주문 서비스 API를 설계하고, 라우팅과 데이터 모델을 제시해 주세요.",
"reasoning": {
"mode": "pro",
"effort": "high"
},
"max_output_tokens": 4096
}
- 과금: 선택한 Sol/Terra/Luna의 token 단가를 따르지만, Pro 모드는 내부 추론 작업이 더 많아 총 token이 종종 더 높음
gpt-5.6-pro같은 slug는 찾지 마세요(존재하지 않음)
5.3 이미지 입력(멀티모달)
GPT-5.6 세 모델 모두 vision을 지원합니다. Responses API 예시:
{
"model": "gpt-5.6-terra",
"input": [
{
"role": "user",
"content": [
{"type": "input_text", "text": "이 아키텍처 다이어그램에 단일 장애점은 어디가 있나요?"},
{"type": "input_image", "image_url": "https://example.com/diagram.png"}
]
}
]
}
base64 인라인 이미지 전송도 가능합니다(프라이빗 배포 경로에 적합).
5.4 도구 호출(Function / Tools)
Agent 시나리오에서는 Responses API의 tools 필드에 함수나 내장 도구(예: web_search, file_search)를 선언하고, 모델이 tool_calls를 반환하면 서비스에서 실행한 뒤 결과를 다시 전달합니다——GPT-5.5와 흐름은 유사하지만 GPT-5.6이 복잡한 도구 체인에서 더 안정적입니다. 구체적인 schema는 Responses API 도구 문서를 참고하세요.
6. GPT-5.6 pricing: 전체 가격표(2026)
아래는 OpenAI 공식 백만 tokens당 가격(미국 달러)입니다. 짧은 컨텍스트는 입력 ≤ 272K tokens을 의미하며, 초과 시 긴 컨텍스트 단가가 적용됩니다.
6.1 표준(짧은 컨텍스트)
| 모델 | 입력 | 캐시 히트 입력 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 |
| gpt-5.6-terra | $2.50 | $0.25 | $3.125 | $15.00 |
| gpt-5.6-luna | $1.00 | $0.10 | $1.25 | $6.00 |
6.2 긴 컨텍스트(입력 > 272K)
| 모델 | 입력 | 캐시 히트 입력 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|
| gpt-5.6-sol | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $5.00 | $0.50 | $6.25 | $22.50 |
| gpt-5.6-luna | $2.00 | $0.20 | $2.50 | $9.00 |
6.3 청구서 추정 예시
Terra 호출 한 번 가정: 20K 입력 + 2K 출력, 캐시 미적중:
입력: 20,000 / 1,000,000 × $2.50 = $0.05
출력: 2,000 / 1,000,000 × $15.00 = $0.03
합계 ≈ $0.08 / 회
유사 요청을 하루 1만 회 호출하면 → 약 $800/일. 그래서 Luna + 캐시 + 배치 처리가 고동시성 제품에 매우 중요합니다.
6.4 기타 비용 요소
| 항목 | 설명 |
|---|---|
| Prompt Caching | 반복되는 system prompt / 긴 문서 접두사로 입력가를 크게 절감(위 표 「캐시 히트」 열 참고) |
| Batch API | 비실시간 작업에 일반적으로 할인, 오프라인 평가와 데이터 라벨링에 적합 |
| 데이터 상주 | 2026-03-05 이후 출시된 eligible 모델, 지역 처리 endpoint +10% |
| GPT-5.5 대비 | Sol은 GPT-5.5와 동일 가격($5/$30)이지만 GPT-5.6이 token을 더 절약해 실제 청구서는 더 낮을 수 있음 |
콘솔 Usage 페이지에서 model별로 그룹화해 확인하는 것이 공식보다 더 신뢰할 수 있습니다.
7. 시나리오별 선택: Sol, Terra, Luna 중 무엇을?
| 시나리오 | 권장 모델 | reasoning | 비고 |
|---|---|---|---|
| 프로덕션급 코드 Agent / 어려운 버그 | Sol | high 또는 mode: pro |
지연 시간을 정확도로 교환 |
| 사내 Copilot | Terra | medium |
가성비 스위트 스팟 |
| 로그 분류, 태깅, 추출 | Luna | low / none |
대량·비용 민감 |
| 초장문서 RAG(>272K) | Terra 또는 Luna | medium |
긴 컨텍스트 가산 요금 주의 |
| 아키텍처 리뷰, 보안 감사 | Sol | pro + high |
모델 비용 아끼지 말 것 |
| 멀티모달 고객 지원(이미지+텍스트) | Terra | medium |
Sol은 에스컬레이션 시에만 |
ChatGPT 구독과의 관계: ChatGPT Plus/Pro는 제품 구독이고 API token 과금과는 별개입니다. 앱에서 쓰는 GPT-5.6 ≠ API 할당량이 자동 포함되지 않으며, 개발 통합은 반드시 별도 API 청구를 개설해야 합니다.
8. GPT-5.5 / GPT-4.1 마이그레이션 체크리스트
- model 문자열 변경:
gpt-5.5→gpt-5.6-sol(또는 terra/luna) - Pro 로직:
gpt-5.5-pro삭제,reasoning.mode: "pro"로 대체 - max_output_tokens 낮추기: GPT-5.6이 더 간결하므로 먼저 20% 줄여 A/B 테스트
- 회귀 테스트: 동일 prompt 세트로 품질, 지연 시간, 달러/요청 비교
- 캐시 히트율 모니터링: 고정 system prompt Agent는 반드시 caching 활성화
- SDK 버전:
openaiPython 패키지가 Responses API를 지원하는 버전인지 확인
9. 흔한 오류와 해결
| HTTP / 현상 | 원인 | 조치 |
|---|---|---|
401 |
Key 무효 또는 만료 | Key 재생성, 환경 변수 확인 |
403 / model_not_found |
계정에 GPT-5.6 미개통 또는 지역 제한 | 콘솔에서 모델 가시성 확인; 영업팀에 개통 요청 |
429 |
속도 제한 | 지수 백오프 재시도; 한도 상향 신청 또는 동시성 감소 |
context_length_exceeded |
입력 1.05M 초과 또는 출력 128K 초과 | 잘라내기, 요약 또는 분할 RAG |
| 청구서 급증 | reasoning.mode: pro + effort: max 남용 |
핵심 경로에만 Pro 사용; 기본 terra + medium |
| 스트리밍 중단 | 게이트웨이 타임아웃 | 리버스 프록시 read_timeout 늘리기, 또는 비스트리밍 Batch 사용 |
10. 7단계 실전 체크리스트(오늘 바로 실행)
- Platform에서 API Key 생성, 월 hard limit 설정(예: $50).
- Terra로 Responses API 스모크 테스트 한 번 실행.
- 프로덕션
model을gpt-5.5에서gpt-5.6-terra로 변경, 일주일 청구서 관찰. - 고정 system prompt에 Prompt Caching 활성화, 입력 비용 감소 여부 확인.
- 어려운 작업만 Sol로 라우팅하고 QPS 제한.
- 오프라인 평가는 Batch API 사용.
- 대시보드에서 model × endpoint별 비용 알림 설정.
11. 요약
GPT-5.6 API를 2026년에 올바르게 쓰는 방법은 다음과 같습니다.
- Endpoint:
v1/responses우선, 호환은v1/chat/completions - 모델:
sol최강,terra일상,luna대량;gpt-5.6= Sol - 가격: Sol $5 / $30(백만 input/output tokens)부터, Terra 절반, Luna 약 1/5
- 파라미터:
reasoning.effort로 깊이 제어; Pro 기능은reasoning.mode: "pro", 존재하지 않는 모델명으로 바꾸지 말 것
Terra로 부하 테스트, Sol로 어려운 작업 처리, Luna로 대량 처리한 뒤 캐시와 Batch를 함께 쓰는 것이 처음부터 전체 Sol보다 지속 가능합니다.
참고 및 추가 읽을거리
- OpenAI Models 문서
- OpenAI Pricing
- GPT-5.6 Model guidance
- ChatGPT Work 무료 vs 유료 차이(제품 구독 vs API 과금)
- MCP 2026: AI 범용 USB 포트 완전 이해(GPT-5.6 Agent에 데이터 소스 연결)
API는 클라우드, 빌드·서명은 Mac 필요
GPT-5.6 API로 Agent와 파이프라인은 가능하지만 iOS/macOS 패키징, Xcode 빌드, 코드 서명은 네이티브 macOS가 필요합니다.
Hashvps 클라우드 Mac(M4) 온디맨드 빌드: API 로직은 로컬, Archive·TestFlight·CI는 클라우드.