← 블로그로 돌아가기

GPT-5.6 API 완전 가이드: 호출 방법, 가격, 지원 모델

LLM · 2026.07.30 · 약 5분 읽기

OpenAI는 GPT-5.6을 gpt-5.6-sol / terra / luna 세 API slug로 나눴지만, ChatGPT 경험이나 GPT-5.5의 gpt-5.5-pro 그대로 API를 호출하는 경우가 많습니다——403이 뜨거나 월말 청구서에서야 알게 되죠.아래에서 검증할 내용: Responses vs Chat Completions, 세 모델 선택, Pro 모드에 별도 slug가 필요한지.

2026년 2월 출시된 GPT-5.6은 복잡한 추론과 에이전트 코딩용입니다. API Key 발급부터 전체 가격표까지, 「실행 → 선택 → 비용 관리」 순으로 Python/cURL 예제와 흔한 함정을 정리했습니다.

1. GPT-5.6이란? GPT-5.5와 무엇이 다른가

GPT-5.6은 OpenAI 2026년 2월 16일 지식 기준일의 frontier 시리즈로, 복잡한 추론, Agent 코딩, 멀티모달 작업을 위해 설계되었습니다. GPT-5.5 대비 공식적으로 강조하는 세 가지는 다음과 같습니다.

항목 GPT-5.5 GPT-5.6
명명 단일 gpt-5.5 + 별도 gpt-5.5-pro Sol / Terra / Luna 3단계 + gpt-5.6 별칭
Pro 모드 gpt-5.5-pro 모델로 교체 동일 모델 + reasoning.mode: "pro"
Token 효율 기준 공식적으로 token 절약, 동일 작업에서 max_output_tokens를 약간 낮출 수 있음
컨텍스트 모델마다 상이 세 모델 모두 최대 약 105만 tokens 입력, 128K 출력 지원

커뮤니티 벤치마크에서 GPT-5.6 Sol은 Terminal-Bench 2.1(Agent 코딩) 등 지표에서 1티어에 속합니다——하지만 프로덕션 선택은 벤치마크만 보지 말고 작업 지연 시간, 청구서, 컴플라이언스를 기준으로 결정해야 합니다.

2. 지원 모델은? 한 표로 정리

모델 slug 포지셔닝 입력가(짧은 컨텍스트) 출력가(짧은 컨텍스트) 적합한 시나리오
gpt-5.6-sol 플래그십, 복잡한 전문 작업 $5.00 / 1M $30.00 / 1M 아키텍처 설계, 어려운 버그, 긴 추론 체인, 핵심 Agent
gpt-5.6-terra 지능과 비용의 균형 $2.50 / 1M $15.00 / 1M 일상 RAG, 고객 지원, 중간 수준 코드 작업
gpt-5.6-luna 비용 민감, 고동시성 $1.00 / 1M $6.00 / 1M 분류, 추출, 대량 요약
gpt-5.6(별칭) Sol로 라우팅 Sol과 동일 Sol과 동일 선택 귀찮을 때 기본값

공통 기능(세 모델 동일):

  • 텍스트 + 이미지 입력, 텍스트 출력
  • 다국어 및 시각 이해
  • v1/responses, v1/chat/completions, v1/batch 지원
  • reasoning.effort: none / low / medium / high / xhigh / max(기본값 medium)

선택 한 줄 요약:

  • 확실하지 않으면 → 먼저 gpt-5.6-terra로 부하 테스트, 부족하면 Sol로 업그레이드
  • 비용이 지능보다 민감하면 → Luna
  • 한 번의 요청이 분기 방향을 결정한다면 → Sol, 필요 시 Pro 추론 모드 활성화

3. GPT-5.6 endpoint: 어떤 API를 써야 하나?

OpenAI에는 현재 두 가지 주요 경로가 있으며, 신규 기능은 Responses API를 우선합니다.

Endpoint URL 사용 시점
Responses API(권장) POST /v1/responses 다중 턴 상태, 도구 호출, 추론 모드, 구조화 출력
Chat Completions(호환) POST /v1/chat/completions 기존 OpenAI SDK 코드, 빠른 마이그레이션
Batch POST /v1/batch 오프라인 대량 처리, 비실시간

Base URL은 모두 다음과 같습니다.

text
https://api.openai.com/v1

인증 헤더(두 API 동일):

http
Authorization: Bearer $OPENAI_API_KEY
Content-Type: application/json

GPT-5.6 endpoint에는 별도 서브도메인이 없습니다——일반 OpenAI API와 api.openai.com을 공유하며, 차이는 요청 본문의 model 필드에 있습니다.

4. 빠른 시작: API Key부터 첫 응답까지

4.1 개통 및 Key

  1. OpenAI Platform에 로그인
  2. Settings → API keys에서 Secret Key 생성(한 번만 표시되므로 반드시 저장)
  3. Billing에서 결제 수단 등록; GPT-5.6은 token 기준 후불이며 「월정액 무제한 API」는 없음
  4. 엔터프라이즈 사용자는 조직 단위로 Spend limits프로젝트별 Key 설정 가능

환경 변수(권장):

bash
export OPENAI_API_KEY="sk-..."

4.2 Responses API(권장 방식)

cURL:

bash
curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-terra",
    "input": "세 문장으로 GPT-5.6 Terra와 Sol 모델 선택 차이를 설명해 주세요.",
    "max_output_tokens": 512
  }'

Python(공식 SDK ≥ 1.x):

python
from openai import OpenAI

client = OpenAI()  # OPENAI_API_KEY 읽기

response = client.responses.create(
    model="gpt-5.6-terra",
    input="세 문장으로 GPT-5.6 Terra와 Sol 모델 선택 차이를 설명해 주세요.",
    max_output_tokens=512,
)

print(response.output_text)

Node.js:

javascript
import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-5.6-terra",
  input: "세 문장으로 GPT-5.6 Terra와 Sol 모델 선택 차이를 설명해 주세요.",
  max_output_tokens: 512,
});

console.log(response.output_text);

4.3 Chat Completions(기존 코드 호환)

bash
curl https://api.openai.com/v1/chat/completions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-sol",
    "messages": [
      {"role": "user", "content": "Hello, GPT-5.6!"}
    ],
    "max_tokens": 256
  }'

마이그레이션 시 modelgpt-5.5에서 gpt-5.6-sol / terra / luna로 바꾸면 됩니다. 응답 구조는 동일합니다.

4.4 스트리밍 출력(SSE)

Responses API에 "stream": true를 추가하면 채팅 UI와 긴 답변에 적합합니다.

python
stream = client.responses.create(
    model="gpt-5.6-luna",
    input="클라우드 네이티브를 주제로 한 오언절시를 지어 주세요.",
    stream=True,
)

for event in stream:
    if event.type == "response.output_text.delta":
        print(event.delta, end="", flush=True)

Chat Completions 쪽은 stream=True에 대응하며, choices[0].delta.content를 파싱합니다.

5. 핵심 파라미터: reasoning, 도구, 멀티모달

5.1 추론 깊이: reasoning.effort

모델이 「얼마나 오래 생각할지」를 제어합니다——깊을수록 지연 시간과 token 소비가 일반적으로 증가합니다.

일반적인 용도
none 매우 빠른 응답, 거의 추론 없음
low / medium 기본 단계, 일상 대화와 가벼운 코드
high / xhigh / max 수학, 복잡한 디버깅, 다단계 계획

생략 시 GPT-5.6 기본값은 medium입니다.

5.2 Pro 모드: reasoning.mode

GPT-5.5 시대에는 gpt-5.5-pro 모델로 교체했습니다. GPT-5.6에서는 동일 slug에서 Pro를 켜고 끕니다.

json
{
  "model": "gpt-5.6-sol",
  "input": "멀티 테넌트를 지원하는 주문 서비스 API를 설계하고, 라우팅과 데이터 모델을 제시해 주세요.",
  "reasoning": {
    "mode": "pro",
    "effort": "high"
  },
  "max_output_tokens": 4096
}
  • 과금: 선택한 Sol/Terra/Luna의 token 단가를 따르지만, Pro 모드는 내부 추론 작업이 더 많아 총 token이 종종 더 높음
  • gpt-5.6-pro 같은 slug는 찾지 마세요(존재하지 않음)

5.3 이미지 입력(멀티모달)

GPT-5.6 세 모델 모두 vision을 지원합니다. Responses API 예시:

json
{
  "model": "gpt-5.6-terra",
  "input": [
    {
      "role": "user",
      "content": [
        {"type": "input_text", "text": "이 아키텍처 다이어그램에 단일 장애점은 어디가 있나요?"},
        {"type": "input_image", "image_url": "https://example.com/diagram.png"}
      ]
    }
  ]
}

base64 인라인 이미지 전송도 가능합니다(프라이빗 배포 경로에 적합).

5.4 도구 호출(Function / Tools)

Agent 시나리오에서는 Responses API의 tools 필드에 함수나 내장 도구(예: web_search, file_search)를 선언하고, 모델이 tool_calls를 반환하면 서비스에서 실행한 뒤 결과를 다시 전달합니다——GPT-5.5와 흐름은 유사하지만 GPT-5.6이 복잡한 도구 체인에서 더 안정적입니다. 구체적인 schema는 Responses API 도구 문서를 참고하세요.

6. GPT-5.6 pricing: 전체 가격표(2026)

아래는 OpenAI 공식 백만 tokens당 가격(미국 달러)입니다. 짧은 컨텍스트는 입력 ≤ 272K tokens을 의미하며, 초과 시 긴 컨텍스트 단가가 적용됩니다.

6.1 표준(짧은 컨텍스트)

모델 입력 캐시 히트 입력 캐시 쓰기 출력
gpt-5.6-sol $5.00 $0.50 $6.25 $30.00
gpt-5.6-terra $2.50 $0.25 $3.125 $15.00
gpt-5.6-luna $1.00 $0.10 $1.25 $6.00

6.2 긴 컨텍스트(입력 > 272K)

모델 입력 캐시 히트 입력 캐시 쓰기 출력
gpt-5.6-sol $10.00 $1.00 $12.50 $45.00
gpt-5.6-terra $5.00 $0.50 $6.25 $22.50
gpt-5.6-luna $2.00 $0.20 $2.50 $9.00

6.3 청구서 추정 예시

Terra 호출 한 번 가정: 20K 입력 + 2K 출력, 캐시 미적중:

text
입력: 20,000 / 1,000,000 × $2.50 = $0.05
출력: 2,000 / 1,000,000 × $15.00 = $0.03
합계 ≈ $0.08 / 회

유사 요청을 하루 1만 회 호출하면 → 약 $800/일. 그래서 Luna + 캐시 + 배치 처리가 고동시성 제품에 매우 중요합니다.

6.4 기타 비용 요소

항목 설명
Prompt Caching 반복되는 system prompt / 긴 문서 접두사로 입력가를 크게 절감(위 표 「캐시 히트」 열 참고)
Batch API 비실시간 작업에 일반적으로 할인, 오프라인 평가와 데이터 라벨링에 적합
데이터 상주 2026-03-05 이후 출시된 eligible 모델, 지역 처리 endpoint +10%
GPT-5.5 대비 Sol은 GPT-5.5와 동일 가격($5/$30)이지만 GPT-5.6이 token을 더 절약해 실제 청구서는 더 낮을 수 있음

콘솔 Usage 페이지에서 model별로 그룹화해 확인하는 것이 공식보다 더 신뢰할 수 있습니다.

7. 시나리오별 선택: Sol, Terra, Luna 중 무엇을?

시나리오 권장 모델 reasoning 비고
프로덕션급 코드 Agent / 어려운 버그 Sol high 또는 mode: pro 지연 시간을 정확도로 교환
사내 Copilot Terra medium 가성비 스위트 스팟
로그 분류, 태깅, 추출 Luna low / none 대량·비용 민감
초장문서 RAG(>272K) Terra 또는 Luna medium 긴 컨텍스트 가산 요금 주의
아키텍처 리뷰, 보안 감사 Sol pro + high 모델 비용 아끼지 말 것
멀티모달 고객 지원(이미지+텍스트) Terra medium Sol은 에스컬레이션 시에만

ChatGPT 구독과의 관계: ChatGPT Plus/Pro는 제품 구독이고 API token 과금과는 별개입니다. 앱에서 쓰는 GPT-5.6 ≠ API 할당량이 자동 포함되지 않으며, 개발 통합은 반드시 별도 API 청구를 개설해야 합니다.

8. GPT-5.5 / GPT-4.1 마이그레이션 체크리스트

  1. model 문자열 변경: gpt-5.5gpt-5.6-sol(또는 terra/luna)
  2. Pro 로직: gpt-5.5-pro 삭제, reasoning.mode: "pro"로 대체
  3. max_output_tokens 낮추기: GPT-5.6이 더 간결하므로 먼저 20% 줄여 A/B 테스트
  4. 회귀 테스트: 동일 prompt 세트로 품질, 지연 시간, 달러/요청 비교
  5. 캐시 히트율 모니터링: 고정 system prompt Agent는 반드시 caching 활성화
  6. SDK 버전: openai Python 패키지가 Responses API를 지원하는 버전인지 확인

9. 흔한 오류와 해결

HTTP / 현상 원인 조치
401 Key 무효 또는 만료 Key 재생성, 환경 변수 확인
403 / model_not_found 계정에 GPT-5.6 미개통 또는 지역 제한 콘솔에서 모델 가시성 확인; 영업팀에 개통 요청
429 속도 제한 지수 백오프 재시도; 한도 상향 신청 또는 동시성 감소
context_length_exceeded 입력 1.05M 초과 또는 출력 128K 초과 잘라내기, 요약 또는 분할 RAG
청구서 급증 reasoning.mode: pro + effort: max 남용 핵심 경로에만 Pro 사용; 기본 terra + medium
스트리밍 중단 게이트웨이 타임아웃 리버스 프록시 read_timeout 늘리기, 또는 비스트리밍 Batch 사용

10. 7단계 실전 체크리스트(오늘 바로 실행)

  1. Platform에서 API Key 생성, 월 hard limit 설정(예: $50).
  2. Terra로 Responses API 스모크 테스트 한 번 실행.
  3. 프로덕션 modelgpt-5.5에서 gpt-5.6-terra로 변경, 일주일 청구서 관찰.
  4. 고정 system prompt에 Prompt Caching 활성화, 입력 비용 감소 여부 확인.
  5. 어려운 작업만 Sol로 라우팅하고 QPS 제한.
  6. 오프라인 평가는 Batch API 사용.
  7. 대시보드에서 model × endpoint별 비용 알림 설정.

11. 요약

GPT-5.6 API를 2026년에 올바르게 쓰는 방법은 다음과 같습니다.

  • Endpoint: v1/responses 우선, 호환은 v1/chat/completions
  • 모델: sol 최강, terra 일상, luna 대량; gpt-5.6 = Sol
  • 가격: Sol $5 / $30(백만 input/output tokens)부터, Terra 절반, Luna 약 1/5
  • 파라미터: reasoning.effort로 깊이 제어; Pro 기능은 reasoning.mode: "pro", 존재하지 않는 모델명으로 바꾸지 말 것

Terra로 부하 테스트, Sol로 어려운 작업 처리, Luna로 대량 처리한 뒤 캐시와 Batch를 함께 쓰는 것이 처음부터 전체 Sol보다 지속 가능합니다.


참고 및 추가 읽을거리

API는 클라우드, 빌드·서명은 Mac 필요

GPT-5.6 API로 Agent와 파이프라인은 가능하지만 iOS/macOS 패키징, Xcode 빌드, 코드 서명은 네이티브 macOS가 필요합니다.
Hashvps 클라우드 Mac(M4) 온디맨드 빌드: API 로직은 로컬, Archive·TestFlight·CI는 클라우드.

홈으로 이동

Hashvps · Mac 클라우드

전용 Mac 클라우드, 네이티브 IP

전용 컴퓨팅 + 독점 IP, 비즈니스를 안정적으로 운영하세요.

홈으로 이동
특별 할인