OpenAI は GPT-5.6 を gpt-5.6-sol / terra / luna の 3 つの API slug に分けていますが、ChatGPT の体験や GPT-5.5 の gpt-5.5-pro のまま API を叩くチームも多い——403 か、月末の請求額のズレで気づくパターンです。本記事で検証するのは: Responses と Chat Completions の使い分け、3 モデルの選び方、Pro モードに別 slug が要るかどうか。
2026 年 2 月リリースの GPT-5.6 は複雑な推論と Agent コーディング向けです。API Key の取得から完全な料金表まで、「動かす → 選ぶ → コストを抑える」の順で、Python/cURL 例とよくある落とし穴付きで解説します。
1. GPT-5.6 とは?GPT-5.5 との違いは
GPT-5.6 は OpenAI の 2026 年 2 月 16 日 知識カットオフの frontier シリーズで、複雑な推論、Agent コーディング、マルチモーダルタスク向けに設計されています。GPT-5.5 との比較で、公式が強調する 3 点は次のとおりです。
| 観点 | GPT-5.5 | GPT-5.6 |
|---|---|---|
| 命名 | 単一の gpt-5.5 + 独立した gpt-5.5-pro |
Sol / Terra / Luna の 3 段階 + gpt-5.6 エイリアス |
| Pro モード | gpt-5.5-pro モデルに切り替え |
同一モデル + reasoning.mode: "pro" |
| Token 効率 | ベースライン | 公式称ではより token を節約。同等タスクでは max_output_tokens をやや下げられる |
| コンテキスト | モデルにより異なる | 3 モデルとも 最大約 105 万 tokens 入力、128K 出力 をサポート |
コミュニティのベンチマークでは、GPT-5.6 Sol が Terminal-Bench 2.1(Agent コーディング)などの指標で第一陣に位置します——ただし本番環境での選定は、ベンチマークだけでなく、タスクのレイテンシ、請求額、コンプライアンスを基準にすべきです。
2. 対応モデルは?一覧表で把握
| モデル slug | ポジション | 入力価格(短コンテキスト) | 出力価格(短コンテキスト) | 適したシナリオ |
|---|---|---|---|---|
gpt-5.6-sol |
フラッグシップ、複雑な専門業務 | $5.00 / 1M | $30.00 / 1M | アーキテクチャ設計、難しいバグ、長い推論チェーン、重要な Agent |
gpt-5.6-terra |
性能とコストのバランス | $2.50 / 1M | $15.00 / 1M | 日常の RAG、カスタマーサポート、中程度のコードタスク |
gpt-5.6-luna |
コスト重視、高並列 | $1.00 / 1M | $6.00 / 1M | 分類、抽出、大量の要約 |
gpt-5.6(エイリアス) |
→ Sol にルーティング | Sol と同じ | Sol と同じ | 選ぶのが面倒なときのデフォルト |
共通能力(3 モデルとも同じ):
- テキスト + 画像入力、テキスト出力
- 多言語とビジョン理解
v1/responses、v1/chat/completions、v1/batchをサポートreasoning.effort:none/low/medium/high/xhigh/max(デフォルトmedium)
選定の一言まとめ:
- 迷ったら → まず
gpt-5.6-terraで負荷テストし、足りなければ Sol にアップグレード - 性能よりコストが重要 → Luna
- 1 リクエストで四半期の方向性が決まる → Sol、必要なら Pro 推論モード を有効化
3. GPT-5.6 endpoint:どの API を使うべきか
OpenAI には現在 2 つの主要パスがあり、新機能は Responses API を優先します。
| Endpoint | URL | いつ使うか |
|---|---|---|
| Responses API(推奨) | POST /v1/responses |
マルチターン状態管理、ツール呼び出し、推論モード、構造化出力 |
| Chat Completions(互換) | POST /v1/chat/completions |
既存の OpenAI SDK コード、迅速な移行 |
| Batch | POST /v1/batch |
オフラインの大量処理、非リアルタイム |
Base URL はいずれも:
https://api.openai.com/v1
認証ヘッダー(両 API で同じ):
Authorization: Bearer $OPENAI_API_KEY
Content-Type: application/json
GPT-5.6 専用のサブドメインはありません——通常の OpenAI API と同じ
api.openai.comを共有し、違いは リクエストボディのmodelフィールド にあります。
4. クイックスタート:API Key から最初の応答まで
4.1 開通と Key
- OpenAI Platform にログイン
- Settings → API keys で Secret Key を作成(一度しか表示されないので必ず保存)
- Billing で支払い方法を登録。GPT-5.6 は token 従量課金で、「月額無制限 API」プランはありません
- エンタープライズユーザーは組織レベルで Spend limits と プロジェクト単位の Key を設定可能
環境変数(推奨):
export OPENAI_API_KEY="sk-..."
4.2 Responses API(推奨の書き方)
cURL:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-terra",
"input": "3文で GPT-5.6 Terra と Sol のモデル選定の違いを説明してください。",
"max_output_tokens": 512
}'
Python(公式 SDK ≥ 1.x):
from openai import OpenAI
client = OpenAI() # OPENAI_API_KEY を読み込む
response = client.responses.create(
model="gpt-5.6-terra",
input="3文で GPT-5.6 Terra と Sol のモデル選定の違いを説明してください。",
max_output_tokens=512,
)
print(response.output_text)
Node.js:
import OpenAI from "openai";
const client = new OpenAI();
const response = await client.responses.create({
model: "gpt-5.6-terra",
input: "3文で GPT-5.6 Terra と Sol のモデル選定の違いを説明してください。",
max_output_tokens: 512,
});
console.log(response.output_text);
4.3 Chat Completions(既存コードとの互換)
curl https://api.openai.com/v1/chat/completions \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"messages": [
{"role": "user", "content": "こんにちは、GPT-5.6!"}
],
"max_tokens": 256
}'
移行時は model を gpt-5.5 から gpt-5.6-sol / terra / luna に変更するだけでよく、レスポンス構造は変わりません。
4.4 ストリーミング出力(SSE)
Responses API に "stream": true を追加。チャット UI や長い回答に適しています。
stream = client.responses.create(
model="gpt-5.6-luna",
input="クラウドネイティブについて五言絶句を一首書いてください。",
stream=True,
)
for event in stream:
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
Chat Completions 側は stream=True に対応し、choices[0].delta.content をパースします。
5. コアパラメータ:reasoning、ツール、マルチモーダル
5.1 推論の深さ:reasoning.effort
モデルが「どれだけ考えるか」を制御します——深いほど、レイテンシと token 消費は通常増加します。
| 値 | 典型的な用途 |
|---|---|
none |
極めて高速な応答、ほぼ推論なし |
low / medium |
デフォルト帯。日常の会話と軽量なコード |
high / xhigh / max |
数学、複雑なデバッグ、多段階の計画 |
省略時、GPT-5.6 の デフォルトは medium です。
5.2 Pro モード:reasoning.mode
GPT-5.5 時代は gpt-5.5-pro モデルに切り替えが必要でした。GPT-5.6 では同一 slug 上で Pro をオン/オフします。
{
"model": "gpt-5.6-sol",
"input": "マルチテナント対応の注文サービス API を設計し、ルーティングとデータモデルを提示してください。",
"reasoning": {
"mode": "pro",
"effort": "high"
},
"max_output_tokens": 4096
}
- 課金:選択した Sol/Terra/Luna の token 単価は変わりませんが、Pro モードでは内部推論が増え、総 token 数はしばしば高くなります
gpt-5.6-proのような slug は存在しないので探さないでください
5.3 画像入力(マルチモーダル)
3 つの GPT-5.6 モデルはすべて vision に対応。Responses API の例:
{
"model": "gpt-5.6-terra",
"input": [
{
"role": "user",
"content": [
{"type": "input_text", "text": "このアーキテクチャ図にはどのような単一障害点がありますか?"},
{"type": "input_image", "image_url": "https://example.com/diagram.png"}
]
}
]
}
base64 でインライン画像を渡すことも可能(プライベートデプロイの経路に適しています)。
5.4 ツール呼び出し(Function / Tools)
Agent シナリオでは、Responses API の tools フィールドで関数や組み込みツール(web_search、file_search など)を宣言します。モデルが tool_calls を返したら、サービス側で実行し結果を返送——GPT-5.5 と同様のフローですが、GPT-5.6 は複雑なツールチェーンでより安定しています。スキーマの詳細は Responses API ツールドキュメント を参照してください。
6. GPT-5.6 pricing:完全な料金表(2026)
以下は OpenAI 公式の 100 万 tokens あたり の価格(米ドル)。短コンテキストは入力 ≤ 272K tokens、超過すると 長コンテキスト 帯に入ります。
6.1 標準(短コンテキスト)
| モデル | 入力 | キャッシュヒット入力 | キャッシュ書き込み | 出力 |
|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 |
| gpt-5.6-terra | $2.50 | $0.25 | $3.125 | $15.00 |
| gpt-5.6-luna | $1.00 | $0.10 | $1.25 | $6.00 |
6.2 長コンテキスト(入力 > 272K)
| モデル | 入力 | キャッシュヒット入力 | キャッシュ書き込み | 出力 |
|---|---|---|---|---|
| gpt-5.6-sol | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $5.00 | $0.50 | $6.25 | $22.50 |
| gpt-5.6-luna | $2.00 | $0.20 | $2.50 | $9.00 |
6.3 請求額の試算例
Terra で 1 回呼び出し、20K 入力 + 2K 出力、キャッシュ未ヒットの場合:
入力:20,000 / 1,000,000 × $2.50 = $0.05
出力:2,000 / 1,000,000 × $15.00 = $0.03
合計 ≈ $0.08 / 回
同様のリクエストを 1 日 1 万回 → 約 $800/日。これが Luna + キャッシュ + バッチ処理 が高並列プロダクトで重要な理由です。
6.4 その他の費用要因
| 項目 | 説明 |
|---|---|
| Prompt Caching | 繰り返しの system prompt / 長いドキュメント接頭辞で入力価格を大幅に削減(上表「キャッシュヒット」列を参照) |
| Batch API | 非リアルタイムタスクは通常割引あり。オフライン評価とデータアノテーションに適する |
| データレジデンシー | 2026-03-05 以降リリースの eligible モデルで、リージョン処理 endpoint は +10% |
| GPT-5.5 との比較 | Sol は GPT-5.5 と同価($5/$30)だが、GPT-5.6 はしばしば token を節約するため、実際の請求額はより低くなる可能性がある |
コンソールの Usage ページで model 別に確認する方が、式を覚えるより確実です。
7. シナリオ別選定:Sol、Terra、Luna のどれを使うか
| シナリオ | 推奨モデル | reasoning | 備考 |
|---|---|---|---|
| 本番レベルのコード Agent / 難しいバグ | Sol | high または mode: pro |
レイテンシと引き換えに正確性を優先 |
| 社内 Copilot | Terra | medium |
コスパのスイートスポット |
| ログ分類、タグ付け、抽出 | Luna | low / none |
大量・コスト重視 |
| 超長文 RAG(>272K) | Terra または Luna | medium |
長コンテキストの追加料金に注意 |
| アーキテクチャレビュー、セキュリティ監査 | Sol | pro + high |
モデル代をケチらない |
| マルチモーダルカスタマーサポート(画像+テキスト) | Terra | medium |
クレームエスカレーション時のみ Sol |
ChatGPT サブスクリプションとの関係: ChatGPT Plus/Pro はプロダクトサブスクリプションであり、API の token 従量課金とは別ラインです。アプリで使う GPT-5.6 ≠ API 枠が自動付与されるわけではなく、開発統合には別途 API 請求の設定が必要です。
8. GPT-5.5 / GPT-4.1 からの移行チェックリスト
- model 文字列を変更:
gpt-5.5→gpt-5.6-sol(または terra/luna) - Pro ロジック:
gpt-5.5-proを削除し、reasoning.mode: "pro"に変更 - max_output_tokens を下げる:GPT-5.6 はよりコンパクトなので、まず 20% 減らして A/B テスト
- 回帰テスト:同一 prompt セットで品質、レイテンシ、ドル/リクエスト を比較
- キャッシュヒット率を監視:固定 system prompt の Agent では caching を必ず有効化
- SDK バージョン:
openaiPython パッケージが Responses API 対応版以上であることを確認
9. よくあるエラーとトラブルシューティング
| HTTP / 現象 | 原因 | 対処 |
|---|---|---|
401 |
Key が無効または期限切れ | Key を再生成し、環境変数を確認 |
403 / model_not_found |
アカウントで GPT-5.6 未開通またはリージョン制限 | コンソールでモデルの可視性を確認。営業に連絡して開通 |
429 |
レート制限 | 指数バックオフでリトライ。上限引き上げ申請または並列度を下げる |
context_length_exceeded |
入力が 1.05M 超または出力が 128K 超 | 切り詰め、要約、または RAG を分割 |
| 請求額の急増 | reasoning.mode: pro + effort: max の乱用 |
重要パスのみ Pro を有効化。デフォルトは terra + medium |
| ストリーム中断 | ゲートウェイタイムアウト | リバースプロキシの read_timeout を延長、または非ストリームの Batch に切り替え |
10. 7 ステップ実装チェックリスト(今日から動かせる)
- Platform で API Key を作成し、月次 hard limit を設定(例:$50)。
- Terra で Responses API のスモークテストを 1 回実行。
- 本番の
modelをgpt-5.5からgpt-5.6-terraに変更し、1 週間請求を観察。 - 固定 system prompt で Prompt Caching を有効化し、入力コストが下がるか確認。
- 難しいタスクだけ Sol にルーティングし、QPS を制限。
- オフライン評価は Batch API を使用。
- ダッシュボードで model × endpoint 別のコストアラートを設定。
11. まとめ
GPT-5.6 API を 2026 年に正しく使うポイント:
- Endpoint:
v1/responsesを優先。互換にはv1/chat/completions - モデル:
solが最強、terraが日常、lunaが大量処理。gpt-5.6= Sol - 価格:Sol $5 / $30(100 万 input/output tokens)から。Terra は半額、Luna は約 5 分の 1
- パラメータ:
reasoning.effortで深度を制御。Pro 能力はreasoning.mode: "pro"で、存在しない phantom モデル名に切り替えない
まず Terra で負荷テスト、Sol でフォールバック、Luna で大量処理し、キャッシュと Batch を組み合わせる方が、最初から全サイト Sol より持続可能です。
参考・関連記事
- OpenAI Models ドキュメント
- OpenAI Pricing
- GPT-5.6 Model guidance
- ChatGPT Work 無料版と有料版の違い(プロダクトサブスクリプション vs API 課金)
- MCP 2026:AI 汎用 USB ポート入門(GPT-5.6 Agent にデータソースを接続)
API はクラウドでも、ビルドと署名は Mac が必要
GPT-5.6 API で Agent やパイプラインは動かせますが、iOS/macOS パッケージング、Xcode ビルド、コード署名はネイティブ macOS が必要です。
Hashvps クラウド Mac(M4)でオンデマンドビルド。API ロジックはローカル、Archive・TestFlight・CI はクラウドへ。