← Retour au blog

API GPT-5.6 : guide complet, appels, tarifs et modèles

LLM · 2026.07.30 · ~11 min de lecture

OpenAI a découpé GPT-5.6 en trois slugs API — gpt-5.6-sol, terra, luna — mais beaucoup d'équipes appellent encore l'API comme ChatGPT ou GPT-5.5 (gpt-5.5-pro). Résultat : 403 ou facture inattendue en fin de mois. Ce que nous vérifions ci-dessous : Responses vs Chat Completions, choix du modèle, et si le mode Pro exige un slug dédié.

GPT-5.6 est sorti en février 2026 pour le raisonnement complexe et le code agentique. De la clé API au tableau de prix complet — dans l'ordre faire tourner, choisir, maîtriser les coûts — avec exemples Python/cURL et pièges courants.

1. Qu'est-ce que GPT-5.6 ? Et quelle différence avec GPT-5.5 ?

GPT-5.6 est la série frontier d'OpenAI avec une date de coupure des connaissances au 16 février 2026, conçue pour le raisonnement complexe, le codage Agent et les tâches multimodales. Par rapport à GPT-5.5, OpenAI met en avant trois points :

Dimension GPT-5.5 GPT-5.6
Nommage Un seul gpt-5.5 + gpt-5.5-pro séparé Sol / Terra / Luna en trois niveaux + alias gpt-5.6
Mode Pro Changer vers le modèle gpt-5.5-pro Même modèle + reasoning.mode: "pro"
Efficacité token Référence Officiellement plus économe ; on peut légèrement réduire max_output_tokens pour une tâche équivalente
Contexte Variable selon le modèle Les trois supportent jusqu'à ~1,05 M tokens en entrée et 128K en sortie

Dans les benchmarks communautaires, GPT-5.6 Sol se situe en tête sur des métriques comme Terminal-Bench 2.1 (codage Agent) — mais en production, basez-vous sur la latence, la facture et la conformité de votre cas d'usage, pas seulement sur les classements.

2. Quels modèles sont disponibles ? Tout en un tableau

Slug du modèle Positionnement Prix entrée (contexte court) Prix sortie (contexte court) Cas d'usage
gpt-5.6-sol Phare, travail professionnel complexe $5.00 / 1M $30.00 / 1M Conception d'architecture, bugs difficiles, raisonnement long, Agents critiques
gpt-5.6-terra Équilibre intelligence/coût $2.50 / 1M $15.00 / 1M RAG quotidien, support client, code de complexité moyenne
gpt-5.6-luna Sensible au coût, forte concurrence $1.00 / 1M $6.00 / 1M Classification, extraction, résumés en masse
gpt-5.6 (alias) → Route vers Sol comme Sol comme Sol Par défaut si vous ne voulez pas choisir

Capacités communes (identiques pour les trois) :

  • Entrée texte + image, sortie texte
  • Multilingue et compréhension visuelle
  • Prise en charge de v1/responses, v1/chat/completions, v1/batch
  • reasoning.effort : none / low / medium / high / xhigh / max (par défaut medium)

Choix en une phrase :

  • Incertain → commencer par gpt-5.6-terra en benchmark, passer à Sol si insuffisant
  • Le coût prime sur l'intelligence → Luna
  • Une requête décide de la stratégie trimestrielle → Sol, mode Pro si nécessaire

3. Endpoint GPT-5.6 : quelle API utiliser ?

OpenAI propose actuellement deux voies principales ; les nouvelles fonctionnalités passent d'abord par la Responses API :

Endpoint URL Quand l'utiliser
Responses API (recommandé) POST /v1/responses État multi-tours, appels d'outils, mode reasoning, sortie structurée
Chat Completions (compatible) POST /v1/chat/completions Code SDK OpenAI existant, migration rapide
Batch POST /v1/batch Traitement massif hors ligne, non temps réel

URL de base pour tous :

text
https://api.openai.com/v1

En-têtes d'authentification (identiques pour les deux API) :

http
Authorization: Bearer $OPENAI_API_KEY
Content-Type: application/json

GPT-5.6 n'a pas de sous-domaine dédié — il partage api.openai.com avec l'API OpenAI classique ; la différence est le champ model du corps de requête.

4. Démarrage rapide : de la clé API à la première réponse

4.1 Activation et clé

  1. Se connecter à OpenAI Platform
  2. Settings → API keys : créer une Secret Key (affichée une seule fois — à sauvegarder)
  3. Billing : lier un moyen de paiement ; GPT-5.6 est facturé au token, pas d'« API illimitée au forfait »
  4. Les entreprises peuvent définir des Spend limits et des clés par projet au niveau organisation

Variable d'environnement (recommandé) :

bash
export OPENAI_API_KEY="sk-..."

4.2 Responses API (écriture recommandée)

cURL :

bash
curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-terra",
    "input": "Expliquez en trois phrases la différence de choix entre GPT-5.6 Terra et Sol.",
    "max_output_tokens": 512
  }'

Python (SDK officiel ≥ 1.x) :

python
from openai import OpenAI

client = OpenAI()  # lit OPENAI_API_KEY

response = client.responses.create(
    model="gpt-5.6-terra",
    input="Expliquez en trois phrases la différence de choix entre GPT-5.6 Terra et Sol.",
    max_output_tokens=512,
)

print(response.output_text)

Node.js :

javascript
import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-5.6-terra",
  input: "Expliquez en trois phrases la différence de choix entre GPT-5.6 Terra et Sol.",
  max_output_tokens: 512,
});

console.log(response.output_text);

4.3 Chat Completions (compatibilité ancien code)

bash
curl https://api.openai.com/v1/chat/completions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-sol",
    "messages": [
      {"role": "user", "content": "Hello, GPT-5.6!"}
    ],
    "max_tokens": 256
  }'

Pour migrer, remplacez model de gpt-5.5 par gpt-5.6-sol / terra / luna ; la structure de réponse reste identique.

4.4 Sortie en flux (SSE)

Responses API avec "stream": true — idéal pour UI de chat et longues réponses :

python
stream = client.responses.create(
    model="gpt-5.6-luna",
    input="Écrivez un quatrain sur le cloud natif.",
    stream=True,
)

for event in stream:
    if event.type == "response.output_text.delta":
        print(event.delta, end="", flush=True)

Côté Chat Completions : stream=True, parser choices[0].delta.content.

5. Paramètres clés : reasoning, outils et multimodalité

5.1 Profondeur de raisonnement : reasoning.effort

Contrôle combien de temps le modèle « réfléchit » — plus c'est profond, plus la latence et la consommation de tokens augmentent en général :

Valeur Usage typique
none Réponse très rapide, presque sans raisonnement
low / medium Niveau par défaut, dialogue quotidien et code léger
high / xhigh / max Mathématiques, débogage complexe, planification multi-étapes

Sans précision, GPT-5.6 utilise medium par défaut.

5.2 Mode Pro : reasoning.mode

À l'ère GPT-5.5, il fallait passer à gpt-5.5-pro ; avec GPT-5.6, Pro s'active sur le même slug :

json
{
  "model": "gpt-5.6-sol",
  "input": "Concevez une API de service de commandes multi-locataire avec routes et modèle de données.",
  "reasoning": {
    "mode": "pro",
    "effort": "high"
  },
  "max_output_tokens": 4096
}
  • Facturation : toujours au tarif token du Sol/Terra/Luna choisi, mais le mode Pro effectue plus de raisonnement interne — total de tokens souvent plus élevé
  • Ne pas chercher un slug gpt-5.6-pro (il n'existe pas)

5.3 Entrée image (multimodal)

Les trois GPT-5.6 supportent la vision. Exemple Responses API :

json
{
  "model": "gpt-5.6-terra",
  "input": [
    {
      "role": "user",
      "content": [
        {"type": "input_text", "text": "Quels points de défaillance uniques y a-t-il dans ce diagramme d'architecture ?"},
        {"type": "input_image", "image_url": "https://example.com/diagram.png"}
      ]
    }
  ]
}

On peut aussi passer des images base64 en ligne (adapté aux déploiements privés).

5.4 Appels d'outils (Function / Tools)

En scénario Agent, déclarez dans le champ tools de la Responses API des fonctions ou outils intégrés (ex. web_search, file_search). Le modèle renvoie des tool_calls ; votre service exécute et renvoie les résultats — flux similaire à GPT-5.5, mais GPT-5.6 est plus stable sur les chaînes d'outils complexes. Schéma : documentation outils Responses API.

6. GPT-5.6 pricing : tableau de prix complet (2026)

Tarifs officiels OpenAI par million de tokens (USD). Contexte court = entrée ≤ 272K tokens ; au-delà, contexte long.

6.1 Standard (contexte court)

Modèle Entrée Entrée cache hit Écriture cache Sortie
gpt-5.6-sol $5.00 $0.50 $6.25 $30.00
gpt-5.6-terra $2.50 $0.25 $3.125 $15.00
gpt-5.6-luna $1.00 $0.10 $1.25 $6.00

6.2 Contexte long (entrée > 272K)

Modèle Entrée Entrée cache hit Écriture cache Sortie
gpt-5.6-sol $10.00 $1.00 $12.50 $45.00
gpt-5.6-terra $5.00 $0.50 $6.25 $22.50
gpt-5.6-luna $2.00 $0.20 $2.50 $9.00

6.3 Exemple d'estimation de facture

Supposons un appel Terra : 20K entrée + 2K sortie, sans cache :

text
Entrée : 20 000 / 1 000 000 × $2,50 = $0,05
Sortie :  2 000 / 1 000 000 × $15,00 = $0,03
Total ≈ $0,08 / appel

À 10 000 appels similaires par jour → environ 800 $/jour. D'où l'importance de Luna + cache + batch pour les produits à fort volume.

6.4 Autres facteurs de coût

Élément Description
Prompt Caching Répétition de system prompt / long préfixe documentaire réduit fortement le prix d'entrée (colonne « cache hit »)
Batch API Tâches non temps réel souvent à tarif réduit — évaluation hors ligne, annotation de données
Résidence des données Modèles eligible publiés après le 2026-03-05 : endpoint de traitement régional +10 %
Comparaison GPT-5.5 Sol au même prix que GPT-5.5 ($5/$30), mais GPT-5.6 consomme souvent moins de tokens — facture réelle potentiellement plus basse

Consultez la page Usage de la console groupée par model — plus fiable que mémoriser des formules.

7. Choix par scénario : Sol, Terra ou Luna ?

Scénario Modèle recommandé reasoning Remarque
Agent code production / bugs difficiles Sol high ou mode: pro Latence contre exactitude
Copilot interne entreprise Terra medium Meilleur rapport qualité-prix
Classification de logs, tags, extraction Luna low / none Volume, sensible au prix
RAG document très long (>272K) Terra ou Luna medium Surcoût contexte long
Revue d'architecture, audit sécurité Sol pro + high Ne pas économiser sur le modèle
Support multimodal (image+texte) Terra medium Sol seulement en escalade

Lien avec l'abonnement ChatGPT : ChatGPT Plus/Pro est un abonnement produit ; la facturation API au token est une ligne séparée. GPT-5.6 dans l'app ≠ quota API inclus — l'intégration développeur nécessite une facturation API dédiée.

8. Checklist de migration depuis GPT-5.5 / GPT-4.1

  1. Modifier la chaîne model : gpt-5.5gpt-5.6-sol (ou terra/luna)
  2. Logique Pro : supprimer gpt-5.5-pro, utiliser reasoning.mode: "pro"
  3. Réduire max_output_tokens : GPT-5.6 est plus compact — baisser de 20 % puis A/B
  4. Tests de régression : même jeu de prompts — qualité, latence, USD/requête
  5. Surveiller le taux de cache : Agents à system prompt fixe — activer le caching
  6. Version SDK : paquet Python openai ≥ version supportant la Responses API

9. Erreurs courantes et dépannage

HTTP / phénomène Cause Action
401 Clé invalide ou expirée Régénérer la clé, vérifier la variable d'environnement
403 / model_not_found Compte sans GPT-5.6 ou restriction régionale Vérifier la visibilité du modèle ; contacter les ventes
429 Limite de débit Retry avec backoff exponentiel ; augmenter le quota ou réduire la concurrence
context_length_exceeded Entrée > 1,05M ou sortie > 128K Tronquer, résumer ou RAG segmenté
Facture qui explose Abus de reasoning.mode: pro + effort: max Pro uniquement sur chemins critiques ; défaut terra + medium
Flux interrompu Timeout passerelle Augmenter read_timeout du reverse proxy ou utiliser Batch non streamé

10. Checklist en sept étapes (opérationnel aujourd'hui)

  1. Créer une clé API sur la Platform, définir un hard limit mensuel (ex. 50 $).
  2. Lancer un test fumée Responses API avec Terra.
  3. Passer le model de production de gpt-5.5 à gpt-5.6-terra, observer la facture une semaine.
  4. Activer Prompt Caching pour un system prompt fixe, vérifier la baisse des coûts d'entrée.
  5. Router les tâches difficiles vers Sol séparément, limiter le QPS.
  6. Évaluations hors ligne via Batch API.
  7. Configurer des alertes de coût par model × endpoint dans le tableau de bord.

11. Résumé

La bonne façon d'utiliser l'API GPT-5.6 en 2026 :

  • Endpoint : privilégier v1/responses, compatibilité avec v1/chat/completions
  • Modèles : sol le plus fort, terra au quotidien, luna en volume ; gpt-5.6 = Sol
  • Prix : Sol à partir de $5 / $30 (million tokens input/output), Terra à moitié prix, Luna environ un cinquième
  • Paramètres : reasoning.effort contrôle la profondeur ; pour Pro utiliser reasoning.mode: "pro", pas de nom de modèle fantôme

Benchmark Terra, filet Sol, volume Luna — plus cache et Batch — est plus durable que tout mettre sur Sol dès le départ.


Références et lectures complémentaires

API dans le cloud — builds et signature exigent un Mac

L'API GPT-5.6 pilote Agents et pipelines, mais packaging iOS/macOS, builds Xcode et signature nécessitent macOS natif.
Hashvps Cloud Mac (M4) : logique API en local, Archive, TestFlight et CI dans le cloud.

Aller à l'accueil

Hashvps · Mac Cloud

Mac Cloud dédié, IP native

Calcul dédié + IP exclusive, fiable pour votre entreprise.

Aller à l'accueil
Offre spéciale