OpenAI a découpé GPT-5.6 en trois slugs API — gpt-5.6-sol, terra, luna — mais beaucoup d'équipes appellent encore l'API comme ChatGPT ou GPT-5.5 (gpt-5.5-pro). Résultat : 403 ou facture inattendue en fin de mois. Ce que nous vérifions ci-dessous : Responses vs Chat Completions, choix du modèle, et si le mode Pro exige un slug dédié.
GPT-5.6 est sorti en février 2026 pour le raisonnement complexe et le code agentique. De la clé API au tableau de prix complet — dans l'ordre faire tourner, choisir, maîtriser les coûts — avec exemples Python/cURL et pièges courants.
1. Qu'est-ce que GPT-5.6 ? Et quelle différence avec GPT-5.5 ?
GPT-5.6 est la série frontier d'OpenAI avec une date de coupure des connaissances au 16 février 2026, conçue pour le raisonnement complexe, le codage Agent et les tâches multimodales. Par rapport à GPT-5.5, OpenAI met en avant trois points :
| Dimension | GPT-5.5 | GPT-5.6 |
|---|---|---|
| Nommage | Un seul gpt-5.5 + gpt-5.5-pro séparé |
Sol / Terra / Luna en trois niveaux + alias gpt-5.6 |
| Mode Pro | Changer vers le modèle gpt-5.5-pro |
Même modèle + reasoning.mode: "pro" |
| Efficacité token | Référence | Officiellement plus économe ; on peut légèrement réduire max_output_tokens pour une tâche équivalente |
| Contexte | Variable selon le modèle | Les trois supportent jusqu'à ~1,05 M tokens en entrée et 128K en sortie |
Dans les benchmarks communautaires, GPT-5.6 Sol se situe en tête sur des métriques comme Terminal-Bench 2.1 (codage Agent) — mais en production, basez-vous sur la latence, la facture et la conformité de votre cas d'usage, pas seulement sur les classements.
2. Quels modèles sont disponibles ? Tout en un tableau
| Slug du modèle | Positionnement | Prix entrée (contexte court) | Prix sortie (contexte court) | Cas d'usage |
|---|---|---|---|---|
gpt-5.6-sol |
Phare, travail professionnel complexe | $5.00 / 1M | $30.00 / 1M | Conception d'architecture, bugs difficiles, raisonnement long, Agents critiques |
gpt-5.6-terra |
Équilibre intelligence/coût | $2.50 / 1M | $15.00 / 1M | RAG quotidien, support client, code de complexité moyenne |
gpt-5.6-luna |
Sensible au coût, forte concurrence | $1.00 / 1M | $6.00 / 1M | Classification, extraction, résumés en masse |
gpt-5.6 (alias) |
→ Route vers Sol | comme Sol | comme Sol | Par défaut si vous ne voulez pas choisir |
Capacités communes (identiques pour les trois) :
- Entrée texte + image, sortie texte
- Multilingue et compréhension visuelle
- Prise en charge de
v1/responses,v1/chat/completions,v1/batch reasoning.effort:none/low/medium/high/xhigh/max(par défautmedium)
Choix en une phrase :
- Incertain → commencer par
gpt-5.6-terraen benchmark, passer à Sol si insuffisant - Le coût prime sur l'intelligence → Luna
- Une requête décide de la stratégie trimestrielle → Sol, mode Pro si nécessaire
3. Endpoint GPT-5.6 : quelle API utiliser ?
OpenAI propose actuellement deux voies principales ; les nouvelles fonctionnalités passent d'abord par la Responses API :
| Endpoint | URL | Quand l'utiliser |
|---|---|---|
| Responses API (recommandé) | POST /v1/responses |
État multi-tours, appels d'outils, mode reasoning, sortie structurée |
| Chat Completions (compatible) | POST /v1/chat/completions |
Code SDK OpenAI existant, migration rapide |
| Batch | POST /v1/batch |
Traitement massif hors ligne, non temps réel |
URL de base pour tous :
https://api.openai.com/v1
En-têtes d'authentification (identiques pour les deux API) :
Authorization: Bearer $OPENAI_API_KEY
Content-Type: application/json
GPT-5.6 n'a pas de sous-domaine dédié — il partage
api.openai.comavec l'API OpenAI classique ; la différence est le champmodeldu corps de requête.
4. Démarrage rapide : de la clé API à la première réponse
4.1 Activation et clé
- Se connecter à OpenAI Platform
- Settings → API keys : créer une Secret Key (affichée une seule fois — à sauvegarder)
- Billing : lier un moyen de paiement ; GPT-5.6 est facturé au token, pas d'« API illimitée au forfait »
- Les entreprises peuvent définir des Spend limits et des clés par projet au niveau organisation
Variable d'environnement (recommandé) :
export OPENAI_API_KEY="sk-..."
4.2 Responses API (écriture recommandée)
cURL :
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-terra",
"input": "Expliquez en trois phrases la différence de choix entre GPT-5.6 Terra et Sol.",
"max_output_tokens": 512
}'
Python (SDK officiel ≥ 1.x) :
from openai import OpenAI
client = OpenAI() # lit OPENAI_API_KEY
response = client.responses.create(
model="gpt-5.6-terra",
input="Expliquez en trois phrases la différence de choix entre GPT-5.6 Terra et Sol.",
max_output_tokens=512,
)
print(response.output_text)
Node.js :
import OpenAI from "openai";
const client = new OpenAI();
const response = await client.responses.create({
model: "gpt-5.6-terra",
input: "Expliquez en trois phrases la différence de choix entre GPT-5.6 Terra et Sol.",
max_output_tokens: 512,
});
console.log(response.output_text);
4.3 Chat Completions (compatibilité ancien code)
curl https://api.openai.com/v1/chat/completions \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"messages": [
{"role": "user", "content": "Hello, GPT-5.6!"}
],
"max_tokens": 256
}'
Pour migrer, remplacez model de gpt-5.5 par gpt-5.6-sol / terra / luna ; la structure de réponse reste identique.
4.4 Sortie en flux (SSE)
Responses API avec "stream": true — idéal pour UI de chat et longues réponses :
stream = client.responses.create(
model="gpt-5.6-luna",
input="Écrivez un quatrain sur le cloud natif.",
stream=True,
)
for event in stream:
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
Côté Chat Completions : stream=True, parser choices[0].delta.content.
5. Paramètres clés : reasoning, outils et multimodalité
5.1 Profondeur de raisonnement : reasoning.effort
Contrôle combien de temps le modèle « réfléchit » — plus c'est profond, plus la latence et la consommation de tokens augmentent en général :
| Valeur | Usage typique |
|---|---|
none |
Réponse très rapide, presque sans raisonnement |
low / medium |
Niveau par défaut, dialogue quotidien et code léger |
high / xhigh / max |
Mathématiques, débogage complexe, planification multi-étapes |
Sans précision, GPT-5.6 utilise medium par défaut.
5.2 Mode Pro : reasoning.mode
À l'ère GPT-5.5, il fallait passer à gpt-5.5-pro ; avec GPT-5.6, Pro s'active sur le même slug :
{
"model": "gpt-5.6-sol",
"input": "Concevez une API de service de commandes multi-locataire avec routes et modèle de données.",
"reasoning": {
"mode": "pro",
"effort": "high"
},
"max_output_tokens": 4096
}
- Facturation : toujours au tarif token du Sol/Terra/Luna choisi, mais le mode Pro effectue plus de raisonnement interne — total de tokens souvent plus élevé
- Ne pas chercher un slug
gpt-5.6-pro(il n'existe pas)
5.3 Entrée image (multimodal)
Les trois GPT-5.6 supportent la vision. Exemple Responses API :
{
"model": "gpt-5.6-terra",
"input": [
{
"role": "user",
"content": [
{"type": "input_text", "text": "Quels points de défaillance uniques y a-t-il dans ce diagramme d'architecture ?"},
{"type": "input_image", "image_url": "https://example.com/diagram.png"}
]
}
]
}
On peut aussi passer des images base64 en ligne (adapté aux déploiements privés).
5.4 Appels d'outils (Function / Tools)
En scénario Agent, déclarez dans le champ tools de la Responses API des fonctions ou outils intégrés (ex. web_search, file_search). Le modèle renvoie des tool_calls ; votre service exécute et renvoie les résultats — flux similaire à GPT-5.5, mais GPT-5.6 est plus stable sur les chaînes d'outils complexes. Schéma : documentation outils Responses API.
6. GPT-5.6 pricing : tableau de prix complet (2026)
Tarifs officiels OpenAI par million de tokens (USD). Contexte court = entrée ≤ 272K tokens ; au-delà, contexte long.
6.1 Standard (contexte court)
| Modèle | Entrée | Entrée cache hit | Écriture cache | Sortie |
|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 |
| gpt-5.6-terra | $2.50 | $0.25 | $3.125 | $15.00 |
| gpt-5.6-luna | $1.00 | $0.10 | $1.25 | $6.00 |
6.2 Contexte long (entrée > 272K)
| Modèle | Entrée | Entrée cache hit | Écriture cache | Sortie |
|---|---|---|---|---|
| gpt-5.6-sol | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $5.00 | $0.50 | $6.25 | $22.50 |
| gpt-5.6-luna | $2.00 | $0.20 | $2.50 | $9.00 |
6.3 Exemple d'estimation de facture
Supposons un appel Terra : 20K entrée + 2K sortie, sans cache :
Entrée : 20 000 / 1 000 000 × $2,50 = $0,05
Sortie : 2 000 / 1 000 000 × $15,00 = $0,03
Total ≈ $0,08 / appel
À 10 000 appels similaires par jour → environ 800 $/jour. D'où l'importance de Luna + cache + batch pour les produits à fort volume.
6.4 Autres facteurs de coût
| Élément | Description |
|---|---|
| Prompt Caching | Répétition de system prompt / long préfixe documentaire réduit fortement le prix d'entrée (colonne « cache hit ») |
| Batch API | Tâches non temps réel souvent à tarif réduit — évaluation hors ligne, annotation de données |
| Résidence des données | Modèles eligible publiés après le 2026-03-05 : endpoint de traitement régional +10 % |
| Comparaison GPT-5.5 | Sol au même prix que GPT-5.5 ($5/$30), mais GPT-5.6 consomme souvent moins de tokens — facture réelle potentiellement plus basse |
Consultez la page Usage de la console groupée par model — plus fiable que mémoriser des formules.
7. Choix par scénario : Sol, Terra ou Luna ?
| Scénario | Modèle recommandé | reasoning | Remarque |
|---|---|---|---|
| Agent code production / bugs difficiles | Sol | high ou mode: pro |
Latence contre exactitude |
| Copilot interne entreprise | Terra | medium |
Meilleur rapport qualité-prix |
| Classification de logs, tags, extraction | Luna | low / none |
Volume, sensible au prix |
| RAG document très long (>272K) | Terra ou Luna | medium |
Surcoût contexte long |
| Revue d'architecture, audit sécurité | Sol | pro + high |
Ne pas économiser sur le modèle |
| Support multimodal (image+texte) | Terra | medium |
Sol seulement en escalade |
Lien avec l'abonnement ChatGPT : ChatGPT Plus/Pro est un abonnement produit ; la facturation API au token est une ligne séparée. GPT-5.6 dans l'app ≠ quota API inclus — l'intégration développeur nécessite une facturation API dédiée.
8. Checklist de migration depuis GPT-5.5 / GPT-4.1
- Modifier la chaîne
model:gpt-5.5→gpt-5.6-sol(ou terra/luna) - Logique Pro : supprimer
gpt-5.5-pro, utiliserreasoning.mode: "pro" - Réduire
max_output_tokens: GPT-5.6 est plus compact — baisser de 20 % puis A/B - Tests de régression : même jeu de prompts — qualité, latence, USD/requête
- Surveiller le taux de cache : Agents à system prompt fixe — activer le caching
- Version SDK : paquet Python
openai≥ version supportant la Responses API
9. Erreurs courantes et dépannage
| HTTP / phénomène | Cause | Action |
|---|---|---|
401 |
Clé invalide ou expirée | Régénérer la clé, vérifier la variable d'environnement |
403 / model_not_found |
Compte sans GPT-5.6 ou restriction régionale | Vérifier la visibilité du modèle ; contacter les ventes |
429 |
Limite de débit | Retry avec backoff exponentiel ; augmenter le quota ou réduire la concurrence |
context_length_exceeded |
Entrée > 1,05M ou sortie > 128K | Tronquer, résumer ou RAG segmenté |
| Facture qui explose | Abus de reasoning.mode: pro + effort: max |
Pro uniquement sur chemins critiques ; défaut terra + medium |
| Flux interrompu | Timeout passerelle | Augmenter read_timeout du reverse proxy ou utiliser Batch non streamé |
10. Checklist en sept étapes (opérationnel aujourd'hui)
- Créer une clé API sur la Platform, définir un hard limit mensuel (ex. 50 $).
- Lancer un test fumée Responses API avec Terra.
- Passer le
modelde production degpt-5.5àgpt-5.6-terra, observer la facture une semaine. - Activer Prompt Caching pour un system prompt fixe, vérifier la baisse des coûts d'entrée.
- Router les tâches difficiles vers Sol séparément, limiter le QPS.
- Évaluations hors ligne via Batch API.
- Configurer des alertes de coût par model × endpoint dans le tableau de bord.
11. Résumé
La bonne façon d'utiliser l'API GPT-5.6 en 2026 :
- Endpoint : privilégier
v1/responses, compatibilité avecv1/chat/completions - Modèles :
solle plus fort,terraau quotidien,lunaen volume ;gpt-5.6= Sol - Prix : Sol à partir de $5 / $30 (million tokens input/output), Terra à moitié prix, Luna environ un cinquième
- Paramètres :
reasoning.effortcontrôle la profondeur ; pour Pro utiliserreasoning.mode: "pro", pas de nom de modèle fantôme
Benchmark Terra, filet Sol, volume Luna — plus cache et Batch — est plus durable que tout mettre sur Sol dès le départ.
Références et lectures complémentaires
- Documentation OpenAI Models
- OpenAI Pricing
- GPT-5.6 Model guidance
- ChatGPT Work : gratuit vs payant (abonnement produit vs facturation API)
- MCP 2026 : le port USB universel de l'IA (brancher des sources de données aux Agents GPT-5.6)
API dans le cloud — builds et signature exigent un Mac
L'API GPT-5.6 pilote Agents et pipelines, mais packaging iOS/macOS, builds Xcode et signature nécessitent macOS natif.
Hashvps Cloud Mac (M4) : logique API en local, Archive, TestFlight et CI dans le cloud.