Intelligence artificielle

GPT-6 : le cache de prompts d'OpenAI économise jusqu'à 90 % en API

OpenAI a annoncé le 22 septembre 2026 une refonte du cache de prompts pour GPT-6 : jusqu'à 90 % de réduction sur les tokens réutilisés, breakpoints explicites et nouveau dashboard de suivi. Pour les pipelines SEO/IA qui tournent sur l'API OpenAI, la structure des prompts devient un levier de coût direct, pas un détail technique.

Illustration éditoriale : GPT-6 : le cache de prompts d'OpenAI économise jusqu'à 90 % en API

OpenAI a publié le 22 septembre 2026 une refonte de son cache de prompts pour GPT-6 : jusqu'à 90 % de réduction sur les tokens d'entrée mis en cache et réutilisés, par rapport au tarif standard. La documentation technique détaille trois nouveautés qui changent la donne pour quiconque pilote un pipeline de génération de contenu ou un agent conversationnel sur l'API : des breakpoints de cache explicites, un TTL fixé à 30 minutes et un dashboard dédié au suivi des taux de succès.

L'annonce s'adresse en priorité aux développeurs, mais elle concerne directement les consultants et agences qui font tourner des usines de contenu ou des chatbots via l'API OpenAI : le montant de la facture dépend désormais très concrètement de la façon dont le prompt est structuré, et non plus seulement du volume de tokens envoyés.

À retenir

  • Jusqu'à 90 % de réduction sur les tokens d'entrée mis en cache et réutilisés
  • Le cache expire après 30 minutes d'inactivité sur le préfixe, pour les modèles GPT-5.6 et ultérieurs
  • Des breakpoints explicites (prompt_cache_options.mode réglé sur « explicit ») permettent de choisir où couper le préfixe caché
  • Un dashboard dédié sur platform.openai.com/usage affiche les taux de succès du cache et diagnostique les cache miss
  • Sur GPT-6, on peut changer l'effort de raisonnement entre deux appels sans casser le cache

01Ce que change concrètement l'annonce du 22 septembre

Le cœur du changement tient en une phrase de la documentation officielle : « The only supported value, 30m, is also the default. » Autrement dit, tout préfixe de prompt réutilisé dans les 30 minutes suivant son dernier appel reste en cache et bénéficie du tarif réduit. Passé ce délai, il faut repayer le tarif plein pour le reconstituer.

Des breakpoints choisis, plus subis

Jusqu'ici, le cache fonctionnait de façon implicite : OpenAI détectait lui-même les portions de prompt identiques d'un appel à l'autre. Avec le nouveau paramètre prompt_cache_options.mode réglé sur « explicit », c'est le développeur qui décide où placer le point de coupure entre la partie stable du prompt (mise en cache) et la partie variable (facturée au tarif plein). Un contrôle plus fin, qui suppose de repenser l'architecture de ses appels.

02Pourquoi ça concerne directement les pipelines SEO/IA

Une usine de contenu type (brief structuré, guide de style, taxonomie de catégories, exemples de ton) envoie à chaque appel un system prompt volumineux et globalement identique, suivi d'une portion variable : le sujet du jour, les données scrapées, le mot-clé cible. C'est exactement le schéma que le cache de prompts est conçu pour récompenser, à condition que le prompt soit construit dans cet ordre précis.

Le sujet rejoint une tendance de fond chez OpenAI ces derniers mois : après l'extension du Zero Data Retention aux modèles frontier en août, puis les baisses tarifaires observées sur GPT-5.6, l'optimisation du coût par token devient un axe de compétition explicite face à Anthropic et Google.

03Comment restructurer ses prompts pour capter la réduction

La règle pratique tient en une phrase : tout ce qui ne change pas d'un appel à l'autre (instructions système, guide éditorial, taxonomie, exemples few-shot, définitions de rubriques) doit former un bloc stable placé en tête du prompt. Tout ce qui varie (le sujet, les données du jour, la requête utilisateur) doit venir après, idéalement en toute fin.

Le cache ne pardonne pas le désordre : le moindre token modifié en tête de prompt, et toute l'économie s'évapore.

Concrètement, un pipeline qui insère la date du jour, le nom du client ou un identifiant de session dans le system prompt casse le cache à chaque appel, sans que rien ne le signale visuellement dans les logs. C'est justement ce que le nouveau dashboard de platform.openai.com/usage permet de vérifier : il affiche les taux de succès du cache (« cache read hit rates ») appel par appel.

04Le piège silencieux du cache miss

OpenAI a ajouté un outil de diagnostic qui identifie précisément la cause d'un cache miss : changement dans la liste d'outils déclarés, modification d'un paramètre, ou rupture du préfixe. Sans cet outil, un cache miss récurrent passe souvent inaperçu : la facture augmente sans qu'aucune erreur ne soit levée côté API.

Autre nouveauté propre aux modèles GPT-6 : il devient possible de changer l'effort de raisonnement entre deux réponses sans casser le cache, en ajoutant un configuration_update tout en laissant l'effort de raisonnement de la requête elle-même inchangé. Avant cette évolution, faire varier ce paramètre selon la complexité d'une tâche (un article court face à une analyse concurrentielle poussée) invalidait systématiquement le cache.

05GPT-6 Sol et Luna, annoncés le même jour

OpenAI a fait coïncider cette mise à jour du cache avec le lancement de deux nouveaux modèles, selon 9to5Mac : GPT-6 Sol, dédié aux tâches de codage complexes et aux workflows autonomes, et GPT-6 Luna, positionné sur les tâches ciblées à haut volume. Les deux affichent des tarifs API réduits de 50 % par rapport aux prix promotionnels de GPT-5.6.

Ce double mouvement, nouveaux modèles moins chers et cache plus efficace, confirme la trajectoire déjà visible avec le déploiement de GPT-6 Astra chez Perplexity : OpenAI cherche à faire baisser le coût réel par requête pour capter les usages à très gros volume, exactement le terrain des pipelines de contenu automatisés.

Questions fréquentes

Le nouveau cache de prompts fonctionne-t-il sur tous les modèles OpenAI ?
La documentation officielle précise le TTL de 30 minutes pour les modèles GPT-5.6 et ultérieurs. La possibilité de changer l'effort de raisonnement sans casser le cache, elle, est décrite spécifiquement pour les modèles GPT-6.
Qu'est-ce qu'un cache miss et comment le repérer ?
Un cache miss survient quand le préfixe d'un prompt n'est pas retrouvé en cache, souvent à cause d'un changement dans les outils déclarés ou les paramètres de l'appel, et le tarif plein s'applique alors sur l'ensemble des tokens d'entrée. Le nouvel outil de diagnostic d'OpenAI, accessible depuis le dashboard de platform.openai.com/usage, identifie précisément la cause de chaque cache miss.
Comment vérifier que mon pipeline profite bien de la réduction ?
Le nouveau Prompt Caching Dashboard sur platform.openai.com/usage affiche les taux de succès du cache (cache read hit rates) appel par appel, ce qui permet de repérer immédiatement si un prompt mal structuré casse le cache en continu.
Faut-il changer l'architecture de tous mes prompts existants ?
Seulement ceux qui répètent un bloc stable volumineux (instructions système, guide de style, taxonomie) à chaque appel : c'est là que le gain de 90 % s'applique. La règle reste la même dans tous les cas : placer la partie fixe du prompt en préfixe et la partie variable en fin de requête.

Sources

CS
Consultant SEO · fondateur de Cat's Eye Web

Écrit sur le SEO technique, l'IA et Google Discover à partir de tests terrain. Créateur de l'outil d'audit Cat's Eye. @ChrisWaoo

À lire ensuite