Les 22–24 septembre ont surtout été marqués par une baisse nette du coût des modèles de frontière et par des outils concrets pour industrialiser les prompts longs et les agents. Côté régulation, aucune annonce majeure n’est tombée dans cette fenêtre de trois jours, mais le classement récent de ChatGPT par l’UE reste un signal structurant pour les produits de prompting avec recherche web.
1. OpenAI : GPT‑6 Sol et Luna
OpenAI a lancé GPT‑6 Sol et GPT‑6 Luna, deux variantes plus rapides et économiques de la famille GPT‑6, destinées au travail professionnel, au code, à l’automatisation et à l’usage agentique. Les prix API baissent de 50% par rapport aux tarifs promotionnels de GPT‑5.6 : Sol passe à 2 $/M tokens en entrée et 10 $/M en sortie ; Luna à 0,10 $/M et 0,50 $/M. Les deux sont accessibles via l’API sous `gpt-6-sol` et `gpt-6-luna`, ainsi que dans Codex et ChatGPT Work selon les offres.
– Le choix de modèle devient davantage une décision d’architecture qu’un compromis brutal entre qualité et budget : Sol vise des tâches interactives et agentiques nécessitant plus de raisonnement, tandis que Luna convient aux tâches nombreuses, rapides et fortement standardisées.
– Il devient économiquement viable d’utiliser des chaînes de prompts plus riches : extraction structurée, validation par second passage, classification préalable, puis génération finale.
– Pour un développeur, cela invite à mettre en place un routeur simple : Luna pour pré-trier, reformater et produire des brouillons ; Sol pour les requêtes ambiguës, les validations et les actions à enjeu plus élevé.
Exemple pratique : pour traiter des tickets support, Luna peut catégoriser et extraire les champs JSON ; Sol peut reprendre les cas à faible confiance, générer une réponse contextualisée et contrôler que les règles métier ont été suivies.
2. OpenAI : amélioration majeure du prompt caching
En parallèle, OpenAI a amélioré le prompt caching de GPT‑6 : davantage de cache hits par défaut, remises sur les préfixes partagés réutilisés dans une fenêtre de 30 minutes, et nouveaux outils de diagnostic pour comprendre les cache misses et régler précisément la portion mise en cache. Les lectures d’entrées mises en cache peuvent bénéficier d’une réduction allant jusqu’à 90%.
– C’est probablement l’actualité la plus directement actionnable pour un praticien du prompting. Un prompt système long, un corpus de règles, un schéma JSON, des exemples few-shot ou un contexte applicatif coûteux peuvent désormais être réemployés plus efficacement.
– Il faut restructurer les prompts en plaçant au début les éléments stables et réutilisables : instructions globales, politique de réponse, formats de sortie, définitions métier, outils disponibles et exemples persistants.
– Les données variables — question utilisateur, paramètres ponctuels, documents spécifiques — doivent rester vers la fin. Ce découpage améliore potentiellement simultanément la latence et le coût.
– Les nouveaux diagnostics permettent enfin de mesurer ce qui relevait auparavant de suppositions : taux de cache hit, causes de raté et quantité de contexte réellement réutilisée.
3. Anthropic : Claude Opus 5.5
Anthropic a publié Claude Opus 5.5 le 22 septembre. L’entreprise le positionne à un niveau comparable à Claude Fable 5.1 sur la plupart des tâches, tout en annonçant un coût d’exécution inférieur de 40% à Opus 5 ; Sonnet 5.5 et Haiku 5.5 sont annoncés pour les semaines suivantes.
– Cette sortie renforce la nécessité d’évaluer les prompts multi-modèles plutôt que d’optimiser exclusivement pour un seul fournisseur. Une même consigne peut exceller sur un modèle et devenir trop verbeuse, trop prudente ou moins fiable sur un autre.
– Le rapport performances/coût rend pertinent l’usage d’Opus 5.5 pour des étapes de contrôle : critique d’une réponse, vérification d’instructions, analyse de documents ou revue de code.
– À court terme, il est utile de constituer un jeu de tests de prompts composé de cas réels : entrées ambiguës, données incomplètes, demandes contradictoires, sorties JSON malformées et documents longs. Mesurez qualité, taux de conformité au format, latence et coût sur GPT‑6 Sol/Luna et Opus 5.5.
4. Régulation : ChatGPT sous le régime DSA renforcé
Ce point ne date pas strictement des trois derniers jours, mais demeure l’évolution réglementaire la plus importante pour les produits IA européens cette semaine. La Commission européenne a désigné ChatGPT comme Very Large Online Search Engine au titre du Digital Services Act, après que le service a déclaré atteindre au moins 45 millions d’utilisateurs mensuels moyens dans l’UE. OpenAI doit satisfaire aux obligations renforcées d’ici janvier 2027, notamment l’évaluation et l’atténuation des risques systémiques concernant les contenus illicites, les mineurs, les droits fondamentaux, les élections et la sécurité publique.
– La recherche web intégrée n’est plus seulement une fonctionnalité de modèle : elle devient une surface de conformité. Les prompts qui demandent de rechercher, résumer, recommander ou classer des contenus devront plus souvent être conçus avec traçabilité, sources, gestion de l’incertitude et mécanismes de signalement.
– Pour des applications professionnelles en France ou dans l’UE, prévoyez dès maintenant des garde-fous dans vos templates : exiger des citations, distinguer les faits des hypothèses, signaler les informations sensibles ou non vérifiées, et journaliser les entrées/sorties lorsque le cadre juridique le justifie.
– Cette décision tend à rapprocher les assistants conversationnels avec web search des obligations déjà appliquées aux moteurs de recherche traditionnels.
Tendance de la semaine
La compétition ne se joue plus seulement sur le « meilleur modèle » : elle bascule vers le coût par tâche utile, la vitesse et la capacité à faire tourner des agents avec de longs contextes réutilisables. Pour le prompting, la priorité pratique devient donc d’industrialiser : prompts modulaires, cache-aware, tests de régression multi-modèles et routage intelligent entre modèles économiques et modèles de raisonnement.
