1. Google annonce Gemini 4 Argon
Google a dévoilé Gemini 4 Argon, un modèle orienté raisonnement et workflows professionnels longs
développement logiciel, travail sur corpus d’entreprise, juridique/finance et cyberdéfense. Il annonce une capacité de sortie allant jusqu’à 1 million de tokens, mais l’accès est pour l’instant limité à des spécialistes cyber de confiance dans le programme Fairwind, le temps des évaluations de sûreté.
– Le changement majeur n’est pas seulement la qualité du modèle : avec des entrées et sorties très longues, le prompting peut devenir un travail de conception de contexte à l’échelle d’un dossier complet. Spécification, codebase, tickets, documents techniques, règles métier et résultats intermédiaires.
– Cela favorise les prompts structurés en étapes : cadrage des rôles, inventaire des sources, plan d’exécution, contraintes de format, critères d’acceptation et boucles d’auto-vérification.
– L’accès restreint est en lui-même une information importante : des capacités élevées, notamment cyber, sont de plus en plus publiées avec un déploiement progressif et conditionnel, ce qui peut modifier les modèles réellement utilisables en production.
Google annonce un prix introductif de 2 $ par million de tokens en entrée et 10 $ en sortie, avec 95% de remise sur les entrées mises en cache. Pour les usages répétitifs, une stratégie de prompt stable préfixé — règles, schéma, documentation commune — puis des requêtes variables courtes devient donc particulièrement intéressante.
2. OpenAI lance GPT-6.1 Sol, avec le multi-agent en bêta
OpenAI a lancé GPT-6.1 Sol le 29 septembre, présenté comme adapté au code agentique, à l’utilisation d’ordinateur et au travail professionnel. L’API introduit aussi une fonction Multi-agent en bêta dans la Responses API : le modèle peut déléguer une partie d’une tâche à des sous-agents dans une même requête.
– La compétence passe du prompt unique au design d’orchestration : définir les sous-tâches, ce qui doit être délégué, les artefacts à transmettre, le format des retours, et la manière de vérifier ou fusionner les résultats.
– Il faut prompt-er explicitement le coordinateur : « décompose seulement si… », « délègue la recherche de régressions à un sous-agent », « exige un diff et des tests », « n’applique aucune modification sans validation ». Sans ces garde-fous, le multi-agent peut augmenter le coût et produire une synthèse moins traçable.
– Pour un profil développement, un bon cas d’usage serait : un agent analyse un projet Delphi/Oracle, un second établit le plan de migration ou de refactorisation, un troisième contrôle la compatibilité SQL et les risques de performance ; l’agent principal livre ensuite une recommandation consolidée, avec preuves et tests proposés.
Côté coût, OpenAI affiche pour GPT-6.1 Sol 2 $/M tokens d’entrée, 0,10 $/M en entrée mise en cache et 10 $/M de sortie, pour des prompts jusqu’à 272 000 tokens en entrée. Cela rend l’optimisation du cache et la séparation « instructions pérennes / données variables » encore plus rentable.
3. Anthropic met à jour Claude Sonnet avec Sonnet 5.5
Anthropic a annoncé Claude Sonnet 5.5 le 28 septembre. L’entreprise le décrit comme une amélioration nette de Sonnet 5, jusqu’à 30% plus rapide et jusqu’à 30% moins coûteuse pour la plupart des usages.
– Une baisse conjointe de latence et de coût change le seuil où l’on peut utiliser le modèle pour des boucles : génération → critique → révision, variantes de prompts, extraction structurée et évaluations de jeux de tests.
– Pour le prompting opérationnel, c’est une invitation à industrialiser l’évaluation comparative plutôt qu’à chercher une formulation parfaite à la main : conservez 20 à 50 exemples représentatifs, comparez l’ancien et le nouveau modèle sur précision, respect du format, robustesse aux cas limites et coût/latence.
– La mise à niveau peut toutefois modifier le comportement sur des instructions existantes. Avant bascule de production, faites tourner les prompts système critiques en « shadow test » et surveillez particulièrement : fidélité aux contraintes, propension à refuser, verbosité et appels d’outils.
4. Les prompts deviennent un sujet de sécurité produit
L’addendum de sécurité d’OpenAI pour GPT-6.1 Sol indique que les évaluations ont placé le modèle au niveau Critical pour la cybersécurité et High pour les capacités biologiques et chimiques. En parallèle, Google limite initialement Gemini 4 Argon à des cyberdéfenseurs de confiance avant un accès plus large.
– Pour les praticiens, le message est clair : le prompt engineering ne concerne plus seulement la qualité de sortie ; il doit intégrer le contrôle de capacité – rôles autorisés, périmètres de données, outils accessibles, validation humaine et journalisation.
– Les instructions système devraient séparer sans ambiguïté les tâches autorisées de celles qui exigent une revue humaine, notamment dès qu’un agent peut exécuter du code, naviguer, modifier un dépôt, appeler une API sensible ou prendre une décision opérationnelle.
– En pratique, une architecture robuste associe : prompts de rôle limités, accès aux outils avec droits minimaux, schémas de sortie stricts, filtres avant exécution et relecture humaine pour les actions irréversibles.
5. Chine : cadre de gouvernance IA 3.0, centré sur les agents et le cycle de vie
Le comité chinois TC260, sous l’égide de la Cyberspace Administration of China, a publié le 14 septembre le *AI Safety Governance Framework 3.0*. Ce n’est donc pas une annonce des trois tout derniers jours, mais c’est l’évolution chinoise récente la plus structurante mise en avant dans le débat actuel : le texte couvre les risques sur tout le cycle de vie et distingue les risques intrinsèques, les risques d’application – dont les agents, la cybersécurité et les données personnelles – et les risques dérivés.
– Pour toute solution destinée au marché chinois, ou utilisant des modèles/services chinois, il faut traiter les instructions, données injectées, traces d’exécution et contrôles humains comme des éléments de conformité dès la conception.
– La place explicite accordée aux agents montre une convergence internationale : les enjeux réglementaires ne portent plus uniquement sur « le modèle », mais sur le système complet – données, outils, permissions, comportement autonome et impacts en aval.
– Attention à l’interprétation : ce cadre est avant tout un document de gouvernance et d’orientation technique ; il ne remplace pas à lui seul les obligations chinoises existantes concernant les services d’IA générative publics, les algorithmes et les contenus synthétiques.
6. Le débat réglementaire européen se recentre sur les modèles avancés
Dans l’UE, l’AI Act est entré dans sa phase d’application par l’AI Office et les autorités nationales depuis le 2 août 2026. Dans l’actualité politique récente, des parlementaires européens défendent le maintien de règles mondiales de sûreté et une responsabilité accrue des grandes plateformes pour les risques liés à leurs modèles les plus avancés.
– Pour les équipes européennes, documenter les prompts système, les sources de contexte, les décisions agentiques et les évaluations de robustesse n’est plus seulement une bonne pratique d’ingénierie : cela devient un actif de gouvernance et d’audit,
– Dans un produit, prévoyez une versionnée des instructions système, des jeux d’évaluation, des politiques de données et de l’historique des actions d’outils. Les modifications de prompt peuvent être des changements de comportement substantiels, au même titre qu’un changement de modèle.
– L’objectif pratique : être capable d’expliquer pourquoi une réponse a été produite, quelles données et quels outils ont été mobilisés, et qui a validé une action à impact.
Tendance de la semaine
La tendance dominante est le passage du prompt isolé au système agentique gouverné : modèles conçus pour des tâches longues, sous-agents, contextes massifs et outils connectés. En parallèle, les fournisseurs et régulateurs convergent vers une même exigence : plus les capacités et l’autonomie augmentent, plus il faut concevoir prompts, permissions, évaluation et traçabilité comme une seule couche de contrôle.
