1) OpenAI lance « Astra for Law », agent juridique spécialisé sur GPT‑6 Astra.
Le 17 septembre 2026, OpenAI a annoncé Astra for Law, une configuration de GPT‑6 Astra dédiée au droit, avec un index de recherche juridique couvrant plus de 230 millions d’URLs et un accès initial réservé à certains grands cabinets via « Trusted Access ».
Cela illustre la tendance aux « modèles spécialisés par domaine » : pour un prompt engineer, cela signifie qu’on peut obtenir de bien meilleurs résultats en ciblant un modèle ou une configuration fine-tunée pour un métier (droit, santé, finance, etc.) plutôt qu’en comptant uniquement sur le prompting générique.
2) GPT‑6 Astra disponible sur Azure et en API ; adoption rapide en entreprise
GPT‑6 Astra, lancé le 3 septembre 2026, est désormais accessible via l’API OpenAI, Microsoft Azure et AWS Bedrock, avec une adoption mesurée à environ 13% des dépenses IA enterprise suivies par Ramp.
La disponibilité cloud et API permet d’intégrer Astra dans des workflows de production (agents, RAG, outils internes). Pour un praticien du prompting, c’est crucial : vous pouvez tester des chaînes de prompts complexes, du structured output et des appels d’outils sur un modèle de pointe en environnement réel.
3) Anthropic pèse un nouveau modèle (Opus 5.5 / « wafer ») en réponse à Astra
Plusieurs sources (19–21 sept.) indiquent qu’Anthropic évalue le lancement d’un nouveau modèle flagship (souvent appelé Opus 5.5 ou « claude-wafer-eap ») dans la semaine du 21 septembre, sans annonce officielle ni fiche modèle publiée à ce jour.
Si ce modèle sort, il deviendra rapidement une cible prioritaire pour le benchmarking de prompts, surtout pour les tâches d’agents, de code et de raisonnement complexe où Opus 5 est déjà fort. Un nouveau modèle implique de re‑tuner vos templates et stratégies de prompting (few-shot, tool use, structured outputs).
4) Guide « Prompt Engineering 2.0 » (2026) : techniques, contextes longs et sortie structurée
Un guide publié le 20 septembre 2026 décrit le « Prompt Engineering 2.0 » comme la discipline de combinaison de techniques nommées (zero/few-shot, CoT, ReAct, role prompting, structured output, long-context, multimodal, etc.) pour atteindre des objectifs précis de précision, latence et coût.
C’est une synthèse très pratique pour structurer vos workflows : choix de techniques, gestion de budgets de tokens, usage natif de JSON schema / tool schemas, et exploitation des très grands contextes (jusqu’à 1–2M tokens sur certains modèles).
5) Débat réglementaire intense : appel au ralentissement vs. promotion de l’IA aux États‑Unis
Le 21 septembre, des dirigeants (Amodei chez Anthropic, Altman chez OpenAI, Musk) ont appelé à un ralentissement coordonné du développement de l’IA avec plus de tests de sécurité et d’évaluateurs indépendants, tandis que Meta (Zuckerberg) et Nvidia (Jensen Huang) se montrent plus sceptiques sur de nouvelles régulations.
Une régulation plus stricte (évaluations externes, reporting d’incidents, « kill switch ») peut influencer les fonctionnalités exposées aux développeurs (accès aux modèles, logs, capacités d’agents, etc.), et donc la manière dont on conçoit et teste les prompts en production.
6) Positions politiques divergentes : Trump (« AI Force », sécurité = « hoax ») vs. Californie (« kill switch »)
Le 19 septembre, Donald Trump a annoncé la création d’un « AI czar » et d’une « AI Force », en qualifiant la sécurité IA de « hoax », tandis que le gouverneur de Californie, Gavin Newsom, a signé le 18 septembre un ordre exécutif imposant, sous deux mois, des propositions pour un mécanisme d’arrêt d’urgence (« kill switch ») et des auditeurs sur site pour les modèles frontier.
Cette fracture fédéral/étatique crée de l’incertitude réglementaire : selon les futures règles, certaines capacités d’agents autonomes, d’accès système ou de déploiement pourraient être restreintes ou fortement auditées, ce qui impacterait directement les cas d’usage avancés de prompting (agents, computer use,
7) Poussée législative aux États‑Unis : nombreuses propositions de lois IA, mais pas de consensus
Mi-septembre, de nombreux projets de loi sur l’IA ont été introduits au Congrès (garde-fous, « kill switch », agence fédérale, voire moratoire sur la superintelligence), mais sans trajectoire claire avant les midterms en raison de désaccords partisans.
À moyen terme, ces textes pourraient imposer des contraintes sur l’entraînement, le déploiement et la transparence des modèles, ce qui se répercuterait sur les API, les quotas, les logs et les fonctionnalités disponibles pour construire des systèmes basés sur le prompting.
Tendance de la semaine
La semaine est dominée par la consolidation de GPT‑6 Astra en entreprise (avec des déclinaisons verticales comme « Astra for Law ») et par la pression concurrentielle sur Anthropic, qui envisage un nouveau modèle flagship. En parallèle, le débat réglementaire s’intensifie fortement aux États‑Unis, avec une fracture nette entre une ligne « pro‑growth » au niveau fédéral et des initiatives étatiques plus restrictives, ce qui commence à structurer l’agenda législatif sur l’IA.
qu’est-ce que jev.ai?
jev.ai est le site de Jev, un modèle d’IA très particulier lancé le 15 septembre 2026 par la startup TypeSafe AI (fondée par Diogo Almeida, ancien chercheur OpenAI et co‑auteur des travaux ayant mené à ChatGPT).
Ce que fait Jev (et ce qu’il ne fait pas)
– Il ne discute pas, ne rédige pas, ne génère pas de texte. Contrairement à GPT, Claude ou Gemini, Jev n’est pas un LLM conversationnel.
– Il prend des décisions structurées ultra‑rapides à partir d’un état (texte, JSON, etc.) et de questions que vous définissez. Il renvoie :
– un Choice : choix parmi une liste prédéfinie (ex. catégorie, routage),
– un Score : note sur une échelle (ex. risque 1–5, qualité 0–100),
– un Noul : oui/non avec une probabilité.
Chaque réponse est accompagnée d’un score de confiance.
Concrètement, vous lui donnez quelque chose comme :
> « À partir de ce ticket support, quelle est la catégorie : billing / technique / commercial ? Et quel est le niveau d’urgence sur une échelle 1–5 ? »
Jev renvoie directement `{ « category »: « billing », « urgency »: 4, « confidence »: 0.92 }` en quelques dizaines à centaines de millisecondes.
Pourquoi c’est intéressant pour un praticien du prompting / de l’automatisation
– Vitesse et coût : TypeSafe annonce des latences de 70–500 ms et un coût d’environ 0,042 $ par million de tokens en entrée (sortie gratuite), soit de l’ordre de 75–200× plus rapide et 40–400× moins cher que des LLM classiques sur des tâches de classification / décision.
– Zéro hallucination textuelle : comme il ne génère pas de phrases, il ne peut pas « inventer » du texte ; il choisit dans un espace de réponses que vous contrôlez. C’est idéal pour du routage, de la modération, du scoring, des garde‑fous dans des agents.
– Brique de décision dans des agents : beaucoup l’utilisent comme couche « intuition rapide » (System One) au sein de workflows plus larges où un LLM « System Two » (GPT, Claude…) gère le raisonnement long et la génération.
Exemples d’usages typiques : tri de tickets, scoring de leads, modération de commentaires, routage d’outils dans un agent, validation de conformité, détection de fraude, etc.
Architecture et positionnement
– Jev est présenté comme le premier modèle « System One » : inspiré de la pensée rapide et intuitive (par opposition aux modèles de raisonnement long).
– C’est un Transformer, mais pas un LLM au sens « génération de texte token par token » : il produit en une passe parallèle des décisions typées avec probabilités.
– Il est entraîné sur des données synthétiques avec une méthode appelée Reinforcement Learning for Calibrated Decisions, visant à obtenir des probabilités bien calibrées.
En bref
Jev n’est pas un concurrent frontal de ChatGPT ou Claude, mais une couche de décision rapide et peu coûteuse à intégrer dans vos systèmes. Pour quelqu’un qui travaille sur le prompting et les agents, c’est un outil complémentaire puissant : vous utilisez Jev pour tout ce qui est classification, routage, scoring, garde‑fous en temps réel, et vous réservez les LLM classiques aux tâches qui nécessitent vraiment de la génération de texte ou du raisonnement long.
