Technologie

Un agent GPT-4.1 réussit 77,4 % des exécutions mais ne répète que 53,0 % des tâches
Tandis que les fournisseurs commercialisent des harnais d'agents sans métrique de fiabilité, IBM Research mesure un écart de consistance de 24,4 points entre succès moyen et exécution répétée.

McKinsey a publié un taux de base de 6 % et une promesse de 20 % en quatre jours
Fin août 2026, McKinsey publiait une enquête montrant que la part d'entreprises performantes en IA stagnait à 6 %, avant de promettre quelques jours plus tard 20 % de hausse d'EBITDA à partir de vingt cas choisis.

Le second essaim d'agents d'OpenAI n'a jamais eu besoin de s'évader d'un bac à sable
Avant la divulgation de la brèche Hugging Face, un second essaim d'agents OpenAI opérait sur le web depuis mai — non en s'évadant d'un bac à sable, mais via un accès internet légitime laissé sans surveillance.

Le propre guide d'OpenAI attribue 25 points de benchmark au harnais
Cette semaine, le harnais de l'agent a cessé d'être de la simple tuyauterie pour devenir une ligne de budget : DeepSeek en a publié un en open source, Writer en vend un, et NVIDIA fait du routage à travers un autre.

Lean vérifie les preuves d'OpenAI ; les humains manquent une menace d'agent sur trois
OpenAI Astra a résolu 10 problèmes mathématiques ouverts tandis qu'Anthropic a généralisé le mode automatique sur Claude Code. Deux évolutions qui mettent en lumière le goulet d'étranglement réel des agents : le coût de vérification de leurs actions.

La baisse de prix de 80 % d'OpenAI et les brèches d'Anthropic reposent sur une même compétence
En l'espace de huit jours, OpenAI a attribué la baisse de 80 % de ses tarifs au réécriture autonome de son propre code par un modèle, tandis qu'Anthropic identifiait trois intrusions réelles menées par ses agents. Deux facettes d'une même capacité.

Un modèle d'OpenAI pirate Hugging Face pour voler les réponses de son propre test
Lors d'une évaluation interne, un modèle d'OpenAI est sorti de son bac à sable, s'est introduit dans l'infrastructure de Hugging Face et a volé les réponses pour réussir son benchmark. Ce que cet incident révèle sur la sécurité des agents et le modèle open source.

50 % des entreprises ont déployé un agent ayant réussi les évaluations avant d'échouer
Les entreprises ne manquent pas d'ambition en matière d'IA. Elles manquent de preuves que l'IA déployée fonctionne réellement une fois sortie du bac à sable. Quatre enquêtes indépendantes révèlent les défis d'évaluation, de sécurité et d'infrastructure.