Anthropic a dévoilé le 22 septembre 2026 une nouvelle version de son modèle haut de gamme, Claude Opus 5.5. Sur son compte officiel, l'entreprise le décrit comme « un net progrès par rapport à Opus 5 », en tête sur trois terrains : le code agentique, le computer use et le travail intellectuel (knowledge work).
Dans la foulée, la plateforme de mesure indépendante Artificial Analysis l'a hissé en tête de son Intelligence Index. Voici ce qu'affirme l'annonce, comment le modèle se situe face aux autres, et les premières réactions, sans surinterpréter ce qui n'a pas encore été chiffré.
Opus 5.5 is a major step up from Opus 5, leading on agentic coding, computer use, and knowledge work.
@claudeai
À retenir
- Anthropic positionne Opus 5.5 comme « a major step up from Opus 5 ».
- Trois axes revendiqués en tête : code agentique, computer use, travail intellectuel.
- 1re place de l'Intelligence Index d'Artificial Analysis : 58 points, cinq de plus que GPT-6 Astra et Fable 5.1 (53).
- Baisse de prix d'environ 20 % par rapport à Opus 5 (4 $ / 20 $ le million de tokens).
- Premières réactions enthousiastes côté développeurs ; recul et évaluations indépendantes encore à venir.
01Ce qu'annonce Anthropic, mot pour mot
Le message officiel est bref et sans ambiguïté sur le positionnement. Il place Opus 5.5 au-dessus d'Opus 5, la génération précédente, sur des usages orientés action plutôt que simple conversation (voir le post ci-dessus).
Ces mots sont ceux d'Anthropic, publiés sur le compte officiel @claudeai le 22 septembre 2026. L'annonce initiale ne détaille pas les benchmarks : pour les chiffres, nous nous appuyons ci-dessous sur des mesures externes attribuées.
02Code agentique : de l'autocomplétion à l'exécution
Le « code agentique » désigne un modèle capable de mener une tâche de développement de bout en bout : lire un dépôt, planifier, écrire et modifier plusieurs fichiers, lancer des commandes, lire les erreurs et corriger, en boucle, avec un minimum de supervision. On passe de l'assistant qui complète une ligne à l'agent qui livre une modification testée.
C'est le terrain sur lequel la famille Claude s'est imposée ces dernières années, et le fait qu'Anthropic le cite en premier pour Opus 5.5 confirme que la bataille se joue là : la fiabilité sur des tâches longues et multi-étapes, pas seulement la qualité d'un extrait de code isolé.
03Computer use : l'IA qui pilote l'écran
Le « computer use » (usage de l'ordinateur) désigne la capacité d'un modèle à interagir avec une interface comme le ferait un humain : voir l'écran, déplacer le curseur, cliquer, saisir du texte, naviguer entre des applications. C'est ce qui permet d'automatiser des tâches qui n'ont pas d'API propre.
Progresser sur cet axe, c'est ouvrir des automatisations concrètes de back-office : remplir des formulaires, extraire des données d'outils fermés, enchaîner des actions dans un navigateur. Pour les entreprises, c'est souvent là que se cache le gain de temps réel, au-delà de la génération de texte.
04Travail intellectuel : l'agent au bureau
Le « knowledge work » recouvre les tâches des métiers de la connaissance : analyse, synthèse, recherche, rédaction structurée, préparation de documents, raisonnement sur des données. Un modèle qui progresse ici devient un exécutant capable de produire un livrable, pas seulement un brouillon.
Le fil rouge des trois axes est le même : une IA qui agit et termine des tâches, pas seulement qui répond.
Cette convergence n'est pas un hasard. Code, pilotage d'interface et travail de bureau sont trois déclinaisons d'un même objectif : l'agent autonome.
05Face aux autres modèles : ce que disent les mesures
Le repère le plus solide vient d'Artificial Analysis, plateforme de mesure indépendante. Selon elle, Opus 5.5 prend la première place de l'Intelligence Index avec 58 points (effort maximal), soit cinq de plus que GPT-6 Astra (OpenAI) et Claude Fable 5.1, à égalité à 53, et sept de plus qu'Opus 5 (51).
Toujours selon Artificial Analysis, Opus 5.5 mène sur six des dix épreuves de l'indice (dont Humanity's Last Exam et SciCode) et atteint la parité avec GPT-6 Astra sur des tests d'agent comme Terminal-Bench 4.0 et AutomationBench-AA. Le média spécialisé The Decoder note de son côté qu'Opus 5.5 offre un niveau proche de Fable 5.1 pour un coût de fonctionnement nettement inférieur, Anthropic promettant au passage une écriture moins « Claudish », c'est-à-dire moins marquée par ses tics habituels.
Côté prix
Anthropic accompagne la sortie d'une baisse d'environ 20 % : 4 $ le million de tokens en entrée et 20 $ en sortie (contre 5 $ / 25 $ pour Opus 5), avec des lectures de cache moins chères. Un modèle plus fort et moins cher, c'est le mouvement de fond du secteur depuis deux ans.
Prudence toutefois : les classements varient d'un banc d'essai à l'autre, et la hiérarchie exacte face à GPT-6 (Astra comme Sol) ou aux Gemini se lira mieux sur plusieurs semaines d'évaluations indépendantes. Le mieux reste de tester sur vos propres tâches.
06Ce qui se dit sur les réseaux
Les premières réactions, publiées dans les heures suivant l'annonce, sont largement positives. Artificial Analysis résume : « Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index, along with a 20% price cut. »
Opus 5.5 scores 58 on Artificial Analysis's Intelligence Index, a 5-point jump over the previous SoTA. 1st by far. Opus is a beast!
Ce commentaire, repéré parmi les réactions de développeurs sur X, résume l'accueil de la communauté technique : un saut de cinq points sur l'indice, jugé rare. À l'inverse, la prudence de rigueur s'impose sur un modèle sorti le jour même, sans encore d'évaluations indépendantes à froid ni de retour d'usage à grande échelle.
07Ce que ça change concrètement (et ce qui reste à vérifier)
Pour les équipes qui outillent déjà leurs processus avec Claude, une montée de version sur ces trois axes se mesure très vite : moins d'allers-retours pour une tâche de code, des automatisations d'interface plus fiables, des livrables intellectuels plus aboutis du premier coup. Avec la baisse de prix, l'équation coût/qualité s'améliore encore.
La prudence de rigueur
Tant que des évaluations indépendantes à froid ne sont pas publiées, l'ampleur exacte du progrès reste à confirmer. Le bon réflexe : tester Opus 5.5 sur vos propres tâches réelles, celles qui comptent pour vous, plutôt que de vous fier au seul positionnement marketing ou à un classement isolé.