Aller au contenu
Sans pub
Tech et IA

Claude Opus 5.5 : ce que les coûts et les tests annoncés permettent de conclure

Tarifs API, dépenses par tâche et abonnements ne mesurent pas la même chose. Les évaluations publiées par Anthropic montrent des progrès, mais leur portée dépend des réglages et des garde-fous.

Texte blanc « Claude Opus 5.5 » sur un dégradé bleu et orangé, encadré de textures jaunes, grises et orange.
Illustration de communication publiée par Anthropic pour Claude Opus 5.5. Ce visuel ne représente ni un résultat de benchmark ni une tâche réalisée par le modèle.
Sur quoi repose cet articleRapport

Type de travail

Rapport ou annonce

À garder en tête

Un rapport ou une annonce n’a pas été évalué par des pairs comme une étude publiée.

Sources

  • Anthropic
1 source citée
Signaler une erreur

Anthropic présente Claude Opus 5.5 comme un modèle plus efficace pour le codage et le travail professionnel, avec une dépense annoncée inférieure de 40 % à celle d’Opus 5 sur des tâches typiques aux réglages par défaut. Les tarifs API sont publiés, mais cette économie par tâche reste un résultat des tests du fournisseur, pas une garantie pour chaque utilisateur. Les évaluations rapportées signalent des progrès tout en laissant ouvertes des questions sur leur transposition aux usages réels.[1]

Une annonce de fournisseur, pas une étude évaluée par les pairs

Le document principal est l’annonce officielle d’Anthropic pour le premier modèle de sa famille Claude 5.5. Il rassemble des tests internes, des résultats de benchmarks et des témoignages de clients ayant eu un accès anticipé. Ce dossier n’est pas une étude publiée dans une revue à comité de lecture. Anthropic indique que Frontier Design et METR ont évalué le modèle avant sa sortie ; cette intervention extérieure ne constitue pas, à elle seule, une validation indépendante de l’ensemble des performances et des économies annoncées.[1]

Des usages centrés sur les tâches longues et le travail vérifiable

En programmation, Anthropic met l’accent sur les migrations et les audits qui traversent une base de code entière. L’entreprise cite un testeur ayant réalisé une migration de 680 000 lignes en moins d’une journée, un travail présenté comme nécessitant plusieurs semaines pour une équipe d’ingénieurs. Cet exemple décrit un retour d’expérience sélectionné par le fournisseur. Il ne donne pas un délai reproductible pour toute migration, dont la difficulté ne se résume pas au nombre de lignes.[1]

Un test interne donne un point de comparaison plus circonscrit : traduire de C en Rust HAProxy, un logiciel de répartition du trafic entre serveurs. Selon Anthropic, les versions produites par Opus 5.5 et Fable 5.1 ont passé presque tous les tests de non-régression propres à HAProxy. Opus 5.5 a terminé en 9,5 heures, contre 12 heures pour Fable 5.1, pour un coût inférieur de 51 %. Le résultat porte sur cette tâche et ce protocole ; passer presque tous les tests n’équivaut pas à démontrer une équivalence complète des logiciels.[1]

Pour le travail documentaire, Anthropic rapporte un test de rédaction de rapports sur les résultats trimestriels d’une entreprise, à partir d’une copie du Web où le communiqué financier était difficile à trouver. Un évaluateur automatique confrontait chaque chiffre et chaque citation aux sources. Sur 18 rapports produits par Opus 5.5 à différents niveaux d’effort, 16 ont atteint le seuil de qualité fixé, toute invention de chiffre ou de citation étant éliminatoire. Ce contrôle mesure une réussite sur un exercice défini, pas l’absence générale d’erreurs factuelles.[1]

Trois coûts à distinguer avant de comparer

Le premier coût est le tarif API par quantité de texte traitée, comptée en jetons. Pour le mode standard, Anthropic publie 4 dollars par million de jetons d’entrée et 20 dollars par million de jetons de sortie, soit une baisse de 20 % par rapport à Opus 5. Les lectures du cache, qui permettent de réutiliser du contexte déjà stocké, sont facturées 0,20 dollar par million de jetons, contre 0,50 dollar pour Opus 5. Le fournisseur indique que ces lectures représentent la majorité du coût des usages de codage et des agents.[1]

Le deuxième coût est la dépense nécessaire pour terminer une tâche. Elle dépend du tarif, mais aussi du nombre de jetons consommés et du réglage d’effort. Anthropic attribue la réduction annoncée de 40 % à la combinaison de prix plus bas et d’une moindre consommation de jetons par tâche. Cette estimation concerne ses charges de travail typiques aux réglages par défaut. Elle ne doit pas être appliquée indistinctement à tous les projets ni confondue avec la baisse de 20 % des tarifs d’entrée et de sortie.[1]

L’option rapide relève encore d’un autre compromis. Dans Claude Code et sur la Claude Platform, Anthropic annonce une vitesse pouvant atteindre 2,5 fois celle du mode standard, avec des tarifs de 8 dollars par million de jetons d’entrée et de 40 dollars par million de jetons de sortie. Ces deux tarifs sont donc le double de ceux du mode standard. Le gain maximal annoncé ne signifie pas que toute tâche sera achevée 2,5 fois plus vite.[1]

Le troisième poste concerne les abonnements. Anthropic annonce une augmentation des limites d’usage sur les fenêtres de cinq heures pour les offres Pro, Max, Team et Enterprise facturées par siège, ainsi qu’une réinitialisation des limites que les abonnés peuvent conserver pour l’utiliser plus tard. Le passage fourni ne chiffre pas cette augmentation et ne donne pas de nouveau prix d’abonnement. Une capacité d’usage accrue ne prouve donc pas une baisse de la facture mensuelle.[1]

Quelle version de Claude est la plus performante ? La tâche compte

Dans les évaluations présentées, Anthropic place Opus 5.5 en tête pour le codage par agents, l’utilisation d’un ordinateur et le travail intellectuel professionnel. Mais l’entreprise nuance elle-même la lecture du classement : les écarts entre benchmarks deviennent moins fiables pour prévoir les différences réelles, et l’écart avec Fable 5.1 lui paraît plus étroit en usage que dans les scores. On peut donc parler d’une avance rapportée sur les évaluations citées, pas désigner une version universellement supérieure pour chaque tâche.[1]

Les réglages limitent aussi les comparaisons. Sauf indication contraire, les résultats d’Opus 5.5 utilisent le raisonnement adaptatif à l’effort maximal, alors que l’économie de 40 % est annoncée aux réglages par défaut. Pour Terminal-Bench 4.0, Anthropic précise une erreur standard de 2,6 points pour Opus 5.5. Les scores sont ainsi des estimations assorties d’incertitude, obtenues dans des conditions qu’il faut distinguer de celles retenues pour les promesses de coût.[1]

Tous les essais ne viennent pas non plus du même dispositif. Les résultats d’AutomationBench ont été exécutés et rapportés par Zapier. Pour WANDR, Anthropic a utilisé des versions hors ligne des outils de recherche et de consultation du Web, dans une configuration différente de celle publiée par Perplexity. L’annonce précise que les scores des deux configurations ne sont pas directement comparables. La présence de résultats tiers ne rend donc pas l’ensemble du tableau homogène ni directement transposable aux usages quotidiens.[1]

Les garde-fous modifient les mesures sans supprimer tous les risques

Les évaluations d’Opus 5.5 ont été réalisées avec ses garde-fous de production activés. Lorsque ceux-ci intervenaient, certaines tâches de cybersécurité étaient achevées par Opus 4.8, et des tâches de biologie ou de développement de modèles avancés par Opus 5. Les scores concernés décrivent donc un fonctionnement incluant des modèles de repli, plutôt qu’Opus 5.5 seul sur toutes les tâches. Anthropic estime que ces interventions réduisent probablement ses performances mesurées. Sur AutomationBench, à l’inverse, aucun modèle de repli n’était utilisé et les interventions étaient comptées comme des échecs.[1]

Sur son audit comportemental automatisé, couvrant près de 2 000 scénarios, Anthropic rapporte de meilleurs résultats que ceux des modèles Claude récents sur presque toutes les mesures de comportement non aligné. L’entreprise décrit aussi un dispositif qui examine chaque action avant son exécution, un environnement isolé dont le code est ouvert et une revue de code destinée à détecter les vulnérabilités avant leur intégration. Ce sont des protections et des résultats de test annoncés, non une preuve que l’agent ne commettra jamais d’action indésirable.[1]

La limite la plus importante est explicitement reconnue : construire des évaluations capables de détecter de manière fiable toutes les défaillances avant le déploiement reste un problème non résolu. Anthropic observe aussi des signes indiquant qu’Opus 5.5 soupçonne souvent qu’il est évalué. Un comportement mesuré dans ce contexte ne suffit donc pas à prévoir celui du modèle dans toute la diversité des situations réelles, notamment lorsqu’il agit longtemps sans supervision.[1]

À lire aussi : Agents IA en entreprise : ce qui change lorsqu’ils peuvent agir.

Sources

  1. Introducing Claude Opus 5.5 \ Anthropic

LaraRédaction ScienceActu

Lara contribue à ScienceActu sur l’intelligence artificielle, l’espace et l’actualité scientifique. Ses articles s’appuient sur les sources indiquées dans chaque publication. Ce profil ne revendique pas de qualification médicale.

Notre méthodeSignaler une erreur

Tout voir

Les plus lus

Toutes disciplines, ce mois-ci

La discussion

Lancer la discussion

Votre adresse e-mail ne sera pas publiée. Restez courtois et appuyez vos affirmations sur des sources.