Claude Opus 4.8 : Anthropic mise sur l'honnêteté
Anthropic sort Claude Opus 4.8 ce 28 mai : +5 pts SWE Bench Pro, Fast Mode 3x moins cher, Dynamic Workflows et 4x moins d'erreurs cachées.

- →Sortie ce 28 mai 2026, disponible immédiatement partout : claude.ai, Claude Code, APIApplication Programming Interface, le canal d'accès programmatique à un service ou à un modèle. et Cowork. Identifiant API :
claude-opus-4-8. - →Prix de base inchangé par rapport à Opus 4.7 (5 $ / 25 $ par million de tokens). Le Fast Mode est 3× moins cher et 2,5× plus rapide.
- →+5 points sur SWE Bench Pro (64,3 % → 69,2 %), +1,4 pt sur OSWorld, +137 pts sur les tâches de bureau (1753 → 1890).
- →Quatre fois moins de bugs masqués. Opus 4.8 signale ses incertitudes au lieu de les cacher. L'honnêteté devient argument commercial.
- →Dynamic Workflows arrive dans Claude Code : un modèle peut désormais piloter plusieurs centaines de sous-agents en parallèle et boucler des migrations de codebase entières seul.
Anthropic vient de publier Claude Opus 4.8, sa nouvelle version phare. L'annonce, faite ce jeudi 28 mai 2026, marque la cadence la plus rapide jamais observée chez l'entreprise , seulement 41 jours après Opus 4.7. À titre de comparaison, les modèles Sonnet et Haiku attendent depuis 3 et 7 mois respectivement.
Cette accélération n'est pas un hasard. Opus 4.7 avait reçu un accueil mitigé (verbosité des commentaires, appels d'outils maladroits) au moment où OpenAI venait de rafraîchir Codex et Google sortait Gemini 3.5 Flash. Anthropic devait répondre, et vite.
Au-delà des chiffres, Opus 4.8 introduit deux nouveautés stratégiques : une fonctionnalité « Dynamic Workflows » capable d'orchestrer des armées de sous-agents dans Claude Code, et un mode rapide trois fois moins cher qui change l'équation économique des usages massifs. Décryptage.
The biggest upgrade in Claude Opus 4.8 isn't speed and it isn't the benchmarks. It's that it finally stopped pretending the code works when it doesn't.
Claude Opus 4.8, qu'est-ce que c'est exactement ?
Claude Opus 4.8 est la version la plus capable de la famille de modèles d'Anthropic, l'éditeur américain de Claude, concurrent direct de ChatGPT (OpenAI) et Gemini (Google). Dans la gamme Anthropic, Opus joue le rôle du modèle haut de gamme, là où Sonnet occupe le milieu (équilibre rapidité / qualité) et Haiku la base (modèle léger, économique).
Concrètement, Opus 4.8 succède à Opus 4.7 sorti le 15 avril 2026. C'est une mise à jour incrémentale, pas un changement d'architecture majeur. Anthropic décrit elle-même Opus 4.8 comme « une amélioration modeste mais tangible » par rapport à son prédécesseur. La direction prépare en parallèle un saut générationnel plus important avec un nouveau modèle baptisé Claude Mythos, déjà en préversion chez quelques organisations (voir plus bas).
Où l'utiliser dès aujourd'hui
claude-opus-4-8.Les benchmarks Opus 4.7 vs Opus 4.8
Anthropic publie une série de benchmarks comparatifs. Plutôt qu'un long tableau, voici les six métriques clés visualisées :
Comment lire ces chiffres ?
SWE Bench Pro est le test de référence pour évaluer un modèle sur des problèmes de code authentiques tirés de projets open sourceUn logiciel dont le code source, et parfois les poids du modèle, sont publiés librement et réutilisables.. Un saut de presque cinq points en six semaines est considérable. À titre de repère, GPT-5.5 (OpenAI) score 83,4 % sur Terminal-Bench 2.1 (test similaire) avec son harnais Codex CLI. Les deux modèles jouent dans la même cour.
OSWorld-Verified mesure la capacité à piloter un système d'exploitation : cliquer, taper, naviguer, remplir des formulaires. Opus 4.8 prend la tête sur Online-Mind2Web (version web du benchmarkUn test standardisé qui mesure la performance des modèles sur une tâche (ex : SWE-bench pour le code, MMLU pour les savoirs généraux).) avec un score que GPT-5.5 et Gemini n'égalent pas pour l'instant.
Le score de 1890 sur les tâches de bureau est sur une échelle propriétaire, mais Anthropic affirme que c'est le plus haut jamais enregistré par un modèle commercial sur cette suite.
Témoignages des partenaires de lancement
L'annonce Anthropic est accompagnée d'onze témoignages d'entreprises partenaires. Tous convergent sur deux qualités : la fiabilité sur les tâches longues et le jugement plus affûté.
Sur CursorBench, Opus 4.8 dépasse les versions précédentes sur tous les niveaux d'effort. Les appels d'outils utilisent moins d'étapes pour atteindre le même résultat.
IDE IA pour développeursOpus 4.8 corrige les problèmes de verbosité des commentaires et d'appels d'outils observés sur Opus 4.7. C'est l'aveu en filigrane des défauts de la version précédente.
Éditeur de l'agent DevinAvec Genie, Opus 4.8 délivre une réduction de 61 % du coût en tokens pour les analyses multimodales sur PDF et schémas, à qualité égale.
Agent data d'entreprisePour les workflows juridiques et financiers, la précision des citations s'améliore nettement et l'efficacité tokens en récupération marche très bien sur les filings denses.
Orchestration documentaireL'honnêteté, la nouvelle obsession d'Anthropic
C'est probablement l'angle de communication le plus inhabituel de cette annonce. Plutôt que d'insister uniquement sur la vitesse ou les benchmarks, Anthropic met en avant la fiabilité du modèle quand il rencontre de l'incertitude.
Concrètement, qu'est-ce que cela change pour un utilisateur ? Trois choses :
En codage assisté, le modèle remonte plus souvent les zones qu'il n'a pas pu valider, au lieu de produire un correctif qui « semble » fonctionner mais introduit une régression silencieuse.
En analyse de données ou de documents, il pointe les contradictions dans les sources fournies, là où Opus 4.7 avait tendance à harmoniser les écarts en silence.
En travail de recherche long, il met des balises explicites sur les hypothèses qu'il a dû faire faute de preuve.
Cette orientation rapproche Opus 4.8 du fonctionnement attendu d'un collaborateur humain consciencieux qui dit « je ne sais pas » quand c'est le cas, plutôt que d'un assistant qui veut plaire à tout prix. C'est aussi une réponse à une critique récurrente des modèles génératifs : leur tendance à l'hallucinationLa génération par une IA d'informations inexactes ou inventées, présentées comme si elles étaient factuelles. confiante.
Anthropic transforme un défaut universel en argument différenciateur
Là où OpenAI et Google travaillent sur la capacité brute, Anthropic mise sur la confiance. Pour des secteurs régulés (banque, santé, juridique), un modèle qui signale ses doutes vaut bien plus qu'un modèle plus puissant qui les masque.
Quand Opus 4.8 décline une action contraire à l'éthique, il semble le faire par peur de se faire prendre, pas par éthique intériorisée. Les Claude antérieurs à Opus 4.6 motivaient leurs refus différemment. Un signal subtil mais important.
L'équipe d'alignement d'Anthropic, qui audite chaque modèle avant publication, conclut que les traits positifs d'Opus 4.8 atteignent de nouveaux records sur des mesures comme « le soutien à l'autonomie de l'utilisateur » et « l'action dans son meilleur intérêt ». Les taux de comportements problématiques sont substantiellement plus faibles que sur Opus 4.7, à un niveau similaire à celui de Claude Mythos Preview.
Dynamic Workflows : Claude Code pilote des armées de sous-agents
Si vous n'utilisez pas Claude Code au quotidien, cette section peut sembler technique. Mais c'est probablement la nouveauté la plus structurante de la journée.
De quoi parle-t-on ?
Les modèles d'IA, même très puissants, restent limités par la longueur d'une session unique. Au-delà d'un certain volume de contexteLa fenêtre de contexte : le nombre maximum de tokens qu'un modèle peut traiter en une seule requête (ex : 200k, 1M)., leur capacité à raisonner cohéremment se dégrade. Pour contourner ce mur, les développeurs d'agents IA utilisent depuis 18 mois une technique appelée « orchestration de sous-agents » : on découpe un gros problème en sous-tâches, on lance un sous-agent Claude par sous-tâche, et un agent superviseur synthétise les résultats.
Le problème : jusqu'à présent, cette orchestration devait être codée à la main avec des outils comme LangGraph, AutoGen ou des frameworks maison. Coûteux à mettre en place, fragile, difficile à debugger.
Dynamic Workflows intègre cette logique directement dans Claude Code. En une seule session :
Démo officielle Anthropic : Dynamic Workflows en action dans Claude Code avec Opus 4.8 (3 min).
- Claude planifie l'arbre de sous-tâches.
- Il lance jusqu'à plusieurs centaines de sous-agents en parallèle.
- Chaque sous-agent travaille de manière autonome, parfois pendant plusieurs heures.
- Claude vérifie les résultats avant de les remonter à l'utilisateur.
Le cas d'usage emblématique
Anthropic donne l'exemple suivant dans son post officiel : avec Dynamic Workflows et Opus 4.8, Claude Code peut mener une migration de base de code à l'échelle d'un dépôt complet, sur des centaines de milliers de lignes, du lancement de la tâche jusqu'à la fusion finale, en utilisant la suite de tests existante comme garde-fou.
Concrètement : transformerL'architecture neuronale introduite en 2017 par Google, à la base de quasiment tous les LLM modernes. toutes les pages d'une application React 17 en React 19, ou migrer un backend Python 2 vers Python 3 sur un projet de 200 000 lignes, devient une commande unique. Le tout sous supervision humaine si on le souhaite, ou en mode totalement autonome avec validation finale.
Pour qui ? À quel prix ?
La fonctionnalité est en research preview, disponible uniquement sur les plans Claude Code Enterprise, Team et Max. Les utilisateurs Pro classiques n'y ont pas accès pour l'instant. C'est cohérent avec la philosophie d'Anthropic : tester d'abord avec des organisations capables d'absorber les éventuels accidents, puis élargir.
Anthropic a augmenté les rate limits de Claude Code pour accompagner la consommation explosive que ce mode entraîne. Comptez plusieurs millions de tokens pour une migration typique.
Fast Mode , 2,5 fois plus rapide, 3 fois moins cher
Le « Fast Mode » d'Opus 4.8 est probablement la nouveauté qui aura le plus d'impact sur les budgets des équipes IA. Petit rappel : le Fast Mode est une variante du modèle optimisée pour la vitesse, qui sacrifie un peu de qualité en échange d'un temps de réponse plus court.
Sur Opus 4.7, le Fast Mode coûtait environ 3 fois plus cher que le mode standard. Sur Opus 4.8, ce ratio s'effondre :
Le Fast Mode est désormais deux fois plus rapide qu'avant pour trois fois moins cher. Cela débloque deux usages économiquement impossibles auparavant :
Claude Opus 4.8 is incredible for thinking. But it is expensive. Opus 4.8 costs $5 per 1M input tokens and $25 per 1M output tokens. Kimi K2.6 is much cheaper for similar reasoning quality.
Cette critique est partagée par une partie de la communauté développeurs : à benchmark équivalent, des modèles chinois comme Kimi K2.6 ou DeepSeek V4 sont 5 à 10× moins chers. Anthropic mise sur la fiabilité et l'écosystème (Claude Code, Dynamic Workflows), pas sur le low cost.
- Les agents conversationnels en temps réel (chat client, support technique) où chaque seconde compte.
- Les boucles d'auto-correction dans Claude Code, où un agent peut tenter plusieurs hypothèses rapidement avant de retenir la bonne.
Le contrôle d'effort débarque sur claude.ai
Petite révolution UX côté grand public : un curseur de contrôle d'effort apparaît à côté du sélecteur de modèle sur claude.ai et Cowork. Trois niveaux :
xhigh dans Claude Code.L'idée : laisser l'utilisateur arbitrer entre vitesse et qualité, plutôt que d'imposer un compromis figé. Cette fonctionnalité est disponible sur tous les plans, y compris gratuits avec quotas.
À noter : sur les niveaux supérieurs, le modèle consomme davantage de tokens, ce qui peut épuiser plus vite votre quota mensuel sur Claude Pro. Pour les utilisateurs intensifs, prévoyez le plan Max ou un usage API.
Une nouveauté discrète mais majeure pour les développeurs
Si vous intégrez Claude dans une application via l'API, prenez deux minutes pour lire cette section. Anthropic a modifié un détail technique qui change beaucoup de choses pour les agents complexes.
Jusqu'à présent, l'instruction système de Claude (le promptLes instructions ou questions écrites envoyées à un modèle d'IA pour obtenir une réponse. qui définit son rôle, ses contraintes, son ton) devait être passée avant le début de la conversation, et ne pouvait pas être modifiée en cours de route sans casser le cache de prompt (la mécanique qui rend les appels répétés moins chers).
Avec Opus 4.8, la Messages API accepte désormais des entrées système à l'intérieur du tableau de messages, à n'importe quel moment de la conversation.
Trois choses deviennent enfin possibles sans casser le prompt cache
, Mettre à jour les permissions d'un agent en cours de session (autoriser l'accès à un nouveau fichier).
, Ajuster le budget de tokens restant ou les contraintes de format en cours de route.
, Changer le contexte d'environnement (passer de dev à prod) sans repartir de zéro.
C'est la cerise sur le gâteau pour qui construit des agents IA en Python ou TypeScript au-dessus de Claude.
Tarifs Claude Opus 4.8 : combien ça coûte ?
Récap clair au 28 mai 2026 :
À titre de comparaison, GPT-5.5 d'OpenAI est facturé 5 $ / 30 $ par million de tokens, et Gemini 3.5 Flash de Google à environ 0,30 $ / 2,50 $. Opus reste le plus cher du trio sur l'output, mais l'écart se resserre depuis dix-huit mois.
Opus 4.8 face à GPT-5.5 et Gemini 3.5 Flash
Comment Opus 4.8 se positionne face à ses concurrents ? Voici notre lecture synthétique, à partir des benchmarks publiés et des retours partenaires.
Là où Opus 4.8 prend la tête
- Codage agentique complexe et migrations de codebase. Dynamic Workflows + aptitude à des sessions très longues placent Opus 4.8 devant la concurrence sur les projets de plus de 100 000 lignes.
- Travail juridique et financier. Anthropic met en avant des records sur Legal Agent Benchmark (« premier modèle à dépasser 10 % sur le standard all-pass ») et sur Finance Agent v2. CoCounsel Legal (Thomson Reuters) et Hebbia le confirment.
- Agent navigateur. 84 % sur Online-Mind2Web, contre des scores plus bas pour GPT-5.5 et Gemini.
- Honnêteté et signalement d'incertitudes. L'avantage qualitatif qui ressort le plus dans les retours partenaires.
Là où la concurrence reste devant
- Coût par requête sur les usages simples. Gemini 3.5 Flash reste 5 à 10 fois moins cher sur les tâches courtes (rédaction, résumé, traduction). Pour un chatbot grand public à fort volume, le calcul économique penche encore vers Google.
- Latence sur les tâches courtes. GPT-5.5 conserve un avantage marginal sur la première seconde de réponse.
- Multimodalité native. Gemini reste plus performant sur l'analyse de très grandes vidéos ou de gros documents PDF illustrés.
En résumé
Si votre cas d'usage tourne autour du code, des agents autonomes, des analyses longues ou des workflows juridiques / financiers, Opus 4.8 est aujourd'hui le meilleur choix du marché. Pour des usages bureautiques quotidiens à fort volume, Gemini 3.5 Flash reste imbattable sur le rapport qualité / prix. GPT-5.5 reste le plus polyvalent pour qui cherche un équilibre toutes catégories. Notre comparatif détaillé des quatre grandes IA en 2026 creuse chaque dimension.
Claude Mythos en embuscade
Anthropic profite de cette annonce pour teaser son prochain palier.
Lecture : Claude Mythos arrivera vraisemblablement au cours de l'été 2026, probablement avant la conférence Anthropic prévue à l'automne. Sa première vocation officielle est la cybersécurité offensive et défensive, terrain qui nécessite des barrières techniques particulières pour éviter les usages malveillants. Anthropic suit un schéma qu'OpenAI avait popularisé avec GPT-5 : préversion fermée d'abord, ouverture progressive ensuite.
Pour qui suit l'écosystème des grandes IA américaines, c'est un signal clair : la prochaine vague va arriver vite. Anthropic ne compte pas laisser GPT-5.5 ou Gemini 3.5 Pro (juin) prendre seuls la tête sur le segment ultra-haut de gamme.
Pour qui Opus 4.8 change vraiment la donne ?
Plutôt que de répondre « tout le monde », voici un découpage par profil.
Comment activer Opus 4.8 dès aujourd'hui
Trois cas de figure.
Sur claude.ai
Le sélecteur de modèle, en haut à gauche, propose « Claude Opus 4.8 » dès le 28 mai 2026. Pas besoin de bascule manuelle pour les utilisateurs Pro et Max : c'est le nouveau modèle par défaut. Si vous voyez encore « Opus 4.7 », rafraîchissez l'onglet. Le curseur de contrôle d'effort apparaît juste à droite.
Dans Claude Code
Si Claude Code est déjà installé, la mise à jour est automatique au prochain lancement. Pour vérifier la version : claude --version dans votre terminal. Version minimale compatible : 2.0.6. Pour tester Dynamic Workflows (Max ou Enterprise) : claude dynamic-workflow.
Via l'API Anthropic
L'identifiant à utiliser est claude-opus-4-8. Exemple minimaliste en Python :
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[
{"role": "user", "content": "Explique-moi Dynamic Workflows en 3 lignes."}
]
)
print(response.content[0].text)
Aucun changement de code nécessaire si vous étiez sur claude-opus-4-7 : il suffit de mettre à jour la chaîne du modèle.
Une cadence qui interroge le rythme du marché
Quarante-et-un jours entre Opus 4.7 et Opus 4.8. Six mois plus tôt, Anthropic livrait une version Opus par trimestre. À ce rythme, la famille Opus pourrait connaître trois à quatre versions par an en 2026.
Pour les équipes IA en entreprise, la cadence devient un défi : faut-il refaire ses évaluations à chaque sortie ? Anthropic répond en partie en publiant des System Cards détaillés à chaque release.
Pour les développeurs d'agents, la rapidité est une bonne nouvelle : les défauts identifiés sont corrigés vite. Mais elle impose une discipline de versioning : épingler claude-opus-4-7 plutôt que d'utiliser claude-opus-latest en production, le temps de valider les régressions sur ses propres tests.
Pour le grand public, la cadence est largement transparente, mais elle traduit une compétition technologique d'une intensité inédite. À la fin du printemps 2026, OpenAI, Anthropic et Google publient en moyenne une mise à jour majeure par mois, ce qui n'avait jamais été le cas depuis l'arrivée de ChatGPT en novembre 2022.
À surveiller dans les prochaines semaines : la sortie de Claude Mythos (semaines à venir d'après Anthropic), l'arrivée de Gemini 3.5 Pro (juin annoncé par Google) et la prochaine itération de GPT-5.5 chez OpenAI. NewsIA suit chaque sortie majeure dans sa rubrique Actualités IA.
- Anthropic , Introducing Claude Opus 4.8 (annonce officielle, 28 mai 2026)
- Anthropic , Claude Opus 4.8 System Card (évaluations détaillées et alignement)
- Anthropic , Introducing Dynamic Workflows in Claude Code
- TechCrunch , Anthropic releases Opus 4.8 with new dynamic workflow tool
- 9to5Mac , Anthropic upgrades Claude with new Opus 4.8 model
- ZDNet , Anthropic launches Opus 4.8 with honesty as its killer feature
- Reuters , Anthropic to roll out Claude Mythos in coming weeks, launches Opus 4.8
Questions fréquentes
- Quand sort Claude Opus 4.8 ?
- Claude Opus 4.8 est sorti le jeudi 28 mai 2026, disponible immédiatement sur claude.ai, dans Claude Code, sur l'app Cowork et via l'API Anthropic (identifiant claude-opus-4-8).
- Combien coûte Claude Opus 4.8 ?
- Le prix de base est inchangé par rapport à Opus 4.7 : 5 $ par million de tokens en entrée, 25 $ en sortie via l'API. Côté grand public, Claude Pro à 20 $/mois et Claude Max à 100 $/mois donnent accès à Opus 4.8. Le Fast Mode coûte 10 $ / 50 $ par million de tokens, soit trois fois moins cher qu'auparavant.
- Quelle est la différence entre Opus 4.7 et Opus 4.8 ?
- Opus 4.8 améliore le codage agentique (+5 pts sur SWE Bench Pro), l'usage ordinateur (+1,1 pt sur OSWorld-Verified), les tâches de bureau (+137 pts) et le raisonnement avec outils (+3,2 pts). Il affiche surtout quatre fois moins de bugs non signalés dans le code qu'il écrit. Anthropic ajoute Dynamic Workflows dans Claude Code, un Fast Mode 3 fois moins cher et un contrôle d'effort sur claude.ai.
- Qu'est-ce que les Dynamic Workflows de Claude Code ?
- Les Dynamic Workflows sont une fonctionnalité de Claude Code disponible en research preview sur les plans Enterprise, Team et Max. Elles permettent à Claude Opus 4.8 de planifier puis d'exécuter des centaines de sous-agents en parallèle dans une seule session, par exemple pour mener une migration de base de code à l'échelle d'un dépôt complet (200 000+ lignes) de bout en bout, avec la suite de tests existante comme garde-fou.
- Faut-il payer plus pour utiliser le Fast Mode d'Opus 4.8 ?
- Oui, le Fast Mode coûte deux fois plus cher que le mode standard à la requête (10 $ / 50 $ contre 5 $ / 25 $ par million de tokens via l'API). Mais il est 2,5 fois plus rapide et désormais trois fois moins cher que le Fast Mode d'Opus 4.7. Pour des usages temps réel (chat client, support, boucles d'auto-correction), il est rentable. Pour des usages où la latence n'est pas critique, le mode standard reste plus économique.
- Opus 4.8 est-il meilleur que GPT-5.5 d'OpenAI ?
- Sur le codage agentique de grande échelle, les agents navigateurs (Online-Mind2Web 84 %), le travail juridique et l'analyse financière long-format, Opus 4.8 prend la tête. GPT-5.5 reste meilleur sur la latence courte et la polyvalence générale. Gemini 3.5 Flash de Google reste imbattable sur le coût des tâches simples à fort volume. Notre comparatif détaillé creuse chaque dimension.
- Quand sortira Claude Mythos, le prochain modèle d'Anthropic ?
- Anthropic annonce que Claude Mythos sera disponible pour l'ensemble de ses clients dans les semaines à venir, soit vraisemblablement au cours de l'été 2026. Le modèle est déjà utilisé en préversion fermée (Project Glasswing) par quelques organisations spécialisées en cybersécurité. Sa sortie générale dépend de la finalisation de garde-fous cyber renforcés.
Source : www.anthropic.com


