Anthropic a lancé Claude Fable 5.1 et Claude Mythos 5.1 le 1er septembre, cinq semaines après Opus 5. Les deux modèles sont techniquement identiques et ne se distinguent réellement que par leurs garde-fous, Mythos bénéficiant d'un cadre allégé pour la recherche en cybersécurité et en sciences du vivant. Le tarif au token ne bouge pas, avec 10 dollars par million en entrée et 50 en sortie, mais la lecture du cache passe de 1 à 0,25 dollar par million, ce qui a impact concrètement sur l'ensemble du calcul économique pour les agents qui relisent en boucle le même contexte.
Fable 5.1 devance Opus 5 sur presque toutes les mesures d'Anthropic

Sur Terminal-Bench 4.0, qui note le codage agentique, Fable 5.1 obtient 55,8 % quand Opus 5 plafonne à 52,3 % et Fable 5 à 42 %. Mythos 5.1 et ses garde-fous allégés montent à 60,9 %. Le même delta sur le travail intellectuel mesuré par GDPval-AA v2, avec 1853 points contre 1824, sur CursorBench 3.2 où le nouveau venu passe de 70 à 73,4 %, et sur AutomationBench qui suit l'automatisation des processus métier et grimpe de 26,9 à 31,4 %. La progression la plus large concerne la recherche scientifique agentique, dont le score double presque par rapport à Fable 5 en passant de 24,7 à 52,6 %.
Ces résultats sortent des évaluations maison d'Anthropic, colonne GPT-5.6 Sol comprise, créditée de 37,3 % en codage agentique et de 1711 points en travail intellectuel. Les scores agentiques dépendent énormément du harnais, des outils fournis et du niveau d'effort concédé à chaque modèle, donc nous prenons le classement inter-laboratoires avec des pincettes tant qu'un test identique externe ne confirme ou ne l'infirme. L'écart interne entre Fable 5 et Fable 5.1 se lit en revanche sans réserve Nous avions décrit le même resserrement au moment de la sortie d'Opus 5 fin juillet.

La lecture du cache baisse de 75 %, la facture globale d'environ un quart
Anthropic chiffre l'économie totale à environ 25 % sur une charge de travail courante et jusqu'à 45 % sur les usages fortement agentiques, presque uniquement grâce au cache. Le modèle conserve par ailleurs sa fenêtre d'un million de tokens, sa sortie maximale de 128 000 tokens et sa réflexion adaptative permanente, il inaugure des contrôles d'usage des outils en bêta. Le prix restait le principal reproche fait à Fable 5 depuis son lancement de juin, un modèle très capable mais compliqué à justifier sur la durée face à un Opus 5 deux fois moins cher.
Ramp rapporte une exécution de 38 heures sans supervision

Dwight Temple, ingénieur en apprentissage automatique chez Ramp, décrit un travail autonome de 38 heures au terme duquel le modèle a identifié qu'un résultat antérieur relevait en réalité d'un artefact d'étiquetage. MongoDB évoque un prototype complexe bouclé en trois jours avec des boucles de vérification, Plaid une cartographie de flux traversant huit services, Red Hat l'identification correcte de la cause de chaque build cassé de son évaluation. Datadog le place devant Opus 5 pour l'analyse de causes racines sur incidents de production. Cognition, l'éditeur de Devin, a basculé son trafic Opus 5 vers Fable 5.1 le jour même du lancement.
Mythos 5.1 reste réservé aux organisations américaines
Mythos 5.1 n'est accessible qu'à un ensemble d'organisations basées aux États-Unis, via les programmes d'accès contrôlé en cybersécurité et en sciences du vivant, Anthropic indiquant se coordonner avec le gouvernement américain pour élargir la liste à d'autres partenaires domestiques puis internationaux. La restriction prolonge la séquence de juin, quand Fable 5 et Mythos 5 avaient été débranchés dans le monde entier au titre du contrôle des exportations. Fable 5.1 est en revanche disponible partout, sur Claude.ai, Claude Code, l'API sous l'identifiant claude-fable-5-1, ainsi que sur Amazon Bedrock, Google Cloud et Microsoft Azure. Anthropic revendique au passage 60 % de faux positifs en moins sur les requêtes de cybersécurité légitimes, un défaut qui pesait sur le confort d'usage des versions précédentes.

En un an, Anthropic a fait défiler Opus 4.8, Fable 5, Opus 5 et maintenant Fable 5.1, chaque palier rendant le précédent discutable en quelques semaines. Pour qui construit des agents par-dessus, cette cadence a un lourd impact autant sur les points remportés au Terminal-Bench, puisqu'elle oblige à réexaminer son arbitrage entre coût et capacité tous les deux mois.
