Aperçu de la sortie de Claude Fable 5.1 et Claude Mythos 5.1
Claude Fable 5.1 et Claude Mythos 5.1 ont été publiés en tant que mises à jour de la ligne de modèles de la classe Mythos d’Anthropic, Claude Fable 5.1 marquant la première mise à jour de la classe Mythos depuis le lancement de Fable 5 le 9 juin. Anthropic a décrit les nouveaux modèles comme « les plus avancés au monde pour le travail de codage et de connaissance ». Les deux mises à jour portent le numéro de version 5.1 pour Fable et Mythos, faisant de 5.1 l’identifiant actuel de sortie pour ces familles de modèles.
Performance des benchmarks de Claude Fable 5.1
Sur le benchmark Terminal-Bench-Science 0.1, Claude Fable 5.1 a obtenu 52.6 %, par rapport à Fable 5 à 24.7 % et Opus 5 à 29.0 %. Sur Terminal-Bench 4.0, Claude Fable 5.1 a obtenu 55.8 %, comparé à Fable 5 à 42.0 % et Opus 5 à 52.3 %. Claude Fable 5.1 a plus que doublé le score de Fable 5 sur le benchmark Terminal-Bench-Science 0.1 et a dépassé les scores rapportés d’Opus 5 sur ces benchmarks. Anthropic a publié que Fable 5.1 bat désormais Opus 5 sur chaque benchmark qu’il a publié.
Mythos 5.1 a obtenu 60.9 % sur Terminal-Bench-Science 0.1, Anthropic notant que Mythos 5.1 avait moins de garanties et que l’écart de score reflétait des tâches que les garanties ont interceptées et redirigées vers Opus 4.8. Lors de l’Examen Final de l’Humanité, Claude Fable 5.1 a obtenu 60.9 % sans outils externes et 65.0 % avec outils. Anthropic a signalé que les résultats de Fable 5.1, sans outils et augmentés d’outils, étaient en avance sur Opus 5 lors de ce test.
Performance des benchmarks de Claude Fable 5.1
Lors du benchmark Terminal-Bench-Science 0.1, Claude Fable 5.1 a obtenu un score de 52.6 %, contre 24.7 % pour Fable 5 et 29.0 % pour Opus 5. Sur Terminal-Bench 4.0, Claude Fable 5.1 a obtenu un score de 55.8 %, comparé à 42.0 % pour Fable 5 et 52.3 % pour Opus 5. Claude Fable 5.1 a plus que doublé le score de Fable 5 sur Terminal-Bench-Science 0.1 et a battu Opus 5 sur ces benchmarks rapportés. Anthropic a publié que Fable 5.1 surpassait désormais Opus 5 sur chaque benchmark qu’il a publié.
Mythos 5.1 a obtenu un score de 60.9 % sur Terminal-Bench-Science 0.1, Anthropic notant que Mythos 5.1 avait moins de mesures de sécurité et que l’écart de score reflétait les tâches que les mesures de sécurité avaient interceptées et redirigées vers Opus 4.8. Lors de l’Examen Final de l’Humanité, Claude Fable 5.1 a obtenu 60.9 % sans outils externes et 65.0 % avec outils. Anthropic a rapporté que les résultats de Fable 5.1, que ce soit sans outils ou augmentés par des outils, étaient supérieurs à ceux d’Opus 5 sur ce test.
Claude Fable 5.1 a été lancé comme une mise à jour de la ligne de modèles de la classe Mythos d’Anthropic et représente la première mise à jour de cette classe depuis le lancement de Fable 5 le 9 juin. Anthropic a rapporté des résultats de benchmark montrant que Claude Fable 5.1 s’était amélioré de manière significative par rapport aux modèles précédents—plus que doublant Fable 5 sur Terminal-Bench-Science 0.1 et surpassant Opus 5 sur les benchmarks publiés—tandis qu’Anthropic a également présenté des résultats connexes de Mythos 5.1 et de l’Examen Final de l’Humanité.


