trade crypt

Claude Fable 5.1 bat Opus 5 sur les benchmarks

AccueilMarchésClaude Fable 5.1 bat Opus 5 sur les benchmarks

-

Aperçu de la sortie de Claude Fable 5.1 et Claude Mythos 5.1

Claude Fable 5.1 et Claude Mythos 5.1 ont été publiés en tant que mises à jour de la ligne de modèles de la classe Mythos d’Anthropic, Claude Fable 5.1 marquant la première mise à jour de la classe Mythos depuis le lancement de Fable 5 le 9 juin. Anthropic a décrit les nouveaux modèles comme « les plus avancés au monde pour le travail de codage et de connaissance ». Les deux mises à jour portent le numéro de version 5.1 pour Fable et Mythos, faisant de 5.1 l’identifiant actuel de sortie pour ces familles de modèles.

Performance des benchmarks de Claude Fable 5.1

Sur le benchmark Terminal-Bench-Science 0.1, Claude Fable 5.1 a obtenu 52.6 %, par rapport à Fable 5 à 24.7 % et Opus 5 à 29.0 %. Sur Terminal-Bench 4.0, Claude Fable 5.1 a obtenu 55.8 %, comparé à Fable 5 à 42.0 % et Opus 5 à 52.3 %. Claude Fable 5.1 a plus que doublé le score de Fable 5 sur le benchmark Terminal-Bench-Science 0.1 et a dépassé les scores rapportés d’Opus 5 sur ces benchmarks. Anthropic a publié que Fable 5.1 bat désormais Opus 5 sur chaque benchmark qu’il a publié.

Mythos 5.1 a obtenu 60.9 % sur Terminal-Bench-Science 0.1, Anthropic notant que Mythos 5.1 avait moins de garanties et que l’écart de score reflétait des tâches que les garanties ont interceptées et redirigées vers Opus 4.8. Lors de l’Examen Final de l’Humanité, Claude Fable 5.1 a obtenu 60.9 % sans outils externes et 65.0 % avec outils. Anthropic a signalé que les résultats de Fable 5.1, sans outils et augmentés d’outils, étaient en avance sur Opus 5 lors de ce test.

Performance des benchmarks de Claude Fable 5.1

Lors du benchmark Terminal-Bench-Science 0.1, Claude Fable 5.1 a obtenu un score de 52.6 %, contre 24.7 % pour Fable 5 et 29.0 % pour Opus 5. Sur Terminal-Bench 4.0, Claude Fable 5.1 a obtenu un score de 55.8 %, comparé à 42.0 % pour Fable 5 et 52.3 % pour Opus 5. Claude Fable 5.1 a plus que doublé le score de Fable 5 sur Terminal-Bench-Science 0.1 et a battu Opus 5 sur ces benchmarks rapportés. Anthropic a publié que Fable 5.1 surpassait désormais Opus 5 sur chaque benchmark qu’il a publié.

Mythos 5.1 a obtenu un score de 60.9 % sur Terminal-Bench-Science 0.1, Anthropic notant que Mythos 5.1 avait moins de mesures de sécurité et que l’écart de score reflétait les tâches que les mesures de sécurité avaient interceptées et redirigées vers Opus 4.8. Lors de l’Examen Final de l’Humanité, Claude Fable 5.1 a obtenu 60.9 % sans outils externes et 65.0 % avec outils. Anthropic a rapporté que les résultats de Fable 5.1, que ce soit sans outils ou augmentés par des outils, étaient supérieurs à ceux d’Opus 5 sur ce test.

Claude Fable 5.1 a été lancé comme une mise à jour de la ligne de modèles de la classe Mythos d’Anthropic et représente la première mise à jour de cette classe depuis le lancement de Fable 5 le 9 juin. Anthropic a rapporté des résultats de benchmark montrant que Claude Fable 5.1 s’était amélioré de manière significative par rapport aux modèles précédents—plus que doublant Fable 5 sur Terminal-Bench-Science 0.1 et surpassant Opus 5 sur les benchmarks publiés—tandis qu’Anthropic a également présenté des résultats connexes de Mythos 5.1 et de l’Examen Final de l’Humanité.

Ce site et ses articles ne fournissent aucun service de conseil en investissement au sens des réglementations en vigueur. Les informations publiées peuvent être incomplètes, obsolètes ou contenir des erreurs. L’auteur ne garantit ni l’exactitude, ni l’exhaustivité, ni l’actualité des informations présentées. L’utilisation de ces informations se fait sous l’entière responsabilité du lecteur. En aucun cas l’auteur ne pourra être tenu responsable de décisions financières prises sur la base du contenu publié sur ce site.
Crypto Fan
Crypto Fanhttps://calipsu.com
Calipsu.com se consacre à fournir des informations claires, fiables et accessibles sur les cryptomonnaies, la technologie blockchain et la finance décentralisée (DeFi). Sa mission est d’aider les lecteurs à mieux comprendre un écosystème en évolution rapide, souvent complexe, technique et mal compris. La plateforme couvre un large éventail de sujets, allant des principaux réseaux blockchain et actifs crypto aux protocoles DeFi, aux applications Web3 et aux tendances émergentes. Le site publie également des guides pratiques et des tutoriels qui expliquent le fonctionnement des outils décentralisés, tels que les portefeuilles, les mécanismes de staking, les protocoles de prêt et les pools de liquidité. Ces guides visent à décrire clairement les processus et les risques, afin d’aider les lecteurs à comprendre les mécanismes de la DeFi plutôt que d’encourager la participation.

LATEST POSTS

Prévision des prix de XRP : la croix de mort baissière teste 1,30 $

Prévision des prix de XRP : croix baissière près de 1,30 $, avec une résistance à 1,50 $–2,70 $ et un potentiel de hausse au-delà de 5 $ si les vents réglementaires s'apaisent.

Les jailbreaks d’IA et le désalignement des modèles révélés par le cadre de transparence d’OpenAI

Les jailbreaks d'IA et le désalignement des modèles révélés par le cadre de transparence d'OpenAI : six confessions, exemples et implications pour la sécurité.

Acheter des données de startups décédées pour la formation de l’IA et Grok

Un regard prudent sur l'achat de données de startups décédées pour la formation de l'IA, les discussions de SpaceXAI et les risques de confidentialité des données bancaires utilisées pour former Grok.

Ce que signifie l’indice crypto multi-actifs pour les conseillers

Découvrez comment un indice crypto multi-actifs aide les conseillers à diversifier au-delà du Bitcoin et de l'Ether face à l'évolution des dynamiques du marché.
trade crypt