Indice Souver de benchmarks

Un indice comparable. 34 évaluations documentées.

L’indice compare les six modèles sur trois benchmarks publics communs. Une matrice étendue conserve les 34 évaluations disponibles sur le code, les agents, le raisonnement et le travail réel, sans mélanger des cohortes incomplètes dans la note principale.

Indice / 100moyenne des 3 scores communs, chacun normalisé sur le meilleur résultat publié

Comparatif

Six modèles, le même échantillon comparable.

Les offres indiquent le périmètre étudié par Souver, pas une promesse de disponibilité publique.

97,9Indice / 10030 résultats publics
TB 2.195,3
GPQA98,4
HLE100,0
Non souverain

Référence propriétaire externe, non proposée dans les offres Souver.

96,2Indice / 10032 résultats publics
TB 2.1100,0
GPQA100,0
HLE88,6
Non souverain

Référence propriétaire externe, non proposée dans les offres Souver.

Souver Frontière · Souver Contrôle

92,6Indice / 10028 résultats publics
TB 2.197,5
GPQA98,4
HLE81,8
Souverain

Modèle Qwen Max de 2,4 T de paramètres, publié le 3 août 2026.

GLM 5.2Souver

Souver Essentiel · Souver Frontière · Souver Contrôle

86,0Indice / 1009 résultats publics
TB 2.187,7
GPQA95,1
HLE75,2
Souverain

Modèle retenu pour l’offre Essentiel, également étudié pour Frontière et Contrôle.

Souver Frontière · Souver Contrôle

84,7Indice / 1009 résultats publics
TB 2.188,6
GPQA96,5
HLE69,0
Souverain

Modèle à poids ouverts étudié pour les environnements mutualisés ou dédiés sur devis.

53,5Indice / 1009 résultats publics
TB 2.157,0
GPQA79,5
HLE24,0
Souverain

Modèle Mistral généraliste le mieux classé dans la cohorte publique retenue.

Chaque indice porte sur les mêmes 3 benchmarks. Les compteurs de résultats publics — de 9 à 32 selon le modèle — décrivent uniquement la profondeur de la matrice documentaire étendue de 34 évaluations ; ils ne modifient pas la note.

Calcul détaillé

Chaque donnée utilisée, modèle par modèle.

1. Trois benchmarks communs

Terminal-Bench 2.1, GPQA Diamond et Humanity’s Last Exam sont publiés pour les six modèles. Eux seuls composent l’indice comparable.

2. Normalisation par benchmark

Le meilleur résultat publié parmi les six modèles vaut 100. Les autres conservent leur proportion. AA-Omniscience est d’abord ramené de −100…100 vers 0…100.

3. Moyenne avec maximum théorique à 100

Les trois scores normalisés ont le même poids. Un modèle qui serait premier sur les trois obtiendrait 100. La matrice de 34 évaluations reste séparée pour ne pas avantager les publications les plus larges.

Faites glisser la matrice pour comparer →

BenchmarkClaude Fable 5indice 97,9 · 30 résultats publicsGPT-5.6 Solindice 96,2 · 32 résultats publicsQwen3.8 Maxindice 92,6 · 28 résultats publicsGLM 5.2indice 86,0 · 9 résultats publicsDeepSeek V4 Flash 0731indice 84,7 · 9 résultats publicsMistral Medium 3.5indice 53,5 · 9 résultats publics
Socle indépendant · 9 benchmarksNeuf évaluations communes du snapshot Artificial Analysis v4.1, de GDPval-AA à AA-LCR.
GDPval-AA v2 Tâches de travail économiquement utiles et livrables professionnels.62,2100,0 / 10061,699,0 / 10050,581,2 / 10052,985,0 / 10021,634,7 / 100
τ³-Banking Usage agentique d’outils sur des scénarios bancaires multi-étapes.26,881,2 / 10033,0100,0 / 10026,881,2 / 10031,194,2 / 10014,443,6 / 100
Terminal-Bench 2.1 Résolution de tâches réelles dans un terminal et un environnement logiciel.84,695,3 / 10088,8100,0 / 10086,697,5 / 10077,987,7 / 10078,788,6 / 10050,657,0 / 100
SciCode Implémentation de problèmes de programmation scientifique.60,2100,0 / 10056,193,2 / 10050,583,9 / 10049,982,9 / 10039,665,8 / 100
Humanity’s Last Exam Connaissances et raisonnement sur des problèmes difficiles et multidisciplinaires.53,3100,0 / 10047,288,6 / 10043,681,8 / 10040,175,2 / 10036,869,0 / 10012,824,0 / 100
GPQA Diamond Raisonnement scientifique sur des questions de niveau expert.92,698,4 / 10094,1100,0 / 10092,698,4 / 10089,595,1 / 10090,896,5 / 10074,879,5 / 100
CritPt Résolution de problèmes avancés de physique.28,688,5 / 10032,3100,0 / 10020,964,7 / 10016,651,4 / 1000,00,0 / 100
AA-Omniscience Fiabilité des connaissances et pénalisation des hallucinations, sur une échelle de −100 à 100.40,2100,0 / 10021,786,8 / 1004,074,2 / 100-15,760,1 / 100-36,345,4 / 100
AA-LCR Raisonnement sur des contextes longs.70,095,0 / 10073,7100,0 / 10071,396,7 / 10065,789,1 / 10061,082,8 / 100
Extension code et agents · 25 benchmarksVingt-cinq tests bornés supplémentaires publiés par Qwen pour Qwen3.8 Max, Claude Fable 5 et GPT-5.6 Sol.
SWE-bench Pro Correction agentique de dépôts logiciels réels.80,0100,0 / 10064,680,7 / 10067,784,6 / 100
DeepSWE 1.1 Tâches d’ingénierie logicielle longues et complexes.70,095,9 / 10073,0100,0 / 10056,677,5 / 100
FrontierSWE Problèmes logiciels de niveau frontière.88,8100,0 / 10073,582,8 / 100
MLS-Bench-Lite Ingénierie de systèmes de machine learning.49,9100,0 / 10046,292,6 / 10041,082,2 / 100
PaperBench Reproduction de résultats de recherche à partir d’un article.88,895,5 / 10090,597,3 / 10093,0100,0 / 100
AndroidBench Développement et modification d’applications Android.84,5100,0 / 10074,087,6 / 10075,188,9 / 100
QwenSWEBench Tâches agentiques de maintenance logicielle.86,3100,0 / 10073,585,2 / 10080,793,5 / 100
QwenQoderBench Production de code dans un environnement outillé.63,1100,0 / 10053,885,3 / 10058,492,6 / 100
CoWorkBench Travail collaboratif multi-étapes sur des livrables.75,9100,0 / 10071,594,2 / 10074,898,6 / 100
WorkSpaceBench Navigation et action dans des espaces de travail complexes.68,7100,0 / 10065,695,5 / 10067,798,5 / 100
JobBench Tâches représentatives d’activités professionnelles.57,4100,0 / 10045,479,1 / 10053,493,0 / 100
SkillsBench Activation et combinaison de compétences outillées.70,996,5 / 10073,5100,0 / 10070,295,5 / 100
Agents’ Last Exam · score Résolution agentique de tâches longues ; composante score publiée.53,6100,0 / 10052,497,8 / 100
Automation-Bench · Pass@1 Automatisation de workflows avec vérification d’exécution.29,198,0 / 10029,7100,0 / 10027,391,9 / 100
Toolathlon Verified · Pass@1 Sélection et enchaînement fiable d’outils.77,9100,0 / 10074,996,1 / 10072,593,1 / 100
WideSearch Recherche large et synthèse multi-source.81,299,1 / 10081,9100,0 / 100
HLE avec outils Humanity’s Last Exam avec accès aux outils.64,5100,0 / 10058,089,9 / 10056,287,1 / 100
IFBench Respect d’instructions détaillées et contraintes de sortie.63,576,7 / 10072,787,8 / 10082,8100,0 / 100
$OneMillion-Bench · expert Résolution de tâches expertes à forte valeur économique.55,9100,0 / 10053,896,2 / 10052,593,9 / 100
HealthBench Raisonnement et qualité de réponse en santé.55,391,9 / 10060,2100,0 / 100
PLawBench Raisonnement juridique et analyse de documents.70,295,9 / 10072,398,8 / 10073,2100,0 / 100
PRBench-Legal Production professionnelle dans le domaine juridique.57,6100,0 / 10057,6100,0 / 10057,6100,0 / 100
PRBench-Finance Production professionnelle dans le domaine financier.55,895,7 / 10055,595,2 / 10058,3100,0 / 100
MRCR v2 256K · 8 needles Récupération d’informations multiples en contexte long.93,8100,0 / 10092,999,0 / 100
LongBench v2 Compréhension et raisonnement sur de longs contextes.67,1100,0 / 10066,398,8 / 100

Le billet Qwen publie aussi 55 benchmarks multimodaux, bureautiques, visuels et vidéo. Ils restent hors de cet indice textuel et agentique, tout comme deux scores Elo sans borne fixe et une ligne sans second modèle comparable. Ils demeurent consultables dans la source officielle.

GLM 5.2 · Souver Max face à Mistral

+5,8 %

de score qualité par euro dans ce calcul

Le coût du token ne raconte pas tout.

Cet encart économique séparé reprend la note stricte sur les 9 benchmarks Artificial Analysis. GLM 5.2 obtient 53,3 points pour 3,99 € par million de tokens avec Souver Max, soit 13,36 points par euro. Mistral Medium 3.5 obtient 34,1 points pour 2,70 €, soit 12,63. Le ratio GLM est donc supérieur de 5,8 %.

L’enjeu humain est plus large : un résultat plus robuste au premier passage peut réduire les reformulations, les reprises, les vérifications répétées et les changements de contexte qui créent de la fatigue. Ce gain n’est pas inclus dans le pourcentage ci-dessus ; il doit être suivi avec le taux de réussite au premier passage, le nombre d’itérations et le temps jusqu’à validation.

Lecture et limites

Un repère public, pas un verdict universel.

L’indice principal utilise volontairement les trois mêmes benchmarks pour les six modèles. Le maximum théorique est 100, atteint seulement par un modèle qui serait premier sur chaque test. Les différences de couverture concernent la matrice étendue, pas cette note comparable.

Le socle GLM 5.2, DeepSeek V4 Flash, Mistral Medium 3.5, Claude Fable 5 et GPT-5.6 Sol vient du snapshot indépendant Artificial Analysis v4.1. L’extension Qwen3.8 est un tableau publié par Qwen et compare Qwen3.8 Max à Claude Fable 5 et GPT-5.6 Sol. Les 25 tests de cette extension restent visibles mais n’entrent pas dans l’indice, car ils ne couvrent pas les six modèles avec un protocole commun.

Qwen annonce l’ouverture des poids de Qwen3.8 Max après la publication. La colonne souveraineté décrit la possibilité d’une exécution sous contrôle Souver ; elle ne promet pas une offre activable immédiatement.