Indice Souver de benchmarks

Un indice comparable. 11 évaluations documentées.

L’indice compare quatre modèles, un par laboratoire, sur trois benchmarks publics communs. Une matrice étendue conserve les 11 évaluations disponibles sur le terminal, les agents, le raisonnement et le travail réel, sans mélanger des cohortes incomplètes dans la note principale.

Indice / 100moyenne des 3 scores communs, chacun normalisé sur le meilleur résultat publié

Comparatif

Quatre modèles, quatre laboratoires, le même échantillon comparable.

Les offres indiquent le périmètre étudié par Souver, pas une promesse de disponibilité publique.

99,2Indice / 10011 résultats publics
TB 2.1100,0
GPQA97,5
HLE100,0
Non souverain

Variante mesurée par Artificial Analysis : effort maximal avec repli par défaut vers Claude Opus 5 en cas de refus.

96,4Indice / 10011 résultats publics
TB 2.196,7
GPQA100,0
HLE92,6
Non souverain

Variante mesurée par Artificial Analysis : effort maximal.

DeepSeek · Souver Frontière

86,7Indice / 10010 résultats publics
TB 2.199,1†
GPQA94,6†
HLE66,3
Souverain

Modèle 552B (8B actifs) étudié pour l’offre Frontière. Artificial Analysis ne l’a pas encore mesuré sur Terminal-Bench 2.1 ni GPQA Diamond : ces deux valeurs viennent de la fiche modèle DeepSeek.

Zhipu AI · Souver Frontière

84,9Indice / 10011 résultats publics
TB 2.192,2
GPQA94,9
HLE67,5
Souverain

Modèle 320B (18B actifs) étudié pour l’offre Frontière ; disponibilité et dimensionnement confirmés sur devis, non servi dans Essentiel à ce jour.

Chaque indice porte sur les mêmes 3 benchmarks. Les compteurs de résultats publics — de 10 à 11 selon le modèle — décrivent uniquement la profondeur de la matrice documentaire étendue de 11 évaluations ; ils ne modifient pas la note. † signale une valeur publiée par le laboratoire lorsque Artificial Analysis n’a pas encore mesuré le modèle sur ce benchmark.

Calcul détaillé

Chaque donnée utilisée, modèle par modèle.

1. Trois benchmarks communs

Terminal-Bench 2.1, GPQA Diamond et Humanity’s Last Exam (sans outils) sont disponibles pour les quatre modèles. Eux seuls composent l’indice comparable. Quand Artificial Analysis n’a pas encore mesuré un modèle sur l’un d’eux, la valeur publiée par le laboratoire est utilisée et marquée †.

2. Normalisation par benchmark

Le meilleur résultat publié parmi les quatre modèles vaut 100. Les autres conservent leur proportion. AA-Omniscience est d’abord ramené de −100…100 vers 0…100.

3. Moyenne avec maximum théorique à 100

Les trois scores normalisés ont le même poids. Un modèle qui serait premier sur les trois obtiendrait 100. La matrice de 11 évaluations reste séparée pour ne pas avantager les publications les plus larges.

Faites glisser la matrice pour comparer →

BenchmarkClaude Fable 5.1Anthropic · indice 99,2 · 11 résultats publicsGPT-6 AstraOpenAI · indice 96,4 · 11 résultats publicsDeepSeek V4.1 FlashDeepSeek · indice 86,7 · 10 résultats publicsGLM 5.3 FlashZhipu AI · indice 84,9 · 11 résultats publics
Socle indépendant · 10 benchmarksÉvaluations mesurées par Artificial Analysis, relevées le 23 septembre 2026, de Terminal-Bench 2.1 à AA-LCR.
Terminal-Bench 2.1 Résolution de tâches réelles dans un terminal et un environnement logiciel (89 tâches).91,4100,0 / 10088,496,7 / 10090,6†99,1 / 10084,392,2 / 100
Terminal-Bench 4.0 Version plus difficile du benchmark terminal (66 tâches), introduite dans l’index AA v4.3.52,088,0 / 10059,1100,0 / 10026,845,3 / 10032,855,5 / 100
GPQA Diamond Raisonnement scientifique sur des questions de niveau expert.93,797,5 / 10096,1100,0 / 10090,9†94,6 / 10091,294,9 / 100
Humanity’s Last Exam Connaissances et raisonnement sur des problèmes difficiles, sans outils, sous-ensemble texte.59,1100,0 / 10054,792,6 / 10039,266,3 / 10039,967,5 / 100
GDPval-AA v2.1 · Elo Tâches de travail économiquement utiles ; classement Elo par comparaisons à l’aveugle.1 734,7100,0 / 1001 541,988,9 / 1001 600,092,2 / 1001 640,894,6 / 100
τ³-Banking Usage agentique d’outils sur des scénarios bancaires multi-étapes.47,2100,0 / 10041,487,7 / 100non publié47,2100,0 / 100
SciCode Implémentation de problèmes de programmation scientifique.63,1100,0 / 10056,589,5 / 10051,982,3 / 10051,681,8 / 100
CritPt Résolution de problèmes avancés de physique.29,793,7 / 10031,7100,0 / 10014,345,1 / 10015,448,6 / 100
AA-Omniscience Fiabilité des connaissances et pénalisation des hallucinations, sur une échelle de −100 à 100.43,5100,0 / 10043,499,9 / 100-5,366,0 / 1007,574,9 / 100
AA-LCR v1.1 Raisonnement sur des contextes longs.85,3100,0 / 10080,794,6 / 10084,098,5 / 10080,093,8 / 100
Publications des laboratoires · 1 benchmarkMesure publiée par chaque laboratoire dans son annonce ou sa fiche modèle ; protocoles non harmonisés.
Humanity’s Last Exam · avec outils HLE avec recherche et exécution de code ; chaque laboratoire publie sa propre mesure, harnais et juge non harmonisés.65,0†100,0 / 10057,2†88,0 / 10063,9†98,3 / 10055,3†85,1 / 100

Artificial Analysis a remplacé Terminal-Bench 2.1 et GPQA Diamond par Terminal-Bench 4.0 dans son Intelligence Index v4.3 ; les modèles publiés depuis septembre 2026 n’y sont plus systématiquement mesurés sur ces deux tests. Terminal-Bench 4.0 figure dans la matrice mais n’entre pas encore dans l’indice, afin de conserver une note comparable avec les relevés précédents. Le changement de socle sera fait pour les quatre modèles en même temps, jamais modèle par modèle.

GLM 5.2 face à Mistral Medium 3.5 · Souver Max

53,3 / 34,1

points sur les 9 benchmarks du snapshot v4.1

Le coût du token ne raconte pas tout.

Cet encart économique séparé porte sur l’offre Essentiel et reprend la note stricte sur les 9 benchmarks du snapshot Artificial Analysis v4.1 du 3 août 2026 : GLM 5.2 obtient 53,3 points, Mistral Medium 3.5 en obtient 34,1. Avec la formule Max, le tarif PAYG par million de tokens est de 2,34 € HT en entrée et 7,15 € HT en sortie pour GLM 5.2, contre 1,95 € HT et 9,75 € HT pour Mistral Medium 3.5. La grille complète, par formule et par type de jeton, est publiée sur la page Essentiel.

L’enjeu humain est plus large : un résultat plus robuste au premier passage peut réduire les reformulations, les reprises, les vérifications répétées et les changements de contexte qui créent de la fatigue. Ce gain n’est pas inclus dans ces chiffres ; il doit être suivi avec le taux de réussite au premier passage, le nombre d’itérations et le temps jusqu’à validation.

Lecture et limites

Un repère public, pas un verdict universel.

L’indice principal utilise volontairement les trois mêmes benchmarks pour les quatre modèles. Le maximum théorique est 100, atteint seulement par un modèle qui serait premier sur chaque test. Les différences de couverture concernent la matrice étendue, pas cette note comparable.

Le socle vient du relevé indépendant Artificial Analysis du 23 septembre 2026, pour la variante que ce site retient par défaut sur ses classements : Claude Fable 5.1 à effort maximal avec repli vers Claude Opus 5, GPT-6 Astra à effort maximal, GLM 5.3 Flash et DeepSeek V4.1 Flash en mode raisonnement à effort maximal. DeepSeek V4.1 Flash n’a pas encore été mesuré par Artificial Analysis sur Terminal-Bench 2.1 ni GPQA Diamond : sa fiche modèle fournit ces deux valeurs, signalées †. Humanity’s Last Exam avec outils est publié par chaque laboratoire avec son propre harnais et son propre juge ; il reste hors de l’indice.

Un modèle par laboratoire : GPT-6 Astra est le modèle de tête d’OpenAI, et « Astra » ne désigne aucun autre modèle public en 2026. GPT-6 Sol et GPT-6 Luna, sortis le 22 septembre 2026, n’ont pas de résultat public sur Terminal-Bench 2.1 ni GPQA Diamond à la date du relevé. DeepSeek V4.1 n’existe qu’en version Flash ; V4.1 Pro n’est pas publié.

La colonne souveraineté décrit la possibilité d’une exécution sous contrôle Souver, sur la base des licences de poids ouverts (MIT pour GLM 5.3 Flash et DeepSeek V4.1 Flash). Elle ne promet pas une offre activable immédiatement : ces deux modèles relèvent de l’offre Frontière, sur devis, et ne font pas partie du catalogue Essentiel.