Anthropic
Variante mesurée par Artificial Analysis : effort maximal avec repli par défaut vers Claude Opus 5 en cas de refus.
Indice Souver de benchmarks
L’indice compare quatre modèles, un par laboratoire, sur trois benchmarks publics communs. Une matrice étendue conserve les 11 évaluations disponibles sur le terminal, les agents, le raisonnement et le travail réel, sans mélanger des cohortes incomplètes dans la note principale.
Comparatif
Les offres indiquent le périmètre étudié par Souver, pas une promesse de disponibilité publique.
Anthropic
Variante mesurée par Artificial Analysis : effort maximal avec repli par défaut vers Claude Opus 5 en cas de refus.
OpenAI
Variante mesurée par Artificial Analysis : effort maximal.
DeepSeek · Souver Frontière
Modèle 552B (8B actifs) étudié pour l’offre Frontière. Artificial Analysis ne l’a pas encore mesuré sur Terminal-Bench 2.1 ni GPQA Diamond : ces deux valeurs viennent de la fiche modèle DeepSeek.
Zhipu AI · Souver Frontière
Modèle 320B (18B actifs) étudié pour l’offre Frontière ; disponibilité et dimensionnement confirmés sur devis, non servi dans Essentiel à ce jour.
| Modèle | Indice / 100 | TB 2.1normalisé / 100 | GPQAnormalisé / 100 | HLEnormalisé / 100 | Souveraineté |
|---|---|---|---|---|---|
Anthropic Variante mesurée par Artificial Analysis : effort maximal avec repli par défaut vers Claude Opus 5 en cas de refus. | 99,211 résultats publics | 100,0 | 97,5 | 100,0 | Non souverain API propriétaire américaine, poids fermés. |
OpenAI Variante mesurée par Artificial Analysis : effort maximal. | 96,411 résultats publics | 96,7 | 100,0 | 92,6 | Non souverain API propriétaire américaine, poids fermés. |
DeepSeek V4.1 FlashSouver DeepSeek · Souver Frontière Modèle 552B (8B actifs) étudié pour l’offre Frontière. Artificial Analysis ne l’a pas encore mesuré sur Terminal-Bench 2.1 ni GPQA Diamond : ces deux valeurs viennent de la fiche modèle DeepSeek. | 86,710 résultats publics | 99,1† | 94,6† | 66,3 | Souverain Poids ouverts (licence MIT), exécutables par Souver sur une infrastructure française éligible. |
GLM 5.3 FlashSouver Zhipu AI · Souver Frontière Modèle 320B (18B actifs) étudié pour l’offre Frontière ; disponibilité et dimensionnement confirmés sur devis, non servi dans Essentiel à ce jour. | 84,911 résultats publics | 92,2 | 94,9 | 67,5 | Souverain Poids ouverts (licence MIT), exécutables par Souver sur une infrastructure française éligible. |
Chaque indice porte sur les mêmes 3 benchmarks. Les compteurs de résultats publics — de 10 à 11 selon le modèle — décrivent uniquement la profondeur de la matrice documentaire étendue de 11 évaluations ; ils ne modifient pas la note. † signale une valeur publiée par le laboratoire lorsque Artificial Analysis n’a pas encore mesuré le modèle sur ce benchmark.
Calcul détaillé
1. Trois benchmarks communs
Terminal-Bench 2.1, GPQA Diamond et Humanity’s Last Exam (sans outils) sont disponibles pour les quatre modèles. Eux seuls composent l’indice comparable. Quand Artificial Analysis n’a pas encore mesuré un modèle sur l’un d’eux, la valeur publiée par le laboratoire est utilisée et marquée †.
2. Normalisation par benchmark
Le meilleur résultat publié parmi les quatre modèles vaut 100. Les autres conservent leur proportion. AA-Omniscience est d’abord ramené de −100…100 vers 0…100.
3. Moyenne avec maximum théorique à 100
Les trois scores normalisés ont le même poids. Un modèle qui serait premier sur les trois obtiendrait 100. La matrice de 11 évaluations reste séparée pour ne pas avantager les publications les plus larges.
Faites glisser la matrice pour comparer →
| Benchmark | Claude Fable 5.1Anthropic · indice 99,2 · 11 résultats publics | GPT-6 AstraOpenAI · indice 96,4 · 11 résultats publics | DeepSeek V4.1 FlashDeepSeek · indice 86,7 · 10 résultats publics | GLM 5.3 FlashZhipu AI · indice 84,9 · 11 résultats publics |
|---|---|---|---|---|
| Socle indépendant · 10 benchmarksÉvaluations mesurées par Artificial Analysis, relevées le 23 septembre 2026, de Terminal-Bench 2.1 à AA-LCR. | ||||
| Terminal-Bench 2.1 Résolution de tâches réelles dans un terminal et un environnement logiciel (89 tâches). | 91,4100,0 / 100 | 88,496,7 / 100 | 90,6†99,1 / 100 | 84,392,2 / 100 |
| Terminal-Bench 4.0 Version plus difficile du benchmark terminal (66 tâches), introduite dans l’index AA v4.3. | 52,088,0 / 100 | 59,1100,0 / 100 | 26,845,3 / 100 | 32,855,5 / 100 |
| GPQA Diamond Raisonnement scientifique sur des questions de niveau expert. | 93,797,5 / 100 | 96,1100,0 / 100 | 90,9†94,6 / 100 | 91,294,9 / 100 |
| Humanity’s Last Exam Connaissances et raisonnement sur des problèmes difficiles, sans outils, sous-ensemble texte. | 59,1100,0 / 100 | 54,792,6 / 100 | 39,266,3 / 100 | 39,967,5 / 100 |
| GDPval-AA v2.1 · Elo Tâches de travail économiquement utiles ; classement Elo par comparaisons à l’aveugle. | 1 734,7100,0 / 100 | 1 541,988,9 / 100 | 1 600,092,2 / 100 | 1 640,894,6 / 100 |
| τ³-Banking Usage agentique d’outils sur des scénarios bancaires multi-étapes. | 47,2100,0 / 100 | 41,487,7 / 100 | non publié | 47,2100,0 / 100 |
| SciCode Implémentation de problèmes de programmation scientifique. | 63,1100,0 / 100 | 56,589,5 / 100 | 51,982,3 / 100 | 51,681,8 / 100 |
| CritPt Résolution de problèmes avancés de physique. | 29,793,7 / 100 | 31,7100,0 / 100 | 14,345,1 / 100 | 15,448,6 / 100 |
| AA-Omniscience Fiabilité des connaissances et pénalisation des hallucinations, sur une échelle de −100 à 100. | 43,5100,0 / 100 | 43,499,9 / 100 | -5,366,0 / 100 | 7,574,9 / 100 |
| AA-LCR v1.1 Raisonnement sur des contextes longs. | 85,3100,0 / 100 | 80,794,6 / 100 | 84,098,5 / 100 | 80,093,8 / 100 |
| Publications des laboratoires · 1 benchmarkMesure publiée par chaque laboratoire dans son annonce ou sa fiche modèle ; protocoles non harmonisés. | ||||
| Humanity’s Last Exam · avec outils HLE avec recherche et exécution de code ; chaque laboratoire publie sa propre mesure, harnais et juge non harmonisés. | 65,0†100,0 / 100 | 57,2†88,0 / 100 | 63,9†98,3 / 100 | 55,3†85,1 / 100 |
Artificial Analysis a remplacé Terminal-Bench 2.1 et GPQA Diamond par Terminal-Bench 4.0 dans son Intelligence Index v4.3 ; les modèles publiés depuis septembre 2026 n’y sont plus systématiquement mesurés sur ces deux tests. Terminal-Bench 4.0 figure dans la matrice mais n’entre pas encore dans l’indice, afin de conserver une note comparable avec les relevés précédents. Le changement de socle sera fait pour les quatre modèles en même temps, jamais modèle par modèle.
GLM 5.2 face à Mistral Medium 3.5 · Souver Max
53,3 / 34,1
points sur les 9 benchmarks du snapshot v4.1
Cet encart économique séparé porte sur l’offre Essentiel et reprend la note stricte sur les 9 benchmarks du snapshot Artificial Analysis v4.1 du 3 août 2026 : GLM 5.2 obtient 53,3 points, Mistral Medium 3.5 en obtient 34,1. Avec la formule Max, le tarif PAYG par million de tokens est de 2,34 € HT en entrée et 7,15 € HT en sortie pour GLM 5.2, contre 1,95 € HT et 9,75 € HT pour Mistral Medium 3.5. La grille complète, par formule et par type de jeton, est publiée sur la page Essentiel.
L’enjeu humain est plus large : un résultat plus robuste au premier passage peut réduire les reformulations, les reprises, les vérifications répétées et les changements de contexte qui créent de la fatigue. Ce gain n’est pas inclus dans ces chiffres ; il doit être suivi avec le taux de réussite au premier passage, le nombre d’itérations et le temps jusqu’à validation.
Lecture et limites
L’indice principal utilise volontairement les trois mêmes benchmarks pour les quatre modèles. Le maximum théorique est 100, atteint seulement par un modèle qui serait premier sur chaque test. Les différences de couverture concernent la matrice étendue, pas cette note comparable.
Le socle vient du relevé indépendant Artificial Analysis du 23 septembre 2026, pour la variante que ce site retient par défaut sur ses classements : Claude Fable 5.1 à effort maximal avec repli vers Claude Opus 5, GPT-6 Astra à effort maximal, GLM 5.3 Flash et DeepSeek V4.1 Flash en mode raisonnement à effort maximal. DeepSeek V4.1 Flash n’a pas encore été mesuré par Artificial Analysis sur Terminal-Bench 2.1 ni GPQA Diamond : sa fiche modèle fournit ces deux valeurs, signalées †. Humanity’s Last Exam avec outils est publié par chaque laboratoire avec son propre harnais et son propre juge ; il reste hors de l’indice.
Un modèle par laboratoire : GPT-6 Astra est le modèle de tête d’OpenAI, et « Astra » ne désigne aucun autre modèle public en 2026. GPT-6 Sol et GPT-6 Luna, sortis le 22 septembre 2026, n’ont pas de résultat public sur Terminal-Bench 2.1 ni GPQA Diamond à la date du relevé. DeepSeek V4.1 n’existe qu’en version Flash ; V4.1 Pro n’est pas publié.
La colonne souveraineté décrit la possibilité d’une exécution sous contrôle Souver, sur la base des licences de poids ouverts (MIT pour GLM 5.3 Flash et DeepSeek V4.1 Flash). Elle ne promet pas une offre activable immédiatement : ces deux modèles relèvent de l’offre Frontière, sur devis, et ne font pas partie du catalogue Essentiel.