Terminal-Bench 2.0 · résultats et limites de mesure

Résultats Souver Desktop sur Terminal-Bench 2.0

Dernière campagne : 39 tâches réussies sur les 89 officielles avec DeepSeek V4 Flash, soit 43,8 %. Retrouvez les 60 tâches exécutées, les 29 non exécutées, les cas neutralisés et la consommation mesurée, sans confondre des modèles ou protocoles différents.

Harbor · Terminal-Bench 2.0Historique 17/07/202689 tâches détaillées
Nouvelle mesure · septembre 2026 · cohorte sélectionnée de 60 tâches

39 tâches réussies sur 89

DeepSeek V4 Flash via Souver Desktop : 43,8 % sur les 89 tâches officielles, avec 39 PASS, 17 FAIL et 4 mesures neutralisées pour un incident d’infrastructure du vérificateur. 29 tâches n’ont pas été exécutées. Les neutralisations et les non-exécutions restent distinctes des échecs du modèle ; le dénominateur du score reste 89.

Couverture de la campagne

60/89 exécutées

17 FAIL, 4 neutralisées et 29 non exécutées, présentées séparément.

Septembre · DeepSeek V4 Flash

39/89 · 43,8 %

39 PASS. Aucun résultat n’est imputé aux tâches non exécutées.

Coût opérationnel conservateur

45,91 €

45,908 € incluant API et infrastructure. Estimation, pas facture débitée.

Méthode, consommation et provenance
Modèle demandé et retourné
deepseek-v4-flash-0731
Effort
Max non transmis : réglage archivé high, effort omis dans la requête HTTP.
Requêtes / crédits
2 467 / 10 935 262
Tokens entrée / dont cache / sortie
104 023 392 / 65 148 928 / 1 314 500
Durées cumulées agent + vérification
25 978 + 2 656 = 28 634 s (pas une durée murale)
Traçabilité
Reçu terminal agrégé, versions épinglées et mesures par tâche. Traces brutes non publiées.

Desktop 9922ff0a8c54b76fa53489ff68adcf5b3a25491d · App 167a0c21c92ba830db5e84d51400708b001cc53a · Harness f81872b413b83f65f4a0b7025ff2baa5554d3945

Source tb60-terminal-results.json · SHA256 61f08d56b84c4e97e76530aca6d81074ebc5594b2c9bbc4da8f2c19f17d2b3f4

Télécharger les 60 résultats et leurs mesures (JSON)
Les 60 tâches : verdicts, neutralisations et consommation
DeepSeek V4 Flash, septembre : 60 tâches exécutées sur les 89 officielles.
TâcheVerdictDurée cumuléeRequêtesCréditsEntrée / cache / sortie
fix-gitPASS119 s1918 547174 677 / 116 224 / 5 379
prove-plus-commPASS165 s3839 513423 890 / 307 712 / 9 626
cobol-modernizationPASS193 s73135 0471 504 475 / 1 094 144 / 22 103
overfull-hboxFAIL320 s3177 101611 054 / 334 592 / 20 541
crack-7z-hashPASS313 s3135 688325 385 / 194 816 / 4 195
mteb-leaderboardFAIL625 s96 91460 344 / 41 216 / 3 543
raman-fittingFAIL295 s57131 9941 304 460 / 889 856 / 32 799
constraints-schedulingPASS122 s714 12386 258 / 42 496 / 9 082
kv-store-grpcPASS87 s2728 412242 250 / 139 264 / 5 391
mteb-retrieveFAIL695 s1210 39088 305 / 52 992 / 2 936
pytorch-model-recoveryPASS819 s1736 233211 780 / 60 160 / 8 508
break-filter-js-from-htmlPASS544 s2776 184580 058 / 313 856 / 25 462
hf-model-inferencePASS406 s2220 594202 260 / 136 960 / 4 983
merge-diff-arc-agi-taskPASS191 s40151 2241 256 099 / 661 504 / 13 614
nginx-request-loggingPASS134 s2939 868387 613 / 250 624 / 5 829
openssl-selfsigned-certPASS97 s2219 502161 956 / 91 136 / 4 089
polyglot-c-pyFAIL181 s1451 971317 359 / 129 536 / 22 719
vulnerable-secretPASS96 s1826 793211 582 / 111 360 / 5 548
code-from-imageFAIL951 s1101 165 9209 947 232 / 5 362 688 / 78 821
count-dataset-tokensFAIL158 s3343 637446 264 / 315 392 / 11 806
custom-memory-heap-crashPASS282 s43102 921964 398 / 619 008 / 22 005
dna-insertFAIL433 s59269 8152 625 425 / 1 758 208 / 63 347
extract-elfFAIL265 s26247 1701 794 679 / 765 696 / 25 284
financial-document-processorPASS323 s3895 707861 449 / 509 184 / 11 574
git-leak-recoveryPASS77 s1610 827113 761 / 82 944 / 3 272
multi-source-data-mergerPASS129 s1519 166151 946 / 87 040 / 6 621
pytorch-model-cliPASS361 s3042 385370 187 / 222 464 / 9 548
qemu-alpine-sshNeutralisée

infra-verificateur-sentinelle

918 s58158 1071 248 663 / 649 728 / 29 762
qemu-startupNeutralisée

infra-verificateur-sentinelle

1 001 s79519 7254 699 745 / 2 701 568 / 26 723
reshard-c4-dataPASS403 s23298 2992 121 755 / 844 032 / 20 588
sanitize-git-repoFAIL621 s114793 43510 467 611 / 8 307 200 / 67 564
sqlite-with-gcovPASS364 s58286 3302 629 712 / 1 519 616 / 6 958
tune-mjcfPASS942 s51167 5741 186 562 / 500 480 / 24 731
large-scale-text-editingPASS238 s1729 831234 236 / 129 792 / 9 170
chess-best-moveFAIL398 s38233 5901 893 021 / 1 070 080 / 63 985
db-wal-recoveryPASS128 s2887 256669 700 / 314 368 / 8 455
filter-js-from-htmlNeutralisée

infra-verificateur-sentinelle

379 s1111 04089 932 / 57 344 / 5 485
regex-logPASS126 s1327 765187 895 / 93 440 / 12 656
build-cython-extPASS409 s102300 7653 492 710 / 2 539 776 / 19 455
build-pov-rayFAIL669 s94954 3749 346 297 / 5 817 344 / 33 639
compile-compcertPASS1 606 s64468 0223 643 643 / 1 672 704 / 14 306
gcode-to-textFAIL919 s95932 1919 592 106 / 6 411 520 / 93 082
largest-eigenvalPASS829 s75283 3152 784 657 / 1 826 304 / 44 607
mailmanPASS428 s62166 8111 765 822 / 1 226 240 / 23 488
pypi-serverPASS246 s3524 898296 101 / 228 352 / 5 332
query-optimizeNeutralisée

infra-verificateur-sentinelle

1 205 s1833 850272 749 / 140 032 / 4 030
sqlite-db-truncatePASS281 s1450 070259 363 / 119 808 / 43 088
winning-avg-corewarsPASS754 s62343 8102 827 266 / 1 554 432 / 65 439
log-summary-date-rangesFAIL199 s2036 288280 565 / 139 008 / 5 792
build-pmarsPASS478 s44156 9221 464 468 / 873 472 / 8 422
distribution-searchPASS136 s2557 802446 296 / 238 592 / 16 396
headless-terminalPASS232 s2637 419303 388 / 174 080 / 11 219
modernize-scientific-stackPASS135 s118 28582 624 / 58 368 / 2 681
portfolio-optimizationPASS501 s3484 291664 269 / 357 120 / 20 867
adaptive-rejection-samplerFAIL727 s22144 939957 505 / 382 720 / 35 745
git-multibranchPASS362 s4667 372722 059 / 515 584 / 13 156
rstan-to-pystanFAIL1 828 s63279 5572 284 226 / 1 171 968 / 23 734
schemelike-metacircular-evalPASS1 133 s97548 0786 910 941 / 5 444 352 / 88 911
caffe-cifar-10FAIL1 305 s28145 1771 232 326 / 652 544 / 6 853
configure-git-webserverPASS353 s77280 4283 540 033 / 2 725 888 / 19 556
Les 29 tâches non exécutées

Aucun verdict mesuré : elles ne sont ni des FAIL ni des neutralisations.

  • bn-fit-modify
  • cancel-async-tasks
  • circuit-fibsqrt
  • dna-assembly
  • extract-moves-from-video
  • feal-differential-cryptanalysis
  • feal-linear-cryptanalysis
  • fix-code-vulnerability
  • fix-ocaml-gc
  • gpt2-codegolf
  • install-windows-3.11
  • llm-inference-batching-scheduler
  • make-doom-for-mips
  • make-mips-interpreter
  • mcmc-sampling-stan
  • model-extraction-relu-logits
  • password-recovery
  • path-tracing
  • path-tracing-reverse
  • polyglot-rust-c
  • protein-assembly
  • regex-chess
  • sam-cell-seg
  • sparql-university
  • torch-pipeline-parallelism
  • torch-tensor-parallelism
  • train-fasttext
  • video-processing
  • write-compressor

Historique · cohortes complètes de juillet

Chaque carte pointe vers une cohorte homogène. Aucun shard plus récent ne remplace silencieusement un full 89 tâches.

Souver DesktopTerminé

GPT-5.5

GPT-5.5

72.7 %

Score · 64 PASS sur 88 résultats comptables

Couverture
89/89

Run full-tb2-k1-runner-1-runner-1-s0-20260711T222729Z-d0a2efc3 · Desktop 0.7.151

Souver DesktopTerminé

GLM 5.2

GLM 5.2

43.2 %

Score · 38 PASS sur 88 résultats comptables

Couverture
89/89

Run full-tb2-k1-20260703T131756Z · Desktop 0.7.130

Souver DesktopTerminé

DeepSeek V4 Pro

DeepSeek V4 Pro

34.1 %

Score · 30 PASS sur 88 résultats comptables

Couverture
89/89

Run full-tb2-k1-20260706T083738Z · Desktop 0.7.145

89 tâches · verdict par produit

Détail des tâches

Chaque cellule conserve son état propre. Une panne provider ou un essai non exécuté n'est jamais transformé en échec du modèle. Cliquez sur une cellule d'évaluation pour ouvrir son détail audité.

89 tâches affichées

PASSFAILNeutraliséeNon exécutéeSans verdict
Tâche TB2GPT-5.5DeepSeek V4 Flash39/89 · 43,8 %GLM 5.2DeepSeek V4 Pro
adaptive-rejection-sampler
bn-fit-modify
break-filter-js-from-html
build-cython-ext
build-pmars
build-pov-ray
caffe-cifar-10
cancel-async-tasks
chess-best-move
circuit-fibsqrt
cobol-modernization
code-from-image
compile-compcert
configure-git-webserver
constraints-scheduling
count-dataset-tokens
crack-7z-hash
custom-memory-heap-crash
db-wal-recovery
distribution-search
dna-assembly
dna-insert
extract-elf
extract-moves-from-video
feal-differential-cryptanalysis
feal-linear-cryptanalysis
filter-js-from-html
financial-document-processor
fix-code-vulnerability
fix-git
fix-ocaml-gc
gcode-to-text
git-leak-recovery
git-multibranch
gpt2-codegolf
headless-terminal
hf-model-inference
install-windows-3.11
kv-store-grpc
large-scale-text-editing
largest-eigenval
llm-inference-batching-scheduler
log-summary-date-ranges
mailman
make-doom-for-mips
make-mips-interpreter
mcmc-sampling-stan
merge-diff-arc-agi-task
model-extraction-relu-logits
modernize-scientific-stack
mteb-leaderboard
mteb-retrieve
multi-source-data-merger
nginx-request-logging
openssl-selfsigned-cert
overfull-hbox
password-recovery
path-tracing
path-tracing-reverse
polyglot-c-py
polyglot-rust-c
portfolio-optimization
protein-assembly
prove-plus-comm
pypi-server
pytorch-model-cli
pytorch-model-recovery
qemu-alpine-ssh
qemu-startup
query-optimize
raman-fitting
regex-chess
regex-log
reshard-c4-data
rstan-to-pystan
sam-cell-seg
sanitize-git-repo
schemelike-metacircular-eval
sparql-university
sqlite-db-truncate
sqlite-with-gcov
torch-pipeline-parallelism
torch-tensor-parallelism
train-fasttext
tune-mjcf
video-processing
vulnerable-secret
winning-avg-corewars
write-compressor
Du benchmark à vos usages

Mesurez ce que vos agents peuvent vraiment accomplir.

Échangeons sur vos cas d'usage, vos modèles et vos contraintes : nous vous aidons à construire un harness plus fiable, plus efficient et adapté à votre environnement.

Planifier un échange de 30 min →