AISemaine 41 · 5 oct. – 11 oct.

AI Models Top 10

Un modèle n'est pas « le meilleur ». Il est meilleur sur quelque chose. Changez de critère, le classement change.

Dernière mise à jour : Comment ce classement est calculé →

#1 cette semaine

Claude Fable 5.1

5ᵉ semaine en tête

Plus forte hausse

Gemini 3 Pro

2En hausse de 2 places n°2

Plus forte baisse

Claude Opus 5.5

1En baisse de 1 place n°3

Entrées et sorties

1 in · 1 out

gpt-oss-120b, GLM-4.6

Trier par critère

  1. Place 01
    Place inchangéeS40 · n°1

    Claude Fable 5.1

    Anthropic · Modèle propriétaire

    La dernière génération de la famille Claude 5

    • Coding 83
    • Reasoning 81
    • Speed 19
    • 16,00 $ /M tok
    • 1M ctx

    Global

    85,1

    5 sem. au Top · pic n°1

    DATAPourquoi ça bouge

    Place inchangée ; Coding 83 (0 pts).

    • SWE-bench Verified : 85,0 % (0 %)
    • LiveCodeBench : 80,0 % (0 %)
    OUR TAKEÉquipe Sandbox
    « Cinquième semaine en tête. Excellent en agents, mais regardez le prix et la vitesse : le Global ne les compte pas, vous si. »
    Détails et sources

    Sous-scores

    • Coding83
    • Reasoning81
    • Maths94
    • Agents88
    • Multimodal82
    • Long context84
    • Speed19
    • Price7
    • Value54

    Mesures · S41

    SWE-bench Verified85,0 %SWE-bench (nouvel onglet)
    LiveCodeBench80,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond89,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam35,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202594,0 %Epoch AI (nouvel onglet)
    Terminal-Bench62,0 %Terminal-Bench (nouvel onglet)
    τ-bench87,0 %τ-bench (nouvel onglet)
    MMMU82,0 %MMMU (nouvel onglet)
    MRCR85,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte1MArtificial Analysis (nouvel onglet)
    Vitesse de sortie49 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte16,00 $calculé

    Ouvrir la fiche de Claude Fable 5.1 →

  2. Place 02
    2En hausse de 2 placesS40 · n°4

    Gemini 3 Pro

    Google DeepMind · Modèle propriétaire

    Le modèle multimodal à très long contexte de Google

    • Coding 81
    • Reasoning 82
    • Speed 50
    • 4,50 $ /M tok
    • 1M ctx

    Global

    84,1

    16 sem. au Top · pic n°2

    DATAPourquoi ça bouge

    +2 places, porté par Agents : 83 (+9 pts).

    • Terminal-Bench : 57,0 % (+16 %)
    • τ-bench : 85,0 % (+9 %)
    OUR TAKEÉquipe Sandbox
    « Le plus gros mouvement de la semaine : +2 places grâce à une révision de ses scores d'agent. À regarder de près, surtout pour le contexte long. »
    Détails et sources

    Sous-scores

    • Coding81 +3
    • Reasoning82
    • Maths94
    • Agents83 +9
    • Multimodal86
    • Long context86
    • Speed50
    • Price47
    • Value69 +2

    Mesures · S41

    SWE-bench Verified81,0 %+5,0SWE-bench (nouvel onglet)
    LiveCodeBench80,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond88,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam36,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202594,0 %Epoch AI (nouvel onglet)
    Terminal-Bench57,0 %+8,0Terminal-Bench (nouvel onglet)
    τ-bench85,0 %+7,0τ-bench (nouvel onglet)
    MMMU86,0 %MMMU (nouvel onglet)
    MRCR88,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte1MArtificial Analysis (nouvel onglet)
    Vitesse de sortie110 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte4,50 $calculé

    Ouvrir la fiche de Gemini 3 Pro →

  3. Place 03
    1En baisse de 1 placeS40 · n°2

    Claude Opus 5.5

    Anthropic · Modèle propriétaire

    Le modèle haut de gamme d'Anthropic pour le code et le raisonnement

    • Coding 80
    • Reasoning 77
    • Speed 22
    • 10,00 $ /M tok
    • 1M ctx

    Global

    81,9

    16 sem. au Top · pic n°1

    DATAPourquoi ça bouge

    −1 place, freiné par Coding : 80 (0 pts).

    • SWE-bench Verified : 82,0 % (0 %)
    • LiveCodeBench : 78,0 % (0 %)
    OUR TAKEÉquipe Sandbox
    « Seize semaines dans le Top, sept en tête. Il glisse à la 3ᵉ place sans avoir démérité : il se fait manger par le calendrier des sorties. »
    Détails et sources

    Sous-scores

    • Coding80
    • Reasoning77
    • Maths92
    • Agents83
    • Multimodal80
    • Long context83
    • Speed22
    • Price23
    • Value58

    Mesures · S41

    SWE-bench Verified82,0 %SWE-bench (nouvel onglet)
    LiveCodeBench78,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond87,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam31,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202592,0 %Epoch AI (nouvel onglet)
    Terminal-Bench58,0 %Terminal-Bench (nouvel onglet)
    τ-bench84,0 %τ-bench (nouvel onglet)
    MMMU80,0 %MMMU (nouvel onglet)
    MRCR82,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte1MArtificial Analysis (nouvel onglet)
    Vitesse de sortie53 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte10,00 $calculé

    Ouvrir la fiche de Claude Opus 5.5 →

  4. Place 04
    1En baisse de 1 placeS40 · n°3

    GPT-5.2

    OpenAI · Modèle propriétaire

    Le modèle généraliste d'OpenAI

    • Coding 81
    • Reasoning 80
    • Speed 33
    • 4,81 $ /M tok
    • 400k ctx

    Global

    81,9

    16 sem. au Top · pic n°1

    DATAPourquoi ça bouge

    −1 place, freiné par Coding : 81 (0 pts).

    • SWE-bench Verified : 81,0 % (0 %)
    • LiveCodeBench : 82,0 % (0 %)
    OUR TAKEÉquipe Sandbox
    « Toujours le roi des maths de concours. Mais ça fait longtemps que ce n'est plus ce qu'on lui demande au quotidien. »
    Détails et sources

    Sous-scores

    • Coding81
    • Reasoning80
    • Maths96
    • Agents81
    • Multimodal81
    • Long context72
    • Speed33
    • Price45
    • Value67

    Mesures · S41

    SWE-bench Verified81,0 %SWE-bench (nouvel onglet)
    LiveCodeBench82,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond88,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam34,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202596,0 %Epoch AI (nouvel onglet)
    Terminal-Bench57,0 %Terminal-Bench (nouvel onglet)
    τ-bench80,0 %τ-bench (nouvel onglet)
    MMMU81,0 %MMMU (nouvel onglet)
    MRCR80,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte400kArtificial Analysis (nouvel onglet)
    Vitesse de sortie71 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte4,81 $calculé

    Ouvrir la fiche de GPT-5.2 →

  5. Place 05
    Place inchangéeS40 · n°5

    Claude Sonnet 5.5

    Anthropic · Modèle propriétaire

    Le compromis qualité, vitesse et prix de la famille Claude

    • Coding 77
    • Reasoning 71
    • Speed 39
    • 6,00 $ /M tok
    • 1M ctx

    Global

    77,7

    16 sem. au Top · pic n°4

    DATAPourquoi ça bouge

    Place inchangée ; Coding 77 (0 pts).

    • SWE-bench Verified : 79,0 % (0 %)
    • LiveCodeBench : 75,0 % (0 %)
    Détails et sources

    Sous-scores

    • Coding77
    • Reasoning71
    • Maths88
    • Agents78
    • Multimodal77
    • Long context80
    • Speed39
    • Price38
    • Value62

    Mesures · S41

    SWE-bench Verified79,0 %SWE-bench (nouvel onglet)
    LiveCodeBench75,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond84,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam26,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202588,0 %Epoch AI (nouvel onglet)
    Terminal-Bench52,0 %Terminal-Bench (nouvel onglet)
    τ-bench82,0 %τ-bench (nouvel onglet)
    MMMU77,0 %MMMU (nouvel onglet)
    MRCR78,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte1MArtificial Analysis (nouvel onglet)
    Vitesse de sortie83 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte6,00 $calculé

    Ouvrir la fiche de Claude Sonnet 5.5 →

  6. Place 06
    Place inchangéeS40 · n°6

    Grok 4

    xAI · Modèle propriétaire

    Le modèle de xAI

    • Coding 72
    • Reasoning 75
    • Speed 30
    • 6,00 $ /M tok
    • 256k ctx

    Global

    72,8

    16 sem. au Top · pic n°5

    DATAPourquoi ça bouge

    Place inchangée ; Coding 72 (0 pts).

    • SWE-bench Verified : 68,0 % (0 %)
    • LiveCodeBench : 77,0 % (0 %)
    Détails et sources

    Sous-scores

    • Coding72
    • Reasoning75
    • Maths93
    • Agents65
    • Multimodal72
    • Long context62
    • Speed30
    • Price38
    • Value59

    Mesures · S41

    SWE-bench Verified68,0 %SWE-bench (nouvel onglet)
    LiveCodeBench77,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond85,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam30,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202593,0 %Epoch AI (nouvel onglet)
    Terminal-Bench42,0 %Terminal-Bench (nouvel onglet)
    τ-bench70,0 %τ-bench (nouvel onglet)
    MMMU72,0 %MMMU (nouvel onglet)
    MRCR70,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte256kArtificial Analysis (nouvel onglet)
    Vitesse de sortie66 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte6,00 $calculé

    Ouvrir la fiche de Grok 4 →

  7. Place 07
    Place inchangéeS40 · n°7

    Gemini 3 Flash

    Google DeepMind · Modèle propriétaire

    La version rapide et économique de Gemini 3

    • Coding 71
    • Reasoning 66
    • Speed 74
    • 1,13 $ /M tok
    • 1M ctx

    Global

    72,0

    16 sem. au Top · pic n°6

    DATAPourquoi ça bouge

    Place inchangée ; Coding 71 (0 pts).

    • SWE-bench Verified : 70,0 % (0 %)
    • LiveCodeBench : 72,0 % (0 %)
    OUR TAKEÉquipe Sandbox
    « Le meilleur rapport vitesse/prix du Top 10. Si vous n'avez pas besoin de la dernière marche de qualité, c'est ici que ça se passe. »
    Détails et sources

    Sous-scores

    • Coding71
    • Reasoning66
    • Maths86
    • Agents64
    • Multimodal78
    • Long context81
    • Speed74
    • Price80
    • Value75

    Mesures · S41

    SWE-bench Verified70,0 %SWE-bench (nouvel onglet)
    LiveCodeBench72,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond80,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam22,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202586,0 %Epoch AI (nouvel onglet)
    Terminal-Bench40,0 %Terminal-Bench (nouvel onglet)
    τ-bench72,0 %τ-bench (nouvel onglet)
    MMMU78,0 %MMMU (nouvel onglet)
    MRCR80,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte1MArtificial Analysis (nouvel onglet)
    Vitesse de sortie204 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte1,13 $calculé

    Ouvrir la fiche de Gemini 3 Flash →

  8. Place 08
    Place inchangéeS40 · n°8

    DeepSeek V3.2

    DeepSeek · Modèle open weights

    Un modèle généraliste ouvert, à très bas coût d'inférence

    • Coding 70
    • Reasoning 68
    • Speed 5
    • 0,32 $ /M tok
    • 128k ctx

    Global

    68,3

    13 sem. au Top · pic n°7

    DATAPourquoi ça bouge

    Place inchangée ; Coding 70 (0 pts).

    • SWE-bench Verified : 69,0 % (0 %)
    • LiveCodeBench : 71,0 % (0 %)
    Détails et sources

    Sous-scores

    • Coding70
    • Reasoning68
    • Maths89
    • Agents63
    • Multimodalnon évalué—
    • Long context51
    • Speed5
    • Price97
    • Value80

    Mesures · S41

    SWE-bench Verified69,0 %SWE-bench (nouvel onglet)
    LiveCodeBench71,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond82,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam23,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202589,0 %Epoch AI (nouvel onglet)
    Terminal-Bench41,0 %Terminal-Bench (nouvel onglet)
    τ-bench68,0 %τ-bench (nouvel onglet)
    MMMU—MMMU (nouvel onglet)
    MRCR62,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte128kArtificial Analysis (nouvel onglet)
    Vitesse de sortie34 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte0,32 $calculé

    Ouvrir la fiche de DeepSeek V3.2 →

  9. Place 09
    Place inchangéeS40 · n°9

    Kimi K2

    Moonshot AI · Modèle open weights

    Une mixture d'experts à poids ouverts, pensée pour les agents et le code

    • Coding 68
    • Reasoning 66
    • Speed 9
    • 1,08 $ /M tok
    • 256k ctx

    Global

    68,1

    14 sem. au Top · pic n°7

    DATAPourquoi ça bouge

    Place inchangée ; Coding 68 (0 pts).

    • SWE-bench Verified : 70,0 % (0 %)
    • LiveCodeBench : 66,0 % (0 %)
    Détails et sources

    Sous-scores

    • Coding68
    • Reasoning66
    • Maths86
    • Agents64
    • Multimodalnon évalué—
    • Long context57
    • Speed9
    • Price81
    • Value73

    Mesures · S41

    SWE-bench Verified70,0 %SWE-bench (nouvel onglet)
    LiveCodeBench66,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond78,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam24,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202586,0 %Epoch AI (nouvel onglet)
    Terminal-Bench40,0 %Terminal-Bench (nouvel onglet)
    τ-bench72,0 %τ-bench (nouvel onglet)
    MMMU—MMMU (nouvel onglet)
    MRCR62,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte256kArtificial Analysis (nouvel onglet)
    Vitesse de sortie38 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte1,08 $calculé

    Ouvrir la fiche de Kimi K2 →

  10. Place 10
    RERetour dans le classementS40 · hors Top 10 (n°13)

    gpt-oss-120b

    OpenAI · Modèle open weights

    Les poids ouverts d'OpenAI, sous Apache-2.0

    • Coding 68
    • Reasoning 63
    • Speed 58
    • 0,26 $ /M tok
    • 128k ctx

    Global

    67,1

    3 sem. au Top · pic n°10

    DATAPourquoi ça bouge

    Retour au Top à la 10ᵉ place (13ᵉ du pool la semaine passée).

    • Terminal-Bench : 45,0 % (+41 %)
    • τ-bench : 70,0 % (+17 %)
    Détails et sources

    Sous-scores

    • Coding68 +6
    • Reasoning63
    • Maths90
    • Agents67 +15
    • Multimodalnon évalué—
    • Long context45
    • Speed58
    • Price98
    • Value80 +3

    Mesures · S41

    SWE-bench Verified68,0 %+10,0SWE-bench (nouvel onglet)
    LiveCodeBench68,0 %LiveCodeBench (nouvel onglet)
    GPQA Diamond80,0 %GPQA Diamond (nouvel onglet)
    Humanity's Last Exam19,0 %Humanity's Last Exam (nouvel onglet)
    AIME 202590,0 %Epoch AI (nouvel onglet)
    Terminal-Bench45,0 %+13,0Terminal-Bench (nouvel onglet)
    τ-bench70,0 %+10,0τ-bench (nouvel onglet)
    MMMU—MMMU (nouvel onglet)
    MRCR52,0 %OpenAI MRCR (nouvel onglet)
    Fenêtre de contexte128kArtificial Analysis (nouvel onglet)
    Vitesse de sortie134 tok/sArtificial Analysis (nouvel onglet)
    Prix mixte0,26 $calculé

    Ouvrir la fiche de gpt-oss-120b →

Bubbling under · juste derrière le Top 10

Out · sortis du Top 10 cette semaine

  • OUTSorti du classementGLM-4.6était 10ᵉ, maintenant 11ᵉ

Hall of #1 · qui a tenu la tête

  1. GPT-5.2

    S26–S29 · 4 sem.

  2. Claude Opus 5.5

    S30–S36 · 7 sem.

  3. Claude Fable 5.1

    en cours · S37–S41 · 5 sem.

Claude Opus 5.5 : 7 semaines / 16Claude Fable 5.1 : 5 semaines / 16GPT-5.2 : 4 semaines / 16

Classement ai-models

Épisodes liés

Dans les podcasts

Sandbox · EP. 42

Claude Code passe #1, et ce que ça dit des agents de code

1 h 16

6 oct. 2026

Épisode 42 · 6 oct. 2026 · 1 h 16

Première place pour Claude Code au GitHub Top 10, adk-python qui bondit de quatre rangs, Gemini 3 Pro qui revient sur le podium : on décortique les mouvements de la semaine 41.

Agents · Coding · Benchmarks

À propos de l’épisode

Première place pour Claude Code au GitHub Top 10, adk-python qui bondit de quatre rangs, Gemini 3 Pro qui revient sur le podium : on décortique les mouvements de la semaine 41.

Voir la fiche de l’épisode →

25 candidats suivis cette semaine. Les rangs au-delà du Top 10 sont affichés pour le contexte (« bubbling under »). Relevé du 6 octobre 2026. Méthodologie.