Méthodologie · AI
Comment le AI Models Top 10 est calculé
Le classement officiel porte sur la qualité globale, une moyenne pondérée de six capacités. Mais cette moyenne cache plus qu'elle ne montre : la page permet donc de trier par chaque critère, et la fiche de chaque modèle détaille tous les benchmarks utilisés.
Dernière mise à jour : · semaine 41 · 16 semaines d’historique
D’où viennent les chiffres
Sources
| Source | Ce qu’on en tire | Statut |
|---|---|---|
| SWE-bench (nouvel onglet) | Coding : résolution de tickets GitHub réels (SWE-bench Verified). | À brancher |
| LiveCodeBench (nouvel onglet) | Coding : problèmes de programmation récents. | À brancher |
| GPQA Diamond (nouvel onglet) | Reasoning : questions de sciences de niveau doctorat. | À brancher |
| Humanity's Last Exam (nouvel onglet) | Reasoning : questions expertes (Humanity's Last Exam). | À brancher |
| Epoch AI (nouvel onglet) | Maths : concours AIME. | À brancher |
| Terminal-Bench (nouvel onglet) | Agents : tâches dans un terminal. | À brancher |
| τ-bench (nouvel onglet) | Agents : usage d'outils face à un utilisateur simulé. | À brancher |
| MMMU (nouvel onglet) | Multimodal : compréhension d'images et de texte. | À brancher |
| OpenAI MRCR (nouvel onglet) | Long context : retrouver l'information dans un long contexte. | À brancher |
| Artificial Analysis (nouvel onglet) | Fenêtre de contexte, vitesse de sortie et prix des API. | À brancher |
Ce qui entre dans la note
Critères et pondérations
Global (classement officiel)
Coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %. La vitesse et le prix n'y entrent pas : un modèle rapide et bon marché n'est pas pour autant un meilleur modèle.
Coding
SWE-bench Verified (60 %) et LiveCodeBench (40 %). Les scores en pourcentage sont repris tels quels.
Reasoning
GPQA Diamond (60 %) et Humanity's Last Exam (40 %, échelle de 0 à 50 % ramenée à 100).
Maths
AIME 2025, repris tel quel.
Agents
Terminal-Bench (55 %, échelle de 0 à 70 % ramenée à 100) et τ-bench (45 %).
Multimodal
MMMU. Les modèles texte seul n'ont pas de score multimodal : ils ne sont pas pénalisés dans le Global, mais n'apparaissent pas dans ce tri.
Long context
MRCR (60 %) et taille de la fenêtre (40 %, échelle logarithmique de 32 000 tokens à 2 millions).
Speed et Price
Vitesse en tokens par seconde (échelle logarithmique de 30 à 400). Prix mixte avec 3 parts d'entrée pour 1 de sortie (échelle logarithmique de 0,2 $ à 20 $ le million de tokens, inversée).
Value (rapport qualité/prix)
60 % qualité globale, 40 % score de prix. C'est un choix éditorial, assumé, qui peut se discuter.
Départage
À score égal, le meilleur résultat SWE-bench Verified passe devant.
Générée à partir du code, donc toujours à jour
La formule, ligne par ligne
Coding
Résoudre de vrais tickets et écrire du code correct.
| SWE-bench Verified | 60 % | valeur telle quelle (déjà sur 100) |
| LiveCodeBench | 40 % | valeur telle quelle (déjà sur 100) |
Reasoning
Raisonnement scientifique et questions expertes.
| GPQA Diamond | 60 % | valeur telle quelle (déjà sur 100) |
| Humanity's Last Exam | 40 % | échelle linéaire entre 0 (0) et 50 (100) |
Maths
Mathématiques de concours.
| AIME 2025 | 100 % | valeur telle quelle (déjà sur 100) |
Agents
Enchaîner des actions avec des outils sans dérailler.
| Terminal-Bench | 55 % | échelle linéaire entre 0 (0) et 70 (100) |
| τ-bench | 45 % | valeur telle quelle (déjà sur 100) |
Multimodal
Comprendre les images en plus du texte. Absente pour les modèles texte seul.
| MMMU | 100 % | valeur telle quelle (déjà sur 100) |
Long context
Taille de la fenêtre et capacité à y retrouver l'information.
| MRCR | 60 % | valeur telle quelle (déjà sur 100) |
| Fenêtre de contexte | 40 % | échelle logarithmique entre 32 (0) et 2000 (100) |
Speed
Vitesse de génération, échelle logarithmique de 30 à 400 tokens par seconde.
| Vitesse de sortie | 100 % | échelle logarithmique entre 30 (0) et 400 (100) |
Price
Prix mixte (3 parts d'entrée pour 1 de sortie), inversé : moins cher = score plus haut.
| Prix mixte | 100 % | échelle logarithmique entre 0.2 (0) et 20 (100), inversée (plus bas = mieux) |
Global Note principale
Qualité globale : coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %. La vitesse et le prix n'y entrent pas.
| Coding | 25 % | sous-score composite |
| Reasoning | 22 % | sous-score composite |
| Agents | 20 % | sous-score composite |
| Maths | 13 % | sous-score composite |
| Multimodal | 10 % | sous-score composite |
| Long context | 10 % | sous-score composite |
Value
Rapport qualité/prix : 60 % qualité globale, 40 % score de prix.
| Global | 60 % | sous-score composite |
| Price | 40 % | sous-score composite |
Ce qu’on ne sait pas faire
Limites
Un benchmark mesure une tâche, pas votre usage. Aucun score ne remplace un essai sur vos propres données.
Les scores peuvent venir de l'éditeur ou d'un évaluateur indépendant, avec des protocoles différents. Nous privilégions les évaluations indépendantes et le précisons dès qu'une valeur vient d'ailleurs.
La contamination (un benchmark qui fuit dans les données d'entraînement) gonfle certains scores. C'est une raison de plus de ne pas résumer un modèle à un seul chiffre.
Vitesse et prix dépendent du fournisseur, de la région et de l'heure. Nous reprenons la médiane des fournisseurs.
Les pondérations du Global sont un choix éditorial. Elles sont publiées pour pouvoir être contestées.

