Méthodologie · OS

Comment le Open Source AI Top 10 est calculé

Mêmes données et mêmes pondérations que l'AI Models Top 10, restreintes aux modèles dont les poids sont téléchargeables. Un modèle présent dans les deux classements a le même score ; seul le rang change, parce que le pool est différent.

Dernière mise à jour : · semaine 41 · 16 semaines d’historique

D’où viennent les chiffres

Sources

SourceCe qu’on en tireStatut
Hugging Face Hub (nouvel onglet)Disponibilité des poids, licence et taille du modèle. Un modèle sans poids téléchargeables ne peut pas entrer.À brancher
SWE-bench (nouvel onglet)Coding : résolution de tickets GitHub réels (SWE-bench Verified).À brancher
LiveCodeBench (nouvel onglet)Coding : problèmes de programmation récents.À brancher
GPQA Diamond (nouvel onglet)Reasoning : questions de sciences de niveau doctorat.À brancher
Humanity's Last Exam (nouvel onglet)Reasoning : questions expertes.À brancher
Epoch AI (nouvel onglet)Maths : concours AIME.À brancher
Terminal-Bench (nouvel onglet)Agents : tâches dans un terminal.À brancher
τ-bench (nouvel onglet)Agents : usage d'outils face à un utilisateur simulé.À brancher
MMMU (nouvel onglet)Multimodal : compréhension d'images et de texte.À brancher
OpenAI MRCR (nouvel onglet)Long context : retrouver l'information dans un long contexte.À brancher
Artificial Analysis (nouvel onglet)Fenêtre de contexte, vitesse de sortie et prix des API d'hébergement.À brancher

Ce qui entre dans la note

Critères et pondérations

  • Open weights

    Critère d'entrée : les poids doivent être téléchargeables. Nous ne jugeons pas la licence : elle est affichée sur chaque fiche, car « open weights » ne veut pas dire « libre ».

  • Score

    Identique à l'AI Models Top 10 : coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %.

  • Vitesse et prix

    Pour un modèle ouvert, la vitesse et le prix sont ceux des fournisseurs qui l'hébergent (médiane). Auto-hébergé, votre coût dépendra de votre matériel.

Générée à partir du code, donc toujours à jour

La formule, ligne par ligne

Coding

Résoudre de vrais tickets et écrire du code correct.

SWE-bench Verified60 %valeur telle quelle (déjà sur 100)
LiveCodeBench40 %valeur telle quelle (déjà sur 100)

Reasoning

Raisonnement scientifique et questions expertes.

GPQA Diamond60 %valeur telle quelle (déjà sur 100)
Humanity's Last Exam40 %échelle linéaire entre 0 (0) et 50 (100)

Maths

Mathématiques de concours.

AIME 2025100 %valeur telle quelle (déjà sur 100)

Agents

Enchaîner des actions avec des outils sans dérailler.

Terminal-Bench55 %échelle linéaire entre 0 (0) et 70 (100)
τ-bench45 %valeur telle quelle (déjà sur 100)

Multimodal

Comprendre les images en plus du texte. Absente pour les modèles texte seul.

MMMU100 %valeur telle quelle (déjà sur 100)

Long context

Taille de la fenêtre et capacité à y retrouver l'information.

MRCR60 %valeur telle quelle (déjà sur 100)
Fenêtre de contexte40 %échelle logarithmique entre 32 (0) et 2000 (100)

Speed

Vitesse de génération, échelle logarithmique de 30 à 400 tokens par seconde.

Vitesse de sortie100 %échelle logarithmique entre 30 (0) et 400 (100)

Price

Prix mixte (3 parts d'entrée pour 1 de sortie), inversé : moins cher = score plus haut.

Prix mixte100 %échelle logarithmique entre 0.2 (0) et 20 (100), inversée (plus bas = mieux)

Global Note principale

Qualité globale : coding 25 %, reasoning 22 %, agents 20 %, maths 13 %, multimodal 10 %, long context 10 %. La vitesse et le prix n'y entrent pas.

Coding25 %sous-score composite
Reasoning22 %sous-score composite
Agents20 %sous-score composite
Maths13 %sous-score composite
Multimodal10 %sous-score composite
Long context10 %sous-score composite

Value

Rapport qualité/prix : 60 % qualité globale, 40 % score de prix.

Global60 %sous-score composite
Price40 %sous-score composite

Ce qu’on ne sait pas faire

Limites

  • Les licences varient beaucoup : Apache-2.0, MIT, licences maison avec restrictions. Lisez la licence avant de bâtir un produit dessus.

  • Les scores de certains modèles viennent de l'éditeur tant qu'aucune évaluation indépendante n'existe. Ils sont signalés comme tels sur la fiche.

  • Les modèles texte seul n'ont pas de score multimodal ; ils ne sont pas pénalisés dans le Global.

  • Le coût réel d'un modèle auto-hébergé n'est pas mesuré ici.