240 238 votes
Obj : 300 000 Légende Discutez, votez et aidez-nous à atteindre cet objectif !
Vos votes sont importants : ils alimentent le jeu de données compar:IA mis à disposition librement pour affiner les prochains modèles sur le français.
Ce commun numérique contribue au meilleur respect de la diversité linguistique et culturelle des futurs modèles de langue.

Des votes… au classement des modèles

Merci pour vos contributions !
Le classement compar:IA repose sur l’ensemble des votes et réactions issus de la comparaison à l'aveugle des modèles et collectés depuis l’ouverture du service au public en octobre 2024.
Construit en partenariat avec le Pôle d'Expertise de la Régulation Numérique (PEReN), le classement des modèles est établi en fonction du score de satisfaction calculé à partir du modèle statistique Bradley Terry, méthode largement répandue pour convertir des votes binaires en classement probabiliste.
Le classement compar:IA n’a pas vocation à constituer une recommandation officielle ni à évaluer la performance technique des modèles. Il reflète les préférences subjectives des utilisateurs de la plateforme et non la factualité ou la véracité des réponses.

Total modèles : 112
Total votes : 240 000

Mise à jour le 7/18/2026

Télécharger les données
Des votes… au classement des modèles
Rang Infobulle Rang de classement attribué selon le score de satisfaction Bradley-Terry
Modèle
Score de
satisfaction BT
Infobulle Score statistique estimé selon le modèle Bradley-Terry reflétant la probabilité qu'un modèle soit préféré à un autre. Ce score est calculé à partir de l'ensemble des votes et réactions des utilisateurs. Pour en savoir plus, rendez-vous sur l’onglet méthodologie.
Confiance (±) Infobulle Intervalle indiquant la fiabilité du rang de classement : plus l'intervalle est étroit, plus l'estimation du rang est fiable. Il y a 95% de chances que le vrai rang du modèle soit dans cette plage.
Total votes
Conso. moyenne
(1000 tokens)
Infobulle Mesurée en milliwattheures, l’énergie consommée représente l'électricité utilisée par le modèle pour traiter une requête et générer la réponse correspondante. La consommation énergétique des modèles dépend de leur taille et de leur architecture. Nous prenons le parti d’afficher en grisé non analysés (N/A) les modèles propriétaires pour lesquels nous ne disposons pas d’information transparente sur la taille et l’architecture.
Taille
(paramètres)
Infobulle Taille du modèle en milliards de paramètres, catégorisée selon cinq classes. Pour les modèles propriétaires, cette taille n’est pas communiquée.
Architecture Infobulle L'architecture d'un modèle LLM désigne les principes de conception qui définissent comment les composants d'un réseau de neurones sont agencés et interagissent pour transformer les données d'entrée en sorties prédictives, incluant le mode d'activation des paramètres (dense vs. sparse), la spécialisation des composants et les mécanismes de traitement de l'information (transformers, réseaux convolutifs, architectures hybrides).
Date sortie
Organisation
Licence
1
1143
-5/+01454N/AL - (estimation)Propriétaire3/26OpenAIPropriétaire
2
1133
-6/+13774N/AXL - (estimation)Propriétaire12/25GooglePropriétaire
3
1124
-10/+25530N/AXL - (estimation)Propriétaire2/26AnthropicPropriétaire
4
1120
-13/+32586N/AL - (estimation)Propriétaire3/26GooglePropriétaire
5
1110
-16/+42051N/AL - (estimation)Propriétaire4/26OpenAIPropriétaire
6
1107
-15/+36362N/AXL - (estimation)Propriétaire12/24GooglePropriétaire
7
1106
-15/+52551N/AL - (estimation)Propriétaire3/26OpenAIPropriétaire
8
1105
-16/+62031117 mWh
S - 31 MdsDense4/26GoogleSemi-ouvert
9
1102
-16/+63039N/AXL - (estimation)Propriétaire9/25AlibabaPropriétaire
10
1095
-24/+71120N/AL - (estimation)Propriétaire12/25OpenAIPropriétaire
11
1095
-18/+72749N/AS - (estimation)Propriétaire3/26OpenAIPropriétaire
12
1092
-17/+93081N/AXL - (estimation)Propriétaire6/25GooglePropriétaire
13
1091
-16/+936223979 mWh
XL - 685 MdsMoE3/25DeepSeekSemi-ouvert
14
1090
-19/+112736N/AXL - (estimation)Propriétaire2/25AnthropicPropriétaire
15
1090
-23/+13766N/AL - (estimation)Propriétaire11/25OpenAIPropriétaire
16
1090
-18/+13197584 mWh
S - 26 MdsMoE4/26GoogleSemi-ouvert
17
1089
-16/+1337833979 mWh
XL - 671 MdsMoE12/24DeepSeekSemi-ouvert
18
1088
-13/+144677N/AXL - (estimation)Propriétaire9/25AnthropicPropriétaire
19
1081
-22/+151195N/AL - (estimation)Propriétaire6/25Mistral AIPropriétaire
20
1075
-22/+1319641524 mWh
L - 284 MdsMoE4/26DeepSeekSemi-ouvert
21
1075
-21/+1417823785 mWh
XL - 1000 MdsMoE9/25Moonshot AISemi-ouvert
22
1073
-22/+161252332 mWh
M - 80 MdsMoE2/26AlibabaSemi-ouvert
23
1072
-19/+152238N/AXL - (estimation)Propriétaire5/25AnthropicPropriétaire
24
1069
-17/+126466112 mWh
S - 27 MdsDense3/25GoogleSemi-ouvert
25
1067
-18/+126006N/AL - (estimation)Propriétaire8/25Mistral AIPropriétaire
26
1067
-17/+134968N/AM - (estimation)Propriétaire4/25OpenAIPropriétaire
27
1065
-21/+181272N/AXL - (estimation)Propriétaire5/26GooglePropriétaire
28
1065
-15/+183290N/AXL - (estimation)Propriétaire2/26GooglePropriétaire
29
1063
-14/+1824723979 mWh
XL - 685 MdsMoE12/25DeepSeekSemi-ouvert
30
1060
-17/+152567N/AXS - (estimation)Propriétaire3/26OpenAIPropriétaire
31
1060
-20/+2311633979 mWh
XL - 685 MdsMoE8/25DeepSeekSemi-ouvert
32
1059
-20/+24868N/AXL - (estimation)Propriétaire11/25GooglePropriétaire
33
1056
-19/+1714881524 mWh
L - 398 MdsMoE1/26ArceeSemi-ouvert
34
1056
-20/+266331951 mWh
XL - 480 MdsMoE7/25AlibabaSemi-ouvert
35
1049
-16/+1848014134 mWh
XL - 675 MdsMoE12/25Mistral AISemi-ouvert
36
1048
-17/+201837N/AS - (estimation)Propriétaire8/25OpenAIPropriétaire
37
1047
-17/+201542N/AS - (estimation)Propriétaire4/25OpenAIPropriétaire
38
1046
-14/+164824857 mWh
L - 111 MdsDense3/25CohereSemi-ouvert
39
1042
-19/+2216118890 mWh
XL - 1600 MdsMoE4/26DeepSeekSemi-ouvert
40
1041
-13/+144194109 mWh
S - 24 MdsDense6/25Mistral AISemi-ouvert
41
1040
-12/+13631894 mWh
XS - 12 MdsDense3/25GoogleSemi-ouvert
42
1039
-25/+268031524 mWh
L - 398 MdsMoE4/26ArceeSemi-ouvert
43
1038
-12/+155761N/AXL - (estimation)Propriétaire9/24GooglePropriétaire
44
1038
-11/+1646101601 mWh
XL - 400 MdsMoE4/25MetaSemi-ouvert
45
1038
-17/+261358N/AL - (estimation)Propriétaire8/25OpenAIPropriétaire
46
1036
-29/+305881892 mWh
L - 355 MdsMoE7/25ZhipuSemi-ouvert
47
1032
-15/+174209N/AXL - (estimation)Propriétaire10/24AnthropicPropriétaire
48
1030
-18/+182477347 mWh
L - 119 MdsMoE3/26Mistral AISemi-ouvert
49
1020
-28/+191142N/AS - (estimation)Propriétaire11/24OpenAIPropriétaire
50
1020
-28/+2013023785 mWh
XL - 1000 MdsMoE4/26Moonshot AISemi-ouvert
51
1019
-23/+162319109 mWh
S - 24 MdsDense6/25Mistral AISemi-ouvert
52
1016
-21/+106855400 mWh
L - 109 MdsMoE4/25MetaSemi-ouvert
53
1016
-25/+1523973785 mWh
XL - 1000 MdsMoE1/26Moonshot AISemi-ouvert
54
1014
-25/+239693785 mWh
XL - 1000 MdsMoE11/25Moonshot AISemi-ouvert
55
1013
-30/+284871892 mWh
L - 357 MdsMoE9/25ZhipuSemi-ouvert
56
1011
-19/+14713784 mWh
XS - 4 MdsDense3/25GoogleSemi-ouvert
57
1011
-21/+18162881 mWh
XS - 8 MdsMoE10/25LiquidSemi-ouvert
58
1006
-20/+14431484 mWh
XS - 8 MdsMatformer5/25GoogleSemi-ouvert
59
1006
-23/+1723153979 mWh
XL - 671 MdsMoE1/25DeepSeekSemi-ouvert
60
1006
-22/+1817673979 mWh
XL - 685 MdsMoE5/25DeepSeekSemi-ouvert
61
1003
-20/+153959N/AS - (estimation)Propriétaire4/25OpenAIPropriétaire
62
1001
-19/+154920658 mWh
M - 70 MdsDense10/24NvidiaSemi-ouvert
63
1000
-22/+191600733 mWh
L - 229 MdsMoE2/26MiniMaxSemi-ouvert
64
998
-20/+172816658 mWh
M - 70 MdsDense8/25NousSemi-ouvert
65
997
-19/+183257N/AS - (estimation)Propriétaire2/25Mistral AIPropriétaire
66
997
-22/+24923733 mWh
L - 230 MdsMoE10/25MiniMaxSemi-ouvert
67
996
-17/+203423109 mWh
S - 24 MdsDense3/25Mistral AISemi-ouvert
68
994
-20/+211522N/AXL - (estimation)Propriétaire4/26AlibabaPropriétaire
69
993
-16/+184940N/AS - (estimation)Propriétaire7/24OpenAIPropriétaire
70
992
-14/+157402658 mWh
M - 70 MdsDense12/24MetaSemi-ouvert
71
989
-14/+183479118 mWh
S - 32 MdsDense12/24CohereSemi-ouvert
72
989
-20/+28679112 mWh
S - 27 MdsDense6/24GoogleSemi-ouvert
73
988
-14/+213365658 mWh
M - 70 MdsDense9/25Swiss AIOpen source
74
985
-20/+30456118 mWh
S - 32 MdsDense4/25AlibabaSemi-ouvert
75
980
-19/+25101689 mWh
XS - 8 MdsDense4/26IBMSemi-ouvert
76
979
-13/+183958N/AXL - (estimation)Propriétaire8/24OpenAIPropriétaire
77
978
-15/+202272109 mWh
S - 24 MdsDense1/25Mistral AISemi-ouvert
78
977
-13/+164407658 mWh
M - 70 MdsDense7/24MetaSemi-ouvert
79
975
-15/+21183682 mWh
S - 24 MdsMoE2/26LiquidSemi-ouvert
80
975
-13/+201963106 mWh
S - 22 MdsDense12/25EuroLLMSemi-ouvert
81
971
-12/+153492342 mWh
L - 117 MdsMoE8/25OpenAISemi-ouvert
82
968
-14/+201425733 mWh
L - 230 MdsMoE3/26MiniMaxSemi-ouvert
83
965
-12/+1348189134 mWh
XL - 405 MdsDense7/24NousSemi-ouvert
84
965
-10/+1379379134 mWh
XL - 405 MdsDense7/24MetaSemi-ouvert
85
952
-15/+161347N/AXS - (estimation)Propriétaire4/25OpenAIPropriétaire
86
952
-14/+1413204095 mWh
XL - 744 MdsMoE4/26ZhipuSemi-ouvert
87
950
-13/+1422791601 mWh
L - 397 MdsMoE2/26AlibabaSemi-ouvert
88
943
-11/+7399490 mWh
XS - 9 MdsDense6/24GoogleSemi-ouvert
89
943
-12/+1615124095 mWh
XL - 744 MdsMoE2/26ZhipuSemi-ouvert
90
941
-12/+131705376 mWh
L - 120 MdsMoE3/26NvidiaSemi-ouvert
91
941
-14/+1990589 mWh
XS - 8 MdsDense10/24CohereSemi-ouvert
92
938
-8/+10666496 mWh
XS - 14 MdsDense12/24MicrosoftSemi-ouvert
93
935
-12/+19747N/AXL - (estimation)Propriétaire5/26AlibabaPropriétaire
94
923
-10/+141693658 mWh
M - 70 MdsDense1/25DeepSeekSemi-ouvert
95
922
-9/+1512401892 mWh
L - 357 MdsMoE12/25ZhipuSemi-ouvert
96
919
-8/+16105883 mWh
S - 30 MdsMoE5/25AlibabaSemi-ouvert
97
918
-6/+13444083 mWh
S - 21 MdsMoE8/25OpenAISemi-ouvert
98
916
-5/+11750289 mWh
XS - 8 MdsDense7/24MetaSemi-ouvert
99
911
-5/+152297193 mWh
S - 56 MdsMoE12/23Mistral AISemi-ouvert
100
905
-3/+122610166 mWh
S - 35 MdsMoE2/26AlibabaSemi-ouvert
101
896
-4/+12131588 mWh
XS - 7 MdsDense9/24AlibabaSemi-ouvert
102
892
-3/+102789N/AS - (estimation)Propriétaire9/24LiquidPropriétaire
103
873
-4/+4504694 mWh
XS - 12 MdsDense7/24Mistral AISemi-ouvert
104
872
-7/+1620589 mWh
XS - 8 MdsDense7/25AlibabaSemi-ouvert
105
865
-3/+6985118 mWh
S - 32 MdsDense4/25AlibabaSemi-ouvert
106
859
-2/+443551063 mWh
L - 176 MdsMoE4/24Mistral AISemi-ouvert
107
851
-4/+5138688 mWh
XS - 14 MdsDense2/25jpacificoSemi-ouvert
108
837
-3/+5238383 mWh
XS - 3.8 MdsDense8/24MicrosoftSemi-ouvert
109
791
-3/+430896 mWh
XS - 14 MdsDense9/24jpacificoSemi-ouvert
110
760
-2/+1752118 mWh
S - 32 MdsDense11/25Ai2Open source
111
759
-1/+66590 mWh
XS - 9 MdsDense5/2401-aiSemi-ouvert
112
750
-0/+78088 mWh
XS - 7 MdsDense7/24AlibabaSemi-ouvert

Les modèles les plus appréciés sont-ils économes en énergie ?

Ce graphique représente pour chaque modèle le score de satisfaction (score Bradley Terry) en fonction de l’estimation de la consommation énergétique moyenne pour 1000 tokens. La consommation énergétique est estimée à partir de la méthodologie Ecologits et repose sur la prise en compte de deux paramètres: la taille des modèles (nombre de paramètres) et leur architecture. Pour les modèles propriétaires, ces informations ne sont pas ou que partiellement communiquées. C’est pourquoi ils sont exclus du graphique ci-dessous.

Score de satisfaction Bradley-Terry (BT) VS Consommation moyenne pour 1000 tokens

Sélectionnez un modèle pour connaitre son score Bradley-Terry (BT) et sa consommation énergétique

Score Bradley-Terry (BT)
7508008509009501000105011005001000150020002500300035004000
Consommation moyenne pour 1000 tokens (mWh)
Filtre par consommation énergétique moyenne pour 1000 tokens
Taille (paramètres)
Visibles

Architecture du modèle

  • MoE Infobulle L’architecture Mixture of Experts (MoE) utilise un mécanisme de routage pour n’activer, en fonction de l’entrée, que certains sous-ensembles spécialisés (“experts”) du réseau de neurones. Cela permet de construire des modèles très grands tout en gardant un coût de calcul réduit, car seule une partie du réseau est utilisée à chaque étape.
  • Dense Infobulle L’architecture dense désigne un type de réseau de neurones dans lequel chaque neurone d’une couche est connecté à tous les neurones de la couche suivante. Cela permet à tous les paramètres de la couche de contribuer au calcul de la sortie.
  • Matformer Infobulle Imaginez des poupées russes (matryoshkas → matryoshka transformer → Matformer) : chaque bloc contient plusieurs sous-modèles imbriqués de tailles croissantes, partageant les mêmes paramètres. Cela permet, à chaque requête, de sélectionner un modèle de capacité adaptée, selon la mémoire ou la latence disponibles, sans avoir besoin de ré-entraîner différents modèles.

Comment trouver le bon équilibre entre performance perçue et sobriété énergétique ? Exemples de lecture du graphique

  • Plus un modèle est situé en haut du graphique, plus son score de satisfaction Bradley-Terry est élevé. Plus un modèle est situé sur la gauche du graphique, moins il consomme d’énergie par rapport aux autres modèles.
  • En haut à gauche se trouvent les modèles qui plaisent et qui consomment peu d’énergie par rapport aux autres modèles.
  • Au-delà de la taille, l’architecture a un impact sur la consommation énergétique moyenne des modèles: par exemple, à gabarit similaire, le modèle Llama 3 405B (architecture dense, 405 milliards de paramètres) consomme 10 fois plus d’énergie en moyenne que le modèle GLM 4.5 (architecture MOE, 355 milliards de paramètres et 32 milliards de paramètres actifs).

Pourquoi les modèles propriétaires ne sont-ils pas affichés sur le graphique ?

L’estimation de la consommation énergétique pour l’inférence des modèles repose sur la méthodologie Ecologits qui prend en compte la taille et l’architecture des modèles. Or ces informations ne sont pas rendues publiques par les éditeurs de modèles pour les modèles dits « propriétaires ».

Nous prenons ainsi le parti de ne pas intégrer les modèles propriétaires au graphique tant que les informations contribuant au calcul de consommation énergétique ne sont pas transparentes.

Comment est calculé l’impact énergétique des modèles ?

compar:IA utilise la méthodologie développée par Ecologits (GenAI Impact) pour fournir une estimation du bilan énergétique lié à l’inférence des modèles d’IA générative conversationnelle. Cette estimation permet aux utilisateurs de comparer l'impact environnemental de différents modèles d'IA pour une même requête. Cette transparence est essentielle pour encourager le développement et l'adoption de modèles d'IA plus éco-responsables.

Ecologits applique les principes de l'analyse du cycle de vie (ACV) conformément à la norme ISO 14044 en se concentrant pour le moment sur l'impact de l'inférence (c'est-à-dire l'utilisation des modèles pour répondre aux requêtes) et de la fabrication des cartes graphiques (extraction des ressources, fabrication et transport).

La consommation électrique du modèle est estimée en tenant compte de divers paramètres tels que la taille et l’architecture du modèle d'IA utilisé, la localisation des serveurs où sont déployés les modèles et le nombre de tokens de sortie. Le calcul de l’indicateur de potentiel de réchauffement climatique exprimé en équivalent CO2 est dérivé de la mesure de consommation électrique du modèle.

Il est important de noter que les méthodologies d'évaluation de l'impact environnemental de l'IA sont encore en développement.

Données du graphique en tableau

Mise à jour le 7/18/2026

Télécharger les données
Des votes… au classement des modèles
Modèle
Score de
satisfaction BT
Infobulle Score statistique estimé selon le modèle Bradley-Terry reflétant la probabilité qu'un modèle soit préféré à un autre. Ce score est calculé à partir de l'ensemble des votes et réactions des utilisateurs. Pour en savoir plus, rendez-vous sur l’onglet méthodologie.
Conso. moyenne
(1000 tokens)
Infobulle Mesurée en milliwattheures, l’énergie consommée représente l'électricité utilisée par le modèle pour traiter une requête et générer la réponse correspondante. La consommation énergétique des modèles dépend de leur taille et de leur architecture. Nous prenons le parti d’afficher en grisé non analysés (N/A) les modèles propriétaires pour lesquels nous ne disposons pas d’information transparente sur la taille et l’architecture.
Taille
(paramètres)
Infobulle Taille du modèle en milliards de paramètres, catégorisée selon cinq classes. Pour les modèles propriétaires, cette taille n’est pas communiquée.
Architecture Infobulle L'architecture d'un modèle LLM désigne les principes de conception qui définissent comment les composants d'un réseau de neurones sont agencés et interagissent pour transformer les données d'entrée en sorties prédictives, incluant le mode d'activation des paramètres (dense vs. sparse), la spécialisation des composants et les mécanismes de traitement de l'information (transformers, réseaux convolutifs, architectures hybrides).
Organisation
Licence
101181 mWh XS - 8 MdsMoELiquidSemi-ouvert
97582 mWh S - 24 MdsMoELiquidSemi-ouvert
91983 mWh S - 30 MdsMoEAlibabaSemi-ouvert
91883 mWh S - 21 MdsMoEOpenAISemi-ouvert
83783 mWh XS - 3.8 MdsDenseMicrosoftSemi-ouvert
109084 mWh S - 26 MdsMoEGoogleSemi-ouvert
101184 mWh XS - 4 MdsDenseGoogleSemi-ouvert
100684 mWh XS - 8 MdsMatformerGoogleSemi-ouvert
89688 mWh XS - 7 MdsDenseAlibabaSemi-ouvert
85188 mWh XS - 14 MdsDensejpacificoSemi-ouvert
75088 mWh XS - 7 MdsDenseAlibabaSemi-ouvert
98089 mWh XS - 8 MdsDenseIBMSemi-ouvert
94189 mWh XS - 8 MdsDenseCohereSemi-ouvert
91689 mWh XS - 8 MdsDenseMetaSemi-ouvert
87289 mWh XS - 8 MdsDenseAlibabaSemi-ouvert
94390 mWh XS - 9 MdsDenseGoogleSemi-ouvert
75990 mWh XS - 9 MdsDense01-aiSemi-ouvert
104094 mWh XS - 12 MdsDenseGoogleSemi-ouvert
87394 mWh XS - 12 MdsDenseMistral AISemi-ouvert
93896 mWh XS - 14 MdsDenseMicrosoftSemi-ouvert
79196 mWh XS - 14 MdsDensejpacificoSemi-ouvert
975106 mWh S - 22 MdsDenseEuroLLMSemi-ouvert
1041109 mWh S - 24 MdsDenseMistral AISemi-ouvert
1019109 mWh S - 24 MdsDenseMistral AISemi-ouvert
996109 mWh S - 24 MdsDenseMistral AISemi-ouvert
978109 mWh S - 24 MdsDenseMistral AISemi-ouvert
1069112 mWh S - 27 MdsDenseGoogleSemi-ouvert
989112 mWh S - 27 MdsDenseGoogleSemi-ouvert
1105117 mWh S - 31 MdsDenseGoogleSemi-ouvert
989118 mWh S - 32 MdsDenseCohereSemi-ouvert
985118 mWh S - 32 MdsDenseAlibabaSemi-ouvert
865118 mWh S - 32 MdsDenseAlibabaSemi-ouvert
760118 mWh S - 32 MdsDenseAi2Open source
905166 mWh S - 35 MdsMoEAlibabaSemi-ouvert
911193 mWh S - 56 MdsMoEMistral AISemi-ouvert
1073332 mWh M - 80 MdsMoEAlibabaSemi-ouvert
971342 mWh L - 117 MdsMoEOpenAISemi-ouvert
1030347 mWh L - 119 MdsMoEMistral AISemi-ouvert
941376 mWh L - 120 MdsMoENvidiaSemi-ouvert
1016400 mWh L - 109 MdsMoEMetaSemi-ouvert
1001658 mWh M - 70 MdsDenseNvidiaSemi-ouvert
998658 mWh M - 70 MdsDenseNousSemi-ouvert
992658 mWh M - 70 MdsDenseMetaSemi-ouvert
988658 mWh M - 70 MdsDenseSwiss AIOpen source
977658 mWh M - 70 MdsDenseMetaSemi-ouvert
923658 mWh M - 70 MdsDenseDeepSeekSemi-ouvert
1000733 mWh L - 229 MdsMoEMiniMaxSemi-ouvert
997733 mWh L - 230 MdsMoEMiniMaxSemi-ouvert
968733 mWh L - 230 MdsMoEMiniMaxSemi-ouvert
1046857 mWh L - 111 MdsDenseCohereSemi-ouvert
8591063 mWh L - 176 MdsMoEMistral AISemi-ouvert
10751524 mWh L - 284 MdsMoEDeepSeekSemi-ouvert
10561524 mWh L - 398 MdsMoEArceeSemi-ouvert
10391524 mWh L - 398 MdsMoEArceeSemi-ouvert
10381601 mWh XL - 400 MdsMoEMetaSemi-ouvert
9501601 mWh L - 397 MdsMoEAlibabaSemi-ouvert
10361892 mWh L - 355 MdsMoEZhipuSemi-ouvert
10131892 mWh L - 357 MdsMoEZhipuSemi-ouvert
9221892 mWh L - 357 MdsMoEZhipuSemi-ouvert
10561951 mWh XL - 480 MdsMoEAlibabaSemi-ouvert
10753785 mWh XL - 1000 MdsMoEMoonshot AISemi-ouvert
10203785 mWh XL - 1000 MdsMoEMoonshot AISemi-ouvert
10163785 mWh XL - 1000 MdsMoEMoonshot AISemi-ouvert
10143785 mWh XL - 1000 MdsMoEMoonshot AISemi-ouvert
10913979 mWh XL - 685 MdsMoEDeepSeekSemi-ouvert
10893979 mWh XL - 671 MdsMoEDeepSeekSemi-ouvert
10633979 mWh XL - 685 MdsMoEDeepSeekSemi-ouvert
10603979 mWh XL - 685 MdsMoEDeepSeekSemi-ouvert
10063979 mWh XL - 671 MdsMoEDeepSeekSemi-ouvert
10063979 mWh XL - 685 MdsMoEDeepSeekSemi-ouvert
9524095 mWh XL - 744 MdsMoEZhipuSemi-ouvert
9434095 mWh XL - 744 MdsMoEZhipuSemi-ouvert
10494134 mWh XL - 675 MdsMoEMistral AISemi-ouvert
10428890 mWh XL - 1600 MdsMoEDeepSeekSemi-ouvert
9659134 mWh XL - 405 MdsDenseNousSemi-ouvert
9659134 mWh XL - 405 MdsDenseMetaSemi-ouvert

Comment choisir la méthode de classement des modèles ?

Depuis 2024, des milliers d’utilisateurs ont utilisé compar:IA pour comparer les réponses de différents modèles, générant ainsi des centaines de milliers de votes. Compter simplement le nombre de victoires ne suffit pas pour établir un classement. Un système équitable doit être statistiquement robuste, s’ajuster après chaque confrontation, et refléter réellement la valeur des performances obtenues.

C’est dans cette perspective qu’a été mis en place un classement basé sur le modèle Bradley-Terry, élaboré en collaboration avec les équipes du Pôle d’Expertise de la Régulation numérique (PEReN), à partir de l’ensemble des votes et réactions collectés sur la plateforme. Pour aller plus loin, consultez notre carnet méthodologique.

Deux manières de classer les modèles

Classement par taux de victoire

Définition : Système de classement empirique des modèles reposant sur le pourcentage de parties gagnées par un modèle contre tous les autres modèles.

Problèmes principaux

  • Biais du nombre de parties : un modèle ayant remporté trois victoires sur trois “matchs” affiche un taux de victoire de 100 %, mais ce score est peu significatif étant basé sur très peu de données.
  • Aucune prise en compte de la difficulté des matchs : battre un modèle “débutant” ou un “expert” compte pareil. Les taux de victoire ne sont pas équitables puisqu’ils ne tiennent pas compte de la difficulté des matchs.
  • Stagnation : à long terme, beaucoup de bons modèles finissent autour de 50 % de taux de victoire car ils affrontent des modèles de leur niveau, ce qui rend le classement peu discriminant.

Classement Bradley-Terry (BT)

Définition : Système de classement où le gain ou la perte de points dépend du résultat (victoire/défaite/nul et du niveau estimé de l’adversaire : si un modèle plus faible bat un modèle plus fort, sa progression dans le classement est plus importante.

Avantages

  • Modèle probabiliste : on peut estimer le résultat probable de n'importe quelle confrontation, même entre des modèles n'ayant jamais été directement comparés.
  • Prise en compte de la difficulté des matchs : les scores estimés à partir du modèle Bradley Terry tiennent compte du niveau des adversaires rencontrés, permettant une comparaison équitable entre modèles.
  • Meilleure gestion de l’incertitude : l'intervalle de confiance intègre l'ensemble du réseau de comparaisons. Cela permet une estimation plus précise de l'incertitude, surtout pour les modèles ayant peu de confrontations directes mais beaucoup d'adversaires communs.

Contrôle du style : neutraliser l’effet de la présentation

Un modèle peut grimper dans le classement simplement en répondant plus longuement ou avec une mise en forme plus riche (titres, gras, listes), sans être plus pertinent sur le fond. Le contrôle du style, inspiré du « Style Control » de LMArena, retire cet effet : une régression logistique sépare, dans chaque vote, ce qui revient à la force du modèle de ce qui revient à la présentation.

Le score affiché devient alors un Elo « débiaisé du style » : le classement que l’on obtiendrait si les deux réponses comparées étaient mises en forme de la même manière. Le contrôle du style est activé par défaut ; le bouton « Contrôle du style » en haut du tableau permet de revenir au classement Bradley-Terry brut pour comparer.

Effet mesuré de la présentation

Coefficients de la régression estimés sur l’ensemble des votes. Une valeur positive indique que cet axe de présentation est associé à une probabilité de victoire plus élevée une fois la force du modèle prise en compte. C’est précisément la part que le contrôle du style retire du classement.

  • Longueur de la réponse +0.305
  • Titres +0.087
  • Texte en gras +0.164
  • Listes à puces +0.062

La longueur et les marqueurs markdown sont corrélés : ces coefficients se lisent conjointement, et non comme des effets indépendants pris isolément.

Impact du choix de la méthode sur le classement des modèles

10 premiers modèles du classement selon de taux de victoire « empirique »

50%55%60%65%70%gemini-2.0-flashgemini-3-flash-previewgemini-3.1-flash-lite-previewqwen3-max-2025-09-23gemma-4-31b-itclaude-4-6-sonnetgpt-5.4gpt-5.5gpt-5.2gpt-5.3

En se basant uniquement sur le taux de victoire moyen, on peut obtenir un classement global, mais ce calcul suppose que chaque modèle ait joué contre tous les autres.

Cette méthode n'est pas idéale car elle nécessite les données de toutes les combinaisons de modèles et ès qu’on augmente le nombre de modèles, cela devient vite coûteux et lourd à maintenir.

10 premiers modèles du classement selon de taux de victoire estimé avec le modèle Bradley-Terry

50%55%60%65%70%gpt-5.3gemini-3-flash-previewclaude-4-6-sonnetgemini-3.1-flash-lite-previewgpt-5.5gemini-2.0-flashgpt-5.4gemma-4-31b-itqwen3-max-2025-09-23gpt-5.2

Le modèle Bradley-Terry transforme un ensemble de comparaisons locales et potentiellement incomplètes en un système de classement global cohérent et statistiquement robuste, là où le taux de victoire empirique reste limité aux observations directes.

Activé
Infobulle Retire l’effet de la mise en forme (longueur de la réponse, titres, gras, listes) du classement, pour que le score reflète le fond plutôt que la présentation. Activé par défaut. Détails dans l’onglet Méthodologie.