Comment nous classons

Comment les classements Best LLM Models sont faits : Arena Agent IPS sur la page d’accueil, notes Texte sur la page Texte, et ce que nous ne prétendons pas.

Système de notation et références officielles

Deux systèmes de mesure distincts. Pour les Agents, nous utilisons l'IPS officiel de LMSYS Arena (gain net lors de sessions réelles avec usage d'outils). Pour le texte, le code, l'open source, l'écriture, les images et les vidéos, nous utilisons les scores de préférence humaine Arena Elo. Deux métriques distinctes qu'il ne faut pas mélanger.

Source des données : lmarena-ai/leaderboard-dataset (CC BY 4.0). Nous n'aspirons pas arena.ai. L'ingestion automatisée récupère directement le dernier instantané officiel dès sa publication.lmarena-ai/leaderboard-dataset

Échelle visuelle et caractéristiques techniques

La longueur des barres est étirée du dernier modèle classé jusqu'au n° 1. Chaque barre affiche le score officiel LMSYS Arena. Chaque ligne indique également le nombre de sessions ou de votes, ainsi que le coût par million de tokens et la fenêtre de contexte vérifiés sur models.dev.

Spécification de tarification API et fenêtre de contexte : models.dev

Principes de la plateforme et neutralité

  • Indépendance totale : nous n'organisons aucune évaluation payante ni duel promotionnel.
  • Aucun score synthétique artificiel : nous ne créons pas de moyenne composite propriétaire.
  • Séparation stricte des dimensions : nous ne mélangeons pas les scores d'agents avec les scores textuels ou visuels.
  • Spécifications techniques vérifiées : prix des tokens et fenêtres de contexte alignés sur les standards de l'industrie.
  • Traçabilité complète des données : liens directs vers les jeux de données ouverts officiels.

Norme des modèles open source

Nous suivons rigoureusement la définition open-weights : un modèle est classé comme open source sur cette plateforme si models.dev indique open_weights, ou si la licence officielle Arena est non propriétaire.