Wie wir einordnen

Wie die Ranglisten von Best LLM Models entstehen: Arena Agent IPS auf der Startseite, Textwertungen auf der Textseite, und was wir nicht behaupten.

Bewertungsregeln & Baselines

Zwei unabhängige Wertungsachsen. Für Agenten nutzen wir den offiziellen LMSYS Arena IPS (Nettoverbesserung bei komplexen mehrstufigen Aufgaben mit Tool-Nutzung). Für Text, Code, Open Source, Schreiben, Bild und Video nutzen wir die Arena-Elo-Wertungen aus Blind-Duellen. Beide Messsysteme bleiben strikt getrennt.

Datenquelle: lmarena-ai/leaderboard-dataset (CC BY 4.0). Wir crawlen arena.ai nicht. Die automatische Datenübernahme lädt jeweils den neuesten offiziellen Snapshot direkt herunter.lmarena-ai/leaderboard-dataset

Balkendiagramme & Spezifikationen

Die Balkenlänge skaliert vom am niedrigsten bewerteten Modell bis zu Platz 1. Jeder Balken zeigt den offiziellen LMSYS-Arena-Score. Zudem werden Dialog-Sitzungen bzw. Stimmen sowie die auf models.dev verifizierten Token-Preise und Kontextfenster aufgeführt.

Spezifikation für API-Preise und Kontextfenster: models.dev

Plattformgrundsätze & Neutralität

  • Volle Unabhängigkeit: Wir führen keine internen Tests durch und veranstalten keine kommerziellen Duelle.
  • Keine künstlichen Mischwerte: Wir erfinden keine proprietären Gesamtnoten.
  • Strikte Trennung der Dimensionen: Agent-IPS wird niemals mit Text- oder Bildwertungen vermischt.
  • Verifizierte Spezifikationen: Token-Kosten und Kontextfenster basieren auf überprüfbaren Industriestandards.
  • Vollständige Datentransparenz: Direkte Verweise auf die offenen Datensätze der LMSYS-Organisation.

Open-Source-Kriterien

Wir halten uns strikt an Open-Weights-Standards: Ein Modell gilt als Open Source, wenn models.dev open_weights angibt oder die offizielle Arena-Lizenz nicht proprietär ist.