Wie wir einordnen
Wie die Ranglisten von Best LLM Models entstehen: Arena Agent IPS auf der Startseite, Textwertungen auf der Textseite, und was wir nicht behaupten.
Bewertungsregeln & Baselines
Zwei unabhängige Wertungsachsen. Für Agenten nutzen wir den offiziellen LMSYS Arena IPS (Nettoverbesserung bei komplexen mehrstufigen Aufgaben mit Tool-Nutzung). Für Text, Code, Open Source, Schreiben, Bild und Video nutzen wir die Arena-Elo-Wertungen aus Blind-Duellen. Beide Messsysteme bleiben strikt getrennt.
Balkendiagramme & Spezifikationen
Die Balkenlänge skaliert vom am niedrigsten bewerteten Modell bis zu Platz 1. Jeder Balken zeigt den offiziellen LMSYS-Arena-Score. Zudem werden Dialog-Sitzungen bzw. Stimmen sowie die auf models.dev verifizierten Token-Preise und Kontextfenster aufgeführt.
Plattformgrundsätze & Neutralität
- Volle Unabhängigkeit: Wir führen keine internen Tests durch und veranstalten keine kommerziellen Duelle.
- Keine künstlichen Mischwerte: Wir erfinden keine proprietären Gesamtnoten.
- Strikte Trennung der Dimensionen: Agent-IPS wird niemals mit Text- oder Bildwertungen vermischt.
- Verifizierte Spezifikationen: Token-Kosten und Kontextfenster basieren auf überprüfbaren Industriestandards.
- Vollständige Datentransparenz: Direkte Verweise auf die offenen Datensätze der LMSYS-Organisation.
Open-Source-Kriterien
Wir halten uns strikt an Open-Weights-Standards: Ein Modell gilt als Open Source, wenn models.dev open_weights angibt oder die offizielle Arena-Lizenz nicht proprietär ist.