Benchmarks / Menschliche Präferenz

LMArena (Chatbot Arena)

Chatbot Arena

Menschliche Präferenz im großen Maßstab: Menschen chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Stimmen werden zu einem Elo-Ranking.

Was dieser Benchmark nicht misst
  • Korrektheit — Wähler belohnen, was gut aussieht; Formatierung, Länge und Selbstsicherheit können Genauigkeit schlagen.
  • Es ist ein Beliebtheitssignal, kein Fähigkeitstest — stilkontrollierte Rankings weichen teils stark vom Rohranking ab.
  • Elo-Abstände sind verrauscht — überlappende Konfidenzintervalle bedeuten, kleine Unterschiede sind nicht echt.
Analyse

Warum dieser Benchmark nützlich ist

Wenn du ein menschliches Präferenzsignal im großen Maßstab brauchst — wie Antworten im blinden Nebeneinander-Chat wirken — keine Korrektheitsprüfung.

Umfang

Abdeckung

Aufgabenfamilie
Menschliche Präferenz
Format
Offene, blinde Paarvergleiche im Chat; Ergebnis ist ein Bradley-Terry-/Elo-Wert mit Konfidenzintervallen.
Bewertung
Elo-Wert aus Millionen menschlicher Stimmen.
Verantwortliche Stelle
LMArena (formerly LMSYS)
Lesehilfe

So liest du die Scores

Lies Elo-artige Werte mit Konfidenzintervallen. Überlappende Intervalle bedeuten Rauschen; Stil und Länge können Genauigkeit schlagen — als Präferenz lesen, nicht als Fähigkeitsbeweis.

Blinde Flecken

Was er nicht abdeckt

  • Korrektheit — Wähler belohnen, was gut aussieht; Formatierung, Länge und Selbstsicherheit können Genauigkeit schlagen.
  • Es ist ein Beliebtheitssignal, kein Fähigkeitstest — stilkontrollierte Rankings weichen teils stark vom Rohranking ab.
  • Elo-Abstände sind verrauscht — überlappende Konfidenzintervalle bedeuten, kleine Unterschiede sind nicht echt.
Scores

Evidenz-Ledger

13 Zeilen
1313 Zeilen
1473bester Score
13quellgeprüft
1Quellen
2026-05-25Quelldatum
LMArena13

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. GPT 5.51473 · LMArena leaderboard
  2. Claude Opus 4.81462 · LMArena leaderboard
  3. Gemini 3.5 Flash1455 · LMArena leaderboard
  4. Grok 4.31441 · LMArena leaderboard
  5. DeepSeek V41418 · LMArena leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1GPT 5.5OpenAIStyle-kontrolliertes Elo. Schlagzeilen-Ränge sind volatil — das 95-%-KI-Band lesen, nicht die Ganzzahl.2026-04-231473
LMArena leaderboard2026-05-25
Quelle geprüft
2Claude Opus 4.8Anthropic2026-05-281462
LMArena leaderboard2026-05-25
Quelle geprüft
3Gemini 3.5 FlashGoogle2026-05-191455
LMArena leaderboard2026-05-25
Quelle geprüft
4Grok 4.3xAI2026-04-301441
LMArena leaderboard2026-05-25
Quelle geprüft
5DeepSeek V4DeepSeek2026-04-241418
LMArena leaderboard2026-05-25
Quelle geprüft
6Qwen 3.7 MaxAlibaba2026-05-201409
LMArena leaderboard2026-05-25
Quelle geprüft
7Gemini 3.1 ProGoogle2026-02-191402
LMArena leaderboard2026-05-25
Quelle geprüft
8Claude Sonnet 4.6Anthropic2026-02-171396
LMArena leaderboard2026-05-25
Quelle geprüft
9Kimi K2.6Moonshot2026-04-201388
LMArena leaderboard2026-05-25
Quelle geprüft
10Claude Opus 4.7Anthropic2026-04-161412
LMArena leaderboard2026-05-25
Quelle geprüft
11GPT 5.4OpenAI2026-03-051405
LMArena leaderboard2026-05-25
Quelle geprüft
12MiniMax M3MiniMax2026-05-311376
LMArena leaderboard2026-05-25
Quelle geprüft
13Claude Haiku 4.5Anthropic2025-10-011368
LMArena leaderboard2026-05-25
Quelle geprüft
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie menschliche präferenz. Sein Format: Offene, blinde Paarvergleiche im Chat; Ergebnis ist ein Bradley-Terry-/Elo-Wert mit Konfidenzintervallen. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst LMArena (Chatbot Arena)?

Menschliche Präferenz im großen Maßstab: Menschen chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Stimmen werden zu einem Elo-Ranking.

Was beweist ein hoher LMArena (Chatbot Arena)-Wert nicht?

Ein starkes LMArena (Chatbot Arena)-Ergebnis sagt nichts aus über:

  • Korrektheit — Wähler belohnen, was gut aussieht; Formatierung, Länge und Selbstsicherheit können Genauigkeit schlagen.
  • Es ist ein Beliebtheitssignal, kein Fähigkeitstest — stilkontrollierte Rankings weichen teils stark vom Rohranking ab.
  • Elo-Abstände sind verrauscht — überlappende Konfidenzintervalle bedeuten, kleine Unterschiede sind nicht echt.

Wie wird LMArena (Chatbot Arena) bewertet?

Elo-Wert aus Millionen menschlicher Stimmen. Aufgabenformat: Offene, blinde Paarvergleiche im Chat; Ergebnis ist ein Bradley-Terry-/Elo-Wert mit Konfidenzintervallen.

Ist LMArena (Chatbot Arena) gesättigt?

LMArena (Chatbot Arena) ist im Atlas derzeit als Aktiv markiert.

Können LMArena (Chatbot Arena)-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für LMArena (Chatbot Arena) ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.