Warum dieser Benchmark nützlich ist
Wenn du ein menschliches Präferenzsignal im großen Maßstab brauchst — wie Antworten im blinden Nebeneinander-Chat wirken — keine Korrektheitsprüfung.
Benchmarks / Menschliche Präferenz
Chatbot Arena
Menschliche Präferenz im großen Maßstab: Menschen chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Stimmen werden zu einem Elo-Ranking.
Wenn du ein menschliches Präferenzsignal im großen Maßstab brauchst — wie Antworten im blinden Nebeneinander-Chat wirken — keine Korrektheitsprüfung.
Lies Elo-artige Werte mit Konfidenzintervallen. Überlappende Intervalle bedeuten Rauschen; Stil und Länge können Genauigkeit schlagen — als Präferenz lesen, nicht als Fähigkeitsbeweis.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | GPT 5.5OpenAIStyle-kontrolliertes Elo. Schlagzeilen-Ränge sind volatil — das 95-%-KI-Band lesen, nicht die Ganzzahl. | 2026-04-23 | 1473 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 2 | Claude Opus 4.8Anthropic | 2026-05-28 | 1462 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 3 | Gemini 3.5 FlashGoogle | 2026-05-19 | 1455 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 4 | Grok 4.3xAI | 2026-04-30 | 1441 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 5 | DeepSeek V4DeepSeek | 2026-04-24 | 1418 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 6 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 1409 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 7 | Gemini 3.1 ProGoogle | 2026-02-19 | 1402 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 8 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 1396 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 1388 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 10 | Claude Opus 4.7Anthropic | 2026-04-16 | 1412 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 11 | GPT 5.4OpenAI | 2026-03-05 | 1405 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 12 | MiniMax M3MiniMax | 2026-05-31 | 1376 | LMArena leaderboard2026-05-25 | Quelle geprüft |
| 13 | Claude Haiku 4.5Anthropic | 2025-10-01 | 1368 | LMArena leaderboard2026-05-25 | Quelle geprüft |
Dieser Benchmark gehört zur Familie menschliche präferenz. Sein Format: Offene, blinde Paarvergleiche im Chat; Ergebnis ist ein Bradley-Terry-/Elo-Wert mit Konfidenzintervallen. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Menschliche Präferenz im großen Maßstab: Menschen chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Stimmen werden zu einem Elo-Ranking.
Ein starkes LMArena (Chatbot Arena)-Ergebnis sagt nichts aus über:
Elo-Wert aus Millionen menschlicher Stimmen. Aufgabenformat: Offene, blinde Paarvergleiche im Chat; Ergebnis ist ein Bradley-Terry-/Elo-Wert mit Konfidenzintervallen.
LMArena (Chatbot Arena) ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für LMArena (Chatbot Arena) ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.