- Reasoning
- 93
- Coding
- 70
- Agentic
- 100
- Long context
- 70
83average across 4 tested families
Vals-Index-Zeilen zuerst. Modelle ohne Vals-Zeile fallen auf Artificial Analysis zurück. Quellen-Badges zeigen Einzel- vs. bestätigte Quelle — kein Cross-Benchmark-Sieger.
Gemischte Kosten pro Million Tokens (Input + 3× Output) auf der X-Achse, log-Skala. Intelligence-Index auf der Y-Achse — Vals wenn vorhanden, sonst Artificial Analysis. Punkte nach Kontextfenster skaliert, verbunden durch die Pareto-Frontier (beste Intelligence pro Kostenstufe).
Der frühere Schnitt nur mit Input-Kosten. Nützlich bei input-lastiger Arbeit (RAG, Dokument-Q&A) statt output-lastig.
Hover or tab any dot for name, score, and input price.
Ältere Releases, Spezialkonfigurationen (Codex CLI, ForgeCode) und Ad-hoc-Aggregationen. Wir zeigen ihre Quell-Scores, promoten sie aber erst mit voller Modellkarte in den Atlas.
Der höchste Intelligence-Receipt pro Family-Slice. Sanity-Check, dass eine einzelne Zahl keine Schwachstelle versteckt.
83average across 4 tested families
78average across 4 tested families
91average across 3 tested families
Ein Modell ohne Zeile in einer Family wurde dort öffentlich nicht getestet. Das zeigen wir — statt Schwäche zu simulieren.
Jede Tool-Karte hier ist mit mindestens einem Modell oben verknüpft. Derselbe Wrapper, der den Harness versteckt, kann auch den Preis verstecken.