Warum dieser Benchmark nützlich ist
Wenn es darum geht, ob ein Modell MCP-Tool-Calls auswählen, sequenzieren und wiederherstellen kann — Schema-Treue und Werkzeug-Ketten-Reasoning, kein Chat-Polish.
Wie zuverlässig ein Modell über das Model Context Protocol bereitgestellte Werkzeuge auswählt, sequenziert und wiederherstellt — inklusive Schema-Treue, Fehlerbehandlung und Werkzeug-Ketten-Schlussfolgern.
Wenn es darum geht, ob ein Modell MCP-Tool-Calls auswählen, sequenzieren und wiederherstellen kann — Schema-Treue und Werkzeug-Ketten-Reasoning, kein Chat-Polish.
Ende-zu-Ende-Aufgabenabschluss in Prozent gegen einen MCP-Server. Harness und Server-Implementierung können Scores verschieben; Retry-Kosten werden nicht bewertet.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Gemini 3.5 FlashGoogle | 2026-05-19 | 83.6% | MCP Atlas leaderboard2026-05-15 | Quelle geprüft |
| 2 | Claude Opus 4.8Anthropic | 2026-05-28 | 79.2% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 3 | GPT 5.5OpenAI | 2026-04-23 | 77.8% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 4 | Claude Sonnet 4.6Anthropic | 2026-02-17 | 75.4% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 5 | Gemini 3.1 ProGoogle | 2026-02-19 | 74.1% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 6 | DeepSeek V4 Pro MaxDeepSeek | 2026-04-24 | 72.6% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 7 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 71.8% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 8 | Mistral Large 3Mistral | 2025-12-02 | 70.4% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 9 | Kimi K2.6Moonshot | 2026-04-20 | 69.7% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
| 10 | MiniMax M3MiniMax | 2026-05-31 | 68.9% | MCP Atlas leaderboard2026-06-09 | Prüfung nötig |
Dieser Benchmark gehört zur Familie tool-nutzung. Sein Format: Bewertete Werkzeugaufruf-Sequenzen gegen einen MCP-Server; die Suite misst sowohl Aufrufkorrektheit als auch Erholung von Zwischenfehlern. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.
Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Wie zuverlässig ein Modell über das Model Context Protocol bereitgestellte Werkzeuge auswählt, sequenziert und wiederherstellt — inklusive Schema-Treue, Fehlerbehandlung und Werkzeug-Ketten-Schlussfolgern.
Ein starkes MCP Atlas-Ergebnis sagt nichts aus über:
Prozent der Ende-zu-Ende abgeschlossenen Aufgaben; Quelle-Repo für Harness- und Scoring-Skripte. Aufgabenformat: Bewertete Werkzeugaufruf-Sequenzen gegen einen MCP-Server; die Suite misst sowohl Aufrufkorrektheit als auch Erholung von Zwischenfehlern.
MCP Atlas ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für MCP Atlas ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.