Benchmarks / Tool-Nutzung

MCP Atlas

Wie zuverlässig ein Modell über das Model Context Protocol bereitgestellte Werkzeuge auswählt, sequenziert und wiederherstellt — inklusive Schema-Treue, Fehlerbehandlung und Werkzeug-Ketten-Schlussfolgern.

Tool-NutzungSolidAktivNiedriges KontaminationsrisikoSeit 2026
Was dieser Benchmark nicht misst
  • Harness-Qualität — unterschiedliche MCP-Server-Implementierungen können Scores künstlich heben oder senken.
  • Kosten — ein Modell, das ein Werkzeug stumpf bis zum Erfolg hämmert, wird gleich bewertet wie eines, das es sauber einmal aufruft.
  • Echte Produktionszuverlässigkeit — das sind saubere Laboraufgaben, nicht die unordentlichen Erholungspfade eines langlebigen Agenten.
Analyse

Warum dieser Benchmark nützlich ist

Redaktionelle Einordnung ausstehendWir veröffentlichen zuerst Methodik und Ledger. Die benchmark-spezifische Analyse folgt nach der Desk-Prüfung.

Umfang

Abdeckung

Aufgabenfamilie
Tool-Nutzung
Format
Bewertete Werkzeugaufruf-Sequenzen gegen einen MCP-Server; die Suite misst sowohl Aufrufkorrektheit als auch Erholung von Zwischenfehlern.
Bewertung
Prozent der Ende-zu-Ende abgeschlossenen Aufgaben; Quelle-Repo für Harness- und Scoring-Skripte.
Verantwortliche Stelle
MCP-Atlas community
Lesehilfe

So liest du die Scores

Die Lesehilfe steht noch aus. Nutze bis zur Desk-Einordnung Aufgabenformat, Bewertungsmethode und Quelldaten im Ledger.

Blinde Flecken

Was er nicht abdeckt

  • Harness-Qualität — unterschiedliche MCP-Server-Implementierungen können Scores künstlich heben oder senken.
  • Kosten — ein Modell, das ein Werkzeug stumpf bis zum Erfolg hämmert, wird gleich bewertet wie eines, das es sauber einmal aufruft.
  • Echte Produktionszuverlässigkeit — das sind saubere Laboraufgaben, nicht die unordentlichen Erholungspfade eines langlebigen Agenten.
Scores

Evidenz-Ledger

10 Zeilen
1010 Zeilen
83.6%bester Score
1quellgeprüft
1Quellen
2026-06-09bis 2026-05-15
Papers / model cards10

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.879.2% · MCP Atlas leaderboard
  2. GPT 5.577.8% · MCP Atlas leaderboard
  3. Claude Sonnet 4.675.4% · MCP Atlas leaderboard
  4. Gemini 3.1 Pro74.1% · MCP Atlas leaderboard
  5. DeepSeek V4 Pro Max72.6% · MCP Atlas leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3.5 FlashGoogle2026-05-1983.6%
MCP Atlas leaderboard2026-05-15
Quelle geprüft
2Claude Opus 4.8Anthropic2026-05-2879.2%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
3GPT 5.5OpenAI2026-04-2377.8%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
4Claude Sonnet 4.6Anthropic2026-02-1775.4%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
5Gemini 3.1 ProGoogle2026-02-1974.1%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
6DeepSeek V4 Pro MaxDeepSeek2026-04-2472.6%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
7Qwen 3.7 MaxAlibaba2026-05-2071.8%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
8Mistral Large 3Mistral2025-12-0270.4%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
9Kimi K2.6Moonshot2026-04-2069.7%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
10MiniMax M3MiniMax2026-05-3168.9%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
Methode

Was er abdeckt

Die Notiz zur Datenqualität steht aus. Jede Ledger-Zeile trägt weiterhin Quellen-URL, Quelldatum und Zeitpunkt des Einlesens.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.