Benchmarks / Tool-Nutzung

MCP Atlas

Wie zuverlässig ein Modell über das Model Context Protocol bereitgestellte Werkzeuge auswählt, sequenziert und wiederherstellt — inklusive Schema-Treue, Fehlerbehandlung und Werkzeug-Ketten-Schlussfolgern.

Was dieser Benchmark nicht misst
  • Harness-Qualität — unterschiedliche MCP-Server-Implementierungen können Scores künstlich heben oder senken.
  • Kosten — ein Modell, das ein Werkzeug stumpf bis zum Erfolg hämmert, wird gleich bewertet wie eines, das es sauber einmal aufruft.
  • Echte Produktionszuverlässigkeit — das sind saubere Laboraufgaben, nicht die unordentlichen Erholungspfade eines langlebigen Agenten.
Analyse

Warum dieser Benchmark nützlich ist

Wenn es darum geht, ob ein Modell MCP-Tool-Calls auswählen, sequenzieren und wiederherstellen kann — Schema-Treue und Werkzeug-Ketten-Reasoning, kein Chat-Polish.

Umfang

Abdeckung

Aufgabenfamilie
Tool-Nutzung
Format
Bewertete Werkzeugaufruf-Sequenzen gegen einen MCP-Server; die Suite misst sowohl Aufrufkorrektheit als auch Erholung von Zwischenfehlern.
Bewertung
Prozent der Ende-zu-Ende abgeschlossenen Aufgaben; Quelle-Repo für Harness- und Scoring-Skripte.
Verantwortliche Stelle
MCP-Atlas community
Lesehilfe

So liest du die Scores

Ende-zu-Ende-Aufgabenabschluss in Prozent gegen einen MCP-Server. Harness und Server-Implementierung können Scores verschieben; Retry-Kosten werden nicht bewertet.

Blinde Flecken

Was er nicht abdeckt

  • Harness-Qualität — unterschiedliche MCP-Server-Implementierungen können Scores künstlich heben oder senken.
  • Kosten — ein Modell, das ein Werkzeug stumpf bis zum Erfolg hämmert, wird gleich bewertet wie eines, das es sauber einmal aufruft.
  • Echte Produktionszuverlässigkeit — das sind saubere Laboraufgaben, nicht die unordentlichen Erholungspfade eines langlebigen Agenten.
Scores

Evidenz-Ledger

10 Zeilen
1010 Zeilen
83.6%bester Score
1quellgeprüft
1Quellen
2026-06-09bis 2026-05-15
Papers / model cards10

manual-snapshot · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Opus 4.879.2% · MCP Atlas leaderboard
  2. GPT 5.577.8% · MCP Atlas leaderboard
  3. Claude Sonnet 4.675.4% · MCP Atlas leaderboard
  4. Gemini 3.1 Pro74.1% · MCP Atlas leaderboard
  5. DeepSeek V4 Pro Max72.6% · MCP Atlas leaderboard

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3.5 FlashGoogle2026-05-1983.6%
MCP Atlas leaderboard2026-05-15
Quelle geprüft
2Claude Opus 4.8Anthropic2026-05-2879.2%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
3GPT 5.5OpenAI2026-04-2377.8%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
4Claude Sonnet 4.6Anthropic2026-02-1775.4%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
5Gemini 3.1 ProGoogle2026-02-1974.1%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
6DeepSeek V4 Pro MaxDeepSeek2026-04-2472.6%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
7Qwen 3.7 MaxAlibaba2026-05-2071.8%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
8Mistral Large 3Mistral2025-12-0270.4%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
9Kimi K2.6Moonshot2026-04-2069.7%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
10MiniMax M3MiniMax2026-05-3168.9%
MCP Atlas leaderboard2026-06-09
Prüfung nötig
Methode

Was er abdeckt

Dieser Benchmark gehört zur Familie tool-nutzung. Sein Format: Bewertete Werkzeugaufruf-Sequenzen gegen einen MCP-Server; die Suite misst sowohl Aufrufkorrektheit als auch Erholung von Zwischenfehlern. Der Score sollte immer mit Aufgabenformat, Bewertungsmethode, Quelldatum und Benchmark-Version gelesen werden.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst MCP Atlas?

Wie zuverlässig ein Modell über das Model Context Protocol bereitgestellte Werkzeuge auswählt, sequenziert und wiederherstellt — inklusive Schema-Treue, Fehlerbehandlung und Werkzeug-Ketten-Schlussfolgern.

Was beweist ein hoher MCP Atlas-Wert nicht?

Ein starkes MCP Atlas-Ergebnis sagt nichts aus über:

  • Harness-Qualität — unterschiedliche MCP-Server-Implementierungen können Scores künstlich heben oder senken.
  • Kosten — ein Modell, das ein Werkzeug stumpf bis zum Erfolg hämmert, wird gleich bewertet wie eines, das es sauber einmal aufruft.
  • Echte Produktionszuverlässigkeit — das sind saubere Laboraufgaben, nicht die unordentlichen Erholungspfade eines langlebigen Agenten.

Wie wird MCP Atlas bewertet?

Prozent der Ende-zu-Ende abgeschlossenen Aufgaben; Quelle-Repo für Harness- und Scoring-Skripte. Aufgabenformat: Bewertete Werkzeugaufruf-Sequenzen gegen einen MCP-Server; die Suite misst sowohl Aufrufkorrektheit als auch Erholung von Zwischenfehlern.

Ist MCP Atlas gesättigt?

MCP Atlas ist im Atlas derzeit als Aktiv markiert.

Können MCP Atlas-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für MCP Atlas ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.