Benchmarks / Tool-Nutzung

Berkeley Function Calling Leaderboard

BFCL

Ob ein Modell Funktionsaufrufe über Single-Turn-, Multi-Turn-, parallele und Live-API-artige Tool-Use-Aufgaben korrekt auswählt und formatiert.

Tool-NutzungSolidAktivMittleres KontaminationsrisikoSeit 2024
Was dieser Benchmark nicht misst
  • Nicht, ob das Tool-Ergebnis nützlich ist — BFCL fokussiert Auswahl und Formatierung von Calls, nicht den gesamten Produktworkflow danach.
  • Keine Sicherheit der Tool-Ausführung — Berechtigungen, Prompt-Injection-Resistenz und Audit-Logs brauchen weiter produktspezifische Tests.
  • Keine Langhorizont-Agentenzuverlässigkeit — bestandene Function-Call-Aufgaben beweisen nicht, dass ein System sich über Dutzende Schritte erholt.
Analyse

Warum dieser Benchmark nützlich ist

Tool Calling ist die Sanitäranlage hinter Agenten, Automationen und Forschungsassistenten. BFCL macht daraus einen öffentlichen Test statt jede Function-Call-Demo als Evidenz zu behandeln.

Umfang

Abdeckung

Aufgabenfamilie
Tool-Nutzung
Format
Function-/Tool-Calling-Aufgaben mit schema-gebundenen erwarteten Outputs über einfache, mehrstufige, parallele und live-ähnliche Settings.
Bewertung
Accuracy-artiger Wert je BFCL-Kategorie und Version. Die konkrete Kategorie ist wichtiger als das Aggregat.
Verantwortliche Stelle
Berkeley Gorilla
Lesehilfe

So liest du die Scores

Modelle nur innerhalb derselben BFCL-Version und Kategorie vergleichen. Ein Modell kann bei einfachen Calls stark und bei parallelen oder mehrstufigen Calls schwach sein.

Blinde Flecken

Was er nicht abdeckt

  • Nicht, ob das Tool-Ergebnis nützlich ist — BFCL fokussiert Auswahl und Formatierung von Calls, nicht den gesamten Produktworkflow danach.
  • Keine Sicherheit der Tool-Ausführung — Berechtigungen, Prompt-Injection-Resistenz und Audit-Logs brauchen weiter produktspezifische Tests.
  • Keine Langhorizont-Agentenzuverlässigkeit — bestandene Function-Call-Aufgaben beweisen nicht, dass ein System sich über Dutzende Schritte erholt.
Scores

Evidenz-Ledger

20 Zeilen
2020 Zeilen
88.7%bester Score
0quellgeprüft
1Quellen
2026-04-15Quelldatum
Berkeley BFCL20

official-page · manual

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Sonnet 4.688.7% · Berkeley Function Calling Leaderboard V4
  2. GPT 5.587.4% · Berkeley Function Calling Leaderboard V4
  3. Claude Opus 4.886.9% · Berkeley Function Calling Leaderboard V4
  4. Kimi K2.685.2% · Berkeley Function Calling Leaderboard V4
  5. GPT 5.483.8% · Berkeley Function Calling Leaderboard V4

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Sonnet 4.6AnthropicV4 aggregate score; drill into multi-turn and parallel sub-scores before choosing.2026-02-1788.7%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
2GPT 5.5OpenAI2026-04-2387.4%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
3Claude Opus 4.8Anthropic2026-05-2886.9%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
4Kimi K2.6Moonshot2026-04-2085.2%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
5GPT 5.4OpenAI2026-03-0583.8%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
6Gemini 3.5 FlashGoogle2026-05-1982.3%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
7Gemini 3.1 ProGoogle2026-02-1981.6%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
8Mistral Large 3Mistral2025-12-0280.1%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
9Gemini 3 Flash PreviewGoogle2025-12-1779.4%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
10Qwen 3.7 MaxAlibaba2026-05-2078.4%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
11o3OpenAIStrong in simple single-turn; drops in multi-turn complexity.2025-04-1678.1%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
12Grok 4.3xAI2026-04-3077.2%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
13DeepSeek V4 Flash MaxDeepSeek2026-04-2476.8%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
14MiniMax M3MiniMax2026-05-3176.2%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
15Llama 4 MaverickMeta2026-04-0575.9%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
16DeepSeek V4DeepSeek2026-04-2474.6%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
17Llama 4 ScoutMeta2026-04-0574.1%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
18DeepSeek R1DeepSeek2025-01-2072.4%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
19Claude Haiku 4.5Anthropic2025-10-0171.8%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
20Cohere Command ACohere2026-03-1570.6%
Berkeley Function Calling Leaderboard V42026-04-15
Prüfung nötig
Methode

Was er abdeckt

Primärquelle ist das Berkeley-Gorilla-Leaderboard. VerdictPal sollte Kategorie und BFCL-Version in jeder Score-Zeile speichern.

Score-Obergrenze

Wo er an Grenzen stößt

Das Leaderboard ersetzt keinen Produkttest mit deinen Schemas, deinem Auth-Modell, Fehlerhandling und adversarial Inputs.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.