Warum dieser Benchmark nützlich ist
Tool Calling ist die Sanitäranlage hinter Agenten, Automationen und Forschungsassistenten. BFCL macht daraus einen öffentlichen Test statt jede Function-Call-Demo als Evidenz zu behandeln.
BFCL
Ob ein Modell Funktionsaufrufe über Single-Turn-, Multi-Turn-, parallele und Live-API-artige Tool-Use-Aufgaben korrekt auswählt und formatiert.
Tool Calling ist die Sanitäranlage hinter Agenten, Automationen und Forschungsassistenten. BFCL macht daraus einen öffentlichen Test statt jede Function-Call-Demo als Evidenz zu behandeln.
Modelle nur innerhalb derselben BFCL-Version und Kategorie vergleichen. Ein Modell kann bei einfachen Calls stark und bei parallelen oder mehrstufigen Calls schwach sein.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Sonnet 4.6AnthropicV4 aggregate score; drill into multi-turn and parallel sub-scores before choosing. | 2026-02-17 | 88.7% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 87.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 3 | Claude Opus 4.8Anthropic | 2026-05-28 | 86.9% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 4 | Kimi K2.6Moonshot | 2026-04-20 | 85.2% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 5 | GPT 5.4OpenAI | 2026-03-05 | 83.8% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 6 | Gemini 3.5 FlashGoogle | 2026-05-19 | 82.3% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 7 | Gemini 3.1 ProGoogle | 2026-02-19 | 81.6% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 8 | Mistral Large 3Mistral | 2025-12-02 | 80.1% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 9 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 79.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 10 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 78.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 11 | o3OpenAIStrong in simple single-turn; drops in multi-turn complexity. | 2025-04-16 | 78.1% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 12 | Grok 4.3xAI | 2026-04-30 | 77.2% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 13 | DeepSeek V4 Flash MaxDeepSeek | 2026-04-24 | 76.8% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 14 | MiniMax M3MiniMax | 2026-05-31 | 76.2% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 15 | Llama 4 MaverickMeta | 2026-04-05 | 75.9% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 16 | DeepSeek V4DeepSeek | 2026-04-24 | 74.6% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 17 | Llama 4 ScoutMeta | 2026-04-05 | 74.1% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 18 | DeepSeek R1DeepSeek | 2025-01-20 | 72.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 19 | Claude Haiku 4.5Anthropic | 2025-10-01 | 71.8% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 20 | Cohere Command ACohere | 2026-03-15 | 70.6% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
Primärquelle ist das Berkeley-Gorilla-Leaderboard. VerdictPal sollte Kategorie und BFCL-Version in jeder Score-Zeile speichern.
Das Leaderboard ersetzt keinen Produkttest mit deinen Schemas, deinem Auth-Modell, Fehlerhandling und adversarial Inputs.
Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Ob ein Modell Funktionsaufrufe über Single-Turn-, Multi-Turn-, parallele und Live-API-artige Tool-Use-Aufgaben korrekt auswählt und formatiert.
Ein starkes BFCL-Ergebnis sagt nichts aus über:
Accuracy-artiger Wert je BFCL-Kategorie und Version. Die konkrete Kategorie ist wichtiger als das Aggregat. Aufgabenformat: Function-/Tool-Calling-Aufgaben mit schema-gebundenen erwarteten Outputs über einfache, mehrstufige, parallele und live-ähnliche Settings.
BFCL ist im Atlas derzeit als Aktiv markiert.
Das Kontaminationsrisiko für BFCL ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.