Warum dieser Benchmark nützlich ist
Tool Calling ist die Sanitäranlage hinter Agenten, Automationen und Forschungsassistenten. BFCL macht daraus einen öffentlichen Test statt jede Function-Call-Demo als Evidenz zu behandeln.
Benchmarks / Tool-Nutzung
BFCL
Ob ein Modell Funktionsaufrufe über Single-Turn-, Multi-Turn-, parallele und Live-API-artige Tool-Use-Aufgaben korrekt auswählt und formatiert.
Tool Calling ist die Sanitäranlage hinter Agenten, Automationen und Forschungsassistenten. BFCL macht daraus einen öffentlichen Test statt jede Function-Call-Demo als Evidenz zu behandeln.
Modelle nur innerhalb derselben BFCL-Version und Kategorie vergleichen. Ein Modell kann bei einfachen Calls stark und bei parallelen oder mehrstufigen Calls schwach sein.
Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.
Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.
| # | Modell | Veröffentlichung | Score | Herkunft | Beleglage |
|---|---|---|---|---|---|
| 1 | Claude Sonnet 4.6AnthropicV4 aggregate score; drill into multi-turn and parallel sub-scores before choosing. | 2026-02-17 | 88.7% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 2 | GPT 5.5OpenAI | 2026-04-23 | 87.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 3 | Claude Opus 4.8Anthropic | 2026-05-28 | 86.9% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 4 | Kimi K2.6Moonshot | 2026-04-20 | 85.2% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 5 | GPT 5.4OpenAI | 2026-03-05 | 83.8% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 6 | Gemini 3.5 FlashGoogle | 2026-05-19 | 82.3% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 7 | Gemini 3.1 ProGoogle | 2026-02-19 | 81.6% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 8 | Mistral Large 3Mistral | 2025-12-02 | 80.1% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 9 | Gemini 3 Flash PreviewGoogle | 2025-12-17 | 79.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 10 | Qwen 3.7 MaxAlibaba | 2026-05-20 | 78.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 11 | o3OpenAIStrong in simple single-turn; drops in multi-turn complexity. | 2025-04-16 | 78.1% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 12 | Grok 4.3xAI | 2026-04-30 | 77.2% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 13 | DeepSeek V4 Flash MaxDeepSeek | 2026-04-24 | 76.8% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 14 | MiniMax M3MiniMax | 2026-05-31 | 76.2% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 15 | Llama 4 MaverickMeta | 2026-04-05 | 75.9% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 16 | DeepSeek V4DeepSeek | 2026-04-24 | 74.6% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 17 | Llama 4 ScoutMeta | 2026-04-05 | 74.1% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 18 | DeepSeek R1DeepSeek | 2025-01-20 | 72.4% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 19 | Claude Haiku 4.5Anthropic | 2025-10-01 | 71.8% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
| 20 | Cohere Command ACohere | 2026-03-15 | 70.6% | Berkeley Function Calling Leaderboard V42026-04-15 | Prüfung nötig |
Primärquelle ist das Berkeley-Gorilla-Leaderboard. VerdictPal sollte Kategorie und BFCL-Version in jeder Score-Zeile speichern.
Das Leaderboard ersetzt keinen Produkttest mit deinen Schemas, deinem Auth-Modell, Fehlerhandling und adversarial Inputs.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.