Benchmarks / Agentisch

τ³-Bench Banking

tau3-bench-banking

Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. 14 % Gewicht im AA Intelligence Index v4.1.

AgentischFlagshipAusgedientNiedriges KontaminationsrisikoSeit 2026
Was dieser Benchmark nicht misst
  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.
Analyse

Warum dieser Benchmark nützlich ist

Ersetzt τ²-Bench Telecom im AA Index v4.1 mit härteren, realistischeren agentischen Szenarien, die Frontier-Modelle besser trennen.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
97 Banking-Szenarien; 5 Wiederholungen; Dual-Control-Simulation mit Tool-Nutzung und Datenbank-Checks.
Bewertung
Backend-Datenbank-Zustandsbewertung, pass@1.
Verantwortliche Stelle
Sierra / Artificial Analysis
Lesehilfe

So liest du die Scores

Lies τ³-Bench Banking als ausgedient Signal mit niedriges kontaminationsrisiko. Vergleiche Modelle nur, wenn Quelle, Testumgebung, Prompting, Sampling und Score-Einheit übereinstimmen.

Blinde Flecken

Was er nicht abdeckt

  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.
Scores

Evidenz-Ledger

64 Zeilen
6464 Zeilen
95.61%bester Score
64quellgeprüft
1Quellen
2026-07-21bis 2026-06-17
64

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Gemini 3.5 Flash (medium)95.61% ·
  2. MiniMax M2.595.32% ·
  3. Grok 4.20 Reasoning92.98% ·
  4. Claude Opus 4.6 (Adaptive Reasoning, Max Effort)92.11% ·
  5. Gemini 3 Pro87.13% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Gemini 3.5 Flash (medium)Google2026-05-1995.61%
2026-07-21
Quelle geprüft
2MiniMax M2.5MiniMax2026-04-0195.32%
2026-07-21
Quelle geprüft
3Grok 4.20 ReasoningxAI2026-03-0592.98%
2026-07-21
Quelle geprüft
4Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0592.11%
2026-07-21
Quelle geprüft
5Gemini 3 ProGoogle2025-11-1887.13%
2026-07-21
Quelle geprüft
6Claude Opus 4.5Anthropic2025-11-2486.26%
2026-07-21
Quelle geprüft
7GPT-5.3 Codex (xhigh)OpenAI2026-02-0585.96%
2026-07-21
Quelle geprüft
8Claude Opus 4.6Anthropic2026-02-0584.8%
2026-07-21
Quelle geprüft
9GPT-5.2OpenAI2025-12-1184.8%
2026-07-21
Quelle geprüft
10MiniCPM5-1B (Reasoning)OpenBMB2026-06-0480.99%
2026-07-21
Quelle geprüft
11OpenAI o3OpenAI2025-04-1680.7%
2026-07-21
Quelle geprüft
12Claude Sonnet 4.6Anthropic2026-02-1779.53%
2026-07-21
Quelle geprüft
13Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1673.98%
2026-07-21
Quelle geprüft
14OpenAI o1OpenAI2024-09-1262.57%
2026-07-21
Quelle geprüft
1Claude Fable 5Anthropic2026-06-0962.4%
2026-06-17
Quelle geprüft
2GPT 5.5OpenAI2026-04-2354.8%
2026-06-17
Quelle geprüft
17Gemini 3 Flash PreviewGoogle2025-12-1743.27%
2026-07-21
Quelle geprüft
18DeepSeek R1DeepSeek2025-01-2036.55%
2026-07-21
Quelle geprüft
19Gemma 4 12B (Reasoning)Google2026-06-0736.26%
2026-07-21
Quelle geprüft
20Kimi K3Moonshot2026-07-1633.4%
2026-07-21
Quelle geprüft
21GPT-5.6 SolOpenAI2026-07-0932.99%
2026-07-21
Quelle geprüft
22Grok 4.5xAI2026-07-0832.58%
2026-07-21
Quelle geprüft
23Gemma 4 12B (Non-reasoning)Google2026-06-1031.87%
2026-07-21
Quelle geprüft
24GPT-5.6 TerraOpenAI2026-07-0931.75%
2026-07-21
Quelle geprüft
25Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1730.52%
2026-07-21
Quelle geprüft
26GPT 5.4OpenAI2026-03-0530.31%
2026-07-21
Quelle geprüft
27GPT-5.5 (high)OpenAI2026-04-2329.48%
2026-07-21
Quelle geprüft
28Claude Opus 4.7Anthropic2026-04-1628.87%
2026-07-21
Quelle geprüft
29Claude Sonnet 5Anthropic2026-06-3028.25%
2026-07-21
Quelle geprüft
30Claude Opus 4.8Anthropic2026-05-2827.63%
2026-07-21
Quelle geprüft
31GPT-5.6 LunaOpenAI2026-07-0927.22%
2026-07-21
Quelle geprüft
32GLM-5.2Zhipu2026-06-1326.8%
2026-07-21
Quelle geprüft
33DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2425.77%
2026-07-21
Quelle geprüft
34GPT-5.5 (medium)OpenAI2026-04-2325.77%
2026-07-21
Quelle geprüft
35Gemini 3.5 FlashGoogle2026-05-1925.36%
2026-07-21
Quelle geprüft
36Muse Spark 1.1Meta2026-07-0925.15%
2026-07-21
Quelle geprüft
37GPT-5.4 MiniOpenAI2026-03-1721.44%
2026-07-21
Quelle geprüft
38GPT-5.5 (low)OpenAI2026-04-2321.24%
2026-07-21
Quelle geprüft
39GPT-5.4 NanoOpenAI2026-03-1721.03%
2026-07-21
Quelle geprüft
40Kimi K2.6Moonshot2026-04-2020.62%
2026-07-21
Quelle geprüft
41Muse SparkOther2026-01-0119.59%
2026-07-21
Quelle geprüft
42Kimi K2.7 CodeMoonshot2026-06-1218.14%
2026-07-21
Quelle geprüft
43Qwen 3.7 PlusAlibaba2026-06-0217.87%
2026-07-21
Quelle geprüft
44Gemini 3.1 Pro PreviewGoogle2026-02-1916.49%
2026-07-21
Quelle geprüft
45LFM2.5-8B-A1BLiquid2026-06-0816.08%
2026-07-21
Quelle geprüft
46Command ACohere2026-03-1515.2%
2026-07-21
Quelle geprüft
47Gemma 4 31B ITGoogle2026-03-0115.05%
2026-07-21
Quelle geprüft
48Kimi K2.5Moonshot2026-01-2714.23%
2026-07-21
Quelle geprüft
49GPT-5.1OpenAI2025-11-1314.02%
2026-07-21
Quelle geprüft
50Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0413.81%
2026-07-21
Quelle geprüft
51MiniMax M3MiniMax2026-05-3112.99%
2026-07-21
Quelle geprüft
52LongCat-2.0Meituan2026-06-2912.78%
2026-07-21
Quelle geprüft
53Grok 4.3xAI2026-04-3012.16%
2026-07-21
Quelle geprüft
54GLM-5.1Zhipu2026-04-0711.55%
2026-07-21
Quelle geprüft
55Step 3.7 FlashStepFun2026-06-0111.34%
2026-07-21
Quelle geprüft
56Qwen3.7 MaxAlibaba2026-05-1910.93%
2026-07-21
Quelle geprüft
57MiniMax M2.7MiniMax2026-04-158.87%
2026-07-21
Quelle geprüft
58Gemini 3.1 Flash LiteGoogle2026-05-078.66%
2026-07-21
Quelle geprüft
59MiMo-V2.5-ProXiaomi2026-04-228.66%
2026-07-21
Quelle geprüft
60North Mini CodeCohere2026-06-096.39%
2026-07-21
Quelle geprüft
61Mistral Large 3Mistral2025-12-025.77%
2026-07-21
Quelle geprüft
62HyperNova 60B 2605Multiverse2026-05-065.36%
2026-07-21
Quelle geprüft
63Llama 4 MaverickMeta2026-04-053.92%
2026-07-21
Quelle geprüft
64Llama 4 ScoutMeta2026-04-053.3%
2026-07-21
Quelle geprüft
Methode

Was er abdeckt

Geschlossen — verifizierte AA-τ³-Bench-Banking-pass@1-Werte clustern jetzt bei 99 %+. Für Methodik-Kontext behalten; härtere agentische Suites für Frontier-Trennung nutzen.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

The Pack · Redaktionsnewsletter

Neue Karten in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn eine Karte erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.