Benchmarks / Agentisch

τ³-Bench Banking

tau3-bench-banking

Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. 14 % Gewicht im AA Intelligence Index v4.1.

Was dieser Benchmark nicht misst
  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.
Analyse

Warum dieser Benchmark nützlich ist

Ersetzt τ²-Bench Telecom im AA Index v4.1 mit härteren, realistischeren agentischen Szenarien, die Frontier-Modelle besser trennen.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
97 Banking-Szenarien; 5 Wiederholungen; Dual-Control-Simulation mit Tool-Nutzung und Datenbank-Checks.
Bewertung
Backend-Datenbank-Zustandsbewertung, pass@1.
Verantwortliche Stelle
Sierra / Artificial Analysis
Lesehilfe

So liest du die Scores

pass@1 auf Backend-Datenbankzustand über 97 Banking-Szenarien. Artificial Analysis berichtet τ³ jetzt auf einer niedrigen Skala (typische verifizierte Scores klar unter 60) — als lebenden agentischen Trenner lesen, nicht als gelöste Prüfung.

Blinde Flecken

Was er nicht abdeckt

  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.
Scores

Evidenz-Ledger

106 Zeilen
106106 Zeilen
51.34%bester Score
106quellgeprüft
1Quellen
2026-09-01Quelldatum
106

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Qwen3.8 Max51.34% ·
  2. Grok 4.650.72% ·
  3. GLM-5.350.31% ·
  4. Qwen3.8 2.4T A95B49.07% ·
  5. Qwen3.8 27B48.04% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Qwen3.8 MaxAlibaba2026-08-0351.34%
2026-09-01
Quelle geprüft
2Grok 4.6xAI2026-08-1250.72%
2026-09-01
Quelle geprüft
3GLM-5.3Zhipu2026-08-1450.31%
2026-09-01
Quelle geprüft
4Qwen3.8 2.4T A95BAlibaba2026-08-1249.07%
2026-09-01
Quelle geprüft
5Qwen3.8 27BAlibaba2026-08-1448.04%
2026-09-01
Quelle geprüft
6GLM-5.3-FlashZhipu2026-08-2647.22%
2026-09-01
Quelle geprüft
7Kimi K3Moonshot2026-07-1645.98%
2026-09-01
Quelle geprüft
8Qwen3.8-Flash-NextAlibaba2026-08-2645.36%
2026-09-01
Quelle geprüft
9Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2444.74%
2026-09-01
Quelle geprüft
10GPT-5.6 SolOpenAI2026-07-0944.33%
2026-09-01
Quelle geprüft
11Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2443.3%
2026-09-01
Quelle geprüft
12Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2442.06%
2026-09-01
Quelle geprüft
13Grok 4.5xAI2026-07-0842.06%
2026-09-01
Quelle geprüft
14Kimi K3 (low)Moonshot2026-07-1641.65%
2026-09-01
Quelle geprüft
15DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2141.03%
2026-09-01
Quelle geprüft
16GPT-5.6 TerraOpenAI2026-07-0940.21%
2026-09-01
Quelle geprüft
17DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1339.59%
2026-09-01
Quelle geprüft
18GPT 5.4OpenAI2026-03-0539.59%
2026-09-01
Quelle geprüft
19DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3139.38%
2026-09-01
Quelle geprüft
20GPT 5.5OpenAI2026-04-2338.97%
2026-09-01
Quelle geprüft
21Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2438.56%
2026-09-01
Quelle geprüft
22Claude Fable 5Anthropic2026-06-0938.14%
2026-09-01
Quelle geprüft
23Claude Sonnet 5Anthropic2026-06-3037.32%
2026-09-01
Quelle geprüft
24GPT-5.5 (high)OpenAI2026-04-2336.7%
2026-09-01
Quelle geprüft
25Agnes 2.5 Pro BetaOther2026-08-2635.67%
2026-09-01
Quelle geprüft
26Motif 3Other2026-08-1235.26%
2026-09-01
Quelle geprüft
27Muse Spark 1.2Meta2026-08-0534.85%
2026-09-01
Quelle geprüft
28Claude Opus 4.7Anthropic2026-04-1634.64%
2026-09-01
Quelle geprüft
29GLM-5.2Zhipu2026-06-1334.64%
2026-09-01
Quelle geprüft
30Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1734.43%
2026-09-01
Quelle geprüft
31Claude Opus 4.8Anthropic2026-05-2834.23%
2026-09-01
Quelle geprüft
32Gemini 3.7 FlashGoogle2026-08-1332.78%
2026-09-01
Quelle geprüft
33Gemini 3.5 FlashGoogle2026-05-1932.16%
2026-09-01
Quelle geprüft
34Muse Spark 1.1Meta2026-07-0931.75%
2026-09-01
Quelle geprüft
35GPT-5.6 LunaOpenAI2026-07-0931.13%
2026-09-01
Quelle geprüft
36Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2430.31%
2026-09-01
Quelle geprüft
37Gemini 3.6 Flash (high)Google2026-07-2129.9%
2026-09-01
Quelle geprüft
38GPT-5.5 (medium)OpenAI2026-04-2329.9%
2026-09-01
Quelle geprüft
39Inkling (xhigh)Other2026-07-1529.07%
2026-09-01
Quelle geprüft
40GPT-5.4 NanoOpenAI2026-03-1727.42%
2026-09-01
Quelle geprüft
41Ling 3.0 FlashOther2026-08-0427.22%
2026-09-01
Quelle geprüft
42DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2426.19%
2026-09-01
Quelle geprüft
43DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2426.19%
2026-09-01
Quelle geprüft
44GPT-5.4 MiniOpenAI2026-03-1725.57%
2026-09-01
Quelle geprüft
45Apodex 1.1Other2026-08-3025.15%
2026-09-01
Quelle geprüft
46GPT-5.5 (low)OpenAI2026-04-2324.95%
2026-09-01
Quelle geprüft
47Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2924.54%
2026-09-01
Quelle geprüft
48Muse GlimmerMeta2026-08-1023.51%
2026-09-01
Quelle geprüft
49Kimi K2.6Moonshot2026-04-2023.3%
2026-09-01
Quelle geprüft
50Solar Pro 4Other2026-08-0623.3%
2026-09-01
Quelle geprüft
51Hy3Other2026-07-0622.89%
2026-09-01
Quelle geprüft
52G9v3-39A5BOther2026-08-0322.06%
2026-09-01
Quelle geprüft
53GPT-5 (high)OpenAI2025-08-0722.06%
2026-09-01
Quelle geprüft
54Solar Open2 250BOther2026-08-1221.65%
2026-09-01
Quelle geprüft
55Gemini 3.1 Pro PreviewGoogle2026-02-1921.44%
2026-09-01
Quelle geprüft
56Gemini 3 Flash Preview (Reasoning)Google2025-12-1720.82%
2026-09-01
Quelle geprüft
57Ling 3.0 TinyOther2026-08-0620.82%
2026-09-01
Quelle geprüft
58Qwen3.6 PlusAlibaba2026-04-0220.82%
2026-09-01
Quelle geprüft
59Kimi K2.7 CodeMoonshot2026-06-1220.21%
2026-09-01
Quelle geprüft
60Inkling SmallOther2026-07-3018.76%
2026-09-01
Quelle geprüft
61Ring-2.6-1TOther2026-05-0817.94%
2026-09-01
Quelle geprüft
62Gemini 3.5 Flash-LiteGoogle2026-07-2117.53%
2026-09-01
Quelle geprüft
63Nex-N2-ProOther2026-06-0217.53%
2026-09-01
Quelle geprüft
64Qwen 3.7 PlusAlibaba2026-06-0217.53%
2026-09-01
Quelle geprüft
65GLM-5.2 (Non-reasoning)Zhipu2026-06-1616.7%
2026-09-01
Quelle geprüft
66Qwen3.6 27B (Reasoning)Alibaba2026-04-2216.7%
2026-09-01
Quelle geprüft
67A.X-K2Other2026-08-1216.08%
2026-09-01
Quelle geprüft
68GPT-5.1OpenAI2025-11-1315.88%
2026-09-01
Quelle geprüft
69MiniMax M3MiniMax2026-05-3115.26%
2026-09-01
Quelle geprüft
70Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2415.26%
2026-09-01
Quelle geprüft
71Mistral Medium 3.5Mistral2026-04-2915.05%
2026-09-01
Quelle geprüft
72Gemma 4 31B ITGoogle2026-03-0114.85%
2026-09-01
Quelle geprüft
73GPT-5.5 (Non-reasoning)OpenAI2026-04-2314.85%
2026-09-01
Quelle geprüft
74Granite 4.2 30BOther2026-08-2514.43%
2026-09-01
Quelle geprüft
75Kimi K2.5Moonshot2026-01-2714.23%
2026-09-01
Quelle geprüft
76Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0414.23%
2026-09-01
Quelle geprüft
77GLM-5.1Zhipu2026-04-0713.61%
2026-09-01
Quelle geprüft
78Grok Build 0.1 0616xAI2026-06-1613.4%
2026-09-01
Quelle geprüft
79Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1613.4%
2026-09-01
Quelle geprüft
80LongCat-2.0Meituan2026-06-2913.2%
2026-09-01
Quelle geprüft
81Agnes 2.5 Pro AlphaOther2026-07-2412.37%
2026-09-01
Quelle geprüft
82Grok 4.3xAI2026-04-3012.37%
2026-09-01
Quelle geprüft
83GLM-4.7 (Reasoning)Zhipu2025-12-2212.16%
2026-09-01
Quelle geprüft
84Step 3.7 FlashStepFun2026-06-0111.96%
2026-09-01
Quelle geprüft
85GPT-5.5 Instant (June 2026)OpenAI2026-06-2511.75%
2026-09-01
Quelle geprüft
86Qwen3.7 MaxAlibaba2026-05-1911.75%
2026-09-01
Quelle geprüft
87K-EXAONE 2.0 0803Other2026-08-1211.55%
2026-09-01
Quelle geprüft
88MiMo-V2.5-ProXiaomi2026-04-229.9%
2026-09-01
Quelle geprüft
89MiniMax M2.7MiniMax2026-04-159.9%
2026-09-01
Quelle geprüft
90Gemini 3.1 Flash LiteGoogle2026-05-079.69%
2026-09-01
Quelle geprüft
91Qwen3.6 27B (Non-reasoning)Alibaba2026-04-229.28%
2026-09-01
Quelle geprüft
92Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-169.28%
2026-09-01
Quelle geprüft
93Nemotron 3.5 LightningNVIDIA2026-08-118.87%
2026-09-01
Quelle geprüft
94MiMo-V2.5Xiaomi2026-04-228.66%
2026-09-01
Quelle geprüft
95Grok 4.3 (Non-reasoning)xAI2026-04-308.04%
2026-09-01
Quelle geprüft
96Granite 4.2 8BOther2026-08-257.63%
2026-09-01
Quelle geprüft
97North Mini CodeCohere2026-06-096.39%
2026-09-01
Quelle geprüft
98Command ACohere2026-03-155.98%
2026-09-01
Quelle geprüft
99Mistral Large 3Mistral2025-12-025.77%
2026-09-01
Quelle geprüft
100Granite 4.2 3BOther2026-08-255.57%
2026-09-01
Quelle geprüft
101HyperNova 60B 2605Multiverse2026-05-065.57%
2026-09-01
Quelle geprüft
102Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-165.36%
2026-09-01
Quelle geprüft
103KAT Coder Pro V2Other2026-03-274.54%
2026-09-01
Quelle geprüft
104Llama 4 MaverickMeta2026-04-053.71%
2026-09-01
Quelle geprüft
105Llama 4 ScoutMeta2026-04-053.3%
2026-09-01
Quelle geprüft
106Ling 2.6 FlashOther2026-04-212.89%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Live — AA-τ³-Bench-Banking (Index v4.1, 14 % Gewicht) nutzt eine härtere Dual-Control-Skala als das abgelöste τ². VerdictPal übernimmt nur aktuelle `tau_banking`/`tau3_banking`-Zeilen auf diese Seite; ältere τ²-Hochskala-Belege werden nicht vermischt.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst τ³-Bench Banking?

Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. 14 % Gewicht im AA Intelligence Index v4.1.

Was beweist ein hoher τ³-Bench Banking-Wert nicht?

Ein starkes τ³-Bench Banking-Ergebnis sagt nichts aus über:

  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.

Wie wird τ³-Bench Banking bewertet?

Backend-Datenbank-Zustandsbewertung, pass@1. Aufgabenformat: 97 Banking-Szenarien; 5 Wiederholungen; Dual-Control-Simulation mit Tool-Nutzung und Datenbank-Checks.

Ist τ³-Bench Banking gesättigt?

τ³-Bench Banking ist im Atlas derzeit als Aktiv markiert.

Können τ³-Bench Banking-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für τ³-Bench Banking ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.