Benchmarks / Agentisch

τ³-Bench Banking

tau3-bench-banking

Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. War 5 % des AA Intelligence Index v4.2; aus Index v4.3 entfernt (ersetzt durch AutomationBench-AA). Die AA-API publiziert die Suite weiter.

Was dieser Benchmark nicht misst
  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.
Analyse

Warum dieser Benchmark nützlich ist

Kam im AA-Index v4.1 als härterer Ersatz für τ²-Bench Telecom. Verließ den Index in v4.3, als AutomationBench-AA den 5-%-Agents-Slot übernahm. Die Suite trennt Frontier-Modelle weiter auf einer niedrigen pass@1-Skala.

Umfang

Abdeckung

Aufgabenfamilie
Agentisch
Format
97 Banking-Szenarien; 5 Wiederholungen; Dual-Control-Simulation mit Tool-Nutzung und Datenbank-Checks.
Bewertung
Backend-Datenbank-Zustandsbewertung, pass@1.
Verantwortliche Stelle
Sierra / Artificial Analysis
Lesehilfe

So liest du die Scores

pass@1 auf Backend-Datenbankzustand über 97 Banking-Szenarien. Artificial Analysis berichtet τ³ jetzt auf einer niedrigen Skala (typische verifizierte Scores klar unter 60) — als lebenden agentischen Trenner lesen, nicht als gelöste Prüfung.

Blinde Flecken

Was er nicht abdeckt

  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.
Scores

Evidenz-Ledger

110 Zeilen
110110 Zeilen
51.34%bester Score
110quellgeprüft
1Quellen
2026-09-10Quelldatum
110

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Qwen3.8 Max51.34% ·
  2. Grok 4.650.72% ·
  3. Muse Spark 1.350.52% ·
  4. GLM-5.350.31% ·
  5. Qwen3.8 2.4T A95B49.07% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Qwen3.8 MaxAlibaba2026-08-0351.34%
2026-09-10
Quelle geprüft
2Grok 4.6xAI2026-08-1250.72%
2026-09-10
Quelle geprüft
3Muse Spark 1.3Meta2026-09-0250.52%
2026-09-10
Quelle geprüft
4GLM-5.3Zhipu2026-08-1450.31%
2026-09-10
Quelle geprüft
5Qwen3.8 2.4T A95BAlibaba2026-08-1249.07%
2026-09-10
Quelle geprüft
6Qwen3.8 27BAlibaba2026-08-1448.04%
2026-09-10
Quelle geprüft
7Claude Fable 5.1Anthropic2026-09-0147.22%
2026-09-10
Quelle geprüft
8GLM-5.3-FlashZhipu2026-08-2647.22%
2026-09-10
Quelle geprüft
9Kimi K3Moonshot2026-07-1645.98%
2026-09-10
Quelle geprüft
10Qwen3.8-Flash-NextAlibaba2026-08-2645.36%
2026-09-10
Quelle geprüft
11Gemini 3.8 FlashGoogle2026-09-0244.95%
2026-09-10
Quelle geprüft
12Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic2026-07-2444.74%
2026-09-10
Quelle geprüft
13GPT-5.6 SolOpenAI2026-07-0944.33%
2026-09-10
Quelle geprüft
14Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic2026-07-2443.3%
2026-09-10
Quelle geprüft
15Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic2026-07-2442.06%
2026-09-10
Quelle geprüft
16Grok 4.5xAI2026-07-0842.06%
2026-09-10
Quelle geprüft
17Kimi K3 (low)Moonshot2026-07-1641.65%
2026-09-10
Quelle geprüft
18GPT-6 AstraOpenAI2026-09-0341.44%
2026-09-10
Quelle geprüft
19DeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek2026-08-2141.03%
2026-09-10
Quelle geprüft
20GPT-5.6 TerraOpenAI2026-07-0940.21%
2026-09-10
Quelle geprüft
21DeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek2026-08-1339.59%
2026-09-10
Quelle geprüft
22GPT 5.4OpenAI2026-03-0539.59%
2026-09-10
Quelle geprüft
23DeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek2026-07-3139.38%
2026-09-10
Quelle geprüft
24GPT 5.5OpenAI2026-04-2338.97%
2026-09-10
Quelle geprüft
25Claude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic2026-07-2438.56%
2026-09-10
Quelle geprüft
26Claude Fable 5Anthropic2026-06-0938.14%
2026-09-10
Quelle geprüft
27Claude Sonnet 5Anthropic2026-06-3037.32%
2026-09-10
Quelle geprüft
28GPT-5.5 (high)OpenAI2026-04-2336.7%
2026-09-10
Quelle geprüft
29Agnes 2.5 Pro BetaOther2026-08-2635.67%
2026-09-10
Quelle geprüft
30Motif 3Other2026-08-1235.26%
2026-09-10
Quelle geprüft
31Muse Spark 1.2Meta2026-08-0534.85%
2026-09-10
Quelle geprüft
32Claude Opus 4.7Anthropic2026-04-1634.64%
2026-09-10
Quelle geprüft
33GLM-5.2Zhipu2026-06-1334.64%
2026-09-10
Quelle geprüft
34Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1734.43%
2026-09-10
Quelle geprüft
35Claude Opus 4.8Anthropic2026-05-2834.23%
2026-09-10
Quelle geprüft
36K2 Horizon 375B A23BOther2026-09-0334.23%
2026-09-10
Quelle geprüft
37Gemini 3.7 FlashGoogle2026-08-1332.78%
2026-09-10
Quelle geprüft
38Gemini 3.5 FlashGoogle2026-05-1932.16%
2026-09-10
Quelle geprüft
39Muse Spark 1.1Meta2026-07-0931.75%
2026-09-10
Quelle geprüft
40GPT-5.6 LunaOpenAI2026-07-0931.13%
2026-09-10
Quelle geprüft
41Claude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic2026-07-2430.31%
2026-09-10
Quelle geprüft
42Gemini 3.6 Flash (high)Google2026-07-2129.9%
2026-09-10
Quelle geprüft
43GPT-5.5 (medium)OpenAI2026-04-2329.9%
2026-09-10
Quelle geprüft
44Inkling (xhigh)Other2026-07-1529.07%
2026-09-10
Quelle geprüft
45GPT-5.4 NanoOpenAI2026-03-1727.42%
2026-09-10
Quelle geprüft
46Ling 3.0 FlashOther2026-08-0427.22%
2026-09-10
Quelle geprüft
47DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek2026-04-2426.19%
2026-09-10
Quelle geprüft
48DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek2026-04-2426.19%
2026-09-10
Quelle geprüft
49GPT-5.4 MiniOpenAI2026-03-1725.57%
2026-09-10
Quelle geprüft
50Apodex 1.1Other2026-08-3025.15%
2026-09-10
Quelle geprüft
51GPT-5.5 (low)OpenAI2026-04-2324.95%
2026-09-10
Quelle geprüft
52Claude 4.5 Sonnet (Reasoning)Anthropic2025-09-2924.54%
2026-09-10
Quelle geprüft
53Muse GlimmerMeta2026-08-1023.51%
2026-09-10
Quelle geprüft
54Kimi K2.6Moonshot2026-04-2023.3%
2026-09-10
Quelle geprüft
55Solar Pro 4Other2026-08-0623.3%
2026-09-10
Quelle geprüft
56Hy3Other2026-07-0622.89%
2026-09-10
Quelle geprüft
57G9v3-39A5BOther2026-08-0322.06%
2026-09-10
Quelle geprüft
58GPT-5 (high)OpenAI2025-08-0722.06%
2026-09-10
Quelle geprüft
59Solar Open2 250BOther2026-08-1221.65%
2026-09-10
Quelle geprüft
60Gemini 3.1 Pro PreviewGoogle2026-02-1921.44%
2026-09-10
Quelle geprüft
61Gemini 3 Flash Preview (Reasoning)Google2025-12-1720.82%
2026-09-10
Quelle geprüft
62Ling 3.0 TinyOther2026-08-0620.82%
2026-09-10
Quelle geprüft
63MiniCPM5-2BOpenBMB2026-09-0720.82%
2026-09-10
Quelle geprüft
64Qwen3.6 PlusAlibaba2026-04-0220.82%
2026-09-10
Quelle geprüft
65Kimi K2.7 CodeMoonshot2026-06-1220.21%
2026-09-10
Quelle geprüft
66Inkling SmallOther2026-07-3018.76%
2026-09-10
Quelle geprüft
67Ring-2.6-1TOther2026-05-0817.94%
2026-09-10
Quelle geprüft
68Gemini 3.5 Flash-LiteGoogle2026-07-2117.53%
2026-09-10
Quelle geprüft
69Nex-N2-ProOther2026-06-0217.53%
2026-09-10
Quelle geprüft
70Qwen 3.7 PlusAlibaba2026-06-0217.53%
2026-09-10
Quelle geprüft
71GLM-5.2 (Non-reasoning)Zhipu2026-06-1616.7%
2026-09-10
Quelle geprüft
72Qwen3.6 27B (Reasoning)Alibaba2026-04-2216.7%
2026-09-10
Quelle geprüft
73A.X-K2Other2026-08-1216.08%
2026-09-10
Quelle geprüft
74GPT-5.1OpenAI2025-11-1315.88%
2026-09-10
Quelle geprüft
75MiniMax M3MiniMax2026-05-3115.26%
2026-09-10
Quelle geprüft
76Qwen3.5 122B A10B (Reasoning)Alibaba2026-02-2415.26%
2026-09-10
Quelle geprüft
77Mistral Medium 3.5Mistral2026-04-2915.05%
2026-09-10
Quelle geprüft
78Gemma 4 31B ITGoogle2026-03-0114.85%
2026-09-10
Quelle geprüft
79GPT-5.5 (Non-reasoning)OpenAI2026-04-2314.85%
2026-09-10
Quelle geprüft
80Granite 4.2 30BOther2026-08-2514.43%
2026-09-10
Quelle geprüft
81Kimi K2.5Moonshot2026-01-2714.23%
2026-09-10
Quelle geprüft
82Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0414.23%
2026-09-10
Quelle geprüft
83GLM-5.1Zhipu2026-04-0713.61%
2026-09-10
Quelle geprüft
84Grok Build 0.1 0616xAI2026-06-1613.4%
2026-09-10
Quelle geprüft
85Qwen3.5 397B A17B (Reasoning)Alibaba2026-02-1613.4%
2026-09-10
Quelle geprüft
86LongCat-2.0Meituan2026-06-2913.2%
2026-09-10
Quelle geprüft
87Agnes 2.5 Pro AlphaOther2026-07-2412.37%
2026-09-10
Quelle geprüft
88Grok 4.3xAI2026-04-3012.37%
2026-09-10
Quelle geprüft
89GLM-4.7 (Reasoning)Zhipu2025-12-2212.16%
2026-09-10
Quelle geprüft
90Step 3.7 FlashStepFun2026-06-0111.96%
2026-09-10
Quelle geprüft
91GPT-5.5 Instant (June 2026)OpenAI2026-06-2511.75%
2026-09-10
Quelle geprüft
92Qwen3.7 MaxAlibaba2026-05-1911.75%
2026-09-10
Quelle geprüft
93K-EXAONE 2.0 0803Other2026-08-1211.55%
2026-09-10
Quelle geprüft
94MiMo-V2.5-ProXiaomi2026-04-229.9%
2026-09-10
Quelle geprüft
95MiniMax M2.7MiniMax2026-04-159.9%
2026-09-10
Quelle geprüft
96Gemini 3.1 Flash LiteGoogle2026-05-079.69%
2026-09-10
Quelle geprüft
97Qwen3.6 27B (Non-reasoning)Alibaba2026-04-229.28%
2026-09-10
Quelle geprüft
98Qwen3.6 35B A3B (Reasoning)Alibaba2026-04-169.28%
2026-09-10
Quelle geprüft
99Nemotron 3.5 LightningNVIDIA2026-08-118.87%
2026-09-10
Quelle geprüft
100MiMo-V2.5Xiaomi2026-04-228.66%
2026-09-10
Quelle geprüft
101Grok 4.3 (Non-reasoning)xAI2026-04-308.04%
2026-09-10
Quelle geprüft
102Granite 4.2 8BOther2026-08-257.63%
2026-09-10
Quelle geprüft
103North Mini CodeCohere2026-06-096.39%
2026-09-10
Quelle geprüft
104Mistral Large 3Mistral2025-12-025.77%
2026-09-10
Quelle geprüft
105Granite 4.2 3BOther2026-08-255.57%
2026-09-10
Quelle geprüft
106Qwen3.6 35B A3B (Non-reasoning)Alibaba2026-04-165.36%
2026-09-10
Quelle geprüft
107KAT Coder Pro V2Other2026-03-274.54%
2026-09-10
Quelle geprüft
108Llama 4 MaverickMeta2026-04-053.71%
2026-09-10
Quelle geprüft
109Llama 4 ScoutMeta2026-04-053.3%
2026-09-10
Quelle geprüft
110Ling 2.6 FlashOther2026-04-212.89%
2026-09-10
Quelle geprüft
Methode

Was er abdeckt

Live — AA publiziert τ³-Bench Banking weiter als `tau_banking`/`tau3_banking` im API-Snapshot vom 10. Sep. 2026, obwohl Index v4.3 es gestrichen hat. VerdictPal übernimmt nur diese aktuellen Zeilen auf diese Seite; ältere τ²-Hochskala-Belege werden nicht vermischt.

Score-Obergrenze

Wo er an Grenzen stößt

Noch ist keine Obergrenze erfasst. Wenn sich Scores oben bündeln, kann der Benchmark Frontier-Modelle möglicherweise nicht mehr trennen.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst τ³-Bench Banking?

Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. War 5 % des AA Intelligence Index v4.2; aus Index v4.3 entfernt (ersetzt durch AutomationBench-AA). Die AA-API publiziert die Suite weiter.

Was beweist ein hoher τ³-Bench Banking-Wert nicht?

Ein starkes τ³-Bench Banking-Ergebnis sagt nichts aus über:

  • Echte Bank-Integrationen — simulierte Umgebung mit kontrollierten APIs, keine Produktions-Kernbankensysteme.
  • Regulatorische Compliance-Zertifizierung — τ³-Bestehen bedeutet nicht, dass ein Deployment SOC2 oder Banken-Regs erfüllt.
  • Jede Customer-Service-Domäne — nur banking-spezifische Policies und Tools.

Wie wird τ³-Bench Banking bewertet?

Backend-Datenbank-Zustandsbewertung, pass@1. Aufgabenformat: 97 Banking-Szenarien; 5 Wiederholungen; Dual-Control-Simulation mit Tool-Nutzung und Datenbank-Checks.

Ist τ³-Bench Banking gesättigt?

τ³-Bench Banking ist im Atlas derzeit als Aktiv markiert.

Können τ³-Bench Banking-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für τ³-Bench Banking ist als Kontamination niedrig eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.