Benchmarks / Agentic

τ³-Bench Banking

tau3-bench-banking

Dual-control agent-user simulation for banking tasks: 97 scenarios with knowledge retrieval, backend database state evaluation, pass@1. 14% weight in AA Intelligence Index v4.1.

AgenticFlagshipDefunctLow contamination riskSince 2026
What this does not measure
  • Real bank integrations — simulated environment with controlled APIs, not production core banking systems.
  • Regulatory compliance certification — passing τ³ does not mean a deployment meets SOC2 or banking regs.
  • Every customer-service domain — banking-specific policies and tools only.
Analysis

Why this benchmark is useful

Replaces τ²-Bench Telecom in AA Index v4.1 with harder, more realistic agentic scenarios that better separate frontier models.

Scope

Coverage map

Task family
Agentic
Format
97 banking scenarios; 5 repeats; dual-control simulation with tool use and database checks.
Scoring
Backend database state evaluation, pass@1.
Maintainer
Sierra / Artificial Analysis
Reading guide

How to read the scores

Read τ³-Bench Banking as a defunct signal with low contamination risk. Compare models only when the source uses the same harness, prompting setup, sampling policy, and score unit.

Blind spots

What it does not cover

  • Real bank integrations — simulated environment with controlled APIs, not production core banking systems.
  • Regulatory compliance certification — passing τ³ does not mean a deployment meets SOC2 or banking regs.
  • Every customer-service domain — banking-specific policies and tools only.
Scores

Evidence ledger

64 rows
6464 rows
95.61%best score
64source-checked
1sources
2026-07-21to 2026-06-17
64

api · api

Distribution

Where the rows land

0255075100

Normalized to this benchmark's axis (0–100). Open the table for raw units.

Timeline

Newest receipts

  1. Gemini 3.5 Flash (medium)95.61% ·
  2. MiniMax M2.595.32% ·
  3. Grok 4.20 Reasoning92.98% ·
  4. Claude Opus 4.6 (Adaptive Reasoning, Max Effort)92.11% ·
  5. Gemini 3 Pro87.13% ·

Scores use this benchmark's own unit and axis, not a universal quality score.

#ModelRelease dateScoreProvenanceTrust
1Gemini 3.5 Flash (medium)Google2026-05-1995.61%
2026-07-21
Source-checked
2MiniMax M2.5MiniMax2026-04-0195.32%
2026-07-21
Source-checked
3Grok 4.20 ReasoningxAI2026-03-0592.98%
2026-07-21
Source-checked
4Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-0592.11%
2026-07-21
Source-checked
5Gemini 3 ProGoogle2025-11-1887.13%
2026-07-21
Source-checked
6Claude Opus 4.5Anthropic2025-11-2486.26%
2026-07-21
Source-checked
7GPT-5.3 Codex (xhigh)OpenAI2026-02-0585.96%
2026-07-21
Source-checked
8Claude Opus 4.6Anthropic2026-02-0584.8%
2026-07-21
Source-checked
9GPT-5.2OpenAI2025-12-1184.8%
2026-07-21
Source-checked
10MiniCPM5-1B (Reasoning)OpenBMB2026-06-0480.99%
2026-07-21
Source-checked
11OpenAI o3OpenAI2025-04-1680.7%
2026-07-21
Source-checked
12Claude Sonnet 4.6Anthropic2026-02-1779.53%
2026-07-21
Source-checked
13Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic2026-04-1673.98%
2026-07-21
Source-checked
14OpenAI o1OpenAI2024-09-1262.57%
2026-07-21
Source-checked
1Claude Fable 5Anthropic2026-06-0962.4%
2026-06-17
Source-checked
2GPT 5.5OpenAI2026-04-2354.8%
2026-06-17
Source-checked
17Gemini 3 Flash PreviewGoogle2025-12-1743.27%
2026-07-21
Source-checked
18DeepSeek R1DeepSeek2025-01-2036.55%
2026-07-21
Source-checked
19Gemma 4 12B (Reasoning)Google2026-06-0736.26%
2026-07-21
Source-checked
20Kimi K3Moonshot2026-07-1633.4%
2026-07-21
Source-checked
21GPT-5.6 SolOpenAI2026-07-0932.99%
2026-07-21
Source-checked
22Grok 4.5xAI2026-07-0832.58%
2026-07-21
Source-checked
23Gemma 4 12B (Non-reasoning)Google2026-06-1031.87%
2026-07-21
Source-checked
24GPT-5.6 TerraOpenAI2026-07-0931.75%
2026-07-21
Source-checked
25Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic2026-02-1730.52%
2026-07-21
Source-checked
26GPT 5.4OpenAI2026-03-0530.31%
2026-07-21
Source-checked
27GPT-5.5 (high)OpenAI2026-04-2329.48%
2026-07-21
Source-checked
28Claude Opus 4.7Anthropic2026-04-1628.87%
2026-07-21
Source-checked
29Claude Sonnet 5Anthropic2026-06-3028.25%
2026-07-21
Source-checked
30Claude Opus 4.8Anthropic2026-05-2827.63%
2026-07-21
Source-checked
31GPT-5.6 LunaOpenAI2026-07-0927.22%
2026-07-21
Source-checked
32GLM-5.2Zhipu2026-06-1326.8%
2026-07-21
Source-checked
33DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek2026-04-2425.77%
2026-07-21
Source-checked
34GPT-5.5 (medium)OpenAI2026-04-2325.77%
2026-07-21
Source-checked
35Gemini 3.5 FlashGoogle2026-05-1925.36%
2026-07-21
Source-checked
36Muse Spark 1.1Meta2026-07-0925.15%
2026-07-21
Source-checked
37GPT-5.4 MiniOpenAI2026-03-1721.44%
2026-07-21
Source-checked
38GPT-5.5 (low)OpenAI2026-04-2321.24%
2026-07-21
Source-checked
39GPT-5.4 NanoOpenAI2026-03-1721.03%
2026-07-21
Source-checked
40Kimi K2.6Moonshot2026-04-2020.62%
2026-07-21
Source-checked
41Muse SparkOther2026-01-0119.59%
2026-07-21
Source-checked
42Kimi K2.7 CodeMoonshot2026-06-1218.14%
2026-07-21
Source-checked
43Qwen 3.7 PlusAlibaba2026-06-0217.87%
2026-07-21
Source-checked
44Gemini 3.1 Pro PreviewGoogle2026-02-1916.49%
2026-07-21
Source-checked
45LFM2.5-8B-A1BLiquid2026-06-0816.08%
2026-07-21
Source-checked
46Command ACohere2026-03-1515.2%
2026-07-21
Source-checked
47Gemma 4 31B ITGoogle2026-03-0115.05%
2026-07-21
Source-checked
48Kimi K2.5Moonshot2026-01-2714.23%
2026-07-21
Source-checked
49GPT-5.1OpenAI2025-11-1314.02%
2026-07-21
Source-checked
50Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA2026-06-0413.81%
2026-07-21
Source-checked
51MiniMax M3MiniMax2026-05-3112.99%
2026-07-21
Source-checked
52LongCat-2.0Meituan2026-06-2912.78%
2026-07-21
Source-checked
53Grok 4.3xAI2026-04-3012.16%
2026-07-21
Source-checked
54GLM-5.1Zhipu2026-04-0711.55%
2026-07-21
Source-checked
55Step 3.7 FlashStepFun2026-06-0111.34%
2026-07-21
Source-checked
56Qwen3.7 MaxAlibaba2026-05-1910.93%
2026-07-21
Source-checked
57MiniMax M2.7MiniMax2026-04-158.87%
2026-07-21
Source-checked
58Gemini 3.1 Flash LiteGoogle2026-05-078.66%
2026-07-21
Source-checked
59MiMo-V2.5-ProXiaomi2026-04-228.66%
2026-07-21
Source-checked
60North Mini CodeCohere2026-06-096.39%
2026-07-21
Source-checked
61Mistral Large 3Mistral2025-12-025.77%
2026-07-21
Source-checked
62HyperNova 60B 2605Multiverse2026-05-065.36%
2026-07-21
Source-checked
63Llama 4 MaverickMeta2026-04-053.92%
2026-07-21
Source-checked
64Llama 4 ScoutMeta2026-04-053.3%
2026-07-21
Source-checked
Method

What it covers

Closed — verified AA τ³-Bench Banking pass@1 scores now cluster at 99%+. Retained for methodology context; use harder agentic suites for frontier separation.

Score ceiling

Where it breaks down

No ceiling note is recorded yet. Treat clustering near the top as a warning that the benchmark may no longer separate frontier models.

Tools that report it

Receipts

Sources and further reading

The Pack · Editorial newsletter

New cards in your inbox. Free.

One short email when a card ships or changes status. No tracking, no third-party analytics. Unsubscribe in one click.