90.3%
MMLU
Modelle / Google
Gemini · Release 2026-02-19
Googles Frontier-Modell Februar 2026. AA Intelligence Index 57,2 (#4). SWE-bench Verified 80,6 %, Terminal-Bench 2.0 78,4 %, ARC-AGI-2 77,1 % (Googles Top-Modell ohne Flash). 1M-Kontext, $7 / $21 pro 1M Tokens.
Googles stärkstes Frontier-Modell ohne Flash. Das Modell der Wahl, wenn 1M-Kontext, multimodaler Input und Tool-Use im selben Workflow zählen.
78average across 10 tested families
Wo Gemini 3.1 Pro auf jeder öffentlichen Benchmark-Quelle mit Zeile steht. Rang zählt jedes Modell mit neuester Zeile im selben Test — kein universeller Qualitätsscore.
Die drei höchstscorierenden kartierten Modelle pro Capability-Family. Wo Gemini 3.1 Pro auftaucht, ist es hervorgehoben.
Benchmark-Zeilen im öffentlichen Ledger für Gemini 3.1 Pro in den letzten 120 Tagen. Ältere Zeilen stehen in der vollen Tabelle unten.
| Benchmark | Family | Score | Quelle | Tage her |
|---|---|---|---|---|
| GPQA Diamond | Reasoning | 78.4% | Artificial Analysis GPQA Diamond evaluation | 44 |
| MCP Atlas | Tool use | 74.1% | MCP Atlas leaderboard | 44 |
| Vals Index | Agentic | 53.42% | Vals AI — Vals Index | 49 |
| SWE-bench Verified | Coding | 80.6% | SWE-bench official leaderboard | 54 |
| LMArena (Chatbot Arena) | Human preference | 1402 | LMArena leaderboard | 59 |
| Terminal-Bench | Agentic | 65.4% | Terminal-Bench 2.0 leaderboard | 64 |
| ARC-AGI | Reasoning | 77.1% | ARC Prize leaderboard | 69 |
| BFCL | Tool use | 81.6% | Berkeley Function Calling Leaderboard V4 | 99 |
| LiveBench | Reasoning | 65.8% | LiveBench leaderboard | 99 |
| LongBench v2 | Long context | 55.4% | LongBench v2 leaderboard | 113 |
Ein hoher Composite, der eine schwache Family versteckt, ist eine Falle. Diese Balken zeigen Families ohne öffentlichen Test — und wo das Modell führt.
Hover or tab any dot for name, score, and input price.
Jeder Katalog-Benchmark für Gemini 3.1 Pro. Scores verlinken zur Originalquelle; Lücken heißen: noch keine öffentliche Zeile.
16 of 32 catalog benchmarks have a sourced row for Gemini 3.1 Pro.
80.6%
SWE-bench Verified
65.4%
Terminal-Bench 2.0 (audited harness)
53.42%
Vals Index
72.4%
MMMU
55.4%
LongBench v2
88.9%
HELM Safety
1402
LMArena Elo (Style Controlled)