Atlas
Der öffentliche Katalog von Tools und Modellen. Ein durchsuchbarer Desk, kein Ranking von Gewinnern.
Dossier · Redaktioneller Fit · Tool-Atlas öffnen
Verlinke diesen Begriff über die Überschrift.
Der öffentliche Katalog von Tools und Modellen. Ein durchsuchbarer Desk, kein Ranking von Gewinnern.
Dossier · Redaktioneller Fit · Tool-Atlas öffnen
Verlinke diesen Begriff über die Überschrift.
tool page · model page
Eine endliche Seite für ein Tool oder Modell: datierte Preise, Datenschutz, Fehlermodi und ein nachvollziehbarer Score. Wir nennen das im Lesetext nie Karten.
Redaktioneller Fit · Fehlermodus · Evidenzstufe
Verlinke diesen Begriff über die Überschrift.
0–100 · fit score · headline score
Der 0–100-Desk-Score auf einem Tool-Dossier. Ein gewichtetes Urteil zur Passung im Recherche-Workflow — kein Sterne-Schnitt und kein Benchmark-Ergebnis.
Status-Labels · Evidenzstufe · Wie die 0–100 landet
Verlinke diesen Begriff über die Überschrift.
Flagship · Solid · Lightweight · Draft
Wie fertig eine öffentliche Seite ist. Flagship hat das volle Gate bestanden. Solid ist zuverlässig, mit Caveats. Lightweight ist ein Ersteindruck. Draft ist Gerüst, keine Empfehlung.
Redaktioneller Fit · Evidenzstufe · Quality Gate
Verlinke diesen Begriff über die Überschrift.
self-run · hands-on · synthesized · vendor claim
Wie nah der Desk an der Behauptung war. Self-run: wir haben die Aufgabe ausgeführt. Hands-on: jemand vom Desk hat das Tool genutzt. Synthesized: unabhängige Berichte. Vendor claim: unverifiziertes Marketing.
VerdictPal Lab · Quellgeprüft · Wie wir testen
Verlinke diesen Begriff über die Überschrift.
editorial desk · Redaktion
Das kleine Schweizer Studierenden-Team, das Seiten schreibt, Daten prüft und öffentliche Seiten freigibt. Hat der Desk ein Tool nicht genutzt, bleibt das Dossier so gekennzeichnet.
VerdictPal Lab · Evidenzstufe · Wer das schreibt
Verlinke diesen Begriff über die Überschrift.
newsletter · drop
Der Redaktionsnewsletter. Ein Drop erscheint, wenn ein Tool, Modell oder die Methode sich ändert — nie mit versprochenem Wochenrhythmus.
Verlinke diesen Begriff über die Überschrift.
pitfall · what breaks
Ein dokumentierter Weg, wie das Tool oder der Workflow in echter Studien- oder Forschungsarbeit bricht. Die bleiben absichtlich sichtbar, auch wenn Anbieter sie lieber verstecken.
Verlinke diesen Begriff über die Überschrift.
blind spot · what it does not measure
Die ehrliche Grenze einer Behauptung. Auf Benchmark-Seiten ist das die Liste dessen, was ein hoher Score nicht beweist.
Verlinke diesen Begriff über die Überschrift.
first-party · The Lab
Benchmarks, die wir selbst laufen, mit eingefrorenem Protokoll, Fragenbank und veröffentlichter Methode. Lab-Scores bleiben unveröffentlicht, bis ein Mensch sie bewertet und freigibt.
Zitationstreue · Evidenzstufe · The Lab öffnen
Verlinke diesen Begriff über die Überschrift.
frontier
Ein aktuelles Spitzenmodell, kein GPT-4-Rest von letztem Jahr. Der Modellvergleich auf dieser Site listet nur Frontier-Optionen.
Verlinke diesen Begriff über die Überschrift.
source-grounded · cited answer
Eine Behauptung an eine Quelle binden, die die Leserin öffnen kann. Ein flüssiger Absatz ohne Spur ist nicht geerdet, auch wenn er akademisch klingt.
Zitationstreue · Halluzination
Verlinke diesen Begriff über die Überschrift.
cited claims
Ob ein zitierter Satz in der genannten Quelle wirklich vorkommt. Das First-Party-Lab-Protokoll von VerdictPal bewertet diesen Fehlermodus für Hausarbeiten.
Grounding · VerdictPal Lab · Halluzination · Citation-Fidelity-Protokoll
Verlinke diesen Begriff über die Überschrift.
made-up source · fabricated citation
Eine selbstsichere Behauptung oder ein Zitat, das nicht in der Quelle steht. Flüssigkeit ist keine Evidenz. Prüfe das PDF, bevor du die Fußnote einfügst.
Verlinke diesen Begriff über die Überschrift.
open weights · open model
Die Modellgewichte lassen sich herunterladen und außerhalb der Vendor-Chatbox laufen. Open-Weight ist nicht dasselbe wie offene Daten, offenes Training oder eine Datenschutzgarantie.
Verlinke diesen Begriff über die Überschrift.
eval · suite · test
Ein konkreter Test einer konkreten Fähigkeit: harte Wissenschaftsfragen, Coding-Bugs, lange Dokumente, Agenten-Workflows. Keine Krone für das beste Modell.
Leaderboard · Familie · Ledger · Benchmark-Bibliothek
Verlinke diesen Begriff über die Überschrift.
ranking · scoreboard
Eine einzige geordnete Modellliste. VerdictPal lehnt diesen Rahmen ab. Verschiedene Tests messen verschiedene Jobs — Elo, pass@1 und Genauigkeit werden hier nie zu einem Fake-Ranking vermischt.
Verlinke diesen Begriff über die Überschrift.
score row · score database · evidence ledger
Die datierte Tabelle belegter Scores hinter einer Benchmark-Seite. Eine Zeile ist ein Modell in einem Test, mit Quellen-URL und Datum. Unterschiedliche Metriken bleiben in eigenen Spalten.
Quellgeprüft · Snapshot · Selbst berichtet
Verlinke diesen Begriff über die Überschrift.
verified · receipt
VerdictPal hat die zitierte Primärquelle geöffnet und die Zahl bestätigt. Eine belegte Zeile ohne diesen Stempel bleibt öffentlich, wird aber vorsichtiger gelesen.
Verlinke diesen Begriff über die Überschrift.
vendor score · announcement score
Die Zahl stammt aus der eigenen Ankündigung des Modell-Anbieters. Nützlich als Claim, schwach als Beweis. Besser ein unabhängiger Maintainer oder eine quellgeprüfte Zeile.
Verlinke diesen Begriff über die Überschrift.
static snapshot · ingested
Eine eingefrorene lokale Kopie öffentlicher Scores. Die Live-Site scrapt nicht und ruft beim Lesen keine Benchmark-APIs auf. Die Daten auf der Zeile sagen, wann diese Kopie entstand.
Verlinke diesen Begriff über die Überschrift.
source date · ingested at
Die Spur einer Zahl: wer sie veröffentlicht hat, die URL, das Quelldatum und wann VerdictPal sie übernommen hat. Keine Zahl ohne diese Spur.
Verlinke diesen Begriff über die Überschrift.
official source
Die Gruppe, der der Test gehört: ein Paper-Team, Artificial Analysis, Vals, LMArena oder VerdictPal Lab. Zeilen des offiziellen Maintainers schlagen einen Drittanbieter-Relauf derselben Suite.
Artificial Analysis · Vals AI · LMArena
Verlinke diesen Begriff über die Überschrift.
alias · model slug
Die stabile ID, die VerdictPal für ein Modell über Quellen hinweg nutzt. Anbieter benennen Anzeigenamen um; Schlüssel und Aliasse verhindern, dass GPT-5.5 als drei Modelle erscheint.
Verlinke diesen Begriff über die Überschrift.
edition · ARC-AGI 2
Eine gepflegte Ausgabe desselben Benchmarks, etwa ARC-AGI-1 gegen ARC-AGI-2. Scores aus verschiedenen Ausgaben sind nicht austauschbar.
Verlinke diesen Begriff über die Überschrift.
pass at 1 · pass@k
Der Anteil der Aufgaben, die das Modell im ersten Versuch löst. pass@k würde k Versuche erlauben. Coding-Benches nutzen das, weil ein sauberer Patch mehr zählt als zehn Glücksversuche.
Genauigkeit / Prozent · Harness
Verlinke diesen Begriff über die Überschrift.
arena elo · rating
Ein relatives Rating aus paarweisen Menschenstimmen, genutzt von Chatbot Arena. 1200 gegen 1300 ist ein Präferenzabstand, keine 100-Prozent-Genauigkeit. Elo nie neben einen Prozent-Score legen.
Menschliche Präferenz · Leaderboard
Verlinke diesen Begriff über die Überschrift.
pct · % · score
Anteil korrekt gelöster Items, meist 0–100. Hohe Genauigkeit auf einem gesättigten Test kann heißen, dass die Suite zu leicht ist — nicht, dass das Modell den Job erledigt hat.
Verlinke diesen Begriff über die Überschrift.
tps · output speed
Wie schnell ein Modell Text ausgibt, sobald es antwortet. Nützlich für interaktives Arbeiten. Sagt nichts darüber, ob die Antwort stimmt.
Zeit bis zum ersten Token · Token · Performance
Verlinke diesen Begriff über die Überschrift.
TTFT · latency
Wie lange du wartest, bis das erste Wort erscheint. Getrennt von Tokens pro Sekunde: ein Modell kann langsam starten und dann schnell streamen — oder umgekehrt.
Tokens pro Sekunde · Token · Performance
Verlinke diesen Begriff über die Überschrift.
expert ceiling · perfect score
Der Score, den eine sorgfältige Person oder ein Expertengremium im selben Test erreicht. Treffen Modelle diese Linie, trennt die Suite die Frontier nicht mehr.
Verlinke diesen Begriff über die Überschrift.
gap to ceiling
Die Punkte zwischen dem besten belegten Modell und dem Human Ceiling. Wenig Headroom heißt: der Test ist fast aufgebraucht.
Verlinke diesen Begriff über die Überschrift.
intelligence index · Vals Index · AA Index
Eine gewichtete Mischung mehrerer Tests eines Maintainers. Praktisch als Blick, undurchsichtig als Behauptung. Öffne immer die darunterliegenden Suites, bevor du den Index zitierst.
Artificial Analysis · Vals AI · Leaderboard
Verlinke diesen Begriff über die Überschrift.
no tools · no search
Das Modell muss allein aus seinen Gewichten antworten: kein Web, kein Rechner, keine Dateien. Ein Closed-Book-Score beschreibt nicht eine Studentin, die nachschlagen darf.
Verlinke diesen Begriff über die Überschrift.
open-book · with tools · agent harness
Das Modell darf während des Tests Browser, Code-Runner oder andere Tools nutzen. Vergleiche diese Zeilen nur mit anderen tool-augmentierten Zeilen.
Closed-Book · Agentisch · Harness
Verlinke diesen Begriff über die Überschrift.
held-out set · hidden test
Manche Prüfungen halten einen versteckten Fragensatz zurück, damit Modelle die öffentliche Liste nicht auswendig lernen. Ein Score nur auf dem öffentlichen Slice ist leichter zu spielen.
Kontamination · Genauigkeit / Prozent
Verlinke diesen Begriff über die Überschrift.
agent harness · eval harness
Die Hülle, die das Modell laufen lässt: Prompts, Tools, Retries, Zeitlimits. Dasselbe Modell kann unter zwei Harnesses glänzen oder holpern. Lies das Harness, bevor du einem Coding- oder Agent-Score vertraust.
Agentisch · pass@1 · Tool-augmentiert
Verlinke diesen Begriff über die Überschrift.
Eine Zahl oder Fähigkeitsaussage der Firma, die das Produkt verkauft. Veröffentlicht, gekennzeichnet und als unverifiziert behandelt, bis der Desk oder eine unabhängige Quelle sie prüft.
Selbst berichtet · Evidenzstufe
Verlinke diesen Begriff über die Überschrift.
AA · AA Index
Ein unabhängiger Evaluator, der viele öffentliche Suites neu laufen lässt und einen eigenen Intelligence-Index veröffentlicht. VerdictPal speichert einen datierten Snapshot; beim Laden der Seite rufen wir AA nicht auf.
Composite-Index · Snapshot · Vals AI
Verlinke diesen Begriff über die Überschrift.
Vals Index
Ein weiterer unabhängiger Score-Host. Wenn Vals und der offizielle Maintainer dieselbe akademische Suite veröffentlichen, gewinnt auf VerdictPal die offizielle Zeile.
Artificial Analysis · Maintainer
Verlinke diesen Begriff über die Überschrift.
Chatbot Arena · LMSYS
Die öffentliche Human-Preference-Arena hinter den Elo-Scores. Menschen stimmen über anonyme Antworten nebeneinander ab. Das misst Geschmack, keine Zitationsqualität.
Verlinke diesen Begriff über die Überschrift.
Das Stück, das ein Modell liest und schreibt — grob ein kurzes Wort oder Wortteil. Preise gelten meist pro Million Tokens. Kontextfenster zählt man in Tokens, nicht in Seiten.
Kontextfenster · Tokens pro Sekunde
Verlinke diesen Begriff über die Überschrift.
context length
Wie viel Text das Modell in einem Prompt halten kann, gemessen in Tokens. Ein riesiges Fenster garantiert nicht, dass es den Satz auf Seite 40 noch nutzt.
Verlinke diesen Begriff über die Überschrift.
RAG · search step
Die richtige Passage finden, bevor geantwortet wird. Long-Context-Tests legen die Passage in den Prompt; Such-Tools müssen sie erst holen. Das sind verschiedene Fähigkeiten.
Verlinke diesen Begriff über die Überschrift.
Der Test trennt die heutige Frontier noch. Das ist das Set, das wir zuerst öffnen, wenn du aktuelle Evidenz brauchst.
Gesättigt · Gelöst / defunct · Primär-Benchmark
Verlinke diesen Begriff über die Überschrift.
used up
Spitzenmodelle kleben an der Decke. Die Suite bleibt als Geschichte und Methode nützlich, aber ein neuer Highscore sagt kaum noch, wer vorn liegt.
Aktiv · Gelöst / defunct · Headroom
Verlinke diesen Begriff über die Überschrift.
defunct · ~100%
Verifizierte Top-Scores liegen bei oder nahe 100 Prozent. Wir behalten den Explainer, damit du alte Paper entschlüsseln kannst — als aktuelle Evidenz gilt er nicht.
Gesättigt · Eingestellt · Human Ceiling
Verlinke diesen Begriff über die Überschrift.
retired
Der Maintainer hat die Suite beendet, oder die öffentliche Seite ist weg. Bleibt nur, damit alte Zitate noch auflösen.
Verlinke diesen Begriff über die Überschrift.
data leak · train/test leak · memorization
Risiko, dass Testfragen in die Trainingsdaten geleakt sind. Ein hoher Score auf einer kontaminierten Suite kann heißen, dass das Modell die Antworten gesehen hat — nicht, dass es die Fähigkeit gelernt hat.
Public-/Private-Split · Gesättigt
Verlinke diesen Begriff über die Überschrift.
start here · discriminator
Der eine lebendige Test, den wir in einer Familie zuerst öffnen. Primär in Mathe ist FrontierMath; ältere MATH- und AIME-Seiten bleiben gelöstes Glossar, keine aktuelle Evidenz.
Familie · Aktiv · Hier-starten-Leiste
Verlinke diesen Begriff über die Überschrift.
task family
Der Job, den ein Benchmark zu messen behauptet: Wissen, Reasoning, Mathe, Coding, Agenten und so weiter. Familien verhindern, dass ungleichartige Scores in ein Chart gestapelt werden.
Verlinke diesen Begriff über die Überschrift.
MMLU
Closed-Book-Abruf über Schul- und Berufsfächer. Ein hoher Wissens-Score beweist nicht, dass das Modell eine Literaturrecherche führen kann.
Verlinke diesen Begriff über die Überschrift.
HLE · GPQA
Harte, mehrschrittige Fragen, die sich nicht allein durch Nachschlagen lösen lassen sollten. Trotzdem eine Prüfung, kein Maß für unordentliche Forschungsproduktivität.
Verlinke diesen Begriff über die Überschrift.
FrontierMath · AIME
Wettbewerbs- oder Forschungsmathematik. Ältere öffentliche Suites sind weitgehend gelöst; FrontierMath ist hier der lebendige Diskriminator.
Primär-Benchmark · Gelöst / defunct
Verlinke diesen Begriff über die Überschrift.
SWE-bench · HumanEval
Programme schreiben oder reparieren. Lies das Harness: ein pass@1 auf einem versteckten Unit-Test ist nicht dasselbe wie ein reviewed Pull Request.
Verlinke diesen Begriff über die Überschrift.
agent · Terminal-Bench
Mehrschrittige Arbeit, bei der das Modell Tools, ein Terminal oder einen Workflow nutzen muss — statt eine Prompt-Antwort zu liefern. Das Harness ist die Hälfte des Ergebnisses.
Harness · Tool-Nutzung · Tool-augmentiert
Verlinke diesen Begriff über die Überschrift.
MMMU · vision
Aufgaben, die Text mit Bildern oder anderen Medien mischen. Ein starkes Nur-Text-Modell kann an einer Abbildung, einem Chart oder einer Folie scheitern.
Verlinke diesen Begriff über die Überschrift.
AA-LCR · needle in a haystack
Evidenz nutzen, die weit auseinander in einem sehr langen Prompt sitzt. Das ist nicht dasselbe wie die Live-Websuche.
Verlinke diesen Begriff über die Überschrift.
function calling · BFCL
Ob das Modell die richtige Funktion, API oder Browser-Aktion zur richtigen Zeit aufruft. Getrennt davon, guten Text über das Tool zu schreiben.
Verlinke diesen Begriff über die Überschrift.
speed · latency
Tempo und Reaktionszeit: Output-Tokens pro Sekunde, Zeit bis zum ersten Token. Diese Zeilen sind keine Qualitäts-Scores.
Tokens pro Sekunde · Zeit bis zum ersten Token
Verlinke diesen Begriff über die Überschrift.
HELM Safety
Ob das Modell schädliche Anfragen ablehnt oder Dinge leakt, die es nicht soll. Ein Safety-Score ist keine Datenschutzerklärung und keine Forschungsnote.
Verlinke diesen Begriff über die Überschrift.
arena · vibe check
Blinde Menschenstimmen dazu, welche Antwort sich besser anfühlt. Hilfreich für Ton und Nützlichkeit. Still zu Zitaten, Kontamination und Prüfungsfähigkeit.
Verlinke diesen Begriff über die Überschrift.
Jeder öffentliche Test auf VerdictPal, in einem Alphabet. Öffne das Dossier für Scores, Caveats und Quellen.
Output tokens per second · Median output speed
Medianer Output-Tokens pro Sekunde nach dem ersten Chunk, gemessen am Default-API-Provider jedes Modells mit ~1k Input-Tokens (AA-Medium-Workload).
TTFT · Median TTFT
Median-Sekunden bis zum ersten Token am Default-API-Provider mit ~1k Input-Tokens.
ARC Prize · ARC-AGI
Flüssiges, dateneffizientes Schließen über die ARC-Prize-Benchmark-Serie — von statischen Gitter-Rätseln (ARC-AGI-1/2) bis zu interaktiven agentischen Umgebungen (ARC-AGI-3). Gegen Auswendiglernen gebaut, belohnt echte Generalisierung.
AIME
Schwere Schulwettbewerbs-Mathematik: 15 Aufgaben mit Ganzzahl-Antwort pro Prüfung. Als Reasoning-Eval genutzt, weil jedes neue Paper anfangs kontaminationsresistent ist — bis es durchsickert.
AA Intelligence Index · AA Index v4.1 · AA Index v4.1.1
AA Intelligence Index v4.1 — gewichteter Composite mit Fokus auf agentische Workloads: GDPval-AA v2 (20 %), Terminal-Bench 2.1 (16 %), τ³-Bench Banking (14 %), Humanity's Last Exam (12 %), AA-Omniscience (12 %), SciCode (8 %), GPQA Diamond (6 %), AA-LCR (6 %), CritPt (6 %). IFBench wegen Sättigung entfernt.
AA-LCR
Long-Context-Synthese und Reasoning: 100 offene Antwortfragen, die Modelle zwingen, Evidenz über lange Inputs zu integrieren. 6 % Gewicht im AA Intelligence Index v4.1.
Berkeley Tool Calling Leaderboard · BFCL
Ob ein Modell Funktionsaufrufe über Single-Turn-, Multi-Turn-, parallele und Live-API-artige Tool-Use-Aufgaben korrekt auswählt und formatiert.
Critical Physics Tasks · Complex Research using Integrated Thinking - Physics Test
Unveröffentlichte Forschungsphysik: 71 zusammengesetzte Challenges (70 Test + 1 Beispiel) von 50+ aktiven Physiker:innen über 11 Teilgebiete, plus 190 einfachere Checkpoint-Aufgaben. 6 % Gewicht im AA Intelligence Index v4.1.
Langhorizont-Software-Engineering auf 113 kontaminationsfreien Aufgaben über 91 Repos und fünf Sprachen — Patches müssen handgeschriebene Verhaltens-Verifier bestehen, keine String-Diffs.
FrontierMath Tiers 1-3 · FrontierMath v2
Harte unveröffentlichte Mathematik: 295 private Tiers-1-3-Aufgaben (v2), bei denen das Modell nach iterativem Reasoning und Code-Ausführung eine Python-answer()-Funktion abgibt.
Real-work deliverables vs experts · GDPval-AA v2
GDPval-AA v2 — echte Wissensarbeits-Lieferungen über 44 Berufe, blind paarweise gegen menschliche Experten bewertet (Elo bei 1000 verankert). 20 % Gewicht im AA Intelligence Index v4.1.
Graduate-Level Google-Proof Q&A
Schwere Wissenschaftsfragen auf Graduiertenniveau (Biologie, Physik, Chemie), so geschrieben, dass Laien sie auch mit Websuche nicht lösen — die 'Diamond'-Teilmenge ist der hochwertigste, von Experten geprüfte Anteil.
Holistic Evaluation of Language Models · Stanford HELM
Eine multimetrische Sicherheits-Evaluationssuite von Stanford CRFM, die Modellverhalten über sicherheitsbezogene Szenarien ausweist, statt alles in einen einzigen Headline-Wert zu pressen.
Ob ein Modell aus einem Docstring eine kurze Python-Funktion schreibt, die einige Unit-Tests besteht — der ursprüngliche Code-Generierungs-Benchmark.
HLE
Fachübergreifende Fragen auf Expertenniveau — Mathematik, Naturwissenschaften, Geisteswissenschaften, professionelles Recht und Medizin — entworfen als die härteste öffentliche Prüfung, die ein Frontier-Modell ablegen kann.
Instruction-Following Benchmark
Präzises Instruction-Following bei neuen Constraints — testet, ob Modelle komplexe, ungesehene Formatregeln ohne Abdriften befolgen.
Ein kontaminationsarmer Benchmark, der Fragen über Zeit erneuert und Reasoning, Coding, Mathe, Datenanalyse, Sprache und Instruction Following abdeckt.
Kontaminationsresistente Coding-Probleme aus aktuellen Contest-Releases — AA führt Modelle im öffentlichen Harness erneut aus.
Chatbot Arena · LMSYS Arena
Menschliche Präferenz im großen Maßstab: Menschen chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Stimmen werden zu einem Elo-Ranking.
LongBench 2
Ob Long-Context-Modelle über lange, realistische Inputs schlussfolgern können, statt nur ein großes Tokenfenster anzunehmen.
MMMU
Fragen auf Hochschulniveau, die Bilder und Text zusammen erfordern — Diagramme, Schaltpläne, chemische Strukturen, medizinische Scans — über 30 Fächer.
MMLU
Breites Multiple-Choice-Wissen über 57 Fächer — von US-Geschichte über Hochschulphysik bis Jura — im Vier-Optionen-Prüfungsformat.
Schritt-für-Schritt-Lösungen zu 12.500 Wettbewerbs-Mathematikaufgaben (AMC/AIME-Stil), bewertet an der finalen Antwort.
Wie zuverlässig ein Modell über das Model Context Protocol bereitgestellte Werkzeuge auswählt, sequenziert und wiederherstellt — inklusive Schema-Treue, Fehlerbehandlung und Werkzeug-Ketten-Schlussfolgern.
Ein schwererer MMLU-Nachfolger: zehn statt vier Optionen, schlussfolgerungslastige Fragen und ein bereinigter Satz, der schwerer zu erraten ist.
MMMU Pro · Massive Multi-discipline Multimodal Understanding Pro
Härtere multimodale Hochschulprüfung: originale MMMU-Items ohne Text-only-Shortcuts, zehn statt vier Optionen, und ein Vision-only-Setting, in dem die Frage im Bild steckt. 3.460 Fragen über 30 Fächer.
AA-Omniscience Index · AA-Omniscience
Faktenabruf und Wissenskalibrierung über 6.000 Fragen in 42 wirtschaftlich relevanten Themen und sechs Domänen. Accuracy ist 8 % des AA Intelligence Index v4.1; der Non-Hallucination-Anteil weitere 4 %.
Wissenschaftliche Programmieraufgaben mit Domänen-Bibliotheken und mehrstufigem numerischem Code — AA-Snapshot-Läufe.
Ob ein Modell echte GitHub-Issues aus populären Python-Repos lösen kann — es muss einen Patch erzeugen, der die versteckte Testsuite besteht. 'Verified' ist eine 500-Issue-Teilmenge, von Menschen validiert.
Terminal-Bench 2.1 · [email protected]
Ob ein Agent realistische, containerisierte Terminal-Aufgaben (Terminal-Bench 2.1) erledigen kann: Code debuggen, Dateien bearbeiten, Befehle ausführen und das Artefakt liefern, das der versteckte Checker erwartet. 16 % Gewicht im AA Intelligence Index v4.1.
TB-Science · Terminal-Bench-Science 0.1
Ob ein Agent echte wissenschaftliche Research-Workflows im Terminal zu Ende bringt: 70 von Expert:innen kuratierte Aufgaben über Life, Physical, Earth, Mathematical und Engineering Sciences, bewertet an konkreten Artefakten (Analysen, Simulationen, Beweise, Code, Datenprodukte).
Vals AI Index
Ein Vals-Kompositwert über branchennähere Aufgaben wie Finance und Coding, gedacht als Näherung für praktische Modellnützlichkeit bei wirtschaftlich relevanter Arbeit.
Langhorizont-Business-Kohärenz: Ein Modell führt 365 Tage ein simuliertes Automaten-Unternehmen — Inventar, Lieferanten-Mail, Preise, Refunds — bewertet nach Endkontostand (USD).
tau3-bench-banking · τ³-Banking
Dual-Control-Agent-User-Simulation für Banking-Aufgaben: 97 Szenarien mit Wissens-Retrieval, Backend-Datenbank-Zustandsbewertung, pass@1. 14 % Gewicht im AA Intelligence Index v4.1.
The Pack · Redaktionsnewsletter
Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.