Benchmarks / Wissen

Omniscience Accuracy

AA-Omniscience

Faktenabruf und Wissenskalibrierung über 6.000 Fragen in 42 wirtschaftlich relevanten Themen und sechs Domänen. Accuracy ist 8 % des AA Intelligence Index v4.1; der Non-Hallucination-Anteil weitere 4 %.

Was dieser Benchmark nicht misst
  • Open-Web-Recherche — die Fragen sind Closed-Book. Ein Modell, das suchen und zitieren sollte, wird hier nicht getestet.
  • Ob eine Verweigerung nützlich ist — Enthaltung zählt 0 im Index; das ist besser als eine selbstsichere Falschantwort, kein Research-Deliverable.
  • Eine einzelne Zuverlässigkeitszahl ohne Hallucination-Rate — hohe Accuracy bei hoher Hallucination ist der übliche OpenAI-förmige Fehlertyp in dieser Suite.
Analyse

Warum dieser Benchmark nützlich ist

Für quellenstarke Studierende ist die relevante Fehlerart die selbstsichere Falschantwort. AA-Omniscience ist die öffentliche Suite, die Abruf und Hallucination gemeinsam über Domänen bewertet, die in Papers tatsächlich vorkommen.

Umfang

Abdeckung

Aufgabenfamilie
Wissen
Format
6.000 Fragen aus akademischen und Branchenquellen über Business, Geisteswissenschaften, Science/Engineering, Gesundheit, Recht und Software Engineering. Modelle dürfen antworten oder sich enthalten.
Bewertung
VerdictPal-Ledger-Zeilen sind AA-Omniscience-Accuracy (% aller Fragen korrekt, Enthaltungen zählen als Fehler). Der Begleit-Index (−100 bis +100) belohnt korrekte Antworten, bestraft Hallucinationen und zählt 0 für Enthaltung — Index-Zahlen stehen in den Notes, nicht als sortierbarer Score, weil der Index negativ werden kann.
Verantwortliche Stelle
Artificial Analysis
Lesehilfe

So liest du die Scores

Lies Accuracy als Headline, dann die Hallucination-Rate in den Notes. Claude Fable 5.1 führt das AA-Board vom 1. Sep. 2026 bei Accuracy (~67 %) und Index (43). GPT-5.6 Sol liegt bei Accuracy nah (~59 %) mit deutlich höherer Hallucination-Rate. Index und Accuracy nicht in einem Ranking mischen.

Blinde Flecken

Was er nicht abdeckt

  • Open-Web-Recherche — die Fragen sind Closed-Book. Ein Modell, das suchen und zitieren sollte, wird hier nicht getestet.
  • Ob eine Verweigerung nützlich ist — Enthaltung zählt 0 im Index; das ist besser als eine selbstsichere Falschantwort, kein Research-Deliverable.
  • Eine einzelne Zuverlässigkeitszahl ohne Hallucination-Rate — hohe Accuracy bei hoher Hallucination ist der übliche OpenAI-förmige Fehlertyp in dieser Suite.
Scores

Evidenz-Ledger

12 Zeilen
1212 Zeilen
67%bester Score
12quellgeprüft
1Quellen
2026-09-01Quelldatum
12

api · api

Verteilung

Wo die Zeilen liegen

0255075100

Auf die Skala dieses Benchmarks normalisiert (0–100). Die Tabelle zeigt die Rohwerte.

Zeitverlauf

Neueste Belege

  1. Claude Fable 5.167% ·
  2. Claude Fable 565% ·
  3. Claude Opus 560.9% ·
  4. GPT-5.6 Sol59.4% ·
  5. GPT-5.557% ·

Scores nutzen die eigene Einheit und Skala dieses Benchmarks, keinen universellen Qualitätswert.

#ModellVeröffentlichungScoreHerkunftBeleglage
1Claude Fable 5.1AnthropicÖffentliches AA-Omniscience-Board, 1. Sep. 2026. Headline-Accuracy 67 %; Begleit-Index 43. Index nicht gegen Accuracy ranken.2026-09-0167%
2026-09-01
Quelle geprüft
2Claude Fable 5AnthropicAA-Headline-Accuracy 65 % (Opus-4.8-Fallback-Variante); Index 43.2026-06-0965%
2026-09-01
Quelle geprüft
3Claude Opus 5Anthropic2026-07-2460.9%
2026-09-01
Quelle geprüft
4GPT-5.6 SolOpenAIHohe Accuracy bei erhöhter Hallucination vs. Claude in dieser Suite. Der Index liegt niedriger, als die Accuracy andeutet.2026-07-0959.4%
2026-09-01
Quelle geprüft
5GPT-5.5OpenAI2026-04-2357%
2026-09-01
Quelle geprüft
11Gemini 3.5 FlashGoogle2026-05-1951.9%
2026-09-01
Quelle geprüft
12Grok 4.5xAI2026-07-0851.6%
2026-09-01
Quelle geprüft
16DeepSeek V4 ProDeepSeek2026-08-1349.1%
2026-09-01
Quelle geprüft
18Claude Opus 4.8Anthropic2026-05-2848.8%
2026-09-01
Quelle geprüft
19Grok 4.6xAI2026-08-1248.2%
2026-09-01
Quelle geprüft
20Kimi K3Moonshot2026-07-1647.6%
2026-09-01
Quelle geprüft
22GPT-5.6 TerraOpenAI2026-07-0946.8%
2026-09-01
Quelle geprüft
Methode

Was er abdeckt

Accuracy-Zeilen aus Artificial Analysis' öffentlicher Omniscience-Evaluation (Board 1. Sep. 2026). Ein öffentliches Hugging-Face-Subset existiert; das live AA-Board ist die Quelle dieser Scores. Das Original-Paper 2025 hatte fast keine Modelle über Index 0 — Claude-Zeilen 2026 liegen jetzt im Index-Band 30–43.

Score-Obergrenze

Wo er an Grenzen stößt

Accuracy ist nicht gesättigt — Frontier-Zeilen 2026 clustern im Band 45–67 %. Der Index bleibt klar unter 50.

Tools, die ihn ausweisen

Belege

Quellen und weiterführende Lektüre

Fragen zu diesem Benchmark

Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.

Was misst AA-Omniscience?

Faktenabruf und Wissenskalibrierung über 6.000 Fragen in 42 wirtschaftlich relevanten Themen und sechs Domänen. Accuracy ist 8 % des AA Intelligence Index v4.1; der Non-Hallucination-Anteil weitere 4 %.

Was beweist ein hoher AA-Omniscience-Wert nicht?

Ein starkes AA-Omniscience-Ergebnis sagt nichts aus über:

  • Open-Web-Recherche — die Fragen sind Closed-Book. Ein Modell, das suchen und zitieren sollte, wird hier nicht getestet.
  • Ob eine Verweigerung nützlich ist — Enthaltung zählt 0 im Index; das ist besser als eine selbstsichere Falschantwort, kein Research-Deliverable.
  • Eine einzelne Zuverlässigkeitszahl ohne Hallucination-Rate — hohe Accuracy bei hoher Hallucination ist der übliche OpenAI-förmige Fehlertyp in dieser Suite.

Wie wird AA-Omniscience bewertet?

VerdictPal-Ledger-Zeilen sind AA-Omniscience-Accuracy (% aller Fragen korrekt, Enthaltungen zählen als Fehler). Der Begleit-Index (−100 bis +100) belohnt korrekte Antworten, bestraft Hallucinationen und zählt 0 für Enthaltung — Index-Zahlen stehen in den Notes, nicht als sortierbarer Score, weil der Index negativ werden kann. Aufgabenformat: 6.000 Fragen aus akademischen und Branchenquellen über Business, Geisteswissenschaften, Science/Engineering, Gesundheit, Recht und Software Engineering. Modelle dürfen antworten oder sich enthalten.

Ist AA-Omniscience gesättigt?

AA-Omniscience ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Accuracy ist nicht gesättigt — Frontier-Zeilen 2026 clustern im Band 45–67 %. Der Index bleibt klar unter 50.

Können AA-Omniscience-Ergebnisse durch Trainingsdaten verunreinigt sein?

Das Kontaminationsrisiko für AA-Omniscience ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.

The Pack · Redaktionsnewsletter

Neue Tools in dein Postfach. Kostenlos.

Eine kurze E-Mail, wenn ein Tool erscheint oder den Status wechselt. Kein Tracking, keine Drittanbieter-Analytics. Abmeldung mit einem Klick.