Jede Antwort unten stammt aus den datierten Feldern dieser Seite. Nichts davon ist zusätzlich für Suchmaschinen geschrieben.
Was misst AA-Omniscience?
Faktenabruf und Wissenskalibrierung über 6.000 Fragen in 42 wirtschaftlich relevanten Themen und sechs Domänen. Accuracy ist 8 % des AA Intelligence Index v4.1; der Non-Hallucination-Anteil weitere 4 %.
Was beweist ein hoher AA-Omniscience-Wert nicht?
Ein starkes AA-Omniscience-Ergebnis sagt nichts aus über:
- Open-Web-Recherche — die Fragen sind Closed-Book. Ein Modell, das suchen und zitieren sollte, wird hier nicht getestet.
- Ob eine Verweigerung nützlich ist — Enthaltung zählt 0 im Index; das ist besser als eine selbstsichere Falschantwort, kein Research-Deliverable.
- Eine einzelne Zuverlässigkeitszahl ohne Hallucination-Rate — hohe Accuracy bei hoher Hallucination ist der übliche OpenAI-förmige Fehlertyp in dieser Suite.
Wie wird AA-Omniscience bewertet?
VerdictPal-Ledger-Zeilen sind AA-Omniscience-Accuracy (% aller Fragen korrekt, Enthaltungen zählen als Fehler). Der Begleit-Index (−100 bis +100) belohnt korrekte Antworten, bestraft Hallucinationen und zählt 0 für Enthaltung — Index-Zahlen stehen in den Notes, nicht als sortierbarer Score, weil der Index negativ werden kann. Aufgabenformat: 6.000 Fragen aus akademischen und Branchenquellen über Business, Geisteswissenschaften, Science/Engineering, Gesundheit, Recht und Software Engineering. Modelle dürfen antworten oder sich enthalten.
Ist AA-Omniscience gesättigt?
AA-Omniscience ist im Atlas derzeit als Aktiv markiert. Kontext zur Obergrenze: Accuracy ist nicht gesättigt — Frontier-Zeilen 2026 clustern im Band 45–67 %. Der Index bleibt klar unter 50.
Können AA-Omniscience-Ergebnisse durch Trainingsdaten verunreinigt sein?
Das Kontaminationsrisiko für AA-Omniscience ist als Kontamination mittel eingestuft. Behandle jede Zeile auf dieser Seite als öffentliche Angabe mit Quelle und Datum, nicht als kontrolliertes Experiment.