Was sich änderte
2026-W36
- Claude Fable 5.1
Live-Vals-Index 68,83 %. Live-AA-Intelligence-Index v4.2 ist 57 bei Max + Default-Fallback.
Modell - Frontier September 2026: GPT-6 Astra, Gemini 3.8 Flash, Muse Spark 1.3, Hy4-Vorschau
OpenAIs GPT-6 Astra vom 3. Sep., Googles Gemini 3.8 Flash vom 2. Sep. und Metas Muse Spark 1.3 vom 2. Sep. stehen jetzt mit Live-Werten des Artificial-Analysis-Intelligence-Index v4.2 im Atlas. Tencents Hy4-Vorschau ist aus dem offiziellen Start erfasst. Claude Fable 5.1 führt den Live-Vals-Index weiter mit 68,83 %. /models
Drop - Gemini 3.7 Flash
Live-AA-Intelligence-Index v4.2 ist 45 bei High Effort. Gemini 3.8 Flash ist jetzt das aktuelle Flash; 3.7 bleibt für den schnelleren 305-t/s-Endpoint gelistet.
Modell - GPT-5.6 Sol
Live-AA-Intelligence-Index v4.2 ist 51 bei Max. GPT-6 Astra ist das aktuelle OpenAI-Flagship; Sol bleibt die günstigere GPT-5.6-Linie.
Modell - GPT-6 Astra
GPT-6 Astra GA auf der OpenAI-API und gestuftem ChatGPT-/AWS-Rollout. Liste $10 / $50 pro 1M Tokens.
Modell - Gemini 3.8 Flash
Gemini 3.8 Flash allgemein verfügbar. AA-High-Effort-Intelligence-Index v4.2 ist 47; Intro-Preis unverändert gegenüber 3.7 Flash.
Modell - Muse Spark 1.2
Muse Spark 1.3 ist jetzt die aktuelle Muse-Spark-Linie. 1.2 bleibt für den v4.1-xhigh-Snapshot gelistet.
Modell - Muse Spark 1.3
Muse Spark 1.3 in Muse Code und der Meta Model API verfügbar. AA-Max-Effort-Intelligence-Index v4.2 ist 53.
Modell - AA-Omniscience und CritPt kommen in den Benchmark-Atlas
Zwei fehlende Slices des AA Intelligence Index v4.1 haben jetzt Erklärseiten und belegte Zeilen: AA-Omniscience (Faktenabruf vs. Hallucination — die Wissens-Primärspur) und CritPt (Forschungsphysik, Frontier noch unter 40 %). /benchmarks/aa-omniscience · /benchmarks/critpt
Drop - Claude Fable 5
Vals-Index 66,04 % im Snapshot vom 1. Sep.; Fable 5.1 übernimmt die Führung mit 67,87 %.
Modell - Claude Fable 5.1
Claude Fable 5.1 GA auf der Claude-API, Bedrock, Vertex und Microsoft Foundry. Cache-Reads auf $0,25 / 1M Tokens gesenkt.
Modell - Claude Fable 5.1 steht im Modell-Atlas — Vals-Index 67,87 %
Anthropics Mythos-class-Refresh von Fable 5 am 1. Sep. Dieselbe $10-/$50-Liste, Cache-Reads auf $0,25 pro 1M Tokens. Vals setzt es auf 67,87 % im Index, vor Opus 5 und Fable 5. Der AA-Intelligence-Index steht im API-Snapshot vom 1. Sep. noch nicht. Vergleich mit GPT-5.6 Sol oder Fable 5. /models/claude-fable-5-1
Drop
2026-W35
- Hy4 preview
Hy4 preview open-sourced und auf TokenHub / OpenRouter mit $0,834 / $2,501 pro 1M Tokens gelistet.
Modell - Drei akademische Guide-Trilogien, neu aufgebaut
Studentische Recherche, Literaturreview und Peer-Review — jeweils mit Stack und Playbook. Peer-Review beginnt mit der KI-Richtlinie des Venues. Alte Grant-, Coding- und Deck-Pfade führen nach /guides.
Drop - Terminal-Bench-Science 0.1 steht im Atlas — beste Zeile 30 %
Stanfords und Laudes 70-Aufgaben-Science-Agent-Suite: echte Labor-Workflows, noch weit von der Decke. Claude Opus 5 + Claude Code führt mit 30,0 %; GPT-5.6 Sol + Codex liegt bei 22,4 %; GLM-5.3 ist die stärkste Open-Weight-Zeile mit 8,1 %. Nicht Terminal-Bench 2.1. /benchmarks/terminal-bench-science
Drop - GLM-5.3-Flash steht im Modell-Atlas — AA-Index 57,5
Z.ais Flash-Geschwister von GLM-5.3, aus dem Artificial-Analysis-Snapshot vom 1. Sep.: Intelligence-Index 57,5 bei $0,15 / $0,50 pro 1M Tokens. Zwei Punkte hinter GLM-5.3 max bei einem Zehntel des Listenpreises. /models/glm-5-3-flash · /compare/models/glm-5-3-vs-glm-5-3-flash
Drop - GLM-5.3 steht im Modell-Atlas — AA-Index 59,5
Z.ais Coding-Refresh vom August steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-24: Max-Effort-Intelligence-Index 59,5, API-Liste $1,40 / $4,40 pro 1M Tokens. Dieselbe Basis wie GLM-5.2; Weights waren bei dieser Prüfung noch unveröffentlicht. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 27B. /models/glm-5-3 · /compare/models/glm-5-3-vs-qwen3-8-27b
Drop - Qwen3.8 27B steht im Modell-Atlas — AA-Index 52
Alibabas dichtes Open-Weight-Qwen3.8-Geschwister steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-24: Xhigh-Intelligence-Index 52, Hosted-Liste $0,50 / $3 pro 1M Tokens, Apache 2.0 auf Hugging Face. Das ist nicht gehostetes Qwen3.8 Max. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 Max. /models/qwen3-8-27b · /compare/models/qwen3-8-27b-vs-qwen3-8-max
Drop
2026-W34
- GLM-5.3
Gehostete API auf Artificial Analysis gelistet (Max-Effort-Index 59,5, $1,40 / $4,40 pro 1M Tokens).
Modell
2026-W33
- Qwen3.8 2.4T steht im Modell-Atlas — AA-Index 57,7
Alibabas Open-Weight-Qwen-Max-Klasse-MoE (2,4T gesamt / 95B aktiv) steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-15: Intelligence-Index 57,7, Hosted-Liste $2 / $6 pro 1M Tokens. Das ist der veröffentlichte Checkpoint, nicht gehostetes Qwen3.8 Max. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 Max. /models/qwen3-8-2-4t-a95b · /compare/models/qwen3-8-2-4t-a95b-vs-qwen3-8-max
Drop - Qwen3.8 27B
Open Weights veröffentlicht. AA-Intelligence-Index 52 auf Xhigh; Hosted-Liste $0,50 / $3 pro 1M Tokens.
Modell - Gemini 3.6 Flash (high)
Objektive Auffrischung: DeepMind-Karte 1M Kontext / 64K Output; Google-Einführungspreis $0,75 / $3,75; AA-High-Effort-Index 51,6.
Modell - Gemini 3.7 Flash
Gemini 3.7 Flash allgemein verfügbar. AA-High-Effort-Intelligence-Index 56; Einführungspreis $0,75 / $3,75 pro 1M Tokens. Google meldet Zugewinne gegenüber 3.6 Flash auf FrontierCode 1.1, DeepSWE v1.1, WebDev Arena und GDP.pdf — Vendor-Claims, keine Ledger-Zeilen.
Modell - Gemini 3.7 Flash steht im Modell-Atlas — AA-Index 56
Googles Flash-Arbeitspferd vom August steht im Atlas aus dem Artificial-Analysis-Snapshot: High-Effort-Intelligence-Index 56, Einführungspreis $0,75 / $3,75 pro 1M Tokens bis 31. Dez. 2026. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit 3.6 Flash oder Claude Sonnet 4.6. /models/gemini-3-7-flash · /compare/models/gemini-3-6-flash-vs-gemini-3-7-flash
Drop - Grok 4.6
Grok 4.6 erscheint auf Artificial Analysis (High-Effort-Index 60,9, $2 / $6 pro 1M Tokens).
Modell - Grok 4.6 steht im Modell-Atlas — AA-Index 60,9
xAIs August-Flaggschiff steht im Atlas aus dem Artificial-Analysis-Snapshot: High-Effort-Intelligence-Index 60,9, $2 / $6 pro 1M Tokens. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit GPT-5.6 Sol. /models/grok-4-6 · /compare/models/gpt-5-6-sol-vs-grok-4-6
Drop - Qwen3.8 2.4T A95B
Open Weights veröffentlicht. AA-Intelligence-Index 57,7; Hosted-Liste $2 / $6 pro 1M Tokens.
Modell - Nemotron 3.5 Lightning
Nemotron 3.5 Lightning auf Artificial Analysis (Index 23,6, $0,05 / $0,20).
Modell - Muse Glimmer
Muse Glimmer als Open Weight veröffentlicht (Apache 2.0, 30B). AA-High-Effort-Index 35,1; Hosted-Listenpreis $0,325 / $1,35 pro 1M Tokens.
Modell
2026-W32
- Muse Spark 1.2
Muse Spark 1.2 erscheint auf Artificial Analysis (xhigh-Index 56,8, $1.25 / $4.25 pro 1M Tokens).
Modell - VerdictPal ist live — und der Atlas-Report legt Zahlen über den ganzen Atlas
Die Launch-Notiz ist veröffentlicht, dazu eine neue eigene Datenfläche: der Atlas-Report berechnet aggregierte Zahlen zu Preisen, Datenschutz, Benchmark-Sättigung und Aktualität aus jedem veröffentlichten Tool — frei zitierbar mit Link. Befunde dieser Ausgabe: die meisten Dossiers halten überhaupt keine Haltung zum Training mit deinen Inhalten fest, bezahlte Einstiegstarife liegen dicht um den Mittelwert, und die Input-Preise der Frontier-Modelle gehen um mehr als drei Größenordnungen auseinander. /report · /launch
Drop
2026-W29
- GPT-5.6 Luna
Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und Benchmark-Evidenz aktualisiert.
Modell - GPT-5.6 Sol
Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und anschließend Benchmark-Evidenz von Vals und Artificial Analysis aktualisiert.
Modell - GPT-5.6 Terra
Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und Benchmark-Evidenz aktualisiert.
Modell
2026-W28
- AI-Builder-Design-Test auf der Lab-Bank — vier Builder, gleiche Prompts, sehr verschiedene Ergebnisse
VerdictPals zweites First-Party-Protokoll: vier identische Multi-Turn-Design-Prompts durch Lovable, v0, Replit und Bolt. Lauf 01 notiert eine Turn-1-Rangfolge (Lovable → v0 → Replit → Bolt) und die Kosten bis zum Ergebnis in der jeweiligen Hersteller-Einheit — kein aufgefülltes Leaderboard, formale Score-Zeilen warten auf ein wiederholbares Rubric. /benchmarks/ai-builder-design-test · /benchmarks/lab
Drop - Citation-Fidelity-Protokoll v0.1 auf der Lab-Bank eingefroren
VerdictPals erster First-Party-Benchmark im Lab: zwölf Forschungsfragen, dual-reviewer Zitierbewertung, eingefrorenes Runbook auf der Atlas-Seite — Protokoll veröffentlicht, Desk-Lauf noch ausstehend, kein aufgefülltes Leaderboard. /benchmarks/citation-fidelity · /benchmarks/lab
Drop - Claude
Evidenz-Integritätsfix: falsches Upgrade auf editorial-hands-on zurückgenommen; Evidenz bleibt synthetisiert und qualityGate von flagship auf solid gemäß der redaktionellen Evidenzleiter zurückgestuft. Kein Desk-Hands-on-Versuch aktenkundig; benchmarkReady bleibt false.
Tool
2026-W27
- Fünf Recherche-Guides jetzt im Atlas
Zitier-Audit, Systematic-Review-Protokoll, Data-Cleaning-Pipeline, Grant-Writer-Pfad und Peer-Reviewer-Pfad — solide Guides mit Schrittblöcken und Verifikations-Checklisten.
Drop - GPT-5.6 Luna
Öffentliche Preise aktualisiert: Luna ist mit $1 Input / $6 Output pro 1M Tokens gelistet.
Modell - GPT-5.6 Sol
Öffentliche Preise aktualisiert: Sol ist mit $5 Input / $30 Output pro 1M Tokens gelistet, plus 1,25× Cache-Write-Billing und 90% Cached-Read-Rabatt.
Modell - GPT-5.6 Terra
Öffentliche Preise aktualisiert: Terra ist mit $2,50 Input / $15 Output pro 1M Tokens gelistet.
Modell - OpenRouter
LongCat-2.0-/Owl-Alpha-Release-Kontext ergänzt: Meituan identifizierte die OpenRouter-Stealth-Route als LongCat-gestützt, nachdem sie bereits ein volumenstarkes Coding-Modell war. Als Evidenz für Routing-Markt-Adoption behandeln, nicht als Datenschutz-Abkürzung oder unabhängig verifizierte Benchmark-Zeile.
Tool - LongCat-2.0
Meituan enthüllte LongCat-2.0 und identifizierte OpenRouters Stealth-Route Owl Alpha als LongCat-gestützt; GitHub/Hugging-Face-Seiten sagen, dass Modellgewichte bald folgen.
Modell
2026-W26
- Studenten-Recherche-Workflow in der Guides-Säule
Pfad, Stack, Playbook und Showcase, um breite Prompts in quellenbasierte Briefings zu verwandeln — der Workflow, den wir neuen Leserinnen zuerst zeigen.
Drop - Factory-Flaggschiff-Dossier veröffentlicht
Agenten-native Auslieferung mit Droid, Spec Mode, Missionen und Enterprise-Kontrollen — Fit 74 mit dokumentierten Autonomie- und Preis-Ausnahmen.
Drop - Cursor-Flaggschiff-Dossier veröffentlicht
VS-Code-kompatibler KI-Editor bei Fit 81 — Tab, Chat, Agent, Privacy Mode, Team-Governance und Diff-Review-Fehlermodi, die wir vor dem Merge dokumentieren.
Drop - Gemini-Flaggschiff-Dossier veröffentlicht
Googles multimodales Assistenten-Ökosystem bei Fit 75 — Suchfundierung, Deep Research, Speicher-Bundles und wo es keine zitierte Suchmaschine ist.
Drop
2026-W25
- NotebookLM-Flaggschiff-Dossier veröffentlicht
Quellengestützter Lese-Workspace bei Fit 78 — Korpus-Chat, Audio-Übersichten, Lernkarten und die leere-Korpus-Falle auf dem Dossier dokumentiert.
Drop - Perplexity-Flaggschiff-Dossier veröffentlicht
Zitierte Such-Eingangstür bei Fit 72 — Consumer Pro/Max, Deep Research, Sonar-APIs und Fehlermodi für Bibliografien, die du nicht geöffnet hast.
Drop - Cursor
Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. benchmarkReady bleibt absichtlich false, bis Agent-Diff-Safety-, Usage-Burn- und Privacy-Mode-Läufe vorliegen.
Tool - Factory
Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. benchmarkReady bleibt absichtlich false, bis Spec-Mode-, Droid-Exec-Autonomie- und Enterprise-Control-Läufe vorliegen.
Tool - Gemini
Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. Keine redaktionellen Claims geändert; Bench-Zeilen bleiben ausdrücklich ausstehend, bis das Desk-Protokoll läuft (Next action in qualityGate.notes).
Tool - Perplexity
Audit zur Produktionsreife: editorsNote und Preis-/Datenschutz-Prüfdaten bestätigt; Sonar-/Search-API-Token- plus Anfragegebühren-Zeilen an docs.perplexity.ai angeglichen. benchmarkReady bleibt bewusst false, bis Desk-Zitationsaudit und Sonar-Latenzläufe vorliegen.
Tool - Command Code
Command-Code-Flaggschiff-Tool veröffentlicht — Terminal-Agent mit Taste-Lernen, Open-Model-Deals und vollständiger Preis-/Datenschutz-Recherche.
Tool - Command-Code-Flaggschiff-Dossier veröffentlicht
Terminal-Coding-Agent mit taste-1-Lernen, Open-Model-Deals ab 1 $/Monat und vollständigem Preis- und Datenschutzbild — inklusive .commandcode/.
Drop - OpenCode
OpenCode-Flaggschiff-Tool — OSS-Agent, Go/Zen-Preise, Plan-/Build-Modi und Zen-Datenschutz-Ausnahmen dokumentiert.
Tool - OpenCode-Flaggschiff-Dossier veröffentlicht
Der Open-Source-Coding-Agent bei Fit 95 — Plan-/Build-Modi, Go- und Zen-Preise, 75+ Anbieter und Free-Model-Datenschutz-Ausnahmen dokumentiert.
Drop - Raycast
Raycast als Flaggschiff-Tool für Knowledge work — der macOS-Launcher, den wir auf jedem Forschungs-Mac installieren würden, bevor wir über einen weiteren KI-Tab debattieren.
Tool - Raycast-Flaggschiff-Dossier veröffentlicht
Der macOS-Launcher, den wir installieren, bevor wir über einen weiteren KI-Tab debattieren — Extensions, Quick AI, Zwischenablage und ehrliche Fehlermodi bei Fit 97.
Drop
2026-W24
- GLM-5.2
GLM-5.2 mit 1M-Kontext, 128K Max-Output, zwei Thinking-Modi und Long-Horizon-Coding-Fokus veröffentlicht. MIT-Open-Weights für die folgende Woche angekündigt.
Modell - Kimi K2.7 Code
Kimi K2.7 Code mit 256K-Kontext, verpflichtendem Thinking-Modus, multimodalen Tool-Beispielen und berichteten 30 % weniger Reasoning-Token gegenüber K2.6 veröffentlicht.
Modell - Canva Business
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - ChatGPT
Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.
Tool - ChatPRD
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Connected Papers
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Consensus
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Crossref
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - DeepSeek
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - ElevenLabs
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Elicit
Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.
Tool - Exa
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Firecrawl
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Gamma
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Google Scholar
Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.
Tool - Grammarly
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Gumloop
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Kagi
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Linear
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Litmaps
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Lovable
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Magic Patterns
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Manus
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Mendeley
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Microsoft Copilot
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Mistral Le Chat
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Mobbin
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - n8n
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Obsidian
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - OpenAlex
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - OpenRouter
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Overleaf
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Paperpile
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - PostHog
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Rayyan
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Replit
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Research Rabbit
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Scholarcy
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Scira AI
Preisbelege von scira.ai/about und api.scira.ai/pricing aktualisiert, maschinenlesbare Preisstufen ergänzt und die Benchmark-Evidenz für das öffentliche Dossier als bereit markiert. Einzelne Desk-Benchmark-Zeilen bleiben explizit dazu, welche Live-Läufe noch fehlen.
Tool - Scite
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Semantic Scholar
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Warp
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Wispr Flow
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - You.com
Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.
Tool - Zotero
Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.
Tool - Förderantrag-Set (archiviert)
Der Förderantrag-Pfad ist zurückgezogen. Akademische Guides leben jetzt als drei Trilogien: studentische Recherche, Literaturreview und Peer-Review.
Drop
2026-W23
- ChatGPT
ChatGPT ist das Baseline-Tool für allgemeine Assistenten, muss aber als Familie von Oberflächen gelesen werden: Consumer-ChatGPT, Business-/Enterprise-Workspaces, Codex-/Agenten-Funktionen und die separate OpenAI-API. Die Stärke ist Breite — Entwürfe, Dateiarbeit, multimodale Analyse, Coding, Agenten und Erweiterungen — das Risiko ist, dass flüssige Ausgabe schwache Quellen, Datenschutzannahmen oder Planlimits unsichtbar macht.
Tool - Claude
Claude ist das Tool für sorgfältiges Entwerfen und langen Kontext. Die aktualisierte Evidenz bestätigt die Kernspur: nuanciertes Umschreiben, Dokumentenanalyse, Projects, Artifacts, Research, Claude Code, Cowork, Websuche und Organisationssuche/Connectoren. Das redaktionelle Risiko ist Quota- und Oberflächenverwirrung: Consumer Pro/Max, Team, Enterprise und API-/Tool-Preise sind deutlich verschiedene Produkte.
Tool - Connected Papers
Connected Papers bleibt die saubere visuelle Literature-Map-Karte. Besonders nützlich zur Orientierung um ein Seed-Paper, aber die Kernlimitation bleibt methodisch: ein Graph ist kein reproduzierbarer Suchkorpus.
Tool - Consensus
Consensus bleibt die behauptungsförmige akademische Q&A-Karte. Am stärksten, wenn der Nutzer eine Forschungsfrage hat und schnell zitierte Orientierung braucht.
Tool - Crossref
Crossref ist wissenschaftliche Infrastruktur, keine glänzende Discovery-App. Es bleibt die DOI-Metadaten-Verifikationskarte.
Tool - Cursor
Cursor bleibt das Flaggschiff unter den KI-nativen Code-Editoren, muss aber drei Trennungen betonen: Editor-Workflow versus Headless-Agenten, individuelle Nutzungspools versus Team-/Enterprise-Governance, und Privacy Mode versus gewöhnlichen Provider-Transit. Cursor ist stark für repo-lokale Tab-, Chat-, Agent-, MCP-, Cloud-Agent- und Bugbot-Workflows, aber nur wenn Diffs geprüft und Tests laufen.
Tool - DeepSeek
DeepSeek is the low-cost reasoning/API tool. This pass sharpens the key facts: DeepSeek’s API is OpenAI- and Anthropic-compatible, current V4-Flash/V4-Pro pricing is extremely low, context length is listed at 1M, and legacy deepseek-chat / deepseek-reasoner names are being deprecated. The low price is real, but the editorial warning is bigger than usual: privacy, residency, institutional policy, and geopolitical availability need explicit review.
Tool - ElevenLabs
ElevenLabs ist das Sprach- und Audio-KI-Tool. Die Produktqualität kann Ergebnisse ausgereift erscheinen lassen.
Tool - Elicit
Elicit ist nicht länger nur ein Paper-Such-Assistent; es positioniert sich als Evidenzsynthese-System für Berichte, systematische Reviews, dynamisches Screening, Extraktion und satzgenaue Zitationen über einen sehr großen wissenschaftlichen Korpus hinweg. Die reichhaltigeren Daten tragen ein Dossier mit höherer Konfidenz, aber die Empfehlung hängt weiter an der benchmarkten Extraktionsgenauigkeit gegen eine handcodierte Tabelle.
Tool - Exa
Exa is one of the cleanest “search as infrastructure” cards in the VerdictPal stack. The current pricing and docs make the value clearer: real-time search, webpage text/highlights, configurable latency, contents retrieval, Answer endpoint, Deep Search, Monitors, and Agent runs. The core risk is economic and privacy-boundary creep when agents fan out across many searches, contents calls, summaries, and enrichment steps.
Tool - Factory
Factory ist das agent-native Software-Delivery-Tool. Am stärksten, wenn die Aufgabe größer ist als Autocomplete: Repo-Verständnis, im Spec Mode geplante Refactorings, Delegation an Terminal/IDE, Hintergrund-Agenten, SDK-Nutzung und CI-artige Droid-Exec-Workflows. Dieser Durchlauf ergänzt aktuelle Factory/Droid-Quellendetails von 2026 und schärft die Enterprise-/Sicherheitsgrenze.
Tool - Firecrawl
Firecrawl ist die Web-Extraktions-Infrastrukturkarte. Sollte als Kontext-Extraktion für Agenten und Forschungspipelines beschrieben werden, nicht als generische Suchmaschine.
Tool - Gamma
Gamma ist das KI-Präsentations- und Visual-Document-Erstdraft-Tool. Die Preis- und Datenschutzseiten waren beim Laden nicht erreichbar.
Tool - Gemini
Anhand offizieller Google-Seiten vertieft: Preise für Consumer (AI Plus/Pro/Ultra), Workspace-Add-on, kostenpflichtige Gemini API und Vertex AI; Datenschutzsprache für Consumer vs. API vs. Workspace/Vertex; Fähigkeitsliste auf die aktuelle Gemini-App- plus API-Oberfläche aktualisiert.
Tool - Google Scholar
Google Scholar bleibt die akademische Such-Baseline: breit, vertraut, schnell und nützlich zum Finden bekannter Einträge, PDFs, Bibliothekslinks, Zitationsspuren, Alerts und Rechtsprechung. Die Schwäche ist methodische Intransparenz. Es sollte als Entdeckungs- und Zitationsverfolgungs-Gewohnheit empfohlen werden, nicht als reproduzierbare Suchstrategie für sich.
Tool - Grammarly
Grammarly ist das Überarbeitungsdurchlauf-Tool, nicht das Argument-Schreib-Tool. Dieser Durchlauf aktualisiert das Tool für Grammarly Pro und Superhuman-Suite.
Tool - Gumloop
Gumloop ist das No-Code-KI-Workflow- und Agent-Automation-Tool. Basiert auf primären Preis- und Datenschutzseiten plus offiziellen Produkt-/Suchergebnissen.
Tool - Kagi
Kagi ist das Paid-Search-Tool: eine nutzerfinanzierte, werbefreie Suchmaschine mit ernsthafter Datenschutz-Technik und nützlicher Assistant-Funktionalität.
Tool - Litmaps
Litmaps ist das Citation-Map-plus-Monitoring-Tool. Wertvoll, wenn Nutzer von Seed-Papern ausgehen und vernetzte Arbeiten entdecken, visualisieren und überwachen wollen.
Tool - Mendeley
Mendeley ist der Elsevier-gestützte Cloud-Sync-Referenzmanager mit zunehmend KI-geprägten Bibliotheksfunktionen.
Tool - Microsoft Copilot
Microsoft Copilot ist a family-name card, not a single-product card. This pass uses Microsoft Learn pages for Microsoft 365 Copilot and Copilot Chat data protection plus Microsoft pricing search results. The key editorial job is to separate consumer Copilot, Microsoft 365 Copilot Chat, paid Microsoft 365 Copilot, and Azure/OpenAI developer paths.
Tool - Mistral Le Chat
Mistral Le Chat ist is the EU-headquartered assistant comparison tool. This pass strengthens the privacy and API boundary: Le Chat inputs/outputs are retained until account/conversation deletion, API inputs/outputs are generally kept for 30 rolling days for abuse monitoring unless zero data retention is activated, and Agents/Fine-tuning have separate retention rules. That makes Mistral useful to compare against US-default assistants, but not automatically compliant.
Tool - n8n
n8n ist die Research-Ops-Automatisierungskarte. Am stärksten, wenn ein Team sichtbaren Workflow-Kleber über APIs, Webhooks, Datenbanken, KI-Schritte, Notion und Alerts benötigt.
Tool - NotebookLM
NotebookLM bleibt das Flaggschiff für quellengestützte Workspaces. Der stärkste VerdictPal-Rahmen ist nicht „KI-Suche“, sondern ein Lese-Workspace, der beim Korpus beginnt: Quellen hochladen oder entdecken, geerdete Fragen stellen, Lernartefakte erzeugen und Behauptungen an Zitationen prüfen. Dieser Durchgang ergänzt aktuelle Enterprise-, Workspace- und Google-AI-Planunterschiede, damit die Datenschutzgeschichte klarer ist.
Tool - Obsidian
Obsidian ist das Local-First-Wissensdatenbank-Tool. Das wichtige Update: Obsidian ist jetzt sowohl für die Arbeit als auch privat kostenlos; Sync und Publish bleiben optional.
Tool - OpenAlex
OpenAlex ist das offene wissenschaftliche Graph-Tool. Sie sitzt zwischen Crossref und Semantic Scholar: breitere Discovery als DOI-Registry, reproduzierbarer als geschlossene Suchprodukte.
Tool - OpenRouter
OpenRouter ist das Model-Router-Tool. Nützlich, wenn ein Entwickler eine OpenAI-kompatible API-Oberfläche für viele LLMs, Fallback-Routing, Modellvergleiche und BYOK möchte.
Tool - Overleaf
Overleaf ist das kollaborative LaTeX-Tool. Dieser Durchlauf aktualisiert das Tool mit aktuellen Plan-Nachweisen: KI-Kontingent, Mitarbeiterlimits und 24x-Kompilierzeit.
Tool - Paperpile
Paperpile ist der Convenience-First-Referenzmanager für Google Docs und browser-natives Schreiben. Exzellente Google-Docs- und PDF-Workflow-Abdeckung, aber Tradeoffs bei bibliographischer Tiefe.
Tool - Perplexity
Perplexity bleibt der Maßstab für zitierte Antworten in der Consumer-KI-Suche, aber das Tool muss Perplexity jetzt als zwei verwandte Produkte behandeln: die Consumer-Antwortmaschine und die API-Plattform. Das Consumer-Produkt taugt für schnelle Quellenkarten und Deep-Research-Entwürfe; die API-Plattform ist eine separate Entwickleroberfläche mit Sonar-, Search-, Agent- und Embeddings-APIs. Die harte redaktionelle Regel bleibt: Zitationen sind Spuren, keine bibliografiefertige Evidenz.
Tool - PostHog
PostHog ist das Produktanalyse- und Experimentier-Stack-Tool. Sie gehört in VerdictPal, weil Produktanalyse, Session Replay, Feature Flags und Experimente sich mit Forschungs- und Produkt-Ops überschneiden.
Tool - Rayyan
Rayyan ist ein fokussierter Systematic-Review-Screening-Workspace mit stärkeren Plan-Mechaniken.
Tool - Replit
Replit ist das browserbasierte KI-Build-and-Deploy-Tool. Nützlich, wenn ein Nutzer einen Ort für Ideenfindung, Agent-Building, Datenbank, Hosting, Zusammenarbeit und Publishing möchte.
Tool - Research Rabbit
Research Rabbit ist the visual exploration and “follow the trail” card. It belongs beside Connected Papers and Litmaps, but its emphasis is adaptive exploration, collections, and seeing how papers/authors/concepts connect. This pass adds current feature language, data-source hints, and a clearer privacy/method boundary.
Tool - Scholarcy
Scholarcy ist das Paper-Überflug- und strukturierte-Zusammenfassungs-Tool. Kann Zeit für Triage, Accessibility und Organisation sparen, muss aber als Lesehilfe geprüft werden.
Tool - Scira AI
Scira bleibt das VerdictPal-Flaggschiff-Template, weil es eine zitierte Such-UI, eine Open-Source-AGPL-Codebase, gehostete Free/Pro/Max-Pläne, eine API-Plattform, eine MCP-Oberfläche und eine tiefe Dossier-Struktur verbindet. Dieser Durchgang ersetzt veralteten und kaputten Seiteninhalt durch ein saubereres Dossier, das sich benchmarken lässt, und hält die Kernhaltung: starke öffentliche Empfehlung, aber benchmark-ready bleibt false, bis die ausstehenden Desk-Zeilen wirklich laufen.
Tool - Scite
Scite ist das Zitationskontext-Tool. Wertvoll, weil sie eine bessere Frage stellt: Haben spätere Paper die Behauptung gestützt, kontrastiert oder nur erwähnt?
Tool - Semantic Scholar
Semantic Scholar bleibt eine Flagship-akademische-Suchschicht, weil sie eine kostenlose wissenschaftliche Such-UI mit TLDRs, Autorenseiten, Alerts und Entwickler-API kombiniert.
Tool - Warp
Warp ist das agentische Terminal/Workspace-Tool. Überzeugend, weil sie Coding-Agenten ins Terminal bringt.
Tool - Zotero
Zotero bleibt der stärkste Local-First-Standard für studentisches und akademisches Referenzmanagement. Die neuen Datenpunkte verstärken die Kernpositionierung: Der Desktop-Workflow funktioniert ohne Konto, Sync ist optional und standardmäßig deaktiviert, bezahlter Speicher finanziert ein Nonprofit-Projekt, und das hauptsächliche redaktionelle Risiko ist nicht die Fähigkeit, sondern Governance um Sync, Anhänge, Plugins und Gruppenbesitz.
Tool - Canva Business
Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.
Tool - ChatPRD
Notion-State-of-Art-Recherche importiert und redaktionelle Eignung gesenkt, um schwache Desk-Nützlichkeit plus Teams-gesicherte Linear-Integration widerzuspiegeln.
Tool - Linear
Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.
Tool - Lovable
Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.
Tool - Magic Patterns
Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.
Tool - Mobbin
Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.
Tool - Wispr Flow
Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.
Tool - Dark Mode für das Evidence Instrument überarbeitet
Dunkle Oberflächen nutzen jetzt gedämpftes Amber, lesbare Ränder und komponentenspezifische Overrides statt Neon-Panels und invertierter Cream-Panels.
Drop - Trusted-Source-Briefing-Workflow veröffentlicht
Die Guides-Säule hat jetzt einen echten Recherchepfad, Tool-Stack, Playbook und Showcase, um breite Prompts in quellenbasierte Briefings zu verwandeln.
Drop - Claude Mythos Preview
Claude-Mythos-Research-Preview veröffentlicht — Spitze bei Vals (73,42 %) und SWE-bench Verified (93,9 %, Best-of-3).
Modell
2026-W22
2026-W21
- Gemini 3.5 Flash
Gemini 3.5 Flash veröffentlicht — MCP-Atlas-Spitze (83,6 %), 1M-Kontext, günstigster Frontier-Preis.
Modell
2026-W18
2026-W17
- DeepSeek V4 Pro Max
DeepSeek V4 Pro Max mit Open Weights und Frontier-Coding-Scores veröffentlicht.
Modell - Kimi K2.6
Kimi K2.6 veröffentlicht — Vals #5 bei 55,55 %, GPQA Diamond 90,5 % (Open-Source-Spitze).
Modell
2026-W16
- Claude Opus 4.7
Claude Opus 4.7 veröffentlicht — 13 % Coding-Steigerung, 3× Produktionsaufgaben, 3,75 MP Vision.
Modell
2026-W15
- GLM-5.1
GLM-5.1 mit 200K-Kontext, 128K Max-Output, Long-Horizon-Coding-Fokus und MIT-lizenzierten Open Weights veröffentlicht.
Modell
2026-W14
2026-W12
2026-W11
2026-W10
2026-W08
- Claude Sonnet 4.6
Claude Sonnet 4.6 veröffentlicht — Vals #3 bei 60,30 %, 1M-Kontext, $3 / $15.
Modell
2026-W07
2026-W06
- Claude Opus 4.6
Claude Opus 4.6 veröffentlicht — erstes Opus mit 1M-Kontext, 128K-Output, Agent-Teams.
Modell
2025-W50
2025-W48
- Claude Opus 4.5
Claude Opus 4.5 veröffentlicht — bestes Coding- und Agent-Modell bei Launch, $5/$25.
Modell