VerdictPal · Redaktions-Desk · Stand 5. Sept. 2026VerdictPal
Aktualität

Was sich änderte

Tool-Changelogs und Pack-Drops, nach Woche gruppiert.

2026-W36

  1. Claude Fable 5.1

    Live-Vals-Index 68,83 %. Live-AA-Intelligence-Index v4.2 ist 57 bei Max + Default-Fallback.

    Modell
  2. Frontier September 2026: GPT-6 Astra, Gemini 3.8 Flash, Muse Spark 1.3, Hy4-Vorschau

    OpenAIs GPT-6 Astra vom 3. Sep., Googles Gemini 3.8 Flash vom 2. Sep. und Metas Muse Spark 1.3 vom 2. Sep. stehen jetzt mit Live-Werten des Artificial-Analysis-Intelligence-Index v4.2 im Atlas. Tencents Hy4-Vorschau ist aus dem offiziellen Start erfasst. Claude Fable 5.1 führt den Live-Vals-Index weiter mit 68,83 %. /models

    Drop
  3. Gemini 3.7 Flash

    Live-AA-Intelligence-Index v4.2 ist 45 bei High Effort. Gemini 3.8 Flash ist jetzt das aktuelle Flash; 3.7 bleibt für den schnelleren 305-t/s-Endpoint gelistet.

    Modell
  4. GPT-5.6 Sol

    Live-AA-Intelligence-Index v4.2 ist 51 bei Max. GPT-6 Astra ist das aktuelle OpenAI-Flagship; Sol bleibt die günstigere GPT-5.6-Linie.

    Modell
  5. Grok 4.6

    Live-AA-Intelligence-Index v4.2 ist 51 bei High Effort; AA listet jetzt 500k Kontext.

    Modell
  6. GPT-6 Astra

    GPT-6 Astra GA auf der OpenAI-API und gestuftem ChatGPT-/AWS-Rollout. Liste $10 / $50 pro 1M Tokens.

    Modell
  7. Gemini 3.8 Flash

    Gemini 3.8 Flash allgemein verfügbar. AA-High-Effort-Intelligence-Index v4.2 ist 47; Intro-Preis unverändert gegenüber 3.7 Flash.

    Modell
  8. Gemini 3.8 Flash Cyber

    Gemini 3.8 Flash Cyber für Fairwind-Trusted-Defender angekündigt.

    Modell
  9. Muse Spark 1.2

    Muse Spark 1.3 ist jetzt die aktuelle Muse-Spark-Linie. 1.2 bleibt für den v4.1-xhigh-Snapshot gelistet.

    Modell
  10. Muse Spark 1.3

    Muse Spark 1.3 in Muse Code und der Meta Model API verfügbar. AA-Max-Effort-Intelligence-Index v4.2 ist 53.

    Modell
  11. AA-Omniscience und CritPt kommen in den Benchmark-Atlas

    Zwei fehlende Slices des AA Intelligence Index v4.1 haben jetzt Erklärseiten und belegte Zeilen: AA-Omniscience (Faktenabruf vs. Hallucination — die Wissens-Primärspur) und CritPt (Forschungsphysik, Frontier noch unter 40 %). /benchmarks/aa-omniscience · /benchmarks/critpt

    Drop
  12. Claude Fable 5

    Vals-Index 66,04 % im Snapshot vom 1. Sep.; Fable 5.1 übernimmt die Führung mit 67,87 %.

    Modell
  13. Claude Fable 5.1

    Claude Fable 5.1 GA auf der Claude-API, Bedrock, Vertex und Microsoft Foundry. Cache-Reads auf $0,25 / 1M Tokens gesenkt.

    Modell
  14. Claude Fable 5.1 steht im Modell-Atlas — Vals-Index 67,87 %

    Anthropics Mythos-class-Refresh von Fable 5 am 1. Sep. Dieselbe $10-/$50-Liste, Cache-Reads auf $0,25 pro 1M Tokens. Vals setzt es auf 67,87 % im Index, vor Opus 5 und Fable 5. Der AA-Intelligence-Index steht im API-Snapshot vom 1. Sep. noch nicht. Vergleich mit GPT-5.6 Sol oder Fable 5. /models/claude-fable-5-1

    Drop

2026-W35

  1. Hy4 preview

    Hy4 preview open-sourced und auf TokenHub / OpenRouter mit $0,834 / $2,501 pro 1M Tokens gelistet.

    Modell
  2. Drei akademische Guide-Trilogien, neu aufgebaut

    Studentische Recherche, Literaturreview und Peer-Review — jeweils mit Stack und Playbook. Peer-Review beginnt mit der KI-Richtlinie des Venues. Alte Grant-, Coding- und Deck-Pfade führen nach /guides.

    Drop
  3. Terminal-Bench-Science 0.1 steht im Atlas — beste Zeile 30 %

    Stanfords und Laudes 70-Aufgaben-Science-Agent-Suite: echte Labor-Workflows, noch weit von der Decke. Claude Opus 5 + Claude Code führt mit 30,0 %; GPT-5.6 Sol + Codex liegt bei 22,4 %; GLM-5.3 ist die stärkste Open-Weight-Zeile mit 8,1 %. Nicht Terminal-Bench 2.1. /benchmarks/terminal-bench-science

    Drop
  4. GLM-5.3-Flash steht im Modell-Atlas — AA-Index 57,5

    Z.ais Flash-Geschwister von GLM-5.3, aus dem Artificial-Analysis-Snapshot vom 1. Sep.: Intelligence-Index 57,5 bei $0,15 / $0,50 pro 1M Tokens. Zwei Punkte hinter GLM-5.3 max bei einem Zehntel des Listenpreises. /models/glm-5-3-flash · /compare/models/glm-5-3-vs-glm-5-3-flash

    Drop
  5. GLM-5.3 steht im Modell-Atlas — AA-Index 59,5

    Z.ais Coding-Refresh vom August steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-24: Max-Effort-Intelligence-Index 59,5, API-Liste $1,40 / $4,40 pro 1M Tokens. Dieselbe Basis wie GLM-5.2; Weights waren bei dieser Prüfung noch unveröffentlicht. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 27B. /models/glm-5-3 · /compare/models/glm-5-3-vs-qwen3-8-27b

    Drop
  6. Qwen3.8 27B steht im Modell-Atlas — AA-Index 52

    Alibabas dichtes Open-Weight-Qwen3.8-Geschwister steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-24: Xhigh-Intelligence-Index 52, Hosted-Liste $0,50 / $3 pro 1M Tokens, Apache 2.0 auf Hugging Face. Das ist nicht gehostetes Qwen3.8 Max. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 Max. /models/qwen3-8-27b · /compare/models/qwen3-8-27b-vs-qwen3-8-max

    Drop

2026-W34

  1. GLM-5.3

    Gehostete API auf Artificial Analysis gelistet (Max-Effort-Index 59,5, $1,40 / $4,40 pro 1M Tokens).

    Modell

2026-W33

  1. Qwen3.8 2.4T steht im Modell-Atlas — AA-Index 57,7

    Alibabas Open-Weight-Qwen-Max-Klasse-MoE (2,4T gesamt / 95B aktiv) steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-15: Intelligence-Index 57,7, Hosted-Liste $2 / $6 pro 1M Tokens. Das ist der veröffentlichte Checkpoint, nicht gehostetes Qwen3.8 Max. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 Max. /models/qwen3-8-2-4t-a95b · /compare/models/qwen3-8-2-4t-a95b-vs-qwen3-8-max

    Drop
  2. GLM-5.3

    GLM-5.3 im GLM Coding Plan angekündigt. Open Weights wegen Safety-Review verzögert.

    Modell
  3. Qwen3.8 27B

    Open Weights veröffentlicht. AA-Intelligence-Index 52 auf Xhigh; Hosted-Liste $0,50 / $3 pro 1M Tokens.

    Modell
  4. Gemini 3.6 Flash (high)

    Objektive Auffrischung: DeepMind-Karte 1M Kontext / 64K Output; Google-Einführungspreis $0,75 / $3,75; AA-High-Effort-Index 51,6.

    Modell
  5. Gemini 3.7 Flash

    Gemini 3.7 Flash allgemein verfügbar. AA-High-Effort-Intelligence-Index 56; Einführungspreis $0,75 / $3,75 pro 1M Tokens. Google meldet Zugewinne gegenüber 3.6 Flash auf FrontierCode 1.1, DeepSWE v1.1, WebDev Arena und GDP.pdf — Vendor-Claims, keine Ledger-Zeilen.

    Modell
  6. Gemini 3.7 Flash steht im Modell-Atlas — AA-Index 56

    Googles Flash-Arbeitspferd vom August steht im Atlas aus dem Artificial-Analysis-Snapshot: High-Effort-Intelligence-Index 56, Einführungspreis $0,75 / $3,75 pro 1M Tokens bis 31. Dez. 2026. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit 3.6 Flash oder Claude Sonnet 4.6. /models/gemini-3-7-flash · /compare/models/gemini-3-6-flash-vs-gemini-3-7-flash

    Drop
  7. A.X-K2

    A.X-K2 erscheint auf Artificial Analysis (Index 35,0, $0 / $0).

    Modell
  8. Grok 4.6

    Grok 4.6 erscheint auf Artificial Analysis (High-Effort-Index 60,9, $2 / $6 pro 1M Tokens).

    Modell
  9. Grok 4.6 steht im Modell-Atlas — AA-Index 60,9

    xAIs August-Flaggschiff steht im Atlas aus dem Artificial-Analysis-Snapshot: High-Effort-Intelligence-Index 60,9, $2 / $6 pro 1M Tokens. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit GPT-5.6 Sol. /models/grok-4-6 · /compare/models/gpt-5-6-sol-vs-grok-4-6

    Drop
  10. K-EXAONE 2.0 0803

    K-EXAONE 2.0 0803 erscheint auf Artificial Analysis (Index 31,0, $0 / $0).

    Modell
  11. Motif 3

    Motif 3 GA auf Artificial Analysis (Index 47,4). Open-Weight-MoE, 314B / 13,2B aktiv.

    Modell
  12. Qwen3.8 2.4T A95B

    Open Weights veröffentlicht. AA-Intelligence-Index 57,7; Hosted-Liste $2 / $6 pro 1M Tokens.

    Modell
  13. Solar Open2 250B

    Solar Open2 250B erscheint auf Artificial Analysis (Index 37,4, $0 / $0).

    Modell
  14. Nemotron 3.5 Lightning

    Nemotron 3.5 Lightning auf Artificial Analysis (Index 23,6, $0,05 / $0,20).

    Modell
  15. Muse Glimmer

    Muse Glimmer als Open Weight veröffentlicht (Apache 2.0, 30B). AA-High-Effort-Index 35,1; Hosted-Listenpreis $0,325 / $1,35 pro 1M Tokens.

    Modell

2026-W32

  1. Solar Pro 4

    Solar Pro 4 auf Artificial Analysis (Index 41,6, $0,30 / $1,20).

    Modell
  2. Muse Spark 1.2

    Muse Spark 1.2 erscheint auf Artificial Analysis (xhigh-Index 56,8, $1.25 / $4.25 pro 1M Tokens).

    Modell
  3. Qwen3.8 Max

    Qwen3.8 Max erscheint auf Artificial Analysis (Index 58,1, $2 / $6 pro 1M Tokens).

    Modell
  4. VerdictPal ist live — und der Atlas-Report legt Zahlen über den ganzen Atlas

    Die Launch-Notiz ist veröffentlicht, dazu eine neue eigene Datenfläche: der Atlas-Report berechnet aggregierte Zahlen zu Preisen, Datenschutz, Benchmark-Sättigung und Aktualität aus jedem veröffentlichten Tool — frei zitierbar mit Link. Befunde dieser Ausgabe: die meisten Dossiers halten überhaupt keine Haltung zum Training mit deinen Inhalten fest, bezahlte Einstiegstarife liegen dicht um den Mittelwert, und die Input-Preise der Frontier-Modelle gehen um mehr als drei Größenordnungen auseinander. /report · /launch

    Drop

2026-W29

  1. GPT-5.6 Luna

    Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und Benchmark-Evidenz aktualisiert.

    Modell
  2. GPT-5.6 Sol

    Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und anschließend Benchmark-Evidenz von Vals und Artificial Analysis aktualisiert.

    Modell
  3. GPT-5.6 Terra

    Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und Benchmark-Evidenz aktualisiert.

    Modell

2026-W28

  1. AI-Builder-Design-Test auf der Lab-Bank — vier Builder, gleiche Prompts, sehr verschiedene Ergebnisse

    VerdictPals zweites First-Party-Protokoll: vier identische Multi-Turn-Design-Prompts durch Lovable, v0, Replit und Bolt. Lauf 01 notiert eine Turn-1-Rangfolge (Lovable → v0 → Replit → Bolt) und die Kosten bis zum Ergebnis in der jeweiligen Hersteller-Einheit — kein aufgefülltes Leaderboard, formale Score-Zeilen warten auf ein wiederholbares Rubric. /benchmarks/ai-builder-design-test · /benchmarks/lab

    Drop
  2. Grok 4.5

    Grok 4.5 erscheint auf Artificial Analysis (High-Effort-Index 53,8).

    Modell
  3. Citation-Fidelity-Protokoll v0.1 auf der Lab-Bank eingefroren

    VerdictPals erster First-Party-Benchmark im Lab: zwölf Forschungsfragen, dual-reviewer Zitierbewertung, eingefrorenes Runbook auf der Atlas-Seite — Protokoll veröffentlicht, Desk-Lauf noch ausstehend, kein aufgefülltes Leaderboard. /benchmarks/citation-fidelity · /benchmarks/lab

    Drop
  4. Claude

    Evidenz-Integritätsfix: falsches Upgrade auf editorial-hands-on zurückgenommen; Evidenz bleibt synthetisiert und qualityGate von flagship auf solid gemäß der redaktionellen Evidenzleiter zurückgestuft. Kein Desk-Hands-on-Versuch aktenkundig; benchmarkReady bleibt false.

    Tool

2026-W27

  1. Fünf Recherche-Guides jetzt im Atlas

    Zitier-Audit, Systematic-Review-Protokoll, Data-Cleaning-Pipeline, Grant-Writer-Pfad und Peer-Reviewer-Pfad — solide Guides mit Schrittblöcken und Verifikations-Checklisten.

    Drop
  2. GPT-5.6 Luna

    Öffentliche Preise aktualisiert: Luna ist mit $1 Input / $6 Output pro 1M Tokens gelistet.

    Modell
  3. GPT-5.6 Sol

    Öffentliche Preise aktualisiert: Sol ist mit $5 Input / $30 Output pro 1M Tokens gelistet, plus 1,25× Cache-Write-Billing und 90% Cached-Read-Rabatt.

    Modell
  4. GPT-5.6 Terra

    Öffentliche Preise aktualisiert: Terra ist mit $2,50 Input / $15 Output pro 1M Tokens gelistet.

    Modell
  5. OpenRouter

    LongCat-2.0-/Owl-Alpha-Release-Kontext ergänzt: Meituan identifizierte die OpenRouter-Stealth-Route als LongCat-gestützt, nachdem sie bereits ein volumenstarkes Coding-Modell war. Als Evidenz für Routing-Markt-Adoption behandeln, nicht als Datenschutz-Abkürzung oder unabhängig verifizierte Benchmark-Zeile.

    Tool
  6. Claude Sonnet 5

    Claude Sonnet 5 auf Artificial Analysis gelistet (Max-Effort-Index 53,4).

    Modell
  7. LongCat-2.0

    Meituan enthüllte LongCat-2.0 und identifizierte OpenRouters Stealth-Route Owl Alpha als LongCat-gestützt; GitHub/Hugging-Face-Seiten sagen, dass Modellgewichte bald folgen.

    Modell

2026-W26

  1. GPT-5.6 Luna

    Als schnellster und kosteneffizientester GPT-5.6-Tier vorgestellt.

    Modell
  2. GPT-5.6 Sol

    OpenAI hat GPT-5.6 Sol zusammen mit Terra und Luna als Preview vorgestellt.

    Modell
  3. GPT-5.6 Terra

    Als ausgewogener GPT-5.6-Tier vorgestellt.

    Modell
  4. Studenten-Recherche-Workflow in der Guides-Säule

    Pfad, Stack, Playbook und Showcase, um breite Prompts in quellenbasierte Briefings zu verwandeln — der Workflow, den wir neuen Leserinnen zuerst zeigen.

    Drop
  5. Factory-Flaggschiff-Dossier veröffentlicht

    Agenten-native Auslieferung mit Droid, Spec Mode, Missionen und Enterprise-Kontrollen — Fit 74 mit dokumentierten Autonomie- und Preis-Ausnahmen.

    Drop
  6. Cursor-Flaggschiff-Dossier veröffentlicht

    VS-Code-kompatibler KI-Editor bei Fit 81 — Tab, Chat, Agent, Privacy Mode, Team-Governance und Diff-Review-Fehlermodi, die wir vor dem Merge dokumentieren.

    Drop
  7. Gemini-Flaggschiff-Dossier veröffentlicht

    Googles multimodales Assistenten-Ökosystem bei Fit 75 — Suchfundierung, Deep Research, Speicher-Bundles und wo es keine zitierte Suchmaschine ist.

    Drop

2026-W25

  1. NotebookLM-Flaggschiff-Dossier veröffentlicht

    Quellengestützter Lese-Workspace bei Fit 78 — Korpus-Chat, Audio-Übersichten, Lernkarten und die leere-Korpus-Falle auf dem Dossier dokumentiert.

    Drop
  2. Perplexity-Flaggschiff-Dossier veröffentlicht

    Zitierte Such-Eingangstür bei Fit 72 — Consumer Pro/Max, Deep Research, Sonar-APIs und Fehlermodi für Bibliografien, die du nicht geöffnet hast.

    Drop
  3. Cursor

    Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. benchmarkReady bleibt absichtlich false, bis Agent-Diff-Safety-, Usage-Burn- und Privacy-Mode-Läufe vorliegen.

    Tool
  4. Factory

    Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. benchmarkReady bleibt absichtlich false, bis Spec-Mode-, Droid-Exec-Autonomie- und Enterprise-Control-Läufe vorliegen.

    Tool
  5. Gemini

    Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. Keine redaktionellen Claims geändert; Bench-Zeilen bleiben ausdrücklich ausstehend, bis das Desk-Protokoll läuft (Next action in qualityGate.notes).

    Tool
  6. Perplexity

    Audit zur Produktionsreife: editorsNote und Preis-/Datenschutz-Prüfdaten bestätigt; Sonar-/Search-API-Token- plus Anfragegebühren-Zeilen an docs.perplexity.ai angeglichen. benchmarkReady bleibt bewusst false, bis Desk-Zitationsaudit und Sonar-Latenzläufe vorliegen.

    Tool
  7. Command Code

    Command-Code-Flaggschiff-Tool veröffentlicht — Terminal-Agent mit Taste-Lernen, Open-Model-Deals und vollständiger Preis-/Datenschutz-Recherche.

    Tool
  8. Command-Code-Flaggschiff-Dossier veröffentlicht

    Terminal-Coding-Agent mit taste-1-Lernen, Open-Model-Deals ab 1 $/Monat und vollständigem Preis- und Datenschutzbild — inklusive .commandcode/.

    Drop
  9. OpenCode

    OpenCode-Flaggschiff-Tool — OSS-Agent, Go/Zen-Preise, Plan-/Build-Modi und Zen-Datenschutz-Ausnahmen dokumentiert.

    Tool
  10. OpenCode-Flaggschiff-Dossier veröffentlicht

    Der Open-Source-Coding-Agent bei Fit 95 — Plan-/Build-Modi, Go- und Zen-Preise, 75+ Anbieter und Free-Model-Datenschutz-Ausnahmen dokumentiert.

    Drop
  11. Raycast

    Raycast als Flaggschiff-Tool für Knowledge work — der macOS-Launcher, den wir auf jedem Forschungs-Mac installieren würden, bevor wir über einen weiteren KI-Tab debattieren.

    Tool
  12. Raycast-Flaggschiff-Dossier veröffentlicht

    Der macOS-Launcher, den wir installieren, bevor wir über einen weiteren KI-Tab debattieren — Extensions, Quick AI, Zwischenablage und ehrliche Fehlermodi bei Fit 97.

    Drop

2026-W24

  1. GLM-5.2

    GLM-5.2 mit 1M-Kontext, 128K Max-Output, zwei Thinking-Modi und Long-Horizon-Coding-Fokus veröffentlicht. MIT-Open-Weights für die folgende Woche angekündigt.

    Modell
  2. Kimi K2.7 Code

    Kimi K2.7 Code mit 256K-Kontext, verpflichtendem Thinking-Modus, multimodalen Tool-Beispielen und berichteten 30 % weniger Reasoning-Token gegenüber K2.6 veröffentlicht.

    Modell
  3. Canva Business

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  4. ChatGPT

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  5. ChatPRD

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  6. Claude Fable 5

    Claude Fable 5 veröffentlicht — erstes GA Mythos-class-Modell.

    Modell
  7. Connected Papers

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  8. Consensus

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  9. Crossref

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  10. DeepSeek

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  11. ElevenLabs

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  12. Elicit

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  13. Exa

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  14. Firecrawl

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  15. Gamma

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  16. Google Scholar

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  17. Grammarly

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  18. Gumloop

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  19. Kagi

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  20. Linear

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  21. Litmaps

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  22. Lovable

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  23. Magic Patterns

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  24. Manus

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  25. Mendeley

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  26. Microsoft Copilot

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  27. Mistral Le Chat

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  28. Mobbin

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  29. n8n

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  30. Obsidian

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  31. OpenAlex

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  32. OpenRouter

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  33. Overleaf

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  34. Paperpile

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  35. PostHog

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  36. Rayyan

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  37. Replit

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  38. Research Rabbit

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  39. Scholarcy

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  40. Scira AI

    Preisbelege von scira.ai/about und api.scira.ai/pricing aktualisiert, maschinenlesbare Preisstufen ergänzt und die Benchmark-Evidenz für das öffentliche Dossier als bereit markiert. Einzelne Desk-Benchmark-Zeilen bleiben explizit dazu, welche Live-Läufe noch fehlen.

    Tool
  41. Scite

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  42. Semantic Scholar

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  43. Warp

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  44. Wispr Flow

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  45. You.com

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  46. Zotero

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  47. Förderantrag-Set (archiviert)

    Der Förderantrag-Pfad ist zurückgezogen. Akademische Guides leben jetzt als drei Trilogien: studentische Recherche, Literaturreview und Peer-Review.

    Drop

2026-W23

  1. ChatGPT

    ChatGPT ist das Baseline-Tool für allgemeine Assistenten, muss aber als Familie von Oberflächen gelesen werden: Consumer-ChatGPT, Business-/Enterprise-Workspaces, Codex-/Agenten-Funktionen und die separate OpenAI-API. Die Stärke ist Breite — Entwürfe, Dateiarbeit, multimodale Analyse, Coding, Agenten und Erweiterungen — das Risiko ist, dass flüssige Ausgabe schwache Quellen, Datenschutzannahmen oder Planlimits unsichtbar macht.

    Tool
  2. Claude

    Claude ist das Tool für sorgfältiges Entwerfen und langen Kontext. Die aktualisierte Evidenz bestätigt die Kernspur: nuanciertes Umschreiben, Dokumentenanalyse, Projects, Artifacts, Research, Claude Code, Cowork, Websuche und Organisationssuche/Connectoren. Das redaktionelle Risiko ist Quota- und Oberflächenverwirrung: Consumer Pro/Max, Team, Enterprise und API-/Tool-Preise sind deutlich verschiedene Produkte.

    Tool
  3. Connected Papers

    Connected Papers bleibt die saubere visuelle Literature-Map-Karte. Besonders nützlich zur Orientierung um ein Seed-Paper, aber die Kernlimitation bleibt methodisch: ein Graph ist kein reproduzierbarer Suchkorpus.

    Tool
  4. Consensus

    Consensus bleibt die behauptungsförmige akademische Q&A-Karte. Am stärksten, wenn der Nutzer eine Forschungsfrage hat und schnell zitierte Orientierung braucht.

    Tool
  5. Crossref

    Crossref ist wissenschaftliche Infrastruktur, keine glänzende Discovery-App. Es bleibt die DOI-Metadaten-Verifikationskarte.

    Tool
  6. Cursor

    Cursor bleibt das Flaggschiff unter den KI-nativen Code-Editoren, muss aber drei Trennungen betonen: Editor-Workflow versus Headless-Agenten, individuelle Nutzungspools versus Team-/Enterprise-Governance, und Privacy Mode versus gewöhnlichen Provider-Transit. Cursor ist stark für repo-lokale Tab-, Chat-, Agent-, MCP-, Cloud-Agent- und Bugbot-Workflows, aber nur wenn Diffs geprüft und Tests laufen.

    Tool
  7. DeepSeek

    DeepSeek is the low-cost reasoning/API tool. This pass sharpens the key facts: DeepSeek’s API is OpenAI- and Anthropic-compatible, current V4-Flash/V4-Pro pricing is extremely low, context length is listed at 1M, and legacy deepseek-chat / deepseek-reasoner names are being deprecated. The low price is real, but the editorial warning is bigger than usual: privacy, residency, institutional policy, and geopolitical availability need explicit review.

    Tool
  8. ElevenLabs

    ElevenLabs ist das Sprach- und Audio-KI-Tool. Die Produktqualität kann Ergebnisse ausgereift erscheinen lassen.

    Tool
  9. Elicit

    Elicit ist nicht länger nur ein Paper-Such-Assistent; es positioniert sich als Evidenzsynthese-System für Berichte, systematische Reviews, dynamisches Screening, Extraktion und satzgenaue Zitationen über einen sehr großen wissenschaftlichen Korpus hinweg. Die reichhaltigeren Daten tragen ein Dossier mit höherer Konfidenz, aber die Empfehlung hängt weiter an der benchmarkten Extraktionsgenauigkeit gegen eine handcodierte Tabelle.

    Tool
  10. Exa

    Exa is one of the cleanest “search as infrastructure” cards in the VerdictPal stack. The current pricing and docs make the value clearer: real-time search, webpage text/highlights, configurable latency, contents retrieval, Answer endpoint, Deep Search, Monitors, and Agent runs. The core risk is economic and privacy-boundary creep when agents fan out across many searches, contents calls, summaries, and enrichment steps.

    Tool
  11. Factory

    Factory ist das agent-native Software-Delivery-Tool. Am stärksten, wenn die Aufgabe größer ist als Autocomplete: Repo-Verständnis, im Spec Mode geplante Refactorings, Delegation an Terminal/IDE, Hintergrund-Agenten, SDK-Nutzung und CI-artige Droid-Exec-Workflows. Dieser Durchlauf ergänzt aktuelle Factory/Droid-Quellendetails von 2026 und schärft die Enterprise-/Sicherheitsgrenze.

    Tool
  12. Firecrawl

    Firecrawl ist die Web-Extraktions-Infrastrukturkarte. Sollte als Kontext-Extraktion für Agenten und Forschungspipelines beschrieben werden, nicht als generische Suchmaschine.

    Tool
  13. Gamma

    Gamma ist das KI-Präsentations- und Visual-Document-Erstdraft-Tool. Die Preis- und Datenschutzseiten waren beim Laden nicht erreichbar.

    Tool
  14. Gemini

    Anhand offizieller Google-Seiten vertieft: Preise für Consumer (AI Plus/Pro/Ultra), Workspace-Add-on, kostenpflichtige Gemini API und Vertex AI; Datenschutzsprache für Consumer vs. API vs. Workspace/Vertex; Fähigkeitsliste auf die aktuelle Gemini-App- plus API-Oberfläche aktualisiert.

    Tool
  15. Google Scholar

    Google Scholar bleibt die akademische Such-Baseline: breit, vertraut, schnell und nützlich zum Finden bekannter Einträge, PDFs, Bibliothekslinks, Zitationsspuren, Alerts und Rechtsprechung. Die Schwäche ist methodische Intransparenz. Es sollte als Entdeckungs- und Zitationsverfolgungs-Gewohnheit empfohlen werden, nicht als reproduzierbare Suchstrategie für sich.

    Tool
  16. Grammarly

    Grammarly ist das Überarbeitungsdurchlauf-Tool, nicht das Argument-Schreib-Tool. Dieser Durchlauf aktualisiert das Tool für Grammarly Pro und Superhuman-Suite.

    Tool
  17. Gumloop

    Gumloop ist das No-Code-KI-Workflow- und Agent-Automation-Tool. Basiert auf primären Preis- und Datenschutzseiten plus offiziellen Produkt-/Suchergebnissen.

    Tool
  18. Kagi

    Kagi ist das Paid-Search-Tool: eine nutzerfinanzierte, werbefreie Suchmaschine mit ernsthafter Datenschutz-Technik und nützlicher Assistant-Funktionalität.

    Tool
  19. Litmaps

    Litmaps ist das Citation-Map-plus-Monitoring-Tool. Wertvoll, wenn Nutzer von Seed-Papern ausgehen und vernetzte Arbeiten entdecken, visualisieren und überwachen wollen.

    Tool
  20. Mendeley

    Mendeley ist der Elsevier-gestützte Cloud-Sync-Referenzmanager mit zunehmend KI-geprägten Bibliotheksfunktionen.

    Tool
  21. Microsoft Copilot

    Microsoft Copilot ist a family-name card, not a single-product card. This pass uses Microsoft Learn pages for Microsoft 365 Copilot and Copilot Chat data protection plus Microsoft pricing search results. The key editorial job is to separate consumer Copilot, Microsoft 365 Copilot Chat, paid Microsoft 365 Copilot, and Azure/OpenAI developer paths.

    Tool
  22. Mistral Le Chat

    Mistral Le Chat ist is the EU-headquartered assistant comparison tool. This pass strengthens the privacy and API boundary: Le Chat inputs/outputs are retained until account/conversation deletion, API inputs/outputs are generally kept for 30 rolling days for abuse monitoring unless zero data retention is activated, and Agents/Fine-tuning have separate retention rules. That makes Mistral useful to compare against US-default assistants, but not automatically compliant.

    Tool
  23. n8n

    n8n ist die Research-Ops-Automatisierungskarte. Am stärksten, wenn ein Team sichtbaren Workflow-Kleber über APIs, Webhooks, Datenbanken, KI-Schritte, Notion und Alerts benötigt.

    Tool
  24. NotebookLM

    NotebookLM bleibt das Flaggschiff für quellengestützte Workspaces. Der stärkste VerdictPal-Rahmen ist nicht „KI-Suche“, sondern ein Lese-Workspace, der beim Korpus beginnt: Quellen hochladen oder entdecken, geerdete Fragen stellen, Lernartefakte erzeugen und Behauptungen an Zitationen prüfen. Dieser Durchgang ergänzt aktuelle Enterprise-, Workspace- und Google-AI-Planunterschiede, damit die Datenschutzgeschichte klarer ist.

    Tool
  25. Obsidian

    Obsidian ist das Local-First-Wissensdatenbank-Tool. Das wichtige Update: Obsidian ist jetzt sowohl für die Arbeit als auch privat kostenlos; Sync und Publish bleiben optional.

    Tool
  26. OpenAlex

    OpenAlex ist das offene wissenschaftliche Graph-Tool. Sie sitzt zwischen Crossref und Semantic Scholar: breitere Discovery als DOI-Registry, reproduzierbarer als geschlossene Suchprodukte.

    Tool
  27. OpenRouter

    OpenRouter ist das Model-Router-Tool. Nützlich, wenn ein Entwickler eine OpenAI-kompatible API-Oberfläche für viele LLMs, Fallback-Routing, Modellvergleiche und BYOK möchte.

    Tool
  28. Overleaf

    Overleaf ist das kollaborative LaTeX-Tool. Dieser Durchlauf aktualisiert das Tool mit aktuellen Plan-Nachweisen: KI-Kontingent, Mitarbeiterlimits und 24x-Kompilierzeit.

    Tool
  29. Paperpile

    Paperpile ist der Convenience-First-Referenzmanager für Google Docs und browser-natives Schreiben. Exzellente Google-Docs- und PDF-Workflow-Abdeckung, aber Tradeoffs bei bibliographischer Tiefe.

    Tool
  30. Perplexity

    Perplexity bleibt der Maßstab für zitierte Antworten in der Consumer-KI-Suche, aber das Tool muss Perplexity jetzt als zwei verwandte Produkte behandeln: die Consumer-Antwortmaschine und die API-Plattform. Das Consumer-Produkt taugt für schnelle Quellenkarten und Deep-Research-Entwürfe; die API-Plattform ist eine separate Entwickleroberfläche mit Sonar-, Search-, Agent- und Embeddings-APIs. Die harte redaktionelle Regel bleibt: Zitationen sind Spuren, keine bibliografiefertige Evidenz.

    Tool
  31. PostHog

    PostHog ist das Produktanalyse- und Experimentier-Stack-Tool. Sie gehört in VerdictPal, weil Produktanalyse, Session Replay, Feature Flags und Experimente sich mit Forschungs- und Produkt-Ops überschneiden.

    Tool
  32. Rayyan

    Rayyan ist ein fokussierter Systematic-Review-Screening-Workspace mit stärkeren Plan-Mechaniken.

    Tool
  33. Replit

    Replit ist das browserbasierte KI-Build-and-Deploy-Tool. Nützlich, wenn ein Nutzer einen Ort für Ideenfindung, Agent-Building, Datenbank, Hosting, Zusammenarbeit und Publishing möchte.

    Tool
  34. Research Rabbit

    Research Rabbit ist the visual exploration and “follow the trail” card. It belongs beside Connected Papers and Litmaps, but its emphasis is adaptive exploration, collections, and seeing how papers/authors/concepts connect. This pass adds current feature language, data-source hints, and a clearer privacy/method boundary.

    Tool
  35. Scholarcy

    Scholarcy ist das Paper-Überflug- und strukturierte-Zusammenfassungs-Tool. Kann Zeit für Triage, Accessibility und Organisation sparen, muss aber als Lesehilfe geprüft werden.

    Tool
  36. Scira AI

    Scira bleibt das VerdictPal-Flaggschiff-Template, weil es eine zitierte Such-UI, eine Open-Source-AGPL-Codebase, gehostete Free/Pro/Max-Pläne, eine API-Plattform, eine MCP-Oberfläche und eine tiefe Dossier-Struktur verbindet. Dieser Durchgang ersetzt veralteten und kaputten Seiteninhalt durch ein saubereres Dossier, das sich benchmarken lässt, und hält die Kernhaltung: starke öffentliche Empfehlung, aber benchmark-ready bleibt false, bis die ausstehenden Desk-Zeilen wirklich laufen.

    Tool
  37. Scite

    Scite ist das Zitationskontext-Tool. Wertvoll, weil sie eine bessere Frage stellt: Haben spätere Paper die Behauptung gestützt, kontrastiert oder nur erwähnt?

    Tool
  38. Semantic Scholar

    Semantic Scholar bleibt eine Flagship-akademische-Suchschicht, weil sie eine kostenlose wissenschaftliche Such-UI mit TLDRs, Autorenseiten, Alerts und Entwickler-API kombiniert.

    Tool
  39. Warp

    Warp ist das agentische Terminal/Workspace-Tool. Überzeugend, weil sie Coding-Agenten ins Terminal bringt.

    Tool
  40. You.com

    You.com sollte primär als Web-Search-API-Plattform für KI-Entwickler betrachtet werden.

    Tool
  41. Zotero

    Zotero bleibt der stärkste Local-First-Standard für studentisches und akademisches Referenzmanagement. Die neuen Datenpunkte verstärken die Kernpositionierung: Der Desktop-Workflow funktioniert ohne Konto, Sync ist optional und standardmäßig deaktiviert, bezahlter Speicher finanziert ein Nonprofit-Projekt, und das hauptsächliche redaktionelle Risiko ist nicht die Fähigkeit, sondern Governance um Sync, Anhänge, Plugins und Gruppenbesitz.

    Tool
  42. Canva Business

    Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.

    Tool
  43. ChatPRD

    Notion-State-of-Art-Recherche importiert und redaktionelle Eignung gesenkt, um schwache Desk-Nützlichkeit plus Teams-gesicherte Linear-Integration widerzuspiegeln.

    Tool
  44. Linear

    Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.

    Tool
  45. Lovable

    Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.

    Tool
  46. Magic Patterns

    Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.

    Tool
  47. Manus

    Notion-State-of-Art-Felder importiert und Scira-Gate-Status auf Solid korrigiert.

    Tool
  48. Mobbin

    Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.

    Tool
  49. Wispr Flow

    Aus der Notion-Tool-Pipeline (Karten-Pipeline) importiert mit Scira-gate status corrected to solid.

    Tool
  50. Dark Mode für das Evidence Instrument überarbeitet

    Dunkle Oberflächen nutzen jetzt gedämpftes Amber, lesbare Ränder und komponentenspezifische Overrides statt Neon-Panels und invertierter Cream-Panels.

    Drop
  51. Trusted-Source-Briefing-Workflow veröffentlicht

    Die Guides-Säule hat jetzt einen echten Recherchepfad, Tool-Stack, Playbook und Showcase, um breite Prompts in quellenbasierte Briefings zu verwandeln.

    Drop
  52. Claude Mythos Preview

    Claude-Mythos-Research-Preview veröffentlicht — Spitze bei Vals (73,42 %) und SWE-bench Verified (93,9 %, Best-of-3).

    Modell

2026-W22

  1. MiniMax M3

    MiniMax M3 veröffentlicht — Terminal-Bench 2.0 66,0 %, 1M-Kontext.

    Modell
  2. Claude Opus 4.8

    Claude Opus 4.8 veröffentlicht — Spitze bei Vals (70,17 %) und AA (61,4).

    Modell

2026-W21

  1. Qwen 3.7 Max

    Qwen 3.7 Max veröffentlicht — AA-Index 56,6, Terminal-Bench 2.0 69,7 %.

    Modell
  2. Gemini 3.5 Flash

    Gemini 3.5 Flash veröffentlicht — MCP-Atlas-Spitze (83,6 %), 1M-Kontext, günstigster Frontier-Preis.

    Modell

2026-W18

  1. Grok 4.3

    Grok 4.3 mit 2M-Kontext und Echtzeit-X-Suche veröffentlicht.

    Modell

2026-W17

  1. DeepSeek V4 Pro Max

    DeepSeek V4 Pro Max mit Open Weights und Frontier-Coding-Scores veröffentlicht.

    Modell
  2. GPT 5.5

    GPT 5.5 mit nativem Audio, Bild und 512K-Kontext veröffentlicht.

    Modell
  3. GPT-5.5 Pro

    GPT-5.5 Pro veröffentlicht — Premium-Stufe, $30/$180, Responses API.

    Modell
  4. Kimi K2.6

    Kimi K2.6 veröffentlicht — Vals #5 bei 55,55 %, GPQA Diamond 90,5 % (Open-Source-Spitze).

    Modell

2026-W16

  1. Claude Opus 4.7

    Claude Opus 4.7 veröffentlicht — 13 % Coding-Steigerung, 3× Produktionsaufgaben, 3,75 MP Vision.

    Modell
  2. Claude Opus 4.8

    Claude Opus 4.7 für allgemeine Verfügbarkeit ausgemustert.

    Modell

2026-W15

  1. GLM-5.1

    GLM-5.1 mit 200K-Kontext, 128K Max-Output, Long-Horizon-Coding-Fokus und MIT-lizenzierten Open Weights veröffentlicht.

    Modell

2026-W14

  1. Qwen 3.7 Max

    Qwen 3.7 Plus für allgemeine Verfügbarkeit ausgemustert.

    Modell

2026-W12

  1. GPT-5.4 Mini

    GPT-5.4 Mini veröffentlicht — bestes Preis-/Leistungs-Verhältnis, $0,75/$4,50.

    Modell
  2. GPT-5.4 Nano

    GPT-5.4 Nano veröffentlicht — Budget-Stufe, $0,20/$1,25.

    Modell

2026-W11

  1. MiniMax M3

    MiniMax M2.7 als Flaggschiff-Open-Weights-Modell ausgemustert.

    Modell

2026-W10

  1. GPT 5.4

    GPT 5.4 veröffentlicht — AA-Index 56,8, Terminal-Bench 2.0 81,8 % (ForgeCode).

    Modell
  2. GPT 5.5

    GPT 5.4 für allgemeine Verfügbarkeit ausgemustert.

    Modell
  3. GPT-5.4 Pro

    GPT-5.4 Pro veröffentlicht — Premium-Stufe, $30/$180.

    Modell
  4. Grok 4.3

    Grok 4.20 aus der allgemeinen Verfügbarkeit ausgemustert.

    Modell

2026-W08

  1. Gemini 3.1 Pro

    Gemini 3.1 Pro veröffentlicht — AA-Index 57,2, ARC-AGI-2 77,1 %.

    Modell
  2. Claude Sonnet 4.6

    Claude Sonnet 4.6 veröffentlicht — Vals #3 bei 60,30 %, 1M-Kontext, $3 / $15.

    Modell

2026-W07

  1. DeepSeek V4 Pro Max

    DeepSeek V3.2 als Flaggschiff-Open-Weights-Modell ausgemustert.

    Modell

2026-W06

  1. Claude Opus 4.6

    Claude Opus 4.6 veröffentlicht — erstes Opus mit 1M-Kontext, 128K-Output, Agent-Teams.

    Modell

2025-W50

  1. GPT 5.4

    GPT 5.2 für allgemeine Verfügbarkeit ausgemustert.

    Modell
  2. GPT-5.2

    GPT-5.2 veröffentlicht — 410K-Kontext, konfigurierbares Reasoning, $1,75/$14.

    Modell

2025-W48

  1. Claude Opus 4.5

    Claude Opus 4.5 veröffentlicht — bestes Coding- und Agent-Modell bei Launch, $5/$25.

    Modell

2025-W40

  1. Claude Haiku 4.5

    Claude Haiku 4.5 veröffentlicht — Speed-Stufe, $1/$5, 200K-Kontext.

    Modell
Pack-Drops-Feed