VerdictPal · Redaktions-Desk · Stand 14. Sept. 2026VerdictPal
Aktualität

Was sich änderte

Tool-Changelogs und Pack-Drops, nach Woche gruppiert.

2026-W38

  1. Canva Business

    Live US-Jahrespreise: Pro 144 USD/Jahr, Business 250 USD/Jahr pro Person. Datenschutz zuletzt 25.08.2026. Canva Teams für neue Anmeldungen geschlossen.

    Tool
  2. ChatGPT

    Preise und Datenschutz am 2026-09-14 anhand chatgpt.com/pricing, OpenAI-Plus-/Business-Hilfe und openai.com/index/introducing-chatgpt-go/ geprüft. Consumer: Kostenlos 0 $ · Go 8 $/Monat (Werbung möglich) · Plus 20 $/Monat · Pro 100 $/Monat · Pro 200 $/Monat (neue 200-$-Anmeldungen pausiert). Business Standard 25 $/20 $ jährlich; Premium 125 $/100 $ jährlich; mind. 2 Sitze. Consumer-Inhalte werden laut Preisseite trainiert; Business/API-Daten standardmäßig nicht.

    Tool
  3. ChatPRD

    Preise und Datenschutz am 2026-09-14 live geprüft. ChatPRD-Preise unverändert: Kostenlos 0 $ mit 3 begrenzten Chats; Pro 15 $/Monat jährlich 179 $; Teams 29 $/Sitz/Monat jährlich 349 $/Sitz; Enterprise individuell. Datenschutzrichtlinie zuletzt 1. März 2026: kein Training mit Customer Content für allgemeine Modelle. Team-Plan-Hilfe-URL lieferte 404.

    Tool
  4. Claude

    Preise und Datenschutz am 2026-09-14 anhand claude.com/pricing und Anthropic-Hilfe geprüft. Consumer Pro bleibt 20 $/Monat oder 17 $ jährlich; Max ab 100 $ (5×/100 $, 20×/200 $); Team Standard 25 $/20 $ jährlich; Team Premium 125 $/100 $ jährlich. Enterprise steht mit 20 $/Sitz/Monat jährlich plus API-Nutzung. Consumer-Training bleibt Opt-in, mit fünfjähriger Aufbewahrung wenn aktiv und 30 Tagen wenn nicht; Team/Enterprise weiter kein Training standardmäßig.

    Tool
  5. Consensus

    Consensus-Preise und Datenschutz am 2026-09-14 live geprüft. Individual: Kostenlos 0 $; Pro 20 $/Monat oder 144 $/Jahr; Deep 65 $/Monat oder 540 $/Jahr. Studenten-/Fakultäts-/US-Kliniker-Rabatt bis 40 %. Datenschutzrichtlinie vom 18. August 2026: Verschlüsselung in Transit/Ruhe; kein Verkauf personenbezogener Daten; kein LLM-Training einschließlich Drittmodelle.

    Tool
  6. ElevenLabs

    ElevenLabs-Preise und Datenschutz am 2026-09-14 live geprüft. Creative-Pläne unverändert: Free 0 $/10k; Starter 6 $/30k; Creator 22 $/121k; Pro 99 $/600k; Scale 299 $/1,8M/3 Sitze; Business 990 $/6M/10 Sitze; Enterprise individuell. Jährliche Abrechnung = 10 Monate. Ungenutzte Paid-Credits bis zwei Monate übertragbar. Datenschutzrichtlinie 20. Mai 2026; Training-Opt-out nur für danach bereitgestellte personenbezogene Daten.

    Tool
  7. Elicit

    Elicit-Preise und Datenschutz am 2026-09-14 live geprüft. Basic bleibt kostenlos mit limitiertem Research Agent und Research Reports plus unbegrenzter Suche/Zusammenfassungen/Chat. Pro 49 $/Nutzer/Monat jährlich 588 $; Scale 169 $ jährlich 2.028 $; Enterprise individuell ohne Training mit Kundendaten standardmäßig. Datenschutzrichtlinie zuletzt 12. September 2023.

    Tool
  8. Gamma

    Live Gamma-Pläne Free/Plus/Pro/Ultra; Credits aus der Hilfe. Öffentliche Preistabelle ohne Dollarbeträge. Datenschutzseite Timeout.

    Tool
  9. Grammarly

    Grammarly-Preise und Datenschutz am 2026-09-14 live geprüft. Kostenlos 0 $ mit 100 KI-Prompts; Pro 12 $/Nutzer/Monat jährlich (144 $/Jahr), 60 $ vierteljährlich, 30 $ monatlich; 1–149 Sitze; Enterprise über Superhuman Go. Trust/Privacy: Superhuman verkauft keine Nutzerinhalte; Product Improvement and Training lässt sich in den Kontoeinstellungen abschalten.

    Tool
  10. Gumloop

    Gumloop-Preise und Datenschutz am 2026-09-14 live geprüft. Neue Konten: 14-Tage-Pro-Test (Karte nötig). Pro ab 37 $/Monat mit 20k Credits; ungenutzte Pro-Credits verfallen; Überschreitung 0,005 $/Credit nach Pay-as-you-go. Die früheren Free-5k- und Pro-97-$/55k-Listings fehlen auf der Live-Preisseite. Datenschutzrichtlinie gültig ab 26.06.2026; Premium: kein Training mit Uploads/Flows/Agent-Chats.

    Tool
  11. Kagi

    Kagi-Preise und Datenschutz am 2026-09-14 live geprüft. Trial: 100 Suchen + 100 Assistant-Interaktionen. Starter 5 $/300 Suchen; Professional 10 $ unbegrenzte Suche; Ultimate 25 $ Research-Modus und Flagship-Modelle. Gutschrift für ungenutzte Monate bleibt; die Live-Seite listet kein jährliches −10 %. Datenschutz: keine Werbung/Telemetrie/Klick-Tracking; 7-Tage-LB/VM-Logs; Sentry 90 Tage; Assistant-Threads standardmäßig nach einem Tag gelöscht.

    Tool
  12. Live-Preisdurchgang: Consensus Pro 20 $, Gumloop-Credits, Canva-Jahrespreise, Mistral Student 5,99 $

    Anbieterseiten am 14. Sep. neu geprüft. Consensus Pro kostet 20 $/Monat oder 144 $/Jahr. Gumloop hat Free 5k und das 97-$-Pro-SKU gestrichen — Pro beginnt bei 37 $/20k Credits. Canva Pro ist 144 US$/Jahr, Business 250 US$/Jahr/Person. Mistral Education 5,99 $. Scholarcy Library 9,99 $/Monat oder 90 $/Jahr. /tools

    Drop
  13. Manus

    Live Manus-Hilfe: Free 0 $, Pro ab 20 $/4.000 Credits oder 40 $/8.000 Credits, Team ab 20 $/Sitz. Datenschutzseite ist SPA; privacyChecked unverändert.

    Tool
  14. Mendeley

    Live-Elsevier-Preise bestätigen Plus 4,99 $ / Pro 9,99 $ / Max 14,99 $ monatlich (keine Custom-Stufen). Datenschutz Stand 01.09.2026.

    Tool
  15. Microsoft Copilot

    Live Copilot Chat inklusive; M365-Copilot-Add-on 30 $/Nutzer/Monat jährlich. Consumer-Copilot-Pro-20-$ ist von der Individuals-Seite verschwunden; Personal 9,99 $ / Family 12,99 $ / Premium 19,99 $. Datenschutzartikel erneut geprüft.

    Tool
  16. Mistral Le Chat

    Live-Prüfung mistral.ai/pricing: Pro 14,99 $, Education 5,99 $, Team 24,99 $. Datenschutz zu Vibe-/API-Retention erneut geprüft.

    Tool
  17. Overleaf

    Live-USD-Pläne: Student 8,25 $, Standard 16,75 $, Pro 33,25 $ pro Monat bei Jahreszahlung. Datenschutzhinweis vom 11.06.2026.

    Tool
  18. Paperpile

    Live-Paperpile-Listenpreise unverändert: Regular 8,30 $ / Expert 11,50 $ pro Monat bei Jahreszahlung; Academic 50 %. Datenschutzseite in diesem Durchgang blockiert.

    Tool
  19. Rayyan

    Live Rayyan: Essential 4,99 $ jährlich / 8,33 $ quartalsweise; Advanced 8,33 $ jährlich / 13,33 $ quartalsweise; Academic 41,67 $/Lizenz/Monat jährlich ab 5 Sitzen.

    Tool
  20. Research Rabbit

    Live RR+ 10 $/Monat mit monatlicher Zahlung; 12,50-$-SKU nicht auf der Preisseite. Datenschutz-URL in diesem Durchgang 422.

    Tool
  21. Scholarcy

    Live Library-Checkout USD 9,99 $/Monat oder 90 $/Jahr; Free 0 $. Datenschutz erneut geprüft (Stand 07.02.2024).

    Tool
  22. Scite

    Live scite.ai/pricing: Free, Basic 20 $/Monat jährlich, Pro 50 $/Monat jährlich. Datenschutzseite in diesem Durchgang nicht geladen.

    Tool

2026-W37

  1. Vals-Index v2 ist das Live-Board — DeepSeek V4.1 Flash steht im Atlas

    Vals-Zeilen vor dem 13. Aug. (Kimi K3 74,7, Sol 73,1) überholen das live v2-Board nicht mehr. Fable 5.1 führt weiter mit 68,83, dann Opus 5 und GPT-6 Astra. DeepSeeks V4.1 Flash vom 10. Sep. ist aus dem offiziellen Launch erfasst: 552B-MoE, deepseek-flash, Off-Peak $0,15 / $0,60. /benchmarks/vals-index

    Drop
  2. AA-Intelligence-Index v4.3 steht im Ledger — Fable 5.1 53,4, Astra 52,8

    Der Artificial-Analysis-API-Snapshot vom 10. Sep. publiziert jetzt den Intelligence Index v4.3. τ³-Banking hat den Composite für AutomationBench-AA verlassen; Terminal-Bench v4.0 steckt im Index, ist aber noch kein eigener API-Schlüssel, daher trackt /benchmarks/terminal-bench weiter 2.1. Claude Fable 5.1 führt mit 53,4, GPT-6 Astra mit 52,8. Vals ist unverändert (Fable 5.1 68,83 %). /benchmarks/artificial-analysis-index

    Drop
  3. Claude Fable 5.1

    AA-API-Snapshot: Intelligence Index v4.3 ist 53,4 bei Max + Default-Fallback. Vals-Index weiter 68,83 % vom Board 5. Sep.

    Modell
  4. DeepSeek V4 Flash 0731 (Reasoning, Max Effort)

    DeepSeek hat diesen API-Namen zurückgezogen. Aufrufe von deepseek-v4-flash landen jetzt bei DeepSeek V4.1 Flash zu V4.1-Flash-Preisen. Siehe /models/deepseek-v4-1-flash.

    Modell
  5. DeepSeek V4.1 Flash

    DeepSeek-V4.1-Flash GA. API-ID deepseek-flash. Off-Peak-Liste $0,15 / $0,60 pro 1M Tokens. V4-Flash-Aliasse gehen auf dieses Modell über.

    Modell
  6. Gemini 3.7 Flash

    AA-API-Snapshot: Intelligence Index v4.3 ist 39,4 bei High Effort. Gemini 3.8 Flash bleibt das aktuelle Flash.

    Modell
  7. Gemini 3.8 Flash

    AA-API-Snapshot: Intelligence Index v4.3 ist 41,2 in der kanonischen High-Effort-Zeile.

    Modell
  8. GPT-5.6 Sol

    AA-API-Snapshot: Intelligence Index v4.3 ist 47,1 bei Max. GPT-6 Astra bleibt das aktuelle OpenAI-Flagship; Sol bleibt die günstigere GPT-5.6-Linie.

    Modell
  9. GPT-6 Astra

    AA-API-Snapshot: Intelligence Index v4.3 ist 52,8 bei Max. Gleichauf mit Fable 5.1 bei der gerundeten Headline 53 in AAs v4.3-Artikel.

    Modell
  10. Grok 4.6

    AA-API-Snapshot: Intelligence Index v4.3 ist 44,4 bei High Effort.

    Modell
  11. K2 Horizon 375B A23B

    AA-API-Snapshot: Intelligence Index v4.3 ist 33,9. Hosted-Liste weiter $0 / $0.

    Modell
  12. Muse Spark 1.3

    AA-API-Snapshot: Intelligence Index v4.3 ist 48,2 bei Max Effort.

    Modell
  13. Qwen3.8 Max

    AA-API-Snapshot: Intelligence Index v4.3 ist 40,3. Listenpreis unverändert $2 / $6.

    Modell
  14. Command Code

    commandcode.ai/pricing und /privacy erneut geprüft. Individuelle Leiter jetzt Go 1 $ · GOAT 10 $ · Pro 20 $ · Max 10× 100 $ · Max 20× 200 $. Datenschutzrichtlinie vom 2026-07-03 ergänzt 30-Tage-Retention für KI-Anfragen, außer CMD_ZDR=1.

    Tool
  15. Cursor

    cursor.com/pricing und cursor.com/data-use erneut geprüft. Hobby bleibt kostenlos; Pro 20 USD/Monat, Pro+ 60 USD/Monat, Ultra 200 USD/Monat, Teams Standard 40 USD/Nutzer/Monat, Enterprise individuell. Privacy Mode steuert weiterhin Training und ZDR gegenüber gewöhnlichem Provider-Transit.

    Tool
  16. Factory

    factory.ai/pricing und factory.ai/security erneut geprüft. Teams kostet jetzt 60 USD/Monat pro Team plus 40 USD/Monat pro Sitz (bis 10 Sitze); Business ist der individuelle Tarif bis 150 Sitze. Listenpreise Pro/Plus/Max unverändert.

    Tool
  17. Gemini

    Google-AI-Pläne erneut geprüft: Plus kostet 4,99 USD/Monat mit 400 GB (vorher 200 GB / 7,99 $). Pro bleibt 19,99 USD/Monat mit 5 TB. Ultra beginnt bei 99,99 USD/Monat. Consumer-Gemini-Aktivitäten können weiterhin geprüft werden, sofern Einstellungen nicht geändert werden.

    Tool
  18. NotebookLM

    Google-AI-Pläne, die NotebookLM bündeln, erneut geprüft. Plus kostet jetzt 4,99 USD/Monat (vorher 7,99). Standard bleibt kostenlos; Pro 19,99 USD/Monat; Enterprise bei Google Cloud mit 9 USD/Lizenz/Monat gelistet.

    Tool
  19. OpenCode

    opencode.ai/go und /docs/zen erneut geprüft. Go listet 10 USD/Monat ohne Erstmonats-Intro auf der aktuellen Seite. Zen-Auto-Reload bleibt unter 5 USD mit 20-USD-Top-up. Free/Promo-Modell-Datenschutz-Ausnahmen aktualisiert.

    Tool
  20. Perplexity

    docs.perplexity.ai-Preise erneut geprüft. Consumer-Listenpreise bleiben Free / Pro 20 USD / Max 200 USD / Education Pro 10 USD / Enterprise Pro 40 USD / Enterprise Max 325 USD. Search API 5 USD pro 1.000 erfolgreichen Anfragen. Consumer-Datenschutzrichtlinie war hinter einer Bot-Wand; die bestehende Cloud-Verarbeitungshaltung bleibt.

    Tool
  21. Raycast

    raycast.com/pricing und /privacy erneut geprüft. Free bleibt für Privatnutzung; Pro 8 $/Monat jährlich oder 10 $/Monat monatlich; Advanced AI +8 $/Monat; Teams Pro 12–15 $/Nutzer/Monat. Local-first-Datenschutz unverändert.

    Tool
  22. Scira AI

    scira.ai/pricing und api.scira.ai/pricing erneut geprüft. Gehostet Free/Pro/Max bleiben 0 / 15 / 60 USD; Pro kostet 9 USD/Monat mit verifizierter Schul-E-Mail. API Free bleibt 20 Anfragen/Tag; API Pro 20 USD/Monat für 1.000 Anfragen/Tag.

    Tool

2026-W36

  1. Claude Fable 5.1

    Live-Vals-Index 68,83 %. Live-AA-Intelligence-Index v4.2 ist 57 bei Max + Default-Fallback.

    Modell
  2. Frontier September 2026: GPT-6 Astra, Gemini 3.8 Flash, Muse Spark 1.3, Hy4-Vorschau

    OpenAIs GPT-6 Astra vom 3. Sep., Googles Gemini 3.8 Flash vom 2. Sep. und Metas Muse Spark 1.3 vom 2. Sep. stehen jetzt mit Live-Werten des Artificial-Analysis-Intelligence-Index v4.2 im Atlas. Tencents Hy4-Vorschau ist aus dem offiziellen Start erfasst. Claude Fable 5.1 führt den Live-Vals-Index weiter mit 68,83 %. /models

    Drop
  3. Gemini 3.7 Flash

    Live-AA-Intelligence-Index v4.2 ist 45 bei High Effort. Gemini 3.8 Flash ist jetzt das aktuelle Flash; 3.7 bleibt für den schnelleren 305-t/s-Endpoint gelistet.

    Modell
  4. GPT-5.6 Sol

    Live-AA-Intelligence-Index v4.2 ist 51 bei Max. GPT-6 Astra ist das aktuelle OpenAI-Flagship; Sol bleibt die günstigere GPT-5.6-Linie.

    Modell
  5. Grok 4.6

    Live-AA-Intelligence-Index v4.2 ist 51 bei High Effort; AA listet jetzt 500k Kontext.

    Modell
  6. GPT-6 Astra

    GPT-6 Astra GA auf der OpenAI-API und gestuftem ChatGPT-/AWS-Rollout. Liste $10 / $50 pro 1M Tokens.

    Modell
  7. K2 Horizon 375B A23B

    IFM veröffentlicht die K2-Horizon-Flotte unter Apache 2.0, inklusive 375B-A23B-Gewichten (512K-Kontext), Daten oder Rezepten, Code und Logs.

    Modell
  8. Gemini 3.8 Flash

    Gemini 3.8 Flash allgemein verfügbar. AA-High-Effort-Intelligence-Index v4.2 ist 47; Intro-Preis unverändert gegenüber 3.7 Flash.

    Modell
  9. Gemini 3.8 Flash Cyber

    Gemini 3.8 Flash Cyber für Fairwind-Trusted-Defender angekündigt.

    Modell
  10. Muse Spark 1.2

    Muse Spark 1.3 ist jetzt die aktuelle Muse-Spark-Linie. 1.2 bleibt für den v4.1-xhigh-Snapshot gelistet.

    Modell
  11. Muse Spark 1.3

    Muse Spark 1.3 in Muse Code und der Meta Model API verfügbar. AA-Max-Effort-Intelligence-Index v4.2 ist 53.

    Modell
  12. AA-Omniscience und CritPt kommen in den Benchmark-Atlas

    Zwei fehlende Slices des AA Intelligence Index v4.1 haben jetzt Erklärseiten und belegte Zeilen: AA-Omniscience (Faktenabruf vs. Hallucination — die Wissens-Primärspur) und CritPt (Forschungsphysik, Frontier noch unter 40 %). /benchmarks/aa-omniscience · /benchmarks/critpt

    Drop
  13. Claude Fable 5

    Vals-Index 66,04 % im Snapshot vom 1. Sep.; Fable 5.1 übernimmt die Führung mit 67,87 %.

    Modell
  14. Claude Fable 5.1

    Claude Fable 5.1 GA auf der Claude-API, Bedrock, Vertex und Microsoft Foundry. Cache-Reads auf $0,25 / 1M Tokens gesenkt.

    Modell
  15. Claude Fable 5.1 steht im Modell-Atlas — Vals-Index 67,87 %

    Anthropics Mythos-class-Refresh von Fable 5 am 1. Sep. Dieselbe $10-/$50-Liste, Cache-Reads auf $0,25 pro 1M Tokens. Vals setzt es auf 67,87 % im Index, vor Opus 5 und Fable 5. Der AA-Intelligence-Index steht im API-Snapshot vom 1. Sep. noch nicht. Vergleich mit GPT-5.6 Sol oder Fable 5. /models/claude-fable-5-1

    Drop

2026-W35

  1. Hy4 preview

    Hy4 preview open-sourced und auf TokenHub / OpenRouter mit $0,834 / $2,501 pro 1M Tokens gelistet.

    Modell
  2. Drei akademische Guide-Trilogien, neu aufgebaut

    Studentische Recherche, Literaturreview und Peer-Review — jeweils mit Stack und Playbook. Peer-Review beginnt mit der KI-Richtlinie des Venues. Alte Grant-, Coding- und Deck-Pfade führen nach /guides.

    Drop
  3. Terminal-Bench-Science 0.1 steht im Atlas — beste Zeile 30 %

    Stanfords und Laudes 70-Aufgaben-Science-Agent-Suite: echte Labor-Workflows, noch weit von der Decke. Claude Opus 5 + Claude Code führt mit 30,0 %; GPT-5.6 Sol + Codex liegt bei 22,4 %; GLM-5.3 ist die stärkste Open-Weight-Zeile mit 8,1 %. Nicht Terminal-Bench 2.1. /benchmarks/terminal-bench-science

    Drop
  4. GLM-5.3-Flash steht im Modell-Atlas — AA-Index 57,5

    Z.ais Flash-Geschwister von GLM-5.3, aus dem Artificial-Analysis-Snapshot vom 1. Sep.: Intelligence-Index 57,5 bei $0,15 / $0,50 pro 1M Tokens. Zwei Punkte hinter GLM-5.3 max bei einem Zehntel des Listenpreises. /models/glm-5-3-flash · /compare/models/glm-5-3-vs-glm-5-3-flash

    Drop
  5. GLM-5.3 steht im Modell-Atlas — AA-Index 59,5

    Z.ais Coding-Refresh vom August steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-24: Max-Effort-Intelligence-Index 59,5, API-Liste $1,40 / $4,40 pro 1M Tokens. Dieselbe Basis wie GLM-5.2; Weights waren bei dieser Prüfung noch unveröffentlicht. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 27B. /models/glm-5-3 · /compare/models/glm-5-3-vs-qwen3-8-27b

    Drop
  6. Qwen3.8 27B steht im Modell-Atlas — AA-Index 52

    Alibabas dichtes Open-Weight-Qwen3.8-Geschwister steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-24: Xhigh-Intelligence-Index 52, Hosted-Liste $0,50 / $3 pro 1M Tokens, Apache 2.0 auf Hugging Face. Das ist nicht gehostetes Qwen3.8 Max. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 Max. /models/qwen3-8-27b · /compare/models/qwen3-8-27b-vs-qwen3-8-max

    Drop

2026-W34

  1. GLM-5.3

    Gehostete API auf Artificial Analysis gelistet (Max-Effort-Index 59,5, $1,40 / $4,40 pro 1M Tokens).

    Modell

2026-W33

  1. Qwen3.8 2.4T steht im Modell-Atlas — AA-Index 57,7

    Alibabas Open-Weight-Qwen-Max-Klasse-MoE (2,4T gesamt / 95B aktiv) steht im Atlas aus dem Artificial-Analysis-Snapshot vom 2026-08-15: Intelligence-Index 57,7, Hosted-Liste $2 / $6 pro 1M Tokens. Das ist der veröffentlichte Checkpoint, nicht gehostetes Qwen3.8 Max. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit Qwen3.8 Max. /models/qwen3-8-2-4t-a95b · /compare/models/qwen3-8-2-4t-a95b-vs-qwen3-8-max

    Drop
  2. GLM-5.3

    GLM-5.3 im GLM Coding Plan angekündigt. Open Weights wegen Safety-Review verzögert.

    Modell
  3. Qwen3.8 27B

    Open Weights veröffentlicht. AA-Intelligence-Index 52 auf Xhigh; Hosted-Liste $0,50 / $3 pro 1M Tokens.

    Modell
  4. Gemini 3.6 Flash (high)

    Objektive Auffrischung: DeepMind-Karte 1M Kontext / 64K Output; Google-Einführungspreis $0,75 / $3,75; AA-High-Effort-Index 51,6.

    Modell
  5. Gemini 3.7 Flash

    Gemini 3.7 Flash allgemein verfügbar. AA-High-Effort-Intelligence-Index 56; Einführungspreis $0,75 / $3,75 pro 1M Tokens. Google meldet Zugewinne gegenüber 3.6 Flash auf FrontierCode 1.1, DeepSWE v1.1, WebDev Arena und GDP.pdf — Vendor-Claims, keine Ledger-Zeilen.

    Modell
  6. Gemini 3.7 Flash steht im Modell-Atlas — AA-Index 56

    Googles Flash-Arbeitspferd vom August steht im Atlas aus dem Artificial-Analysis-Snapshot: High-Effort-Intelligence-Index 56, Einführungspreis $0,75 / $3,75 pro 1M Tokens bis 31. Dez. 2026. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit 3.6 Flash oder Claude Sonnet 4.6. /models/gemini-3-7-flash · /compare/models/gemini-3-6-flash-vs-gemini-3-7-flash

    Drop
  7. A.X-K2

    A.X-K2 erscheint auf Artificial Analysis (Index 35,0, $0 / $0).

    Modell
  8. Grok 4.6

    Grok 4.6 erscheint auf Artificial Analysis (High-Effort-Index 60,9, $2 / $6 pro 1M Tokens).

    Modell
  9. Grok 4.6 steht im Modell-Atlas — AA-Index 60,9

    xAIs August-Flaggschiff steht im Atlas aus dem Artificial-Analysis-Snapshot: High-Effort-Intelligence-Index 60,9, $2 / $6 pro 1M Tokens. Ledger-Zeilen kommen von AA; redaktionelle Tiefe braucht noch einen Desk-Pass. Vergleich mit GPT-5.6 Sol. /models/grok-4-6 · /compare/models/gpt-5-6-sol-vs-grok-4-6

    Drop
  10. K-EXAONE 2.0 0803

    K-EXAONE 2.0 0803 erscheint auf Artificial Analysis (Index 31,0, $0 / $0).

    Modell
  11. Motif 3

    Motif 3 GA auf Artificial Analysis (Index 47,4). Open-Weight-MoE, 314B / 13,2B aktiv.

    Modell
  12. Qwen3.8 2.4T A95B

    Open Weights veröffentlicht. AA-Intelligence-Index 57,7; Hosted-Liste $2 / $6 pro 1M Tokens.

    Modell
  13. Solar Open2 250B

    Solar Open2 250B erscheint auf Artificial Analysis (Index 37,4, $0 / $0).

    Modell
  14. Nemotron 3.5 Lightning

    Nemotron 3.5 Lightning auf Artificial Analysis (Index 23,6, $0,05 / $0,20).

    Modell
  15. Muse Glimmer

    Muse Glimmer als Open Weight veröffentlicht (Apache 2.0, 30B). AA-High-Effort-Index 35,1; Hosted-Listenpreis $0,325 / $1,35 pro 1M Tokens.

    Modell

2026-W32

  1. Solar Pro 4

    Solar Pro 4 auf Artificial Analysis (Index 41,6, $0,30 / $1,20).

    Modell
  2. Muse Spark 1.2

    Muse Spark 1.2 erscheint auf Artificial Analysis (xhigh-Index 56,8, $1.25 / $4.25 pro 1M Tokens).

    Modell
  3. Qwen3.8 Max

    Qwen3.8 Max erscheint auf Artificial Analysis (damaliger Index 58,1, $2 / $6 pro 1M Tokens).

    Modell
  4. VerdictPal ist live — und der Atlas-Report legt Zahlen über den ganzen Atlas

    Die Launch-Notiz ist veröffentlicht, dazu eine neue eigene Datenfläche: der Atlas-Report berechnet aggregierte Zahlen zu Preisen, Datenschutz, Benchmark-Sättigung und Aktualität aus jedem veröffentlichten Tool — frei zitierbar mit Link. Befunde dieser Ausgabe: die meisten Dossiers halten überhaupt keine Haltung zum Training mit deinen Inhalten fest, bezahlte Einstiegstarife liegen dicht um den Mittelwert, und die Input-Preise der Frontier-Modelle gehen um mehr als drei Größenordnungen auseinander. /report · /launch

    Drop

2026-W29

  1. GPT-5.6 Luna

    Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und Benchmark-Evidenz aktualisiert.

    Modell
  2. GPT-5.6 Sol

    Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und anschließend Benchmark-Evidenz von Vals und Artificial Analysis aktualisiert.

    Modell
  3. GPT-5.6 Terra

    Allgemeine Verfügbarkeit in ChatGPT, Codex und der API erfasst und Benchmark-Evidenz aktualisiert.

    Modell

2026-W28

  1. AI-Builder-Design-Test auf der Lab-Bank — vier Builder, gleiche Prompts, sehr verschiedene Ergebnisse

    VerdictPals zweites First-Party-Protokoll: vier identische Multi-Turn-Design-Prompts durch Lovable, v0, Replit und Bolt. Lauf 01 notiert eine Turn-1-Rangfolge (Lovable → v0 → Replit → Bolt) und die Kosten bis zum Ergebnis in der jeweiligen Hersteller-Einheit — kein aufgefülltes Leaderboard, formale Score-Zeilen warten auf ein wiederholbares Rubric. /benchmarks/ai-builder-design-test · /benchmarks/lab

    Drop
  2. Grok 4.5

    Grok 4.5 erscheint auf Artificial Analysis (High-Effort-Index 53,8).

    Modell
  3. Citation-Fidelity-Protokoll v0.1 auf der Lab-Bank eingefroren

    VerdictPals erster First-Party-Benchmark im Lab: zwölf Forschungsfragen, dual-reviewer Zitierbewertung, eingefrorenes Runbook auf der Atlas-Seite — Protokoll veröffentlicht, Desk-Lauf noch ausstehend, kein aufgefülltes Leaderboard. /benchmarks/citation-fidelity · /benchmarks/lab

    Drop
  4. Claude

    Evidenz-Integritätsfix: falsches Upgrade auf editorial-hands-on zurückgenommen; Evidenz bleibt synthetisiert und qualityGate von flagship auf solid gemäß der redaktionellen Evidenzleiter zurückgestuft. Kein Desk-Hands-on-Versuch aktenkundig; benchmarkReady bleibt false.

    Tool

2026-W27

  1. Fünf Recherche-Guides jetzt im Atlas

    Zitier-Audit, Systematic-Review-Protokoll, Data-Cleaning-Pipeline, Grant-Writer-Pfad und Peer-Reviewer-Pfad — solide Guides mit Schrittblöcken und Verifikations-Checklisten.

    Drop
  2. GPT-5.6 Luna

    Öffentliche Preise aktualisiert: Luna ist mit $1 Input / $6 Output pro 1M Tokens gelistet.

    Modell
  3. GPT-5.6 Sol

    Öffentliche Preise aktualisiert: Sol ist mit $5 Input / $30 Output pro 1M Tokens gelistet, plus 1,25× Cache-Write-Billing und 90% Cached-Read-Rabatt.

    Modell
  4. GPT-5.6 Terra

    Öffentliche Preise aktualisiert: Terra ist mit $2,50 Input / $15 Output pro 1M Tokens gelistet.

    Modell
  5. OpenRouter

    LongCat-2.0-/Owl-Alpha-Release-Kontext ergänzt: Meituan identifizierte die OpenRouter-Stealth-Route als LongCat-gestützt, nachdem sie bereits ein volumenstarkes Coding-Modell war. Als Evidenz für Routing-Markt-Adoption behandeln, nicht als Datenschutz-Abkürzung oder unabhängig verifizierte Benchmark-Zeile.

    Tool
  6. Claude Sonnet 5

    Claude Sonnet 5 auf Artificial Analysis gelistet (Max-Effort-Index 53,4).

    Modell
  7. LongCat-2.0

    Meituan enthüllte LongCat-2.0 und identifizierte OpenRouters Stealth-Route Owl Alpha als LongCat-gestützt; GitHub/Hugging-Face-Seiten sagen, dass Modellgewichte bald folgen.

    Modell

2026-W26

  1. GPT-5.6 Luna

    Als schnellster und kosteneffizientester GPT-5.6-Tier vorgestellt.

    Modell
  2. GPT-5.6 Sol

    OpenAI hat GPT-5.6 Sol zusammen mit Terra und Luna als Preview vorgestellt.

    Modell
  3. GPT-5.6 Terra

    Als ausgewogener GPT-5.6-Tier vorgestellt.

    Modell
  4. Studenten-Recherche-Workflow in der Guides-Säule

    Pfad, Stack, Playbook und Showcase, um breite Prompts in quellenbasierte Briefings zu verwandeln — der Workflow, den wir neuen Leserinnen zuerst zeigen.

    Drop
  5. Factory-Flaggschiff-Dossier veröffentlicht

    Agenten-native Auslieferung mit Droid, Spec Mode, Missionen und Enterprise-Kontrollen — Fit 74 mit dokumentierten Autonomie- und Preis-Ausnahmen.

    Drop
  6. Cursor-Flaggschiff-Dossier veröffentlicht

    VS-Code-kompatibler KI-Editor bei Fit 81 — Tab, Chat, Agent, Privacy Mode, Team-Governance und Diff-Review-Fehlermodi, die wir vor dem Merge dokumentieren.

    Drop
  7. Gemini-Flaggschiff-Dossier veröffentlicht

    Googles multimodales Assistenten-Ökosystem bei Fit 75 — Suchfundierung, Deep Research, Speicher-Bundles und wo es keine zitierte Suchmaschine ist.

    Drop

2026-W25

  1. NotebookLM-Flaggschiff-Dossier veröffentlicht

    Quellengestützter Lese-Workspace bei Fit 78 — Korpus-Chat, Audio-Übersichten, Lernkarten und die leere-Korpus-Falle auf dem Dossier dokumentiert.

    Drop
  2. Perplexity-Flaggschiff-Dossier veröffentlicht

    Zitierte Such-Eingangstür bei Fit 72 — Consumer Pro/Max, Deep Research, Sonar-APIs und Fehlermodi für Bibliografien, die du nicht geöffnet hast.

    Drop
  3. Cursor

    Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. benchmarkReady bleibt absichtlich false, bis Agent-Diff-Safety-, Usage-Burn- und Privacy-Mode-Läufe vorliegen.

    Tool
  4. Factory

    Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. benchmarkReady bleibt absichtlich false, bis Spec-Mode-, Droid-Exec-Autonomie- und Enterprise-Control-Läufe vorliegen.

    Tool
  5. Gemini

    Audit zur Produktionsreife: editorsNote und die geprüften Preis-/Datenschutzdaten bestätigt. Keine redaktionellen Claims geändert; Bench-Zeilen bleiben ausdrücklich ausstehend, bis das Desk-Protokoll läuft (Next action in qualityGate.notes).

    Tool
  6. Perplexity

    Audit zur Produktionsreife: editorsNote und Preis-/Datenschutz-Prüfdaten bestätigt; Sonar-/Search-API-Token- plus Anfragegebühren-Zeilen an docs.perplexity.ai angeglichen. benchmarkReady bleibt bewusst false, bis Desk-Zitationsaudit und Sonar-Latenzläufe vorliegen.

    Tool
  7. Command Code

    Command-Code-Flaggschiff-Tool veröffentlicht — Terminal-Agent mit Taste-Lernen, Open-Model-Deals und vollständiger Preis-/Datenschutz-Recherche.

    Tool
  8. Command-Code-Flaggschiff-Dossier veröffentlicht

    Terminal-Coding-Agent mit taste-1-Lernen, Open-Model-Deals ab 1 $/Monat und vollständigem Preis- und Datenschutzbild — inklusive .commandcode/.

    Drop
  9. OpenCode

    OpenCode-Flaggschiff-Tool — OSS-Agent, Go/Zen-Preise, Plan-/Build-Modi und Zen-Datenschutz-Ausnahmen dokumentiert.

    Tool
  10. OpenCode-Flaggschiff-Dossier veröffentlicht

    Der Open-Source-Coding-Agent bei Fit 95 — Plan-/Build-Modi, Go- und Zen-Preise, 75+ Anbieter und Free-Model-Datenschutz-Ausnahmen dokumentiert.

    Drop
  11. Raycast

    Raycast als Flaggschiff-Tool für Knowledge work — der macOS-Launcher, den wir auf jedem Forschungs-Mac installieren würden, bevor wir über einen weiteren KI-Tab debattieren.

    Tool
  12. Raycast-Flaggschiff-Dossier veröffentlicht

    Der macOS-Launcher, den wir installieren, bevor wir über einen weiteren KI-Tab debattieren — Extensions, Quick AI, Zwischenablage und ehrliche Fehlermodi bei Fit 97.

    Drop

2026-W24

  1. GLM-5.2

    GLM-5.2 mit 1M-Kontext, 128K Max-Output, zwei Thinking-Modi und Long-Horizon-Coding-Fokus veröffentlicht. MIT-Open-Weights für die folgende Woche angekündigt.

    Modell
  2. Kimi K2.7 Code

    Kimi K2.7 Code mit 256K-Kontext, verpflichtendem Thinking-Modus, multimodalen Tool-Beispielen und berichteten 30 % weniger Reasoning-Token gegenüber K2.6 veröffentlicht.

    Modell
  3. Canva Business

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  4. ChatGPT

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  5. ChatPRD

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  6. Claude Fable 5

    Claude Fable 5 veröffentlicht — erstes GA Mythos-class-Modell.

    Modell
  7. Connected Papers

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  8. Consensus

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  9. Crossref

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  10. DeepSeek

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  11. ElevenLabs

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  12. Elicit

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  13. Exa

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  14. Firecrawl

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  15. Gamma

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  16. Google Scholar

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  17. Grammarly

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  18. Gumloop

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  19. Kagi

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  20. Linear

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  21. Litmaps

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  22. Lovable

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  23. Magic Patterns

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  24. Manus

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  25. Mendeley

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  26. Microsoft Copilot

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  27. Mistral Le Chat

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  28. Mobbin

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  29. n8n

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  30. Obsidian

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  31. OpenAlex

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  32. OpenRouter

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  33. Overleaf

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  34. Paperpile

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  35. PostHog

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  36. Rayyan

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  37. Replit

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  38. Research Rabbit

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  39. Scholarcy

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  40. Scira AI

    Preisbelege von scira.ai/about und api.scira.ai/pricing aktualisiert, maschinenlesbare Preisstufen ergänzt und die Benchmark-Evidenz für das öffentliche Dossier als bereit markiert. Einzelne Desk-Benchmark-Zeilen bleiben explizit dazu, welche Live-Läufe noch fehlen.

    Tool
  41. Scite

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  42. Semantic Scholar

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  43. Warp

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  44. Wispr Flow

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  45. You.com

    Converted imported Notion research into a full flagship-ready dossier template with metrics, panes, pricing deck, scenarios, benchmark rows, and comparison slices.

    Tool
  46. Zotero

    Importierte Notion-Recherche in ein vollständiges flagship-fähiges Dossier-Template mit Metriken, Panes, Preisdeck, Szenarien, Benchmark-Zeilen und Vergleichsschnitten umgewandelt.

    Tool
  47. Förderantrag-Set (archiviert)

    Der Förderantrag-Pfad ist zurückgezogen. Akademische Guides leben jetzt als drei Trilogien: studentische Recherche, Literaturreview und Peer-Review.

    Drop

2026-W23

  1. ChatGPT

    ChatGPT ist das Baseline-Tool für allgemeine Assistenten, muss aber als Familie von Oberflächen gelesen werden: Consumer-ChatGPT, Business-/Enterprise-Workspaces, Codex-/Agenten-Funktionen und die separate OpenAI-API. Die Stärke ist Breite — Entwürfe, Dateiarbeit, multimodale Analyse, Coding, Agenten und Erweiterungen — das Risiko ist, dass flüssige Ausgabe schwache Quellen, Datenschutzannahmen oder Planlimits unsichtbar macht.

    Tool
  2. Claude

    Claude ist das Tool für sorgfältiges Entwerfen und langen Kontext. Die aktualisierte Evidenz bestätigt die Kernspur: nuanciertes Umschreiben, Dokumentenanalyse, Projects, Artifacts, Research, Claude Code, Cowork, Websuche und Organisationssuche/Connectoren. Das redaktionelle Risiko ist Quota- und Oberflächenverwirrung: Consumer Pro/Max, Team, Enterprise und API-/Tool-Preise sind deutlich verschiedene Produkte.

    Tool
  3. Connected Papers

    Connected Papers bleibt die saubere visuelle Literaturkarte. Besonders nützlich zur Orientierung um ein Seed-Paper, aber die Kernlimitation bleibt methodisch: ein Graph ist kein reproduzierbarer Suchkorpus.

    Tool
  4. Consensus

    Consensus bleibt die behauptungsförmige akademisches Q&A-Tool. Am stärksten, wenn der Nutzer eine Forschungsfrage hat und schnell zitierte Orientierung braucht.

    Tool
  5. Crossref

    Crossref ist wissenschaftliche Infrastruktur, keine glänzende Discovery-App. Es bleibt das DOI-Metadaten-Verifikations-Tool.

    Tool
  6. Cursor

    Cursor bleibt das Flaggschiff unter den KI-nativen Code-Editoren, muss aber drei Trennungen betonen: Editor-Workflow versus Headless-Agenten, individuelle Nutzungspools versus Team-/Enterprise-Governance, und Privacy Mode versus gewöhnlichen Provider-Transit. Cursor ist stark für repo-lokale Tab-, Chat-, Agent-, MCP-, Cloud-Agent- und Bugbot-Workflows, aber nur wenn Diffs geprüft und Tests laufen.

    Tool
  7. DeepSeek

    DeepSeek is the low-cost reasoning/API tool. This pass sharpens the key facts: DeepSeek’s API is OpenAI- and Anthropic-compatible, current V4-Flash/V4-Pro pricing is extremely low, context length is listed at 1M, and legacy deepseek-chat / deepseek-reasoner names are being deprecated. The low price is real, but the editorial warning is bigger than usual: privacy, residency, institutional policy, and geopolitical availability need explicit review.

    Tool
  8. ElevenLabs

    ElevenLabs ist das Sprach- und Audio-KI-Tool. Die Produktqualität kann Ergebnisse ausgereift erscheinen lassen.

    Tool
  9. Elicit

    Elicit ist nicht länger nur ein Paper-Such-Assistent; es positioniert sich als Evidenzsynthese-System für Berichte, systematische Reviews, dynamisches Screening, Extraktion und satzgenaue Zitationen über einen sehr großen wissenschaftlichen Korpus hinweg. Die reichhaltigeren Daten tragen ein Dossier mit höherer Konfidenz, aber die Empfehlung hängt weiter an der benchmarkten Extraktionsgenauigkeit gegen eine handcodierte Tabelle.

    Tool
  10. Exa

    Exa is one of the cleanest „Suche als Infrastruktur“-Dossiers in the VerdictPal stack. The current pricing and docs make the value clearer: real-time search, webpage text/highlights, configurable latency, contents retrieval, Answer endpoint, Deep Search, Monitors, and Agent runs. The core risk is economic and privacy-boundary creep when agents fan out across many searches, contents calls, summaries, and enrichment steps.

    Tool
  11. Factory

    Factory ist das agent-native Software-Delivery-Tool. Am stärksten, wenn die Aufgabe größer ist als Autocomplete: Repo-Verständnis, im Spec Mode geplante Refactorings, Delegation an Terminal/IDE, Hintergrund-Agenten, SDK-Nutzung und CI-artige Droid-Exec-Workflows. Dieser Durchlauf ergänzt aktuelle Factory/Droid-Quellendetails von 2026 und schärft die Enterprise-/Sicherheitsgrenze.

    Tool
  12. Firecrawl

    Firecrawl ist das Web-Extraktions-Infrastruktur-Tool. Sollte als Kontext-Extraktion für Agenten und Forschungspipelines beschrieben werden, nicht als generische Suchmaschine.

    Tool
  13. Gamma

    Gamma ist das KI-Präsentations- und Visual-Document-Erstdraft-Tool. Die Preis- und Datenschutzseiten waren beim Laden nicht erreichbar.

    Tool
  14. Gemini

    Anhand offizieller Google-Seiten vertieft: Preise für Consumer (AI Plus/Pro/Ultra), Workspace-Add-on, kostenpflichtige Gemini API und Vertex AI; Datenschutzsprache für Consumer vs. API vs. Workspace/Vertex; Fähigkeitsliste auf die aktuelle Gemini-App- plus API-Oberfläche aktualisiert.

    Tool
  15. Google Scholar

    Google Scholar bleibt die akademische Such-Baseline: breit, vertraut, schnell und nützlich zum Finden bekannter Einträge, PDFs, Bibliothekslinks, Zitationsspuren, Alerts und Rechtsprechung. Die Schwäche ist methodische Intransparenz. Es sollte als Entdeckungs- und Zitationsverfolgungs-Gewohnheit empfohlen werden, nicht als reproduzierbare Suchstrategie für sich.

    Tool
  16. Grammarly

    Grammarly ist das Überarbeitungsdurchlauf-Tool, nicht das Argument-Schreib-Tool. Dieser Durchlauf aktualisiert das Tool für Grammarly Pro und Superhuman-Suite.

    Tool
  17. Gumloop

    Gumloop ist das No-Code-KI-Workflow- und Agent-Automation-Tool. Basiert auf primären Preis- und Datenschutzseiten plus offiziellen Produkt-/Suchergebnissen.

    Tool
  18. Kagi

    Kagi ist das Paid-Search-Tool: eine nutzerfinanzierte, werbefreie Suchmaschine mit ernsthafter Datenschutz-Technik und nützlicher Assistant-Funktionalität.

    Tool
  19. Litmaps

    Litmaps ist das Citation-Map-plus-Monitoring-Tool. Wertvoll, wenn Nutzer von Seed-Papern ausgehen und vernetzte Arbeiten entdecken, visualisieren und überwachen wollen.

    Tool
  20. Mendeley

    Mendeley ist der Elsevier-gestützte Cloud-Sync-Referenzmanager mit zunehmend KI-geprägten Bibliotheksfunktionen.

    Tool
  21. Microsoft Copilot

    Microsoft Copilot ist ein Familienname-Dossier, kein Einzelprodukt-Dossier. Dieser Pass nutzt Microsoft-Learn-Seiten zu Microsoft 365 Copilot und Copilot-Chat-Datenschutz plus Microsoft-Preis-Suchergebnisse. Die redaktionelle Aufgabe ist, Consumer Copilot, Microsoft 365 Copilot Chat, bezahltes Microsoft 365 Copilot und Azure/OpenAI-Entwicklerpfade zu trennen.

    Tool
  22. Mistral Le Chat

    Mistral Le Chat ist is the EU-headquartered assistant comparison tool. This pass strengthens the privacy and API boundary: Le Chat inputs/outputs are retained until account/conversation deletion, API inputs/outputs are generally kept for 30 rolling days for abuse monitoring unless zero data retention is activated, and Agents/Fine-tuning have separate retention rules. That makes Mistral useful to compare against US-default assistants, but not automatically compliant.

    Tool
  23. n8n

    n8n ist das Research-Ops-Automatisierungs-Tool. Am stärksten, wenn ein Team sichtbaren Workflow-Kleber über APIs, Webhooks, Datenbanken, KI-Schritte, Notion und Alerts benötigt.

    Tool
  24. NotebookLM

    NotebookLM bleibt das Flaggschiff für quellengestützte Workspaces. Der stärkste VerdictPal-Rahmen ist nicht „KI-Suche“, sondern ein Lese-Workspace, der beim Korpus beginnt: Quellen hochladen oder entdecken, geerdete Fragen stellen, Lernartefakte erzeugen und Behauptungen an Zitationen prüfen. Dieser Durchgang ergänzt aktuelle Enterprise-, Workspace- und Google-AI-Planunterschiede, damit die Datenschutzgeschichte klarer ist.

    Tool
  25. Obsidian

    Obsidian ist das Local-First-Wissensdatenbank-Tool. Das wichtige Update: Obsidian ist jetzt sowohl für die Arbeit als auch privat kostenlos; Sync und Publish bleiben optional.

    Tool
  26. OpenAlex

    OpenAlex ist das offene wissenschaftliche Graph-Tool. Sie sitzt zwischen Crossref und Semantic Scholar: breitere Discovery als DOI-Registry, reproduzierbarer als geschlossene Suchprodukte.

    Tool
  27. OpenRouter

    OpenRouter ist das Model-Router-Tool. Nützlich, wenn ein Entwickler eine OpenAI-kompatible API-Oberfläche für viele LLMs, Fallback-Routing, Modellvergleiche und BYOK möchte.

    Tool
  28. Overleaf

    Overleaf ist das kollaborative LaTeX-Tool. Dieser Durchlauf aktualisiert das Tool mit aktuellen Plan-Nachweisen: KI-Kontingent, Mitarbeiterlimits und 24x-Kompilierzeit.

    Tool
  29. Paperpile

    Paperpile ist der Convenience-First-Referenzmanager für Google Docs und browser-natives Schreiben. Exzellente Google-Docs- und PDF-Workflow-Abdeckung, aber Tradeoffs bei bibliographischer Tiefe.

    Tool
  30. Perplexity

    Perplexity bleibt der Maßstab für zitierte Antworten in der Consumer-KI-Suche, aber das Tool muss Perplexity jetzt als zwei verwandte Produkte behandeln: die Consumer-Antwortmaschine und die API-Plattform. Das Consumer-Produkt taugt für schnelle Quellenvorschauen und Deep-Research-Entwürfe; die API-Plattform ist eine separate Entwickleroberfläche mit Sonar-, Search-, Agent- und Embeddings-APIs. Die harte redaktionelle Regel bleibt: Zitationen sind Spuren, keine bibliografiefertige Evidenz.

    Tool
  31. PostHog

    PostHog ist das Produktanalyse- und Experimentier-Stack-Tool. Sie gehört in VerdictPal, weil Produktanalyse, Session Replay, Feature Flags und Experimente sich mit Forschungs- und Produkt-Ops überschneiden.

    Tool
  32. Rayyan

    Rayyan ist ein fokussierter Systematic-Review-Screening-Workspace mit stärkeren Plan-Mechaniken.

    Tool
  33. Replit

    Replit ist das browserbasierte KI-Build-and-Deploy-Tool. Nützlich, wenn ein Nutzer einen Ort für Ideenfindung, Agent-Building, Datenbank, Hosting, Zusammenarbeit und Publishing möchte.

    Tool
  34. Research Rabbit

    Research Rabbit ist das visuelle Explorations-Dossier zum Spurensuchen. Es gehört neben Connected Papers und Litmaps, betont aber adaptive Exploration, Sammlungen und wie Paper, Autor:innen und Konzepte zusammenhängen. Dieser Pass ergänzt aktuelle Feature-Sprache, Datenquellen-Hinweise und eine klarere Privacy-/Methodengrenze.

    Tool
  35. Scholarcy

    Scholarcy ist das Paper-Überflug- und strukturierte-Zusammenfassungs-Tool. Kann Zeit für Triage, Accessibility und Organisation sparen, muss aber als Lesehilfe geprüft werden.

    Tool
  36. Scira AI

    Scira bleibt das VerdictPal-Flaggschiff-Template, weil es eine zitierte Such-UI, eine Open-Source-AGPL-Codebase, gehostete Free/Pro/Max-Pläne, eine API-Plattform, eine MCP-Oberfläche und eine tiefe Dossier-Struktur verbindet. Dieser Durchgang ersetzt veralteten und kaputten Seiteninhalt durch ein saubereres Dossier, das sich benchmarken lässt, und hält die Kernhaltung: starke öffentliche Empfehlung, aber benchmark-ready bleibt false, bis die ausstehenden Desk-Zeilen wirklich laufen.

    Tool
  37. Scite

    Scite ist das Zitationskontext-Tool. Wertvoll, weil sie eine bessere Frage stellt: Haben spätere Paper die Behauptung gestützt, kontrastiert oder nur erwähnt?

    Tool
  38. Semantic Scholar

    Semantic Scholar bleibt eine Flagship-akademische-Suchschicht, weil sie eine kostenlose wissenschaftliche Such-UI mit TLDRs, Autorenseiten, Alerts und Entwickler-API kombiniert.

    Tool
  39. Warp

    Warp ist das agentische Terminal/Workspace-Tool. Überzeugend, weil sie Coding-Agenten ins Terminal bringt.

    Tool
  40. You.com

    You.com sollte primär als Web-Search-API-Plattform für KI-Entwickler betrachtet werden.

    Tool
  41. Zotero

    Zotero bleibt der stärkste Local-First-Standard für studentisches und akademisches Referenzmanagement. Die neuen Datenpunkte verstärken die Kernpositionierung: Der Desktop-Workflow funktioniert ohne Konto, Sync ist optional und standardmäßig deaktiviert, bezahlter Speicher finanziert ein Nonprofit-Projekt, und das hauptsächliche redaktionelle Risiko ist nicht die Fähigkeit, sondern Governance um Sync, Anhänge, Plugins und Gruppenbesitz.

    Tool
  42. Canva Business

    Aus der Notion-Tool-Pipeline importiert; Scira-Gate-Status auf solid korrigiert.

    Tool
  43. ChatPRD

    Notion-State-of-Art-Recherche importiert und redaktionelle Eignung gesenkt, um schwache Desk-Nützlichkeit plus Teams-gesicherte Linear-Integration widerzuspiegeln.

    Tool
  44. Linear

    Aus der Notion-Tool-Pipeline importiert; Scira-Gate-Status auf solid korrigiert.

    Tool
  45. Lovable

    Aus der Notion-Tool-Pipeline importiert; Scira-Gate-Status auf solid korrigiert.

    Tool
  46. Magic Patterns

    Aus der Notion-Tool-Pipeline importiert; Scira-Gate-Status auf solid korrigiert.

    Tool
  47. Manus

    Notion-State-of-Art-Felder importiert und Scira-Gate-Status auf Solid korrigiert.

    Tool
  48. Mobbin

    Aus der Notion-Tool-Pipeline importiert; Scira-Gate-Status auf solid korrigiert.

    Tool
  49. Wispr Flow

    Aus der Notion-Tool-Pipeline importiert; Scira-Gate-Status auf solid korrigiert.

    Tool
  50. Dark Mode für das Evidence Instrument überarbeitet

    Dunkle Oberflächen nutzen jetzt gedämpftes Amber, lesbare Ränder und komponentenspezifische Overrides statt Neon-Panels und invertierter Cream-Panels.

    Drop
  51. Trusted-Source-Briefing-Workflow veröffentlicht

    Die Guides-Säule hat jetzt einen echten Recherchepfad, Tool-Stack, Playbook und Showcase, um breite Prompts in quellenbasierte Briefings zu verwandeln.

    Drop
  52. Claude Mythos Preview

    Claude-Mythos-Research-Preview veröffentlicht — Spitze bei Vals (73,42 %) und SWE-bench Verified (93,9 %, Best-of-3).

    Modell

2026-W22

  1. MiniMax M3

    MiniMax M3 veröffentlicht — Terminal-Bench 2.0 66,0 %, 1M-Kontext.

    Modell
  2. Claude Opus 4.8

    Claude Opus 4.8 veröffentlicht — Spitze bei Vals (70,17 %) und AA (61,4).

    Modell

2026-W21

  1. Qwen 3.7 Max

    Qwen 3.7 Max veröffentlicht — AA-Index 56,6, Terminal-Bench 2.0 69,7 %.

    Modell
  2. Gemini 3.5 Flash

    Gemini 3.5 Flash veröffentlicht — MCP-Atlas-Spitze (83,6 %), 1M-Kontext, günstigster Frontier-Preis.

    Modell

2026-W18

  1. Grok 4.3

    Grok 4.3 mit 2M-Kontext und Echtzeit-X-Suche veröffentlicht.

    Modell

2026-W17

  1. DeepSeek V4 Pro Max

    DeepSeek V4 Pro Max mit Open Weights und Frontier-Coding-Scores veröffentlicht.

    Modell
  2. GPT 5.5

    GPT 5.5 mit nativem Audio, Bild und 512K-Kontext veröffentlicht.

    Modell
  3. GPT-5.5 Pro

    GPT-5.5 Pro veröffentlicht — Premium-Stufe, $30/$180, Responses API.

    Modell
  4. Kimi K2.6

    Kimi K2.6 veröffentlicht — Vals #5 bei 55,55 %, GPQA Diamond 90,5 % (Open-Source-Spitze).

    Modell

2026-W16

  1. Claude Opus 4.7

    Claude Opus 4.7 veröffentlicht — 13 % Coding-Steigerung, 3× Produktionsaufgaben, 3,75 MP Vision.

    Modell
  2. Claude Opus 4.8

    Claude Opus 4.7 für allgemeine Verfügbarkeit ausgemustert.

    Modell

2026-W15

  1. GLM-5.1

    GLM-5.1 mit 200K-Kontext, 128K Max-Output, Long-Horizon-Coding-Fokus und MIT-lizenzierten Open Weights veröffentlicht.

    Modell

2026-W14

  1. Qwen 3.7 Max

    Qwen 3.7 Plus für allgemeine Verfügbarkeit ausgemustert.

    Modell

2026-W12

  1. GPT-5.4 Mini

    GPT-5.4 Mini veröffentlicht — bestes Preis-/Leistungs-Verhältnis, $0,75/$4,50.

    Modell
  2. GPT-5.4 Nano

    GPT-5.4 Nano veröffentlicht — Budget-Stufe, $0,20/$1,25.

    Modell

2026-W11

  1. MiniMax M3

    MiniMax M2.7 als Flaggschiff-Open-Weights-Modell ausgemustert.

    Modell

2026-W10

  1. GPT 5.4

    GPT 5.4 veröffentlicht — AA-Index 56,8, Terminal-Bench 2.0 81,8 % (ForgeCode).

    Modell
  2. GPT 5.5

    GPT 5.4 für allgemeine Verfügbarkeit ausgemustert.

    Modell
  3. GPT-5.4 Pro

    GPT-5.4 Pro veröffentlicht — Premium-Stufe, $30/$180.

    Modell
  4. Grok 4.3

    Grok 4.20 aus der allgemeinen Verfügbarkeit ausgemustert.

    Modell

2026-W08

  1. Gemini 3.1 Pro

    Gemini 3.1 Pro veröffentlicht — AA-Index 57,2, ARC-AGI-2 77,1 %.

    Modell
  2. Claude Sonnet 4.6

    Claude Sonnet 4.6 veröffentlicht — Vals #3 bei 60,30 %, 1M-Kontext, $3 / $15.

    Modell

2026-W07

  1. DeepSeek V4 Pro Max

    DeepSeek V3.2 als Flaggschiff-Open-Weights-Modell ausgemustert.

    Modell

2026-W06

  1. Claude Opus 4.6

    Claude Opus 4.6 veröffentlicht — erstes Opus mit 1M-Kontext, 128K-Output, Agent-Teams.

    Modell

2025-W50

  1. GPT 5.4

    GPT 5.2 für allgemeine Verfügbarkeit ausgemustert.

    Modell
  2. GPT-5.2

    GPT-5.2 veröffentlicht — 410K-Kontext, konfigurierbares Reasoning, $1,75/$14.

    Modell

2025-W48

  1. Claude Opus 4.5

    Claude Opus 4.5 veröffentlicht — bestes Coding- und Agent-Modell bei Launch, $5/$25.

    Modell

2025-W40

  1. Claude Haiku 4.5

    Claude Haiku 4.5 veröffentlicht — Speed-Stufe, $1/$5, 200K-Kontext.

    Modell
Pack-Drops-Feed