Die führenden LLM-Anbieter 2026 im großen Vergleich: Modelle, Features, Abos und API-Kosten
Die führenden LLM-Anbieter 2026 im großen Vergleich
Welche KI ist die beste?
Es gibt keine beste KI — es gibt eine beste je Aufgabe. Das ist keine Ausweichantwort, sondern die einzige, die trägt: Die Modelle unterscheiden sich inzwischen weniger in der allgemeinen Qualität als darin, wofür sie gebaut und wie sie betrieben werden.
Die Kurzantwort, falls du nur diesen Abschnitt liest:
| Einsatzfall | Empfehlung | Warum |
|---|---|---|
| Programmieren | Anthropic Claude oder ein spezialisiertes Coder-Modell | stärkste Ergebnisse bei längeren Codezusammenhängen |
| Lange Dokumente | Google Gemini | größtes Kontextfenster im Feld |
| Breites Ökosystem, viele Werkzeuge | OpenAI | die meisten Anbindungen und Bibliotheken |
| Datenschutz, Daten bleiben im Haus | lokal betriebenes Modell (Llama, Qwen, Mistral) | keine Übertragung an Dritte |
| Europäischer Anbieter | Mistral | Betrieb in der EU, DSGVO-nah |
| Preis pro Token | ein kleines Modell des jeweiligen Anbieters — GPT-5.6 Luna, Gemini Flash-Lite, DeepSeek-V4.1-Flash | deutlich günstiger bei vergleichbarer Qualität für einfache Aufgaben |
| Aktuelle Ereignisse | ein Modell mit Websuche | ohne Nachschlagen ist jedes Modell auf seinen Trainingsstand begrenzt |
Stand 09/2026. Dieses Feld verändert sich schneller als jedes andere in diesem Blog — die Einordnung unten nennt die Kriterien, die Zeilen oben sind eine Momentaufnahme.
Woran ich das messe
Damit die Empfehlungen nachvollziehbar bleiben, hier die Kriterien offengelegt:
- Eigene Nutzung im Alltag, über mehrere Monate und mit denselben wiederkehrenden Aufgaben.
- Kontextlänge laut Modellkarte, nicht laut Ankündigung.
- Preisstruktur je Million Token, Eingabe und Ausgabe getrennt.
- Verfügbarkeit im EU-Raum und ob Eingaben zum Training verwendet werden.
- Veröffentlichte Vergleiche, mit der Einschränkung, dass sie kurzlebig sind und Modelle teils darauf optimiert werden.
Was ich nicht heranziehe: einzelne Bestenlisten ohne Angabe des Testverfahrens. Sie ändern sich wöchentlich und sagen über den eigenen Anwendungsfall wenig aus.
Wer mischt eigentlich ganz vorne mit?
Vor drei Jahren war die Sache noch übersichtlich: Es gab ChatGPT – und alle anderen. Heute? Da rennen ein gutes halbes Dutzend Anbieter um die Wette, jeder mit eigenem Flaggschiff, eigener Philosophie und eigenem Preismodell. Und ehrlich: Den Überblick zu behalten ist ein Vollzeitjob geworden. Kaum hast du dich für ein Modell entschieden, kommt der nächste Anbieter um die Ecke und behauptet, jetzt das schnellste, schlauste, günstigste Ding auf dem Planeten zu haben.
Genau deshalb gibt es diesen Artikel. Wir schauen uns die führenden Anbieter von Large Language Models an – wer sie sind, was ihre Modelle können, wofür sie sich eignen, was die Desktop-Software taugt, welche Abos es gibt und – ganz wichtig – was der Spaß über die API kostet. Am Ende gibt's eine Entscheidungshilfe und einen ehrlichen Blick auf das Thema Datenschutz.
Ein Hinweis vorweg: Stand ist September 2026. In diesem Markt veraltet alles unfassbar schnell. Modellnamen, Preise, Features – das kann sich innerhalb von Wochen ändern. Nimm die konkreten Zahlen also als gute Orientierung, nicht als in Stein gemeißelte Wahrheit. Bei einer echten Kaufentscheidung lohnt immer ein kurzer Blick auf die offizielle Seite des jeweiligen Anbieters.
Kurz zum Verständnis: Was unterscheidet die Modelle überhaupt?
Bevor wir in die einzelnen Anbieter eintauchen, ein paar Begriffe, die in diesem Artikel ständig auftauchen:
- Kontextfenster: Wie viel Text das Modell auf einmal „im Kopf" behalten kann, gemessen in Token (grob: 1 Token ≈ 0,75 Wörter). 1 Million Token sind rund 750.000 Wörter – also ganze Bücher oder komplette Codebasen auf einmal.
- Reasoning / Thinking: Modelle, die vor der Antwort „nachdenken", also Zwischenschritte durchgehen. Das kostet mehr Rechenzeit und Token, liefert bei kniffligen Aufgaben aber deutlich bessere Ergebnisse.
- Multimodalität: Ob das Modell außer Text auch Bilder, Audio, Video oder PDFs versteht.
- Agenten / Tool Use: Ob das Modell selbstständig Werkzeuge bedienen kann – im Browser klicken, Code ausführen, Dateien bearbeiten.
- API-Kosten: Was Entwickler pro 1 Million verarbeiteter Token zahlen, getrennt nach Input (was du reinschickst) und Output (was das Modell rausschreibt). Output ist fast immer deutlich teurer.
- Open Weights: Ob du die Modellgewichte herunterladen und selbst hosten darfst – wichtig für Datenschutz und Self-Hosting.
So, genug Vorrede. Schauen wir uns die Platzhirsche an.
OpenAI – der Platzhirsch mit dem größten Ökosystem
OpenAI ist der Anbieter, der den ganzen Hype 2022 losgetreten hat, und auch 2026 ist ChatGPT für die meisten Menschen das Synonym für KI schlechthin. Das größte Pfund: ein riesiges, reifes Ökosystem aus Modellen, Apps und Tools.
Die Modelle
Seit dem 3. September 2026 steht an der Spitze GPT-6 Astra – OpenAIs neues Flaggschiff für die schwierigsten End-to-End-Aufgaben: komplexes Reasoning, Coding, Computer Use, Recherche und Dokumentenerstellung. Es arbeitet mit einem Kontextfenster von 1,05 Millionen Token, bis zu 128.000 Token Ausgabe und einem Reasoning-Regler von „low" bis „max". Der Start lief gestaffelt: zuerst Unternehmenskunden im Daybreak-Programm, dann ChatGPT und API. Astra ist außerdem das erste Modell, das OpenAI in seinem Preparedness Framework auf der höchsten Stufe für Cyber-Fähigkeiten einordnet – die entsprechenden Funktionen sind deshalb beschränkt.
Darunter bleibt die GPT-5.6-Familie, die am 9. Juli 2026 allgemein verfügbar wurde, das Arbeitspferd: Sol für harte Probleme, Coding und langlaufende Agenten, Terra als ausgewogenes Alltagsmodell und Luna als schnelle, günstige Variante für hohes Volumen. Alle drei arbeiten mit gut 1 Million Token Kontext. Sol ist das Spitzenmodell in ChatGPT Plus; Luna ist seit dem 6. August 2026 das Standardmodell im kostenlosen Tarif und in ChatGPT Go.
Die Vorgänger laufen über die API weiter: GPT-5.5 samt GPT-5.5 Pro und darunter die günstigere GPT-5.4-Familie (Mini, Nano) für schnelle Massenaufgaben. In ChatGPT und Codex verabschiedet sich GPT-5.5 (samt GPT-5.5 Thinking) allerdings zum 14. Oktober 2026 – wer dort noch darauf sitzt, sollte auf GPT-5.6 wechseln.
Dazu kommt ein ganzer Werkzeugkasten an Spezialmodellen: Codex (ein dedizierter Programmier-Agent, der Dateien liest und schreibt und Shell-Befehle ausführt), Bildgenerierung (GPT-Image 2.5) und Voice-Modelle in Echtzeit (GPT-Live, GPT-Realtime). Den eigenständigen Browser-Agenten Operator führt OpenAI nicht mehr; Computer Use ist inzwischen ein Werkzeug von GPT-6 Astra über die Responses API.
Wofür geeignet?
GPT-6 Astra ist das Modell für die schwersten Aufgaben, Sol für komplexes Reasoning, agentisches Arbeiten und lange Aufgabenketten zum kleineren Preis, Terra der Allrounder für den Geschäftsalltag. Für hohes Volumen zu kleinem Preis greifst du zu Luna oder zur GPT-5.4-Familie (Mini, Nano). Codex ist eine der stärksten Lösungen für eigenständiges Programmieren.
Desktop-Software
Hier hat sich seit dem Frühjahr das meiste geändert: ChatGPT Atlas, OpenAIs eigener KI-Browser, wurde am 9. August 2026 eingestellt. Er kam nie über macOS hinaus — die lange angekündigte Windows-Fassung ist nie erschienen. Die Browser-Fähigkeiten, also Seitenzusammenfassung, Produktvergleich und der agentische Modus, der auch repetitive Aufgaben hartnäckig durchzieht, wandern stattdessen in ChatGPT und Codex. Wer mit Atlas gearbeitet hat, muss umziehen. Bleiben die klassischen ChatGPT-Desktop-Apps für Mac und Windows, in die diese Funktionen nach und nach einziehen.
Für wen?
Praktisch für alle: Privatnutzer über Free/Plus, Power-User über Pro, Entwickler über die API und Codex, Unternehmen über Team und Enterprise. Wenn du dich nicht entscheiden kannst und einfach das größte, am besten dokumentierte Ökosystem willst, machst du mit OpenAI selten etwas falsch.
Abos
| Plan | Preis (USD/Monat) | Kurz |
|---|---|---|
| Free | 0 $ | Basiszugang, seit August 2026 mit GPT-5.6 Luna |
| Go | 8 $ | Einsteiger, ebenfalls GPT-5.6 Luna |
| Plus | 20 $ | GPT-5.6 Sol, Sora, Basis-Codex; GPT-6 Astra nur in ChatGPT Work und Codex |
| Pro | 100 $ bzw. 200 $ | 5× bzw. 20× Plus-Limits, GPT-6 Astra als „GPT-6 Pro" im Chat, voller Codex, unbegrenzt Sora |
| Business/Team | 25 $/Nutzer | Team-Features, GPT-6 Astra |
| Enterprise | individuell | Compliance, Admin, Data Residency |
Ein Hinweis zur 200-$-Stufe: Seit dem 10. September 2026 nimmt OpenAI dort keine Neuabschlüsse und Upgrades mehr an, weil die Nachfrage nach Astra die Systeme überlastet. Bestehende Abos laufen weiter; ein Enddatum der Pause gibt es nicht.
API-Kosten (pro 1 Mio. Token)
| Modell | Input | Output |
|---|---|---|
| GPT-6 Astra | 10,00 $ | 50,00 $ |
| GPT-5.6 Sol | 4,00 $ | 20,00 $ |
| GPT-5.6 Terra | 2,00 $ | 12,00 $ |
| GPT-5.6 Luna | 0,20 $ | 1,20 $ |
| GPT-5.5 | 5,00 $ | 30,00 $ |
| GPT-5.5 Pro | 30,00 $ | 180,00 $ |
| GPT-5.4 | 2,50 $ | 15,00 $ |
| GPT-5.4 Mini | 0,75 $ | 4,50 $ |
| GPT-5.4 Nano | 0,20 $ | 1,25 $ |
Der Sol-Preis ist ein Aktionspreis, der seit dem 21. August 2026 gilt und mindestens bis zum 21. November 2026 zugesagt ist (vorher 5,00 $ / 30,00 $). Über die Batch-API gibt's rund 50 % Rabatt, und „cached input" (wiederkehrender Kontext) kostet nur ein Zehntel des Input-Preises. Achtung bei sehr langen Prompts: Ab 272.000 Eingabe-Token berechnet OpenAI für Astra und die 5.6-Familie einen Aufschlag – bei Sol das Doppelte auf den Input und das Anderthalbfache auf den Output.
Anthropic – der Liebling der Entwickler
Anthropic positioniert sich seit jeher über Zuverlässigkeit, Ehrlichkeit und Sicherheit – und hat sich damit besonders bei Entwicklern und Engineering-Teams einen Namen gemacht. Wenn es ums Programmieren und um langlebige Agenten geht, ist Claude für viele die erste Wahl.
Die Modelle
Das Lineup gliedert sich klar nach Leistung und Geschwindigkeit:
- Claude Fable 5.1 – das Spitzenmodell, seit dem 1. September 2026 verfügbar und von Anthropic für anspruchsvolles Reasoning und lange agentische Aufgaben empfohlen. Reasoning immer an, 1-Mio-Token-Kontext, 128k Token Ausgabe, Wissensstand Juni 2026. Der Vorgänger Fable 5 (Juni 2026) läuft als Altmodell weiter. Parallel führt die Preisliste Claude Mythos 5.1 zum selben Preis, aber nur in eingeschränkter Verfügbarkeit für ausgewählte Organisationen.
- Claude Opus 5 – seit dem 24. Juli 2026 verfügbar und in Anthropics eigener Empfehlung der Einstieg für die meisten Aufgaben, also für komplexes agentisches Coding und Unternehmensaufgaben, die das Modell über lange Strecken autonom durchzieht. 1-Mio-Token-Kontext, 128k Token Ausgabe – und das zum halben Preis von Fable 5.1. Es hat Opus 4.8 als Empfehlung abgelöst.
- Claude Sonnet 5 – das ausgewogene Preis-/Leistungsmodell, ebenfalls mit 1-Mio-Token-Kontext und spürbar günstiger als der Vorgänger Sonnet 4.6. Der als befristet angekündigte Einführungspreis ist seit September 2026 der reguläre Preis.
- Claude Haiku 4.5 – schnell und günstig für einfache Aufgaben, mit 200k Token allerdings deutlich kleinerem Kontextfenster.
Die Vorgänger Fable 5, Opus 4.8, 4.7 und 4.6 sowie Sonnet 4.6 sind weiter über die API erreichbar, führt Anthropic inzwischen aber als Altmodelle.
Das prägende Feature der aktuellen Generation ist Adaptive Thinking: Claude schätzt die Komplexität einer Aufgabe selbst ein und teilt seine „Denk-Leistung" dynamisch zu. Statt ein festes Token-Budget vorzugeben, wählst du als Entwickler nur noch ein Effort-Level (von niedrig bis maximal). Dazu kommen Vision, Computer Use (Claude bedient den Bildschirm), Artifacts (Code, Dokumente und interaktive Previews direkt im Chat), Projects, Memory, Skills und die durchgängige Unterstützung des offenen Model Context Protocol (MCP).
Wofür geeignet?
Coding ist die Kernstärke – hier gehört Claude zu den absolut führenden Modellen, vor allem wenn es darum geht, über viele Dateien hinweg den Überblick zu behalten und nicht versehentlich Nachbarmodule zu zerschießen. Außerdem: lange Dokumente, große Codebasen und autonome Agenten mit Selbstverifikation.
Desktop-Software
Hier hat Anthropic ein richtig starkes Angebot: die Claude Desktop App (Mac/Windows) als Chat-Client, Claude Code als Terminal-basierter Coding-Agent (plus VS-Code-Extension) und Claude Cowork – ein Agent mit der gleichen Architektur wie Claude Code, aber ohne Terminal, der in deinen Dateien und Ordnern arbeitet. Cowork ist dabei längst nicht mehr auf den Desktop beschränkt: Seit Juli 2026 läuft es auch im Browser und auf dem Handy, die Sitzungen laufen auf Anthropics Servern – eine Aufgabe läuft also weiter, auch wenn kein eigenes Gerät online ist. Der nächste Schritt ist seit dem 16. September 2026 im Gang: Anthropic führt Cowork und den Chat zu einem einzigen Claude zusammen. Du entscheidest nicht mehr, wo eine Aufgabe hingehört; Claude wählt selbst, ob es antwortet oder in deinen Dateien arbeitet. Der Rollout beginnt bei Pro und Max (Web, Desktop, Mobil), Team und Free folgen. Im selben Zug kommen Claude Docs, Slides und Design als Beta in die Konversation. Dazu Claude in Chrome, die Browser-Extension, die navigiert, klickt und Formulare ausfüllt – seit dem 26. August 2026 allgemein verfügbar in allen Bezahltarifen und inzwischen auch ohne Freigabe jeder einzelnen Aktion. Über MCP lässt sich Claude an nahezu beliebige Datenquellen und Tools anbinden.
Für wen?
Klar Entwickler und Engineering-Teams als Hauptzielgruppe. Über Cowork zunehmend auch Knowledge Worker, die ohne Terminal an Dateien arbeiten wollen. Und über die Enterprise-Schiene Unternehmen mit Compliance-Bedarf.
Abos
| Plan | Preis (USD/Monat) | Kurz |
|---|---|---|
| Free | 0 $ | Chat und Artifacts, kein Claude Code |
| Pro | 20 $ (17 $ jährlich) | Höhere Limits, Claude Code, Claude Cowork |
| Max 5× | 100 $ | 5× Pro-Nutzung, Priority-Zugang, Fable-Modelle inklusive |
| Max 20× | 200 $ | 20× Pro-Nutzung, Fable-Modelle inklusive |
| Team, Standardsitz | 25 $ (20 $ jährlich) | SSO, zentrale Admin, Claude Code |
| Team, Premiumsitz | 125 $ (100 $ jährlich) | Fable-Modelle inklusive |
| Enterprise | 20 $/Sitz jährlich plus Nutzung | Nutzung zu API-Preisen, Data Residency, Compliance |
Ab Pro ist Claude Code durchgängig enthalten, die Nutzungsmenge skaliert mit der Stufe – im Team-Tarif inzwischen in jedem Sitz, nicht mehr nur im Premiumsitz. Die Fable-Modelle sind die Ausnahme: In Max und im Premiumsitz sind sie bis zur Hälfte des Wochenkontingents enthalten, in Pro und im Standardsitz nur gegen zusätzliche Usage Credits, im Free-Tarif gar nicht.
API-Kosten (pro 1 Mio. Token)
| Modell | Input | Output |
|---|---|---|
| Claude Fable 5.1 | 10,00 $ | 50,00 $ |
| Claude Opus 5 | 5,00 $ | 25,00 $ |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ |
| Claude Haiku 4.5 | 1,00 $ | 5,00 $ |
Mit Prompt-Caching lassen sich die Kosten für wiederkehrenden Kontext drastisch senken – Cache-Reads kosten ein Zehntel des Input-Preises, bei Fable 5.1 sogar nur ein Vierzigstel (0,25 $) –, und die Batch-API gibt 50 % Rabatt. Für Opus 5 (und Opus 4.8) gibt es zusätzlich einen „Fast Mode", der die Ausgabe erheblich beschleunigt und dafür mit 10 $ / 50 $ je Million Token abgerechnet wird – also zum Fable-Preis.
Google Gemini – der Multimodalitäts- und Kontext-König
Google hat lange gebraucht, um in die Spur zu kommen, aber mit Gemini ist der Konzern voll da – und spielt vor allem zwei Trümpfe aus: riesige Kontextfenster und tiefe Integration in das gesamte Google-Universum.
Die Modelle
Die Modellbenennung ist 2026 ehrlich gesagt etwas verwirrend – inzwischen laufen die Reihen 2.5, 3.1, 3.5, 3.6, 3.7 und 3.8 nebeneinander –, aber im Kern:
- Gemini 3.8 Flash – seit dem 2. September 2026 das neue Arbeitspferd und von Google als bisher bestes Reasoning- und Coding-Modell des Hauses beworben. 1-Mio-Token-Kontext, dritte Flash-Generation innerhalb von sechs Wochen.
- Gemini 3.1 Pro – nominell weiterhin das Flaggschiff für höchste Intelligenz, komplexes Problemlösen und agentisches Coding. Es steht seit Monaten als Preview in der Preisliste.
- Gemini 3.7 Flash (in der API seit 13. August) und Gemini 3.6 Flash (21. Juli 2026) – die Vorgänger von 3.8 Flash, deutlich günstiger als das ältere 3.5 Flash.
- Gemini 3.5 Flash-Lite und Gemini 3.1 Flash-Lite – die günstigsten Varianten für hohes Volumen.
Bemerkenswert ist, was nicht kam: Gemini 3.5 Pro wurde im Mai 2026 auf der Google I/O für „nächsten Monat" angekündigt und ist Mitte September 2026 immer noch nicht da – auf DeepMinds Modellseite steht weiterhin „coming soon", in Preisliste und Changelog fehlt es. Stattdessen liefert Google im Sechswochentakt neue Flash-Modelle, und die Lücke zwischen Flash und Pro wird dabei immer kleiner. Wer Gemini als Coding-Modell einplant, nimmt derzeit 3.8 Flash.
Die Gemini-Modelle sind durchgehend multimodal – Text, Bilder, Audio, Video und PDF – und arbeiten in der Spitze mit einem 1-Mio-Token-Kontextfenster. Dazu kommt ein beeindruckendes Kreativ- und Agenten-Arsenal: Deep Research (ein autonomer Recherche-Agent, der dutzende Quellen liest und zitierte Reports schreibt), Veo für Videogenerierung mit Ton, „Nano Banana" für Bilder sowie ein Agent Mode, der im Chrome-Browser selbstständig Aufgaben erledigt.
Wofür geeignet?
Die Paradedisziplinen: extrem lange Kontexte (komplette Codebasen, riesige Dokumentensammlungen, stundenlange Videos), multimodale Aufgaben und alles, was tief in Google Workspace (Gmail, Docs, Sheets) eingebettet ist. Wenn dein Arbeitsleben ohnehin bei Google stattfindet, ist Gemini ein Selbstläufer.
Desktop-Software
Seit dem 10. September 2026 gibt es eine Gemini-App für Windows 10 und 11, die sich per Alt+Leertaste über jedes Fenster legt. Ansonsten ist Gemini überall dort, wo Google schon ist: in der Gemini App (Web, Android, iOS), als Gemini in Chrome (Seitenleiste, Seiten-Zusammenfassung, Auto Browse), tief in Workspace und zunehmend direkt im Android-/Pixel-Betriebssystem. Für Entwickler gibt es AI Studio und Vertex AI, dazu Tools wie NotebookLM und die agentische Entwicklungsumgebung Antigravity.
Für wen?
Privatnutzer und Workspace-Anwender über die Abos, Power-User über Pro, anspruchsvolle Kreative und Entwickler über die teureren Ultra-Tiers und die API.
Abos (EUR, offizielle Preise)
| Tier | Preis/Monat | Kurz |
|---|---|---|
| Free | 0 € | Gemini 3.6 Flash, begrenzter 3.1-Pro-Zugang, 15 GB |
| Google AI Plus | 4,99 € | 2× Limits, Videogenerierung, 400 GB |
| Google AI Pro | 21,99 € | 4× Limits, Gemini 3.1 Pro, Antigravity, Gemini in Gmail/Docs, 5 TB Speicher |
| Google AI Ultra | 99,99 € (5×) bzw. 219,99 € (20×) | Deep Think, Gemini Spark, ab 20 TB Speicher |
API-Kosten (pro 1 Mio. Token)
| Modell | Input | Output |
|---|---|---|
| Gemini 3.1 Pro (bis 200k) | 2,00 $ | 12,00 $ |
| Gemini 3.1 Pro (über 200k) | 4,00 $ | 18,00 $ |
| Gemini 3.8 Flash | 0,75 $ | 3,75 $ |
| Gemini 3.7 Flash | 0,75 $ | 3,75 $ |
| Gemini 3.6 Flash | 0,75 $ | 3,75 $ |
| Gemini 3.5 Flash | 1,50 $ | 9,00 $ |
| Gemini 3.5 Flash-Lite | 0,30 $ | 2,50 $ |
| Gemini 3.1 Flash-Lite | 0,25 $ | 1,50 $ |
Die Flash-Preise für 3.6, 3.7 und 3.8 sind Einführungspreise, die bis zum 31. Dezember 2026 gelten; ab Januar 2027 verdoppeln sie sich auf 1,50 $ / 7,50 $. Der Batch-Modus halbiert die Preise, und es gibt einen kostenlosen Tier im AI Studio fürs Ausprobieren. Bei sehr langen Prompts (über 200.000 Token) steigen die Preise gestaffelt. Separat berechnet wird die Anbindung an die Google-Suche: 5.000 Anfragen im Monat sind frei, danach kostet sie 14 $ je 1.000 Anfragen – ein Posten, den man bei Recherche-Anwendungen leicht übersieht.
SpaceXAI Grok – der Echtzeit-Spezialist mit Haltung
Elon Musks xAI – seit der Übernahme durch SpaceX im Februar 2026 und der Umbenennung im Juli 2026 offiziell SpaceXAI, die Adresse x.ai und der Produktname Grok bleiben – hat sich eine eigene Nische erarbeitet: Echtzeit-Zugriff auf die Plattform X (ehemals Twitter), eine eher ungefilterte, frechere Persönlichkeit und sehr aggressive Preise.
Die Modelle
Aktuelles Flaggschiff ist Grok 4.6, seit dem 12. August 2026 verfügbar und ausdrücklich auf langlaufende Agenten ausgelegt. Es hat ein 500.000-Token-Kontextfenster – also ein kleineres als seine eigenen Vorgänger – und liegt in unabhängigen Vergleichen auf Augenhöhe mit den Spitzenmodellen von OpenAI und Anthropic. Daneben läuft Grok 4.5 mit denselben Eckdaten sowie das ältere Grok 4.3 mit 1-Mio-Token-Kontext, das inzwischen die günstige Stufe im Angebot ist. Das Alleinstellungsmerkmal ist die Live-Integration in X – kein anderes großes Modell hat so direkten Zugriff auf aktuelle Social-Media-Daten. Dazu kommen Echtzeit-Websuche mit Quellen, ein Reasoning-Modus sowie Bild- und Videogenerierung über Grok Imagine.
Wofür geeignet?
Stark bei Echtzeit- und Trend-Recherche, aktuellen Ereignissen und allem, wo der Draht zu X hilft. Außerdem günstige agentische Workflows. Beim agentischen Coding hat Grok mit 4.6 deutlich aufgeholt – die Spitze teilen sich derzeit xAI, OpenAI und Anthropic, und wer vorn liegt, hängt stark von der Aufgabe ab. Für sehr lange Eingaben ist allerdings nicht mehr das Flaggschiff die richtige Wahl, sondern das ältere Grok 4.3 mit seinem größeren Kontextfenster.
Desktop-Software
Fürs Chatten ist Grok weiter am schwächsten aufgestellt: Einen offiziellen nativen Desktop-Client für Mac oder Windows gibt es auch im September 2026 nicht. Der empfohlene Weg bleibt die Web-App auf grok.com, dazu offizielle Apps für iOS und Android sowie die Integration direkt in X. Anders sieht es bei den Agenten aus: Grok Bot, seit dem 11. August 2026 in der Beta, sind autonome Agenten mit eigenem Cloud-Rechner, die sich in Werkzeuge einloggen und rund um die Uhr arbeiten – mit nativen Apps für macOS, Windows, Linux, iOS und Android. Seit dem 26. August 2026 sind sie in allen SuperGrok-Tarifen enthalten. Fürs Programmieren gibt es seit dem 25. Mai 2026 Grok Build, einen Coding-Agenten fürs Terminal.
Für wen?
Power-User und X-Nutzer, die Echtzeitdaten und einen lockereren Ton wollen, kostenbewusste Entwickler und Researcher/Journalisten.
Abos (USD/Monat, Richtwerte)
| Tier | Preis | Kurz |
|---|---|---|
| Free | 0 $ | Grok limitiert |
| X Premium | ca. 8 $ | Grok im X-Abo |
| SuperGrok | 30 $ | Voller Zugang, DeepSearch, Voice |
| SuperGrok Heavy | 300 $ | Höchste Limits, „Grok 4 Heavy" |
API-Kosten (pro 1 Mio. Token)
| Modell | Input | Output |
|---|---|---|
| Grok 4.6 | 2,00 $ | 6,00 $ |
| Grok 4.5 | 2,00 $ | 6,00 $ |
| Grok 4.3 | 1,25 $ | 2,50 $ |
Achtung bei der Staffelung: Ab 200.000 Token Eingabe verdoppeln sich die Preise, und zwar für die gesamte Anfrage, nicht nur für den Teil oberhalb der Schwelle. Auch nach der Anhebung mit Grok 4.6 ist das für ein Modell dieser Klasse günstig – grob die Hälfte dessen, was die Flaggschiffe der Konkurrenz kosten. Tool-Calls werden separat abgerechnet: Web-Suche und Code-Ausführung mit je 5 $ je 1.000 Aufrufe, Dateianhänge mit 10 $; die X-Suche wird seit dem 21. September 2026 nicht mehr je Aufruf, sondern je abgerufenem Post (5 $ je 1.000) und Profil (10 $ je 1.000) berechnet.
Meta Llama – das Open-Weights-Kraftpaket
Meta verfolgt einen ganz anderen Ansatz als die übrigen Anbieter: Statt ein geschlossenes Produkt zu verkaufen, veröffentlicht Meta seine Llama-Modelle als Open Weights – du kannst sie herunterladen, selbst hosten und anpassen. Das macht Llama zum Fundament für unzählige andere Anwendungen und Anbieter.
Die Modelle
Ein wichtiger Punkt vorweg: Llama ist bei Meta nicht mehr die vorderste Reihe. Auf Metas eigener Modellseite steht inzwischen die Muse-Familie vorn, Llama läuft dahinter weiter:
- Muse Spark 1.3 – das aktuelle Aushängeschild seit dem 2. September 2026, auf Programmieren und agentisches Arbeiten ausgelegt, 1-Mio-Token-Kontext, Eingabe von Text, Bild, Video und Dokumenten. Gegenüber 1.2 braucht es laut Meta beim Coding rund ein Fünftel weniger Tool-Aufrufe und ein Viertel weniger Token.
- Muse Glimmer – ein offenes Modell mit 30 Milliarden Parametern für lokale Agenten, also ausdrücklich dafür gedacht, auf gewöhnlicher Hardware dauerhaft mitzulaufen.
- Llama 4 Scout – mit bis zu 10 Mio. Token Kontext an der Spitze der Branche.
- Llama 4 Maverick – das stärkere Llama-Modell mit 1-Mio-Token-Kontext.
- Llama 4 Behemoth – das riesige Top-Modell, das bis heute nicht veröffentlicht wurde.
Ein „Llama 5" gibt es weiterhin nicht, auch wenn im Netz hartnäckig Meldungen darüber kursieren. Wer heute bei Meta nach offenen Gewichten sucht, landet eher bei Muse Glimmer als bei Llama.
Wofür geeignet?
Das große Plus ist Self-Hosting und Datenkontrolle: On-Premises-Betrieb, Forschung, Fine-Tuning auf eigene Daten und kostengünstige Inferenz über Cloud-Anbieter. Wer seine Daten nicht aus dem Haus geben will oder volle Kontrolle braucht, kommt an Open-Weights-Modellen wie Llama kaum vorbei.
Desktop-Software & Endnutzer
Für Endnutzer steckt inzwischen Muse Spark unter der Haube von Meta AI – integriert in WhatsApp, Instagram, Messenger und Facebook, dazu eine eigenständige Meta-AI-App, die Ray-Ban-KI-Brille und seit Kurzem eine Mac-App in der Beta. Neu daneben ist Muse als eigenständiger persönlicher Agent (seit dem 8. September 2026, zunächst nur in den USA): Er erledigt Aufgaben in einer eigenen virtuellen Maschine mit Browser, läuft auf iOS, Android und im Web und seit dem 18. September 2026 auch als Mac-App, die in Dateien, Kalender, Notizen und Mail auf dem Rechner arbeitet.
API-Kosten
Das hat sich gedreht: Meta hat mit der Meta Model API inzwischen eine eigene Pay-per-Token-Schnittstelle in der öffentlichen Vorschau, kompatibel zum OpenAI-SDK. Muse Spark (1.3, 1.2, 1.1) kostet dort 1,25 $ Input / 4,25 $ Output je Million Token, Cache-Treffer 0,15 $. Bemerkenswert ist der Contributor-Tarif für 0,10 $ / 0,20 $: Der Preisnachlass wird damit bezahlt, dass Meta deine Prompts und Antworten zum Training nutzen darf – für Geschäftsdaten also keine Option. Llama bekommst du weiterhin über Drittanbieter wie Groq (extrem schnell), Together AI oder Fireworks AI – meist im Bereich von 0,05 bis 0,90 $ pro 1 Mio. Token, je nach Modell und Anbieter. Für Endnutzer ist Meta One seit dem 15. September 2026 aus dem Test heraus und offiziell gestartet: Core für 7,99 $ und Premium für 19,99 $ im Monat, mit mehr Bild- und Videoerzeugung in den Meta-Apps; Preise und Verfügbarkeit variieren laut Meta je Region. Gelegenheitsnutzung bleibt kostenlos.
Für wen?
Entwickler und Unternehmen, die Open Weights und Self-Hosting wollen, die Forschung – und über die Meta-Apps schlicht Milliarden Endnutzer.
Mistral – die europäische Antwort mit DSGVO-Vorsprung
Wenn dir Datenschutz und europäische Souveränität wichtig sind, führt kaum ein Weg an Mistral AI vorbei. Das Pariser Unternehmen ist das einzige Frontier-AI-Labor mit Sitz in der EU – und das ist mehr als nur ein Marketing-Argument.
Die Modelle
Mistral hat ein breites, konsolidiertes Portfolio:
- Mistral Medium 3.5 – das leistungsstarke Mittelklasse-Flaggschiff, multimodal und auf agentisches Arbeiten und Coding ausgelegt.
- Mistral Large 3 – eines der größten Open-Weight-Modelle eines großen Labors, unter Apache 2.0.
- Mistral Small 4 – der Production-Default, der Reasoning, Vision und Coding in einem Modell vereint.
- Ministral 3 – kompakt für Edge-Geräte, in den Größen 3B, 8B und 14B.
- Dazu Spezialisten wie Codestral (Coding), Voxtral (Sprache), Mistral OCR (Dokumentenerkennung) und Shieldstral (Moderation).
Viele Modelle sind als Open Weights verfügbar und damit self-hostbar.
Der entscheidende Vorteil: Datenschutz
Hier spielt Mistral seinen Trumpf aus. Während EU-Datenresidenz bei OpenAI, Anthropic und Google ein zubuchbares Enterprise-Feature ist, ist sie bei Mistral der Standard: Daten liegen by default in der EU, US-Routing ist Opt-in statt Pflicht. Zwei Feinheiten sollte man kennen: Der globale API-Endpunkt macht keine Zusage zum Ort der Inferenz; wer sie garantiert in der EU haben will, nimmt den EU-Endpunkt mit 10 % Aufschlag. Und Zero Data Retention gibt es auf der API nur in Bezahltarifen auf Antrag und nur für zustandslose Aufrufe – nicht für Agents, Batch oder Dateien. Als EU-Anbieter unterliegt Mistral direkt dem EU AI Act. Für deutsche Behörden und datenschutzsensible Unternehmen ist das oft der ausschlaggebende Punkt.
Desktop-Software
Mistrals Chat-Oberfläche hieß bis zum Sommer 2026 Le Chat und firmiert seitdem als Vibe – ein Agent mit den Modi Vibe Chat, Vibe Work und Vibe Code. Es gibt sie als Web-App, für iOS und Android, als Kommandozeilenwerkzeug und als Erweiterung für VS Code und JetBrains. Einen offiziellen nativen Desktop-Client (Mac/Windows) gibt es allerdings weiterhin nicht – nur Community-Wrapper und Drittlösungen.
Für wen?
Europäische Unternehmen und Behörden mit Datenschutz- und Souveränitätsanforderungen, Entwickler (günstige API, gute Coding-Modelle, Open Weights) und datenschutzbewusste Endnutzer.
Abos (Vibe, ehemals Le Chat, USD/Monat)
| Plan | Preis | Kurz |
|---|---|---|
| Free | 0 $ | Frontier-Modelle, begrenzte Nachrichten, 10 $ API-Guthaben/Monat |
| Student | 5,99 $ | wie Pro, für verifizierte Studierende, 30 $ API-Guthaben/Monat |
| Pro | 14,99 $ | Höhere Limits, Deep Research, 15 $ API-Guthaben/Monat |
| Team | 24,99 $/Nutzer (mind. 50 $/Monat) | Shared Workspace, Admin |
| Enterprise | individuell | Private Deployment, SSO |
API-Kosten (pro 1 Mio. Token, Auswahl)
| Modell | Input | Output |
|---|---|---|
| Mistral Medium 3.5 | 1,50 $ | 7,50 $ |
| Mistral Large 3 | 0,50 $ | 1,50 $ |
| Mistral Small 4 | 0,15 $ | 0,60 $ |
Sehr preisaggressiv – und anders als bei den meisten Wettbewerbern stecken in den Vibe-Abos monatliche API-Guthaben, die sich über Studio, API und Vibe Code teilen lassen. Für kleine Projekte reicht das Pro-Abo damit oft schon als API-Zugang.
DeepSeek – der Preisbrecher aus China
DeepSeek hat die Branche Anfang 2025 aufgeschreckt, indem es bewiesen hat, dass man Top-Leistung auch zu einem Bruchteil der üblichen Kosten anbieten kann. Im August 2026 hat der Anbieter die Preise kräftig angehoben, im September mit einem neuen Modell wieder gesenkt – dazu gleich mehr.
Die Modelle
Aktuell sind DeepSeek-V4.1-Flash (seit dem 10. September 2026, günstiges Allzweckmodell) und DeepSeek-V4-Pro (mehr Leistung, fortgeschrittenes Reasoning), beide mit 1-Mio-Token-Kontext. V4.1-Flash hat V4-Flash abgelöst – alte Aufrufe landen automatisch beim neuen Modell –, versteht jetzt auch Bilder, steuert den Reasoning-Aufwand über einen Regler von 1 bis 100 und ist unter MIT-Lizenz als offene Gewichte erschienen: 552 Milliarden Parameter, von denen pro Token nur 8 bis 16 Milliarden aktiv sind. Ein V4.1-Pro ist angekündigt, ohne Termin. Die frühere Trennung zwischen Chat- und Reasoning-Modell ist aufgehoben – Thinking-Mode und Tool-Calls stecken in einem einheitlichen Modell.
Wofür geeignet?
Extrem günstige Inferenz bei großem Kontext, starkes Reasoning und Coding. DeepSeek ist der Liebling kostenbewusster Entwickler und der Open-Source-Community.
Die Preise – erst angehoben, dann wieder gesenkt
Zum 16. August 2026 hat DeepSeek die API-Preise deutlich erhöht und auf Haupt- und Nebenzeiten umgestellt. Die Nebenzeit-Rate liegt bei der Hälfte der Hauptzeit-Rate; als Hauptzeit gelten 01:00–04:00 und 06:00–10:00 UTC. Für V4-Pro gilt dieser Tarif unverändert weiter. Für das kleine Modell hat das neue V4.1-Flash die Karten neu gemischt: Beim Input ist es rund ein Drittel günstiger als sein Vorgänger nach der Erhöhung und damit wieder auf dem Niveau vor dem August, beim Output liegt es knapp unter dem Vorgänger, aber immer noch gut doppelt so hoch wie im Frühjahr.
| Modell | Input Nebenzeit | Output Nebenzeit | Input Hauptzeit | Output Hauptzeit |
|---|---|---|---|---|
| DeepSeek-V4.1-Flash | 0,15 $ | 0,60 $ | 0,30 $ | 1,20 $ |
| DeepSeek-V4-Pro | 0,66 $ | 1,98 $ | 1,32 $ | 3,96 $ |
Zum Vergleich: Das abgelöste V4-Flash kostete nach der Erhöhung 0,22 $ / 0,66 $ in der Nebenzeit und 0,44 $ / 1,32 $ in der Hauptzeit. Bei wiederkehrendem Kontext (Cache Hit) fällt der Input-Preis weiterhin auf wenige Cent. DeepSeek begründet die Zeitstaffelung damit, die Rechenkapazität gleichmäßiger auslasten zu wollen, und lenkt Entwickler so in die Nebenzeiten. Kurz war auch V4-Pro zur Disposition gestellt: Ab dem 14. September sollten seine Aufrufe auf V4.1-Flash umgeleitet werden; das hat DeepSeek nach drei Tagen wieder zurückgenommen, V4-Pro bleibt mit unveränderter Abrechnung erreichbar.
Damit ist DeepSeek zwar nicht mehr die Sensation, die es Anfang 2025 war – aber mit V4.1-Flash wieder ein ernsthafter Preiskandidat neben GPT-5.6 Luna und Gemini Flash-Lite, in der Nebenzeit sogar knapp darunter. Wer batchweise arbeitet, legt die Läufe in die Nebenzeit. Ein Consumer-Abo gibt es übrigens weiterhin nicht: Web-Chat und App sind gratis, bezahlt wird nur die API.
Der große Haken: Datenschutz
Und jetzt der Dämpfer. DeepSeek verarbeitet und speichert Daten in China. Unter dem chinesischen Geheimdienstgesetz können Behörden die Herausgabe von Nutzerdaten erzwingen. Mehrere EU-Datenschutzbehörden (allen voran Italiens Garante) haben Verfahren eingeleitet oder Verarbeitungsverbote verhängt, und zahlreiche Behörden weltweit haben den Dienst auf Dienstgeräten gesperrt. Für DSGVO-sensible oder geschäftliche Daten ist die offizielle China-API kritisch. Wer DeepSeek trotzdem nutzen will, sollte auf die Open Weights mit eigenem EU-Hosting setzen statt auf die China-Cloud.
Und sonst so? Drei Anbieter, die du kennen solltest
Neben den großen Modell-Laboren gibt es ein paar Anbieter, die einen anderen Weg gehen und für bestimmte Anwendungsfälle extrem nützlich sind.
Perplexity – die Antwort-Maschine
Perplexity ist keine reine Chat-KI, sondern eine Antwort-Engine: Sie kombiniert Live-Websuche mit sauberen Quellenangaben. Im Hintergrund laufen eine eigene Sonar-Modellfamilie und auf Wunsch Drittmodelle (GPT, Claude, Gemini). Dazu gibt es den KI-nativen Comet-Browser, der inzwischen kostenlos und auf allen großen Plattformen verfügbar ist. Das Pro-Abo kostet 20 $/Monat, darüber liegt Max mit 200 $/Monat. Neu seit dem 25. August 2026 ist Portable Computer: Perplexitys Agenten-Plattform läuft damit komplett lokal auf einem Linux-Rechner mit Nvidia-GPU ab 24 GB Grafikspeicher (Windows angekündigt), ohne Token-Kosten, aber nur mit Pro-, Max- oder Enterprise-Abo. Für Entwickler wichtig: Die klassische Sonar-API wird zum 27. September 2026 abgeschaltet, Ersatz ist die Agent API. Ideal für alle, die recherchieren und dabei nachvollziehbare Quellen brauchen.
Microsoft Copilot – KI direkt im Arbeitsalltag
Microsoft Copilot ist tief in Windows und Microsoft 365 (Word, Excel, PowerPoint, Outlook, Teams) integriert und läuft primär auf OpenAI-Modellen, ergänzt um Anthropic-Modelle und eigene Microsoft-Modelle. Für EU-Kunden gibt es dafür einen Admin-Schalter, der Claude in Word, Excel und PowerPoint freigibt – mit dem Hinweis, dass diese Verarbeitung außerhalb der EU-Datengrenze von Microsoft stattfindet. Für viele Unternehmen ist das der pragmatischste Einstieg, weil die KI genau dort sitzt, wo ohnehin gearbeitet wird. Bei den Tarifen hat Microsoft allerdings aufgeräumt: Das frühere Copilot Pro für 20 $ im Monat wurde eingestellt, der Support dafür lief zum 1. August 2026 aus; für Privatnutzer tritt Microsoft 365 Premium an seine Stelle – 19,99 $ im Monat, in Deutschland 22 € (oder 219 € im Jahr) für bis zu sechs Personen, wobei die KI-Funktionen nur dem Abo-Inhaber zustehen. Für Unternehmen kostet Microsoft 365 Copilot 30 $ je Nutzer und Monat bei jährlicher Zahlung, die Variante Copilot Business für kleinere Organisationen 21 $ – bis Ende 2026 vergünstigt auf 18 $. Ein passender Microsoft-365-Basisplan ist jeweils Voraussetzung.
Alibaba Qwen – der Open-Weights-Standard aus China
Qwen ist Chinas führende Open-Weights-Familie und für viele Teams der De-facto-Standard, wenn sie auf offenen Gewichten bauen wollen. Im August 2026 hat Alibaba hier gleich dreimal nachgelegt: Qwen3.8-Max, ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern (95 Milliarden aktiv), ist als offene Gewichte erschienen – zum ersten Mal für ein Modell dieser Größenklasse. Das Kleingedruckte lohnt sich: Die Cloud-Version bietet 1 Mio. Token Kontext und Text-, Bild- und Video-Eingabe; die offenen Gewichte verstehen nur Text, haben nativ 262k Token Kontext (erweiterbar auf 1 Mio.) und stehen unter einer eigenen Lizenz statt Apache 2.0. Daneben steht Qwen3.8-27B, ein kompaktes, auf einfaches Deployment ausgelegtes multimodales Modell unter Apache 2.0, und Ende August folgte Qwen3.8-Flash-Next, das Alibaba ausdrücklich als experimentelle Vorschau auf die Qwen4-Architektur bezeichnet: 125 Milliarden Parameter, davon nur 6 Milliarden aktiv, multimodal, unter Community-Lizenz. Für Self-Hosting ist Qwen damit derzeit die interessanteste Alternative zu Meta.
Der direkte Vergleich: API-Kosten der Flaggschiffe
Damit du ein Gefühl für die Größenordnungen bekommst – die Top-Modelle der großen Anbieter nebeneinander (Preise pro 1 Mio. Token):
| Anbieter / Modell | Input | Output | Kontext |
|---|---|---|---|
| GPT-5.5 Pro | 30,00 $ | 180,00 $ | 1 Mio. |
| GPT-6 Astra | 10,00 $ | 50,00 $ | 1 Mio. |
| Claude Fable 5.1 | 10,00 $ | 50,00 $ | 1 Mio. |
| Claude Opus 5 | 5,00 $ | 25,00 $ | 1 Mio. |
| GPT-5.6 Sol (Aktionspreis) | 4,00 $ | 20,00 $ | 1 Mio. |
| GPT-5.6 Terra | 2,00 $ | 12,00 $ | 1 Mio. |
| Gemini 3.1 Pro | 2,00 $ | 12,00 $ | 1 Mio. |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ | 1 Mio. |
| Mistral Medium 3.5 | 1,50 $ | 7,50 $ | 128k+ |
| Grok 4.6 | 2,00 $ | 6,00 $ | 500k |
| Muse Spark 1.3 | 1,25 $ | 4,25 $ | 1 Mio. |
| Gemini 3.8 Flash (bis Ende 2026) | 0,75 $ | 3,75 $ | 1 Mio. |
| DeepSeek-V4-Pro (Nebenzeit) | 0,66 $ | 1,98 $ | 1 Mio. |
| GPT-5.6 Luna | 0,20 $ | 1,20 $ | 1 Mio. |
Was sofort auffällt: Zwischen dem teuersten und dem günstigsten Modell in dieser Tabelle liegt beim Output-Preis der Faktor 150. Das heißt aber nicht, dass das günstigste Modell die beste Wahl ist – es heißt nur, dass du nicht für jede Aufgabe das teuerste Modell brauchst. Eine simple Klassifizierung oder Zusammenfassung läuft auf einem günstigen Modell genauso gut wie auf dem Flaggschiff, nur eben für einen Bruchteil des Preises.
Für wen eignet sich was? Die Entscheidungshilfe
Genug Tabellen. Wenn du dich fragst, womit du anfangen sollst, hier eine ehrliche Empfehlung nach Anwendungsfall:
„Ich will einfach einen guten, vielseitigen Assistenten." → ChatGPT (OpenAI) oder Gemini. Beide haben das reifste Endnutzer-Erlebnis, sind multimodal und gut dokumentiert. Wenn du im Google-Kosmos lebst, nimm Gemini; sonst ChatGPT.
„Ich programmiere und will den besten Coding-Assistenten." → Claude (Anthropic). Für agentisches Coding und das Arbeiten über viele Dateien hinweg ist Claude Code mit Opus 5 die Referenz. GPT-6 Astra mit Codex ist eine starke Alternative, Gemini 3.8 Flash ist Googles bestes Coding-Modell, und Grok hat mit 4.6 aufgeschlossen.
„Mir ist Datenschutz und EU-Konformität wichtig." → Mistral. EU-Sitz, EU-Datenresidenz als Standard, Open Weights für Self-Hosting. Für Microsoft-Häuser ist Copilot mit EU-Einstellungen ein gangbarer Weg.
„Ich brauche maximale Kontrolle und will selbst hosten." → Qwen3.8 oder Mistral (Open Weights), bei Meta inzwischen eher Muse Glimmer als Llama. Damit liegen deine Daten ausschließlich bei dir.
„Ich will so günstig wie möglich entwickeln." → Für günstige, schnelle Massenaufgaben GPT-5.6 Luna, Gemini Flash-Lite oder Mistral Small. DeepSeek ist mit V4.1-Flash preislich wieder in dieser Liga – in der Nebenzeit sogar davor –, aber den Datenschutz-Vorbehalt mitdenken. Für ein Top-Modell zum vergleichsweise kleinen Preis Grok 4.6 oder, solange der Aktionspreis gilt, GPT-5.6 Sol.
„Ich brauche aktuelle Echtzeit-Infos und Trends." → Grok (X-Integration) oder Perplexity (Recherche mit Quellen).
„Ich arbeite den ganzen Tag in Office." → Microsoft Copilot. Die KI sitzt direkt in Word, Excel und Outlook.
Ein Wort zum Datenschutz
Das wird oft unterschätzt, ist aber gerade für Unternehmen und Behörden in Deutschland entscheidend. Die meisten US-Anbieter (OpenAI, Anthropic, Google) verarbeiten Prompts auf US-Infrastruktur. Jeder Prompt ist damit ein Datentransfer in die USA, der über Standardvertragsklauseln abgesichert wird. EU-Datenresidenz gibt es dort meist nur als zubuchbares Enterprise-Feature – oder gar nicht.
Mistral ist hier der Sonderfall mit EU-Sitz und EU-Datenhaltung als Standard. DeepSeek ist das andere Extrem: Server in China unter einem Rechtsrahmen, der die Herausgabe von Daten an Behörden erzwingen kann – für sensible Daten ein klares No-Go über die offizielle API.
Und ein genereller Tipp: Achte bei den Consumer-Plänen darauf, ob deine Eingaben zum Training verwendet werden. Bei vielen Anbietern ist das per Opt-in oder Opt-out steuerbar, bei den API- und Business-Tiers ist Training meist standardmäßig ausgeschlossen. Wenn du mit personenbezogenen oder vertraulichen Daten arbeitest, führt am Geschäftskunden-Tarif mit Auftragsverarbeitungsvertrag (AVV) kein Weg vorbei. Wer es ganz genau wissen will, dem sei mein ausführlicher Artikel zum Thema LLMs und Datenschutz ans Herz gelegt.
Die direkten Vergleiche
Drei Paarungen, nach denen ausdrücklich gesucht wird.
ChatGPT oder Claude?
Der häufigste Vergleich, und die Unterschiede sind inzwischen gut greifbar.
Claude ist bei längeren Codezusammenhängen und beim Befolgen komplexer Anweisungen im Vorteil — es hält sich zuverlässiger an Formatvorgaben und erfindet seltener Schnittstellen, die es nicht gibt. Auch bei längeren Texten bleibt der Stil gleichmäßiger.
ChatGPT hat das größere Ökosystem: mehr Anbindungen, mehr Bibliotheken, mehr fertige Integrationen in Fremdprodukte. Wer etwas anbinden will, findet dafür mit höherer Wahrscheinlichkeit eine fertige Lösung.
Meine Empfehlung: Für Entwicklungsarbeit Claude, für breite Werkzeuganbindung OpenAI. Wer beides braucht, kapselt den Zugriff hinter einer eigenen Schnittstelle und wechselt je Aufgabe — wie das aussieht, steht in Cloud-Architektur und KI.
ChatGPT oder Gemini?
Gemini hat den deutlichsten Vorsprung bei sehr langen Eingaben. Wenn ein vollständiges Handbuch, eine lange Vertragssammlung oder eine umfangreiche Codebasis in einem Stück verarbeitet werden soll, ist das der praktische Unterschied. Dazu kommt die enge Verzahnung mit dem Google-Ökosystem.
ChatGPT ist bei der Werkzeugvielfalt und bei Anbindungen an Drittsysteme im Vorteil.
Ein Hinweis zur Kontextlänge: Ein großes Kontextfenster ist nicht gleichbedeutend mit gleichbleibender Qualität über die ganze Länge. Modelle verarbeiten Anfang und Ende zuverlässiger als die Mitte, und die Kosten steigen mit jeder Anfrage. Warum Nachschlagen oft die bessere Antwort ist als immer mehr Kontext, steht in Context Window und lange Kontexte bei LLMs und RAG selbst bauen.
Welche KI ist kostenlos — und taugt etwas?
Drei Wege zu kostenloser Nutzung, mit unterschiedlichen Haken:
Kostenlose Tarife der Anbieter. Alle großen haben einen, meist mit einem kleineren Modell, Nutzungsgrenzen und — der wichtige Punkt — häufig ohne die Zusicherung, dass Eingaben nicht zum Training verwendet werden. Für berufliche Inhalte ist das der Ausschlussgrund.
Offene Modelle lokal betreiben. Kostenlos im Sinne von keine Nutzungsgebühr, dafür Hardware und Betrieb. Der große Vorteil: Die Daten verlassen den Rechner nicht. Was auf welche Hardware passt, steht in Welches Ollama-Modell?.
Günstige Anbieter statt kostenloser Tarife. Für viele Aufgaben — Klassifikation, Extraktion, Zusammenfassung — reicht ein kleines Modell, und dessen Kosten liegen im Cent-Bereich. Oft ist das die vernünftigere Antwort als ein kostenloser Tarif mit unklaren Datenzusagen.
Welche KI fürs Programmieren?
Ein eigener Abschnitt, weil die Frage anders gelagert ist als die allgemeine Modellwahl: Bei Programmieraufgaben entscheidet nicht nur das Modell, sondern auch das Werkzeug drumherum — was es an Kontext bereitstellt, wie es Werkzeuge aufruft, wie es Änderungen anwendet.
Kurz eingeordnet:
- Für längere Zusammenhänge über mehrere Dateien hat Claude derzeit die Nase vorn.
- Für Codeergänzung im Editor ist der Unterschied zwischen den Anbietern kleiner als der zwischen den Werkzeugen.
- Lokal betriebene Coder-Modelle reichen für Ergänzung und Erklärung; für agentisches Arbeiten über mehrere Schritte sind sie in der Größenordnung, die auf einem Arbeitsplatzrechner läuft, noch nicht zuverlässig genug.
Die Werkzeuge selbst — Copilot, Claude Code, Cursor und die lokalen Alternativen — vergleiche ich in KI-Coding-Assistenten im Vergleich.
Verfügbarkeit und Datenresidenz im DACH-Raum
Der Abschnitt, den kein US-Vergleich enthält und der im deutschsprachigen Raum häufig die Entscheidung bestimmt.
Drei Fragen, die man je Anbieter getrennt beantworten muss:
1. Wo wird verarbeitet? Die großen Anbieter bieten inzwischen EU-Regionen an, teils gegen Aufpreis oder nur in Geschäftstarifen. Für die Schweiz gibt es weniger Angebote, und „EU" ist dort nicht automatisch ausreichend.
2. Werden Eingaben zum Training verwendet? Das ist unabhängig vom Speicherort und unterscheidet sich je Tarif. In Geschäftsverträgen ist die Nichtnutzung meist zugesichert, in kostenlosen Tarifen häufig nicht. Diese Frage wird am häufigsten übersehen.
3. Gibt es einen Vertrag zur Auftragsverarbeitung? Ohne ihn ist die Verarbeitung personenbezogener Daten nicht zulässig.
Mistral ist in diesem Punkt strukturell im Vorteil, weil Sitz und Betrieb in der EU liegen. Lokal betriebene Modelle umgehen alle drei Fragen — der Preis ist Betriebsaufwand und eine geringere Modellklasse.
Die rechtliche Seite behandle ich ausführlich in KI, Datenschutz und Recht.
Was sich seit der letzten Fassung geändert hat
Dieser Artikel wird regelmäßig aktualisiert; der Slug trägt die Jahreszahl seiner Erstfassung. Damit wiederkehrende Leser nicht alles neu lesen müssen, hier die wesentlichen Änderungen dieser Überarbeitung:
- OpenAI: GPT-6 Astra (3. September 2026) ist das neue Flaggschiff über der 5.6-Familie; GPT-5.6 Sol ist bis mindestens 21. November 2026 im Aktionspreis (4 $ / 20 $). GPT-5.5 verlässt ChatGPT und Codex am 14. Oktober 2026. Neuabschlüsse der 200-$-Pro-Stufe sind seit dem 10. September pausiert. Operator ist als eigenständiges Produkt gestrichen.
- Anthropic: Claude Fable 5.1 (1. September 2026) löst Fable 5 als Spitzenmodell ab, der Sonnet-5-Einführungspreis ist dauerhaft. Cowork und Chat werden seit dem 16. September zu einem Claude zusammengeführt, Claude in Chrome ist allgemein verfügbar. Bei den Abos korrigiert: Claude Code steckt in jedem Team-Sitz, aber nicht im Free-Tarif; Enterprise hat einen öffentlichen Sitzpreis; Fable-Modelle sind nur in Max und Premiumsitzen inklusive.
- Google: Gemini 3.8 Flash (2. September 2026) ergänzt, Flash-Einführungspreise bis Jahresende benannt; Gemini 3.5 Pro ist weiterhin nicht erschienen. Gemini-App für Windows seit dem 10. September. Abo-Tabelle um die beiden Ultra-Stufen präzisiert.
- SpaceXAI: Der Anbieter heißt seit Juli 2026 SpaceXAI. Grok Bot mit nativen Desktop-Apps ergänzt. Nicht belegbare Feature-Namen (Aurora, DeepSearch, Video-Eingabe bei 4.3) gestrichen.
- Meta: Muse Spark 1.3, eigene Meta Model API mit Preisen, Meta AI für Mac, der neue Muse-Agent und der offizielle Start von Meta One.
- Mistral: Le Chat heißt jetzt Vibe, die Abos enthalten API-Guthaben (die frühere Aussage war falsch), Zero Data Retention und EU-Endpunkt präzisiert.
- DeepSeek: V4.1-Flash (10. September 2026) ersetzt V4-Flash zu niedrigerem Preis; die kurzzeitig angekündigte Abschaltung von V4-Pro wurde zurückgenommen.
- Perplexity, Microsoft, Alibaba: Portable Computer und Sonar-API-Ende; Premium-Preis in Euro und Anthropic-Modelle in Office; Lizenz- und Modalitätsdetails der offenen Qwen-Gewichte sowie Qwen3.8-Flash-Next.
Zusammenfassung und praktische Tipps
Wenn du eine Sache aus diesem Artikel mitnimmst, dann diese: Die Frage „Welches ist das beste LLM?" ist falsch gestellt. Die richtige Frage lautet: „Welches Modell passt zu meinem Anwendungsfall, meinem Budget und meinen Datenschutzanforderungen?"
- OpenAI hat das größte Ökosystem und ist die sichere Standardwahl.
- Anthropic/Claude ist die Referenz fürs Programmieren und für Agenten.
- Google/Gemini glänzt mit riesigem Kontext, Multimodalität und Workspace-Integration.
- SpaceXAI/Grok punktet mit Echtzeitdaten und aggressiven Preisen.
- Metas Muse-Familie und Qwen sind die Open-Weights-Kraftpakete fürs Self-Hosting; Llama läuft bei Meta nur noch in zweiter Reihe.
- Mistral ist die erste Wahl für DSGVO und europäische Souveränität.
- DeepSeek ist mit V4.1-Flash wieder richtig günstig, aber nicht mehr konkurrenzlos – und trägt weiter ein großes Datenschutz-Sternchen.
- Perplexity und Copilot sind keine Modell-Labore, lösen aber spezifische Probleme (Recherche bzw. Office) hervorragend.
Mein praktischer Rat: Leg dich nicht auf einen Anbieter fest. In der Praxis bewährt sich ein Mix – ein starkes Modell fürs Coding, ein günstiges für die Masse an einfachen Aufgaben, und für sensible Daten ein EU-Anbieter oder Self-Hosting. Die meisten Tools und Frameworks lassen sich heute problemlos mit mehreren Anbietern verbinden, sodass du je nach Aufgabe das passende Modell wählen kannst.
Und das Wichtigste zum Schluss: Probier es aus. Die Modelle unterscheiden sich im Alltag oft anders, als es Benchmarks vermuten lassen. Was auf dem Papier vorne liegt, muss für deinen konkreten Anwendungsfall nicht das beste sein. Ein paar Stunden mit den kostenlosen Tiers der verschiedenen Anbieter sind besser investiert als jede Benchmark-Tabelle – auch besser als diese hier.
Ressourcen
- OpenAI – Modelle und Preise – aktueller Stand der Modellfamilie
- Anthropic – Modellübersicht – Fähigkeiten, Kontextgrößen und Verfügbarkeit
- Google – Gemini-Modelle – Kontextfenster und Multimodalität
- Mistral AI – Dokumentation – europäischer Anbieter mit EU-Verarbeitung
- LMSYS Chatbot Arena – offener Vergleich per Blindtest statt Herstellerangabe