Welches KI-Modell
passt zu deiner Aufgabe – und was kostet es wirklich?
Sag uns, was du machen willst — wir zeigen dir das passende Modell, die ehrliche Token-Rechnung und warum ChatGPT Plus, Claude Pro & Co. nicht vergleichbar sind.
In wenigen Klicks zum passenden KI-Modell
Wähle deinen Einsatzzweck und drei Anforderungen — wir schlagen dir die besten Modelle vor und rechnen die Kosten gegen.
Wähle den Einsatzzweck, der am ehesten passt.
Bestimmt, ob wir günstige oder Top-Modelle bevorzugen.
Mehrfachauswahl möglich. Für sensible Daten meist EU (DSGVO).
Das „Kontextfenster“ — das Kurzzeitgedächtnis der KI.
Automatisch passend zum gewählten Use-Case – du kannst jederzeit ändern.
★Deine persönliche Empfehlung
Aus über 40 Modellen, frisch kalkuliert — das passt am besten zu dir:
Kosten geschätzt für 500k Input- + 200k Output-Tokens/Monat (≈ ein paar tausend Anfragen). Brauchst du eine genaue Kalkulation? Lass uns das gemeinsam durchrechnen →
ByteDance Doubao 🇨🇳
Doubao Pro 1.5
Extrem günstig für Massen-Inhalte, Social-Tagging und Content-Moderation.
Gemini 2.5 Flash-Lite
Tagging von Produktdaten, Massen-Übersetzungen, einfache Klassifikation — wenn dich pro Aufruf jeder Cent interessiert.
Meta (Llama)
Llama 4 Maverick
Open-Weights-Flaggschiff für On-Prem & Fine-Tuning, wenn du Modellgewichte selbst hosten oder anpassen willst.
OpenAI
GPT-5 mini
Das Arbeitspferd für Produktivanwendungen: Chat-Assistenten, Content-Drafts, RAG-Antworten, Tool-Calling im Mittelfeld.
Du willst nicht selbst entscheiden müssen?
Wir bauen dir ein Multi-Modell-Routing, das pro Aufgabe automatisch das günstigste ausreichend gute Modell wählt – und integrieren es in dein ERP, CRM oder PIM. Warum „nur Chat“ nicht reicht →
Immer up-to-date bei neuen KI-Modellen oder Preisen
Kurze Mail, sobald ein neues Modell erscheint oder sich Preise ändern. Kein Spam, jederzeit abbestellbar.
Modellwahl ist nur der Anfang
Damit aus dem Modell echter Geschäftswert wird, braucht es gute Daten, klare Prozesse und die richtige Distribution. Hier kommen wir ins Spiel.
Du brauchst saubere Daten als Input?
Kein Modell der Welt rettet schlechte Eingangsdaten. Wir bündeln, bereinigen und reichern deine Daten an — damit jeder Token zählt.
Zu DataNaicerDu willst aus Daten direkt Content machen?
Produktbeschreibungen, SEO-Texte, Varianten in Massen — datengetrieben generiert, statt mühselig im ChatGPT-Chat geschrieben.
Zu ContentNaicerDu brauchst kontinuierlich Reichweite?
News Stream übernimmt LinkedIn, Blog und Newsletter vollautomatisch — das passende KI-Modell wählen wir je Format für dich aus.
Zu News StreamAlle KI-Modelle im Preis-Detail
Listenpreise je 1 Mio. Tokens (USD) inkl. Nutzen-Empfehlung pro Modell.
OpenAI
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| GPT-5 | $5.00 | $15.00 | 400k | Wenn du eine echte „zweite Meinung“ brauchst: Strategie-Papiere, juristische Analyse, schwierige Code-Refactorings, Agenten, die mehrere Tools sauber orchestrieren. Abo-Pendant: ChatGPT Plus 20 $ / Pro 200 $ pro Monat |
| GPT-5 mini | $0.40 | $1.60 | 400k | Das Arbeitspferd für Produktivanwendungen: Chat-Assistenten, Content-Drafts, RAG-Antworten, Tool-Calling im Mittelfeld. |
| GPT-4o | $2.50 | $10.00 | 128k | Sprach- und Voice-Assistenten, Bildbeschreibung & OCR, alles wo du Text + Bild + Audio mischen willst. |
| o4-mini | $1.10 | $4.40 | 200k | Mathematik, Logik, Unit-Test-Generierung und Coding-Agenten, wenn du Reasoning brauchst, aber nicht GPT-5-Preise zahlen willst. |
| GPT-5.6 Sol | $0.00 | $0.00 | Flexible | Du kannst es für allgemeine Textaufgaben verwenden, wo Flexibilität gefragt ist. |
| GPT-5.6 Sol Pro | $0.00 | $0.00 | Flexible | Du kannst es für anspruchsvollere und geschäftliche Anwendungsfälle nutzen. |
| GPT-5.6 Terra | $0.00 | $0.00 | Flexible | Du kannst es für umfangreiche Datenanalyse und -verarbeitung einsetzen. |
| GPT-5.6 Luna | $0.00 | $0.00 | Flexible | Du kannst es für kreative Textgenerierung und Sprachdesign verwenden. |
| GPT-5 Thinking Mini | $0.00 | $0.00 | Flexible | Du kannst es für schnelle, kleinere Denkaufgaben und schnelle Antworten einsetzen. |
Anthropic
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Claude Fable 5 | $10.00 | $50.00 | 1M | Anthropics neuer Top-Tier (Mythos-Klasse). Für die wirklich harten Brocken: vielstufige Recherche-Agenten, autonome Coding-Sessions über Stunden, juristische Tiefenanalysen. Abo-Pendant: Nur über Claude Max 200 $ oder API |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Aktuell die erste Wahl für lang laufende Coding-Agenten (Claude Code, Cursor) und komplette Codebasen oder Aktenstapel im Kontext. Schreibt auf Top-Niveau mit Stil und Konsistenz. Abo-Pendant: Claude Pro 20 $ / Max 100–200 $ pro Monat |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | Das Arbeitspferd für Coding-Agenten und RAG mit langem Kontext — günstiger als Opus, bei vielen Tasks fast gleich gut. |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k | Customer-Support-Bots, Ticket-Routing, Sentiment- und Intent-Klassifizierung in hoher Frequenz. |
| Fable 5 | $10.00 | $50.00 | 200k | Nutze mich für anspruchsvolle, länger laufende Agenten-Workflows, die tiefe Intelligenz erfordern. |
| Opus 5 | $5.00 | $25.00 | 200k | Ich bin ideal für komplexe Codierungsaufgaben und anspruchsvolle Unternehmensprojekte. |
| Sonnet 5 | $2.00 | $10.00 | 200k | Setze mich ein für Codierung und Agenten, wenn du hohe Leistung brauchst. |
| Haiku 4.5 | $1.00 | $5.00 | 200k | Ich bin das schnellste und kostengünstigste Modell für deine einfachen Anwendungen. |
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Gemini 2.5 Pro | $1.25 | $10.00 | unbekannt | Wenn du ganze Codebases, Videos oder hunderte PDFs auf einmal verstehen lassen willst — der König der langen Kontexte. Abo-Pendant: Gemini Advanced 21,99 $ / AI Ultra 250 $ pro Monat |
| Gemini 2.5 Flash | $0.30 | $2.50 | 1M | RAG, Übersetzungen, Bilderkennung in Volumen — sehr gutes Preis-/Leistungs-Verhältnis bei langem Kontext. |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | unknown | Tagging von Produktdaten, Massen-Übersetzungen, einfache Klassifikation — wenn dich pro Aufruf jeder Cent interessiert. |
| Gemini 3.7 Flash | $0.75 | $3.75 | unknown | Nutze es für fortgeschrittene Agenten-Workflows und multimodale Schlussfolgerungen. |
| Gemini 3.6 Flash | $0.75 | $3.75 | unknown | Ideal für Anwendungen, die schnelle Reaktionen und präzise Suchergebnisse benötigen. |
| Gemini 3.5 Flash | $1.50 | $9.00 | unknown | Ideal für Anwendungen, die schnelle Reaktionen und präzise Suchergebnisse benötigen. |
| Gemini 3.5 Live Translate | $3.50 | $21.00 | unknown | Verwende es für Sprach-zu-Sprache-Übersetzungen in Echtzeit mit über 70 Sprachen. |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | unknown | Ideal für kostengünstige, hochvolumige Agenten-Aufgaben, Übersetzungen und einfache Datenverarbeitung. |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | unknown | Nutze es für kostengünstige, hochvolumige Agenten-Aufgaben, Übersetzungen und einfache Datenverarbeitung. |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | unbekannt | Verwende es für multimodales Verständnis und Agentenfähigkeiten. |
| Gemini 3.1 Flash Live Preview | $0.75 | $4.50 | unknown | Setze es für Echtzeit-Dialoge mit geringer Latenz und multimodaler Wahrnehmung ein. |
| Gemini 3 Flash Preview | $0.50 | $3.00 | unknown | Ideal für Anwendungen, die schnelle Reaktionen und präzise Suchergebnisse benötigen. |
Meta (Llama)
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Llama 4 Maverick | $0.50 | $1.50 | 1M | Open-Weights-Flaggschiff für On-Prem & Fine-Tuning, wenn du Modellgewichte selbst hosten oder anpassen willst. |
| Llama 4 Scout | $0.15 | $0.60 | 10M | Riesige Wissensbasen komplett in den Kontext laden, ohne eine RAG-Pipeline bauen zu müssen. |
Mistral
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Mistral Large 2 | $2.00 | $6.00 | 128k | Erste Wahl bei DSGVO-Pflicht & EU-Datenresidenz. Mehrsprachig, ordentliches Function-Calling. Abo-Pendant: Le Chat Pro 14,99 € pro Monat |
| Mistral Small 3 | $0.20 | $0.60 | 32k | EU-konforme Low-Latency-Anwendungen, Edge-Deployments, schnelle interne Tools. |
| Mistral Large | $0.50 | $1.50 | unknown | Du kannst es für anspruchsvolle Aufgaben nutzen, die tiefes Sprachverständnis und präzise Antworten erfordern. |
| Mistral Medium | $0.25 | $0.75 | unknown | Ideal für die meisten alltäglichen Aufgaben und Coding-Projekte, wenn du ein vielseitiges Modell brauchst. |
| Mistral Small | $0.20 | $0.60 | unknown | Nutze es für Projekte, bei denen die Kosten eine Rolle spielen, aber du trotzdem gute Ergebnisse erwartest. |
| Mistral Tiny | $0.10 | $0.10 | unknown | Perfekt für einfache, kostensensible Aufgaben, die keine komplexen Anforderungen haben. |
xAI
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Grok 4 | $3.00 | $15.00 | 256k | Wenn Echtzeit-Web- & X-Daten Teil der Antwort sein müssen — z. B. für Trend-Research oder Social Monitoring. Abo-Pendant: X Premium+ 40 $ / SuperGrok 30–300 $ pro Monat |
| Grok 4 mini | $0.30 | $1.50 | 128k | Schnelle, günstige Antworten mit aktuellem Web-Wissen. |
DeepSeek 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| DeepSeek-V3.2 | $0.27 | $1.10 | 128k | Sehr günstiges Allzweck-Modell mit überraschend starker Coding-Leistung — der Preisbrecher für Volumen. |
| DeepSeek-R1 | $0.55 | $2.19 | 128k | Reasoning auf Frontier-Niveau zu einem Bruchteil der Kosten von GPT-5 oder Opus 4.5. |
Alibaba Qwen 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Qwen3-Max | $1.20 | $6.00 | 32K | Top-Allrounder aus China, sehr stark in Coding & mehrsprachigen Tasks (CN, EN, DE). |
| Qwen3-Coder | $0.30 | $1.20 | 1M | Riesige Repos durchsuchen, refaktorieren, Tests generieren — günstige Coding-Agenten. |
Moonshot Kimi 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Kimi K2 | $0.60 | $2.50 | 2M | Lange Dokumente, Recherche-Agenten, „Lies dieses Buch und beantworte mir Fragen“-Szenarien. |
Zhipu GLM 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| GLM-4.6 | $0.60 | $2.20 | 200k | Solider Allrounder mit gutem Tool-Use und CN/EN-Stärke — gerne als Backup-Router-Ziel. |
Baidu Ernie 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Ernie 4.5 Turbo | $0.55 | $2.20 | 128k | Chinesischsprachige Kundenkommunikation, Marketing-Content für den CN-Markt. |
ByteDance Doubao 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Doubao Pro 1.5 | $0.11 | $0.28 | 256k | Extrem günstig für Massen-Inhalte, Social-Tagging und Content-Moderation. |
MiniMax 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| MiniMax M2 | $0.30 | $1.20 | 1M | Multimodale Apps (Text + Bild) zum kleinen Preis, populär in Asien. |
DeepSeek
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| deepseek-v4-flash | $0.01 | $1.32 | 1M | Du kannst diesen Modus für schnelle Textgenerierung und einfache Aufgaben nutzen. |
| deepseek-v4-pro | $0.04 | $3.96 | 1M | Dieser Modus ist ideal für anspruchsvolle Anwendungen, die höchste Präzision erfordern. |
Alibaba (Qwen)
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| qwen3.8-max | $1.65 | $4.95 | 1M | Du kannst diesen vielseitigen Agenten für komplexe Codierungsaufgaben und professionelle Projekte nutzen. |
| qwen3.7-max | $1.65 | $4.95 | 1M | Ideal für Aufgaben, die fortgeschrittene Argumentationsfähigkeiten und Anpassungsfähigkeit an verschiedene Frameworks erfordern. |
| qwen3.7-max-2026-06-08 | $1.65 | $4.95 | 1M | Dieser Agent ist gut für komplexe Aufgaben, die sowohl Nicht-Denk- als auch Denkmodi erfordern. |
| qwen3.7-max-2026-05-20 | $1.65 | $4.95 | 1M | Du kannst diesen Agenten für Aufgaben einsetzen, die sowohl direkte Antworten als auch logische Denkprozesse benötigen. |
| qwen3.7-max-preview | $2.50 | $7.50 | 1M | Perfekt für das Testen von Aufgaben, die ausschließlich den Denkmodus nutzen, um Problemlösungen zu evaluieren. |
| qwen3.7-max-2026-05-17 | $2.50 | $7.50 | 1M | Nutze diesen spezifischen Agenten für Szenarien, in denen eine tiefgehende, denkbasierte Analyse entscheidend ist. |
| qwen3.6-max-preview | $1.30 | $7.80 | 128K | Dieser Agent eignet sich für vielfältige Aufgaben im Nicht-Denk- und Denkmodus, wenn der Kontext 128K Token nicht überschreitet. |
| qwen3-max-2026-01-23 | $1.20 | $6.00 | 32K | Dieser Modell ist für Standardaufgaben geeignet, die bis zu 32K Token Kontext erfordern. |
| qwen3-max-2025-09-23 | $1.20 | $6.00 | 32K | Verwende diesen Modell für einfachere Aufgaben, die nur den Nicht-Denkmodus benötigen und kurze Kontexte haben. |
| qwen3-max-preview | $1.20 | $6.00 | 32K | Ideal, um erste Tests mit Nicht-Denk- und Denkmodi bei begrenztem Kontext durchzuführen. |
| qwen-max | $1.60 | $6.40 | Keine Staffelung | Optimal für einfache, direkte Anfragen, die keine komplexen Denkprozesse benötigen. |
| qwen3.7-plus | $0.40 | $1.60 | 256K | Du kannst dieses Modell für allgemeine Aufgaben verwenden, die sowohl direkte Antworten als auch Denkprozesse erfordern. |
| qwen3.7-plus-2026-05-26 | $0.40 | $1.60 | 256K | Für vielseitige Aufgaben mit einem Kontext von bis zu 256K Token ist dieses Modell gut geeignet. |
| qwen3.6-plus | $0.50 | $3.00 | 256K | Dieses Modell ist gut für Aufgaben mit moderaten Kontextlängen, die sowohl Nicht-Denk- als auch Denkmodi unterstützen. |
| qwen3.6-plus-2026-04-02 | $0.50 | $3.00 | 256K | Du kannst dieses Modell für Standardaufgaben nutzen, die eine gute Balance aus Kontext und Leistung bieten. |
| qwen3.5-plus | $0.40 | $2.40 | 256K | Ideal für Aufgaben, die eine gute Balance zwischen Kosten und Leistung für Kontexte bis 256K Token erfordern. |
| qwen3.5-plus-2026-04-20 | $0.40 | $2.40 | 256K | Du kannst diesen Modell für Aufgaben nutzen, die eine effiziente Verarbeitung von Kontexten bis zu 256K erfordern. |
| qwen3.5-plus-2026-02-15 | $0.40 | $2.40 | 256K | Für Anwendungen, die sowohl Nicht-Denk- als auch Denkmodi mit einem 256K Kontextfenster benötigen. |
| qwen-plus | $0.40 | $1.20 | 256K | Du kannst dieses Modell für vielseitige Anwendungsfälle verwenden, die einen flexiblen Kontext bis 256K benötigen. |
| qwen-plus-latest | $0.40 | $1.20 | 256K | Ideal, um immer die aktuellste Version des Qwen-Plus Modells für verschiedene Aufgaben zu nutzen. |
| qwen-plus-2025-12-01 | $0.40 | $1.20 | 256K | Für allgemeine Textgenerierungsaufgaben mit einem 256K Kontextfenster ist dieses Modell eine gute Wahl. |
| qwen-plus-2025-09-11 | $0.40 | $1.20 | 256K | Du kannst dieses Modell für stabile Anwendungen mit einem verlässlichen Release-Datum und 256K Kontext nutzen. |
| qwen-plus-2025-07-28 | $0.40 | $1.20 | 256K | Dieses Modell ist gut für Aufgaben, die einen ausgewogenen Kontext von 256K Token erfordern. |
| qwen-plus-2025-07-14 | $0.40 | $1.20 | Keine Staffelung | Ideal für konsistente Leistung bei Textgenerierungsaufgaben ohne spezielle Kontextstaffelung. |
| qwen-plus-2025-04-28 | $0.40 | $1.20 | Keine Staffelung | Für Standardanwendungen, die eine einfache Abrechnung ohne Kontextstaffelung bevorzugen. |
| qwen-plus-2025-01-25 | $0.40 | $1.20 | Keine Staffelung | Du kannst dieses Modell für Aufgaben verwenden, die eine unkomplizierte Preisgestaltung ohne Kontext-Staffelung schätzen. |
Hinweis: Preise sind Listenpreise der Anbieter-APIs (Stand August 2026) und ändern sich regelmäßig. Rabatte über Batch-, Cache- oder Volumenverträge sowie regionale Hosting-Aufschläge (Azure, Vertex AI, Bedrock) sind nicht berücksichtigt.
Häufige Fragen zu KI-Modell-Kosten
5 Dinge, die niemand offen sagt – und die in keiner Preisliste stehen.
Sind Output-Token wirklich teurer als Input-Token?
Ja, meist um Faktor 3–5×. Wer lange Antworten generieren lässt, zahlt überproportional. Trick: System-Prompts kurz halten, Antwortlänge begrenzen.
Ist ein großes Kontextfenster automatisch teurer?
Lange Prompts kosten linear mit der Tokenzahl. Ein 1M-Kontext lohnt nur, wenn du ihn wirklich brauchst — RAG ist oft günstiger.
Was sind Reasoning- bzw. Thinking-Tokens?
GPT-o-Reihe, DeepSeek-R1 und Claude Opus „denken" intern. Diese Thinking-Tokens werden mitberechnet, deshalb fallen Reasoning-Modelle in der Rechnung oft höher aus als erwartet.
Was bringt Multi-Modell-Routing?
Einfache Tasks an Flash-Lite oder DeepSeek, schwere an Sonnet oder GPT-5 routen — spart in unseren Projekten typischerweise 60–80 % der Kosten.
Welche KI-Modelle sind DSGVO-konform nutzbar?
Für DSGVO-kritische Workloads sind Mistral (EU-Hosting) oder Self-Hosted Llama meist die einzige saubere Wahl. Chinesische Modelle haben in Sales- oder Personendaten nichts verloren.
Unsicher, welches Modell zu deinem Use Case passt?
Wir wählen für dich – datenbasiert, anbieterneutral und mit Blick auf die Total Cost of Ownership.