Welches KI-Modell
passt zu deiner Aufgabe – und was kostet es wirklich?
Sag uns, was du machen willst — wir zeigen dir das passende Modell, die ehrliche Token-Rechnung und warum ChatGPT Plus, Claude Pro & Co. nicht vergleichbar sind.
In wenigen Klicks zum passenden KI-Modell
Wähle deinen Einsatzzweck und drei Anforderungen — wir schlagen dir die besten Modelle vor und rechnen die Kosten gegen.
Wähle den Einsatzzweck, der am ehesten passt.
Bestimmt, ob wir günstige oder Top-Modelle bevorzugen.
Mehrfachauswahl möglich. Für sensible Daten meist EU (DSGVO).
Das „Kontextfenster“ — das Kurzzeitgedächtnis der KI.
Automatisch passend zum gewählten Use-Case – du kannst jederzeit ändern.
★Deine persönliche Empfehlung
Aus über 40 Modellen, frisch kalkuliert — das passt am besten zu dir:
Kosten geschätzt für 500k Input- + 200k Output-Tokens/Monat (≈ ein paar tausend Anfragen). Brauchst du eine genaue Kalkulation? Lass uns das gemeinsam durchrechnen →
ByteDance Doubao 🇨🇳
Doubao Pro 1.5
Extrem günstig für Massen-Inhalte, Social-Tagging und Content-Moderation.
DeepSeek
deepseek-v4-flash
Du kannst diesen Modell verwenden, um schnell große Mengen an Text zu verarbeiten und zusammenzufassen.
Gemini 2.5 Flash-Lite
Tagging von Produktdaten, Massen-Übersetzungen, einfache Klassifikation — wenn dich pro Aufruf jeder Cent interessiert.
Meta (Llama)
Llama 4 Maverick
Open-Weights-Flaggschiff für On-Prem & Fine-Tuning, wenn du Modellgewichte selbst hosten oder anpassen willst.
Du willst nicht selbst entscheiden müssen?
Wir bauen dir ein Multi-Modell-Routing, das pro Aufgabe automatisch das günstigste ausreichend gute Modell wählt – und integrieren es in dein ERP, CRM oder PIM. Warum „nur Chat“ nicht reicht →
Immer up-to-date bei neuen KI-Modellen oder Preisen
Kurze Mail, sobald ein neues Modell erscheint oder sich Preise ändern. Kein Spam, jederzeit abbestellbar.
Modellwahl ist nur der Anfang
Damit aus dem Modell echter Geschäftswert wird, braucht es gute Daten, klare Prozesse und die richtige Distribution. Hier kommen wir ins Spiel.
Du brauchst saubere Daten als Input?
Kein Modell der Welt rettet schlechte Eingangsdaten. Wir bündeln, bereinigen und reichern deine Daten an — damit jeder Token zählt.
Zu DataNaicerDu willst aus Daten direkt Content machen?
Produktbeschreibungen, SEO-Texte, Varianten in Massen — datengetrieben generiert, statt mühselig im ChatGPT-Chat geschrieben.
Zu ContentNaicerDu brauchst kontinuierlich Reichweite?
News Stream übernimmt LinkedIn, Blog und Newsletter vollautomatisch — das passende KI-Modell wählen wir je Format für dich aus.
Zu News StreamAlle KI-Modelle im Preis-Detail
Listenpreise je 1 Mio. Tokens (USD) inkl. Nutzen-Empfehlung pro Modell.
OpenAI
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| GPT-5 | $5.00 | $15.00 | 400k | Wenn du eine echte „zweite Meinung“ brauchst: Strategie-Papiere, juristische Analyse, schwierige Code-Refactorings, Agenten, die mehrere Tools sauber orchestrieren. Abo-Pendant: ChatGPT Plus 20 $ / Pro 200 $ pro Monat |
| GPT-5 mini | $0.40 | $1.60 | 400k | Das Arbeitspferd für Produktivanwendungen: Chat-Assistenten, Content-Drafts, RAG-Antworten, Tool-Calling im Mittelfeld. |
| GPT-4o | $2.50 | $10.00 | 128k | Sprach- und Voice-Assistenten, Bildbeschreibung & OCR, alles wo du Text + Bild + Audio mischen willst. |
| o4-mini | $1.10 | $4.40 | 200k | Mathematik, Logik, Unit-Test-Generierung und Coding-Agenten, wenn du Reasoning brauchst, aber nicht GPT-5-Preise zahlen willst. |
| GPT-5.6 Sol | $7.50 | $22.50 | 54K | Nutze es für alltägliche Textaufgaben und schnelle Antworten. |
| GPT-5.6 Sol Pro | $15.00 | $45.00 | 54K | Wenn du schnellere und präzisere Ergebnisse für deine Textaufgaben brauchst. |
| GPT-5.6 Terra | $7.50 | $22.50 | 256K | Ideal, wenn du mit langen Texten arbeitest und einen größeren Kontext benötigst. |
| GPT-5.6 Luna | $15.00 | $45.00 | 256K | Perfekt für komplexe Aufgaben mit langen Dokumenten, wo schnelle Argumentation gefragt ist. |
| GPT-5 Thinking Mini | $3.00 | $9.00 | 54K | Für einfache und schnelle Aufgaben, bei denen du auf das Budget achten musst. |
Anthropic
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Claude Fable 5 | $10.00 | $50.00 | 1M | Anthropics neuer Top-Tier (Mythos-Klasse). Für die wirklich harten Brocken: vielstufige Recherche-Agenten, autonome Coding-Sessions über Stunden, juristische Tiefenanalysen. Abo-Pendant: Nur über Claude Max 200 $ oder API |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Aktuell die erste Wahl für lang laufende Coding-Agenten (Claude Code, Cursor) und komplette Codebasen oder Aktenstapel im Kontext. Schreibt auf Top-Niveau mit Stil und Konsistenz. Abo-Pendant: Claude Pro 20 $ / Max 100–200 $ pro Monat |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | Das Arbeitspferd für Coding-Agenten und RAG mit langem Kontext — günstiger als Opus, bei vielen Tasks fast gleich gut. |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k | Customer-Support-Bots, Ticket-Routing, Sentiment- und Intent-Klassifizierung in hoher Frequenz. |
| Fable 5 | $10.00 | $50.00 | - | Du kannst diesen Modell für die Entwicklung intelligenter Agenten und komplexe logische Probleme verwenden. |
| Opus 5 | $5.00 | $25.00 | - | Du kannst diesen Modell für komplexe Codierungsaufgaben, Agentenentwicklung und strategische Unternehmensanalysen nutzen. |
| Sonnet 5 | $2.00 | $10.00 | - | Du kannst diesen Modell für schnelle Codierungsaufgaben und effiziente Agenten-Anwendungen einsetzen. |
| Haiku 4.5 | $1.00 | $5.00 | - | Du kannst diesen Modell für einfache, schnelle und kostengünstige Textgenerierung nutzen. |
| Opus 4.8 | $5.00 | $25.00 | - | Du kannst diesen Modell für anspruchsvolle Analysen und komplexe Problemstellungen verwenden. |
| Sonnet 4.6 | $3.00 | $15.00 | - | Du kannst diesen Modell für eine Vielzahl von Anwendungen nutzen, bei denen eine gute Balance zwischen Leistung und Kosten wichtig ist. |
| Opus 4.7 | $5.00 | $25.00 | - | Du kannst diesen Modell für Aufgaben nutzen, die ein tiefes Verständnis und fortgeschrittene Logik erfordern. |
| Opus 4.6 | $5.00 | $25.00 | - | Du kannst diesen Modell für robuste Anwendungen und komplexe Szenarien einsetzen, wo Verlässlichkeit zählt. |
| Sonnet 4.5 | $3.00 | $15.00 | - | Du kannst diesen Modell für Aufgaben mittlerer Komplexität einsetzen, die ein gutes Preis-Leistungs-Verhältnis bieten. |
| Opus 4.5 | $5.00 | $25.00 | - | Du kannst diesen Modell für umfassende und vielseitige Anwendungen verwenden, die präzise Ergebnisse benötigen. |
| Opus 4.1 | $15.00 | $75.00 | - | Du kannst diesen Modell für sehr rechenintensive und skalierbare Anwendungen verwenden. |
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Gemini 2.5 Pro | $1.25 | $10.00 | 200k tokens | Wenn du ganze Codebases, Videos oder hunderte PDFs auf einmal verstehen lassen willst — der König der langen Kontexte. Abo-Pendant: Gemini Advanced 21,99 $ / AI Ultra 250 $ pro Monat |
| Gemini 2.5 Flash | $0.30 | $2.50 | 1M tokens | RAG, Übersetzungen, Bilderkennung in Volumen — sehr gutes Preis-/Leistungs-Verhältnis bei langem Kontext. |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | unknown | Tagging von Produktdaten, Massen-Übersetzungen, einfache Klassifikation — wenn dich pro Aufruf jeder Cent interessiert. |
| gemini-3.6-flash | $1.50 | $7.50 | unknown | Du kannst damit schnelle und intelligente Antworten generieren, die auf externen Informationen basieren. |
| gemini-3.5-flash | $1.50 | $9.00 | unknown | Du kannst damit schnelle und intelligente Antworten generieren, die auf externen Informationen basieren. |
| gemini-3.5-live-translate | $3.50 | $21.00 | unknown | Du kannst damit Echtzeit-Sprachübersetzungen für über 70 Sprachen durchführen. |
| gemini-3.5-flash-lite | $0.30 | $2.50 | unknown | Du kannst damit kostengünstig und effizient große Mengen an agentenbasierten Aufgaben oder Übersetzungen bearbeiten. |
| gemini-3.1-flash-lite | $0.25 | $1.50 | unknown | Du kannst damit kostengünstig und effizient große Mengen an agentenbasierten Aufgaben oder Übersetzungen bearbeiten. |
| gemini-omni-flash-preview | $1.50 | $9.00 | unknown | Du kannst damit schnell Videos generieren und bearbeiten. |
| gemini-3.1-pro-preview | $2.00 | $12.00 | 200k tokens | Du kannst damit komplexe multimodale Aufgaben lösen und agentenbasierte Anwendungen entwickeln. |
| gemini-3.1-pro-preview-customtools | $2.00 | $12.00 | 200k tokens | Du kannst damit komplexe multimodale Aufgaben lösen und agentenbasierte Anwendungen entwickeln. |
| gemini-3.1-flash-live-preview | $0.75 | $4.50 | unknown | Du kannst damit Audio-zu-Audio-Gespräche in Echtzeit führen und akustische Nuancen erkennen. |
| gemini-3.1-flash-image | $0.50 | $3.00 | unknown | Du kannst damit schnell und effizient Bilder generieren für interaktive Anwendungen. |
| gemini-3.1-flash-lite-image | $0.25 | $1.50 | unknown | Du kannst damit kostengünstig und mit geringer Latenz Bilder generieren und bearbeiten. |
| gemini-3.1-flash-tts-preview | $1.00 | $20.00 | unknown | Du kannst damit kostengünstig und mit geringer Latenz steuerbare Sprachausgaben aus Text erzeugen. |
| gemini-3-flash-preview | $0.50 | $3.00 | unknown | Du kannst damit schnelle und intelligente Antworten generieren, die auf externen Informationen basieren. |
| gemini-3-pro-image | $2.00 | $12.00 | unknown | Du kannst damit schnell und flexibel Bilder generieren, die kontextuell stimmig sind. |
| gemini-2.5-flash-lite-preview-09-2025 | $0.10 | $0.40 | unknown | Du kannst damit kosteneffizient und in großem Umfang hochwertige Aufgaben bewältigen. |
| gemini-2.5-flash-native-audio-preview-12-2025 | $0.50 | $2.00 | unknown | Du kannst damit hochwertige und natürlich klingende Audioausgaben mit guter Sprachmelodie erzeugen. |
| gemini-2.5-flash-image | $0.30 | $0.04 | unknown | Du kannst damit schnell und flexibel Bilder generieren, die kontextuell stimmig sind. |
Meta (Llama)
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Llama 4 Maverick | $0.50 | $1.50 | 1M | Open-Weights-Flaggschiff für On-Prem & Fine-Tuning, wenn du Modellgewichte selbst hosten oder anpassen willst. |
| Llama 4 Scout | $0.15 | $0.60 | 10M | Riesige Wissensbasen komplett in den Kontext laden, ohne eine RAG-Pipeline bauen zu müssen. |
Mistral
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Mistral Large 2 | $2.00 | $6.00 | 128k | Erste Wahl bei DSGVO-Pflicht & EU-Datenresidenz. Mehrsprachig, ordentliches Function-Calling. Abo-Pendant: Le Chat Pro 14,99 € pro Monat |
| Mistral Small 3 | $0.20 | $0.60 | 32k | EU-konforme Low-Latency-Anwendungen, Edge-Deployments, schnelle interne Tools. |
| Mistral Large | $2.00 | $6.00 | - | Du solltest dieses Modell für die anspruchsvollsten Aufgaben nutzen, wenn dir die beste Performance am wichtigsten ist. |
| Mistral Medium 3.5 | $2.70 | $8.10 | - | Dieses Modell ist perfekt, wenn du Unterstützung beim Programmieren benötigst. |
| Mistral Small | $0.20 | $0.60 | - | Nutze dieses Modell, wenn du bei deinen Projekten besonders auf die Kosten achten musst. |
xAI
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Grok 4 | $3.00 | $15.00 | 256k | Wenn Echtzeit-Web- & X-Daten Teil der Antwort sein müssen — z. B. für Trend-Research oder Social Monitoring. Abo-Pendant: X Premium+ 40 $ / SuperGrok 30–300 $ pro Monat |
| Grok 4 mini | $0.30 | $1.50 | 128k | Schnelle, günstige Antworten mit aktuellem Web-Wissen. |
DeepSeek 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| DeepSeek-V3.2 | $0.27 | $1.10 | 128k | Sehr günstiges Allzweck-Modell mit überraschend starker Coding-Leistung — der Preisbrecher für Volumen. |
| DeepSeek-R1 | $0.55 | $2.19 | 128k | Reasoning auf Frontier-Niveau zu einem Bruchteil der Kosten von GPT-5 oder Opus 4.5. |
Alibaba Qwen 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Qwen3-Max | $1.20 | $6.00 | 32K | Top-Allrounder aus China, sehr stark in Coding & mehrsprachigen Tasks (CN, EN, DE). |
| Qwen3-Coder | $0.30 | $1.20 | 1M | Riesige Repos durchsuchen, refaktorieren, Tests generieren — günstige Coding-Agenten. |
Moonshot Kimi 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Kimi K2 | $0.60 | $2.50 | 2M | Lange Dokumente, Recherche-Agenten, „Lies dieses Buch und beantworte mir Fragen“-Szenarien. |
Zhipu GLM 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| GLM-4.6 | $0.60 | $2.20 | 200k | Solider Allrounder mit gutem Tool-Use und CN/EN-Stärke — gerne als Backup-Router-Ziel. |
Baidu Ernie 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Ernie 4.5 Turbo | $0.55 | $2.20 | 128k | Chinesischsprachige Kundenkommunikation, Marketing-Content für den CN-Markt. |
ByteDance Doubao 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| Doubao Pro 1.5 | $0.11 | $0.28 | 256k | Extrem günstig für Massen-Inhalte, Social-Tagging und Content-Moderation. |
MiniMax 🇨🇳
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| MiniMax M2 | $0.30 | $1.20 | 1M | Multimodale Apps (Text + Bild) zum kleinen Preis, populär in Asien. |
DeepSeek
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| deepseek-v4-flash | $0.14 | $0.28 | 1M | Du kannst diesen Modell verwenden, um schnell große Mengen an Text zu verarbeiten und zusammenzufassen. |
| deepseek-v4-pro | $0.43 | $0.87 | 1M | Mit diesem Modell kannst du anspruchsvolle Aufgaben lösen, die tiefes Verständnis und präzise Antworten erfordern. |
Alibaba (Qwen)
| Modell | Input / 1M | Output / 1M | Kontext | Womit du es nutzt |
|---|---|---|---|---|
| qwen3.8-max | $2.00 | $6.00 | 1M | Du kannst es für umfassende Coding-Aufgaben und anspruchsvolle professionelle Projekte nutzen. |
| qwen3.7-max | $2.50 | $7.50 | 1M | Du kannst es für Agenten-basierte Anwendungen mit komplexen Denkprozessen und flexiblen Frameworks verwenden. |
| qwen3.7-max-2026-06-08 | $2.50 | $7.50 | 1M | Du kannst es für Agenten-basierte Anwendungen mit komplexen Denkprozessen und flexiblen Frameworks verwenden. |
| qwen3.7-max-2026-05-20 | $2.50 | $7.50 | 1M | Du kannst es für Agenten-basierte Anwendungen mit komplexen Denkprozessen und flexiblen Frameworks verwenden. |
| qwen3.7-max-preview | $2.50 | $7.50 | 1M | Du kannst es für Anwendungen nutzen, die ausschließlich den Denkmodus erfordern und komplexe logische Probleme lösen müssen. |
| qwen3.7-max-2026-05-17 | $2.50 | $7.50 | 1M | Du kannst es für Anwendungen nutzen, die ausschließlich den Denkmodus erfordern und komplexe logische Probleme lösen müssen. |
| qwen3.6-max-preview | $1.30 | $7.80 | 128K | Du kannst es für detaillierte Analysen und Aufgaben nutzen, die einen längeren Kontext erfordern. |
| qwen3-max-2026-01-23 | $1.20 | $6.00 | 32K | Du kannst es für allgemeine Anwendungen nutzen, die eine ausgewogene Leistung erfordern. |
| qwen3-max-2025-09-23 | $1.20 | $6.00 | 32K | Du kannst es für Anwendungen nutzen, die direkte und effiziente Antworten ohne komplexe Denkprozesse benötigen. |
| qwen3-max-preview | $1.20 | $6.00 | 32K | Du kannst es für Entwicklungs- und Testzwecke nutzen, insbesondere für Anwendungen, die den Denkmodus erfordern. |
| qwen-max | $1.60 | $6.40 | No tiered pricing | Du kannst es für allgemeine Aufgaben nutzen, die eine zuverlässige Textgenerierung erfordern. |
| qwen3.7-plus | $0.40 | $1.60 | 256K | Du kannst es für multimodale Anwendungen und Agenten-Coding mit großem Kontextfenster nutzen. |
| qwen3.7-plus-2026-05-26 | $0.40 | $1.60 | 256K | Du kannst es für multimodale Anwendungen und Agenten-Coding mit großem Kontextfenster nutzen. |
| qwen3.6-plus | $0.50 | $3.00 | 256K | Du kannst es für effiziente und vielseitige Anwendungen mit einem großen Kontextfenster nutzen. |
| qwen3.6-plus-2026-04-02 | $0.50 | $3.00 | 256K | Du kannst es für effiziente und vielseitige Anwendungen mit einem großen Kontextfenster nutzen. |
| qwen3.5-plus | $0.40 | $2.40 | 256K | Du kannst es für Anwendungen nutzen, die eine gute Balance zwischen Leistung und Kontextlänge erfordern. |
| qwen3.5-plus-2026-04-20 | $0.40 | $2.40 | 256K | Du kannst es für Anwendungen nutzen, die eine gute Balance zwischen Leistung und Kontextlänge erfordern. |
| qwen3.5-plus-2026-02-15 | $0.40 | $2.40 | 256K | Du kannst es für Anwendungen nutzen, die eine gute Balance zwischen Leistung und Kontextlänge erfordern. |
| qwen-plus | $0.40 | $1.20 | 256K | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
| qwen-plus-latest | $0.40 | $1.20 | 256K | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
| qwen-plus-2025-12-01 | $0.40 | $1.20 | 256K | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
| qwen-plus-2025-09-11 | $0.40 | $1.20 | 256K | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
| qwen-plus-2025-07-28 | $0.40 | $1.20 | 256K | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
| qwen-plus-2025-07-14 | $0.40 | $1.20 | No tiered pricing | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
| qwen-plus-2025-04-28 | $0.40 | $1.20 | No tiered pricing | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
| qwen-plus-2025-01-25 | $0.40 | $1.20 | No tiered pricing | Du kannst es für Standardaufgaben nutzen, die eine kosteneffiziente Textgenerierung erfordern. |
Hinweis: Preise sind Listenpreise der Anbieter-APIs (Stand August 2026) und ändern sich regelmäßig. Rabatte über Batch-, Cache- oder Volumenverträge sowie regionale Hosting-Aufschläge (Azure, Vertex AI, Bedrock) sind nicht berücksichtigt.
Häufige Fragen zu KI-Modell-Kosten
5 Dinge, die niemand offen sagt – und die in keiner Preisliste stehen.
Sind Output-Token wirklich teurer als Input-Token?
Ja, meist um Faktor 3–5×. Wer lange Antworten generieren lässt, zahlt überproportional. Trick: System-Prompts kurz halten, Antwortlänge begrenzen.
Ist ein großes Kontextfenster automatisch teurer?
Lange Prompts kosten linear mit der Tokenzahl. Ein 1M-Kontext lohnt nur, wenn du ihn wirklich brauchst — RAG ist oft günstiger.
Was sind Reasoning- bzw. Thinking-Tokens?
GPT-o-Reihe, DeepSeek-R1 und Claude Opus „denken" intern. Diese Thinking-Tokens werden mitberechnet, deshalb fallen Reasoning-Modelle in der Rechnung oft höher aus als erwartet.
Was bringt Multi-Modell-Routing?
Einfache Tasks an Flash-Lite oder DeepSeek, schwere an Sonnet oder GPT-5 routen — spart in unseren Projekten typischerweise 60–80 % der Kosten.
Welche KI-Modelle sind DSGVO-konform nutzbar?
Für DSGVO-kritische Workloads sind Mistral (EU-Hosting) oder Self-Hosted Llama meist die einzige saubere Wahl. Chinesische Modelle haben in Sales- oder Personendaten nichts verloren.
Unsicher, welches Modell zu deinem Use Case passt?
Wir wählen für dich – datenbasiert, anbieterneutral und mit Blick auf die Total Cost of Ownership.