
Preistabellen für KI-APIs zeigen einen Tarif, nicht die Kosten einer erledigten Aufgabe. Vergleichen Sie Input, gecachten Input, Output, Werkzeugkosten, Modellverhalten und Abrechnungsbedingungen mit demselben Anwendungsfall.
Dieser Leitfaden vergleicht öffentliche Produkte, die Entwickler direkt bei den jeweiligen Unternehmen kaufen können. Die repräsentativen Listenpreise wurden am 31. August 2026 geprüft und sind in US-Dollar pro eine Million Text-Tokens angegeben, sofern nichts anderes vermerkt ist. Anbieter können Preise und Modellverfügbarkeit ändern. Öffnen Sie vor einer Kauf- oder Produktionsentscheidung die verlinkte Primärquelle.
Repräsentative öffentliche Preise
| Öffentliche API und Modell | Input | Gecachter Input oder Cache-Lesezugriff | Output | Primärquelle, geprüft am 31.08.2026 |
|---|---|---|---|---|
| LLMBase, DeepSeek V4 Flash | $0,20 | $0,07 | $0,30 | Öffentlicher LLMBase-Modellkatalog |
| OpenAI, GPT-5.6 Luna | $0,20 | $0,02 | $1,20 | OpenAI-Modelldokumentation |
| Anthropic, Sonnet 5 | $2,00 | $0,20 Cache-Lesezugriff | $10,00 | Anthropic API-Preise |
| Google, Gemini 3.5 Flash | $1,50 | $0,15 plus Cache-Speicherung | $9,00 | Gemini API-Preise |
| Mistral, Mistral Large | $0,50 | Bis zu 90 % günstiger für gecachten Input | $1,50 | Mistral-Preise |
Diese Modelle haben keine identische Qualität, Geschwindigkeit, Kontextgröße oder Werkzeugunterstützung. Die Tabelle zeigt Preisstrukturen und ist keine Rangliste der Modellfähigkeiten.
Auch Caching hat je nach API eine andere Bedeutung. Prüfen Sie Kosten für Cache-Schreibvorgänge, Lesezugriffe, Speicherdauer oder automatische Wiederverwendung. Ein niedriger Cache-Lesepreis hilft wenig, wenn Ihre Prompts selten einen stabilen Präfix teilen.
Kosten Ihres Anwendungsfalls berechnen
Verwenden Sie gemessene Tokenzahlen aus einer repräsentativen Anfrage. Eine einfache Monatsschätzung lautet:
nicht gecachte Input-Tokens × Input-Preis
+ gecachte Tokens × Cache-Preis
+ generierte und Reasoning-Tokens × Output-Preis
+ Kosten für Werkzeuge, Speicherung, Bilder, Audio oder Suche
Testen Sie mindestens drei Aufgabenarten. Support-Klassifizierung, Coding-Agent und Dokumentanalyse können unterschiedliche Input-Output-Verhältnisse und Cache-Trefferquoten haben. Zählen Sie Wiederholungen und abgelehnte Ergebnisse, da sie Entwicklungszeit und möglicherweise Tokens verbrauchen.
Modellabdeckung vergleichen
Entscheiden Sie, ob Sie eine Modellfamilie, einen Katalog mit Open-Weight-Modellen oder mehrere Familien über ein Konto benötigen. Notieren Sie genaue Modell-IDs, Lebenszyklusregeln, Kontextfenster, Modalitäten und aktuelle Verfügbarkeit.
Ein breiter Katalog reduziert Kontoverwaltung nur dann, wenn seine Modelle Ihre Aufgabentests bestehen. Eine fokussierte API kann passen, wenn eine Modellfamilie den Anwendungsfall abdeckt und anbieterspezifische Funktionen wichtiger als Portabilität sind.
Dokumentierte API-Funktionen testen
Erstellen Sie eine kleine Kompatibilitätsmatrix für die Felder Ihrer Anwendung:
- Modellsuche und stabile Modell-IDs.
- Chat Completions oder ein anderer benötigter Endpunkt.
- Server-Sent Streaming und Abbruchverhalten.
- Tool Calls einschließlich der Fortsetzung mit Werkzeugergebnis.
- Strukturierte Ausgaben oder JSON-Schema-Verarbeitung.
- Bild-, Audio-, Embedding- und Batch-Endpunkte bei Bedarf.
- Fehlerformate, Anfrage-IDs, Limits und Hinweise zu Wiederholungen.
„OpenAI-kompatibel“ hat Grenzen. Testen Sie Ihre konkrete SDK-Version und die verwendeten Felder. Gehen Sie nicht davon aus, dass ein kompatibler Chat-Completions-Endpunkt jeden weiteren Endpunkt oder jede anbieterspezifische Erweiterung umfasst.
Regionale Optionen und AVV prüfen
Fragen Sie nach dem Verarbeitungsort des gewählten Modells. Trennen Sie in Ihrer Prüfung Modellverarbeitung, Speicherung, Supportzugriff und Kontobetrieb. Klären Sie, ob eine regionale Option standardmäßig, je Modell, je Endpunkt oder nur über eine separate Vereinbarung gilt.
Beschaffen Sie den aktuellen AVV oder DPA, wenn Ihre Organisation ihn benötigt. Prüfen Sie Geltungsbereich, Abschlussprozess, Unterauftragsverarbeiter und Aktualisierungsmechanismus. Ihre Rechts- und Datenschutzverantwortlichen sollten das Dokument anhand der geplanten Daten und Aufgaben bewerten.
Abrechnungsbedingungen lesen
Tokenpreise zeigen nicht jeden Unterschied für Zahlungsfluss und Buchhaltung. Vergleichen Sie:
- Vorausbezahlte Credits, nachträgliche Rechnungen und Mindestkäufe.
- Ablauf- und Erstattungsbedingungen für Credits.
- Währung, Steuern und Rechnungsverfügbarkeit.
- Ausgabenlimits, Projektbudgets und Nutzungsdatenexporte.
- Batch-Rabatte, Prioritätsstufen, regionale Aufschläge und Werkzeugkosten.
Setzen Sie vor einem Produktionstest ein Ausgabenlimit und eine Warnung. Gleichen Sie das Anbieter-Dashboard mit den Token- und Anfragezahlen Ihrer Anwendung ab.
LLMBase veröffentlicht den EU-gehosteten Modellkatalog mit aktuellen Preisen auf der Inference-Seite. Wenn Sie bereits einen OpenAI-SDK-Client verwenden, folgen Sie dem Leitfaden zur OpenAI-kompatiblen Migration und behalten Sie einen minimalen Integrationstest für jede benötigte Funktion.