Zum Inhalt springen
Produkte

Was kostet Ihre LLM-Last wirklich?

Modellieren Sie Ihre monatlichen LLM-API-Kosten direkt im Browser — und sehen Sie dann, wie viel Prompt-Caching, Batch-Verarbeitung und das Routing eines Teils Ihres Traffics zu einem günstigeren Modell einsparen würden. Vergleichen Sie 18 Modelle von 6 Anbietern auf Ihrer exakten Last.

Monatlich & jährlich Live-Neuberechnung Offizielle Preise Ohne Anmeldung
Last-Vorlage

Vorlagen sind Beispiel-Lasten — Ausgangspunkte, die Sie an Ihre eigenen Zahlen anpassen.

Modell
Traffic

Die Tokenizer unterscheiden sich zwischen Modellfamilien — messen Sie an Ihren eigenen Daten. Warum Token-Zahlen schwanken.

Prompt-Caching
5 Min. (1,25× Schreiben)
1 Stunde (2× Schreiben)
Batch
Routing zu einem günstigeren Modell
Prognose & Währung
Geben Sie links Ihren Traffic ein, um die Schätzung zu sehen.

Optimierte Kosten

im Ausgangszustand

Pro Jahr

optimiert, bei gesetztem Wachstum

Pro Aufgabe

Woher die Ersparnis kommt

Die Hebel greifen in dieser Reihenfolge: Caching, dann Batch, dann Routing. Ein ausgegrauter Hebel lässt sich auf dieses Modell oder diese Last nicht anwenden.

Modelle auf dieser Last vergleichen

Jedes Modell auf Ihrem exakten Traffic berechnet — Ausgangszustand und optimiert (Caching + Batch). Sortiert nach optimierten Monatskosten.

ModellAusgangszustand / Mon.Optimiert / Mon.ErsparnisPro Aufgabe

12-Monats-Prognose

Optimierte Monatskosten, aufgezinst mit Ihrer Wachstumsrate.

So kommen Sie dorthin

Erhalten Sie die drei wirkungsvollsten Empfehlungen für Ihre Last — und diese Schätzung als PDF per E-Mail (Aufschlüsselung, Modellvergleich und Prognose).

    So funktioniert die Schätzung

    Ein transparentes Modell auf Token-Ebene — keine Blackbox. Jede Zahl wird live neu berechnet, sobald Sie eine Eingabe ändern, und Sie sehen die exakten Zahlen dahinter.

    Häufig gestellte Fragen

    Wie werden die LLM-API-Kosten berechnet?
    Die Kosten richten sich nach Tokens, nicht nach Anfragen. Wir multiplizieren Ihre monatlichen Aufrufe mit den durchschnittlichen Ein- und Ausgabe-Tokens pro Aufruf, berechnen Eingabe und Ausgabe getrennt zum Millionen-Preis jedes Modells und wenden dann Ersparnisse durch Caching, Batch und Routing an. Das Ergebnis sind ausschließlich die API-Kosten — monatlich und jährlich.
    Wie viel spart Prompt-Caching?
    Caching hilft, wenn ein großer, stabiler Präfix über mehrere Aufrufe hinweg wiederkehrt. Cache-Lesevorgänge kosten typischerweise ~10 % des Eingabepreises, sodass die Ersparnis mit Ihrem cachefähigen Anteil und der Trefferquote skaliert. Ist der cachefähige Präfix kürzer als das Minimum des Modells, greift Caching nicht und die Ersparnis ist null.
    Wann sollte ich Batch-Verarbeitung nutzen?
    Batch-APIs gewähren üblicherweise 50 % Rabatt für asynchrone Verarbeitung mit höherer Latenz. Nutzen Sie sie für Arbeit, die keine sofortige Antwort braucht — Extraktion, Klassifizierung, Offline-Generierung. Nicht für interaktiven Chat.
    Ist ein günstigeres Modell immer günstiger pro Aufgabe?
    Nicht immer. Ein günstigeres Modell braucht möglicherweise mehr Aufrufe, längere Prompts oder Wiederholungen, und seine Caching-/Batch-Unterstützung ist anders. Die Vergleichstabelle berechnet jedes Modell auf Ihrer exakten Last, sodass Sie die echten Kosten pro Aufgabe sehen, nicht den Listenpreis.
    Wie oft werden die Preise aktualisiert?
    Die Preise stammen ausschließlich von den offiziellen Anbieterseiten, aktualisiert monatlich und bei neuen Modell-Releases. Jedes Modell trägt einen Quell-Link; die Referenzdatei trägt ein Aktualisierungsdatum, und ist es älter als 60 Tage, zeigt der Rechner einen Hinweis.
    Umfassen Token-Zahlen und Schätzungen die Infrastruktur?
    Die Schätzung deckt ausschließlich die Token-Kosten der LLM-API ab — sie schließt Server, Vektordatenbanken und Embeddings, Fine-Tuning, Monitoring und Entwicklungszeit aus. Beachten Sie außerdem, dass sich Tokenizer zwischen Modellfamilien unterscheiden, derselbe Text kann auf einem anderen Modell also mehr oder weniger Tokens ergeben; messen Sie an Ihren eigenen Daten.
    Link kopiert