Leistungen

LLM Fine-Tuning und MLOps für US- & EU-KI-Teams

Wir tunen große Sprachmodelle für Produktteams, die über Prompt-Engineering und RAG hinausgewachsen sind — als schlanke Festpreis-Stufen, nicht als sechsstelliges Enterprise-Engagement. SFT, DPO, ORPO, LoRA und QLoRA auf Llama 3.3, Qwen 2.5, Mistral, Phi-4 sowie OpenAI/Anthropic Custom Models. Jedes Engagement umfasst ein versioniertes Eval-Harness, vLLM- oder TGI-Inferenz mit INT4/INT8-Quantisierung und einen MLOps-Loop, der Regressionen erkennt, bevor Nutzer es tun. Ein Eval-PoC ab 2.900 $ in 4–6 Wochen, RAG über Ihrer Wissensbasis ab 8.100 $, ein autonomer KI-Agent ab 10.400 $, ein fine-getuntes Modell in Produktion ab 13.800 $. Festumfänglich, All-in-Preise in USD, IP ab Tag eins auf Sie übertragen.

LLM Fine-Tuning und MLOps Dienste fuer Unternehmens-KI-Teams
9+Jahre am Markt
80+Senior-Ingenieure im Team
120+Gelieferte Projekte
71Kunden-NPS

Senior-MLEs, die fine-getunete Modelle in Produktion gebracht haben · Ihre Cloud, Ihre Gewichte · DSGVO-konform · ISO-27001-bereit · SOC 2 Type II in Vorbereitung · HIPAA-fähig · MEZ-Arbeitstag mit Überlappung 9–13 Uhr ET

Die meisten KI-Teams sollten kein Fine-Tuning durchführen. Prompt-Engineering, strukturierte Ausgaben und Retrieval-Augmented Generation lösen 80 Prozent der Produktionsfälle zu Frontier-API-Kosten. Die verbleibenden 20 Prozent sind der Bereich, in dem Fine-Tuning seinen Wert beweist — Verhaltensänderungen, die kein Prompt erzwingen kann, Struktur-Ausgabetreue über 99 Prozent, Latenz unter 400 ms bei p95 oder eine Inferenzkostenkurve, die im großen Maßstab bricht. Wir helfen Teams herauszufinden, auf welcher Seite dieser Linie sie stehen, und liefern dann das kleinste Modell, das die Eval-Messlatte erfüllt. Engagements beginnen mit einem schriftlichen Machbarkeitsmemo und einem versionierten Eval-Harness; nichts wird trainiert, bevor beides schriftlich vereinbart ist.

Was wir in einem LLM-Fine-Tuning-Engagement liefern

Datenkuration & Annotierungs-Pipelines

Golden-Set-Erstellung, Annotierungsrubriken, Inter-Annotator-Agreement-Tracking, PII-Redaktion mit Presidio, synthetische Datengenerierung mit Frontier-Modellen und Deduplizierung. Die Annotierungs-Pipeline liegt in Ihrer Cloud, nicht in unserer.

SFT, DPO, ORPO Fine-Tuning

Supervised Fine-Tuning für Verhaltensänderungen, DPO und ORPO für Präferenz-Alignment ohne separates Reward-Modell sowie KTO, wenn Präferenzdaten asymmetrisch sind. TRL, Unsloth und Axolotl auf Ihren Cloud-GPUs oder unseren.

LoRA / QLoRA Kostenoptimierung

Parametereffizientes Fine-Tuning reduziert den GPU-Speicherbedarf um 60–80 Prozent und ermöglicht die Iteration von Ablations auf einem einzelnen A100. Wir setzen standardmäßig QLoRA 4-bit für die erste Phase ein, volles Fine-Tuning nur, wenn Ablations den Nutzen belegen.

Eval-Harness & Regressionstests

Versioniertes Golden Set, LLM-as-Judge mit Rubrik-Bewertung (Ragas, eigene), Aufgaben-Metriken (F1, BLEU, ROUGE, Exact Match), adversarielle Probes auf Halluzination, Jailbreak, PII-Leakage. CI blockiert jeden Merge, der die Messlatte unterschreitet.

MLOps & kontinuierliches Training

Trainingsdaten-Versionierung mit DVC oder LakeFS, Experiment-Tracking auf Weights & Biases oder MLflow, geplantes Retraining durch Drift-Metriken ausgelöst sowie Rollback-Runbooks. Alles reproduzierbar, alles in Ihrem Repository.

Inferenz-Serving & Quantisierung

vLLM, TGI oder TensorRT-LLM mit Continuous Batching, INT8/INT4-Quantisierung (AWQ, GPTQ, FP8), Speculative Decoding und Prefix Caching. Last-getestet bei Ihrem realen p95-Traffic vor dem Cutover, mit Monitoring-Dashboards.

Unser eingesetzter Stack

PyTorch Hugging Face PEFT LoRA QLoRA DPO ORPO TRL Unsloth Axolotl vLLM TGI TensorRT-LLM Llama 3.3 Qwen 2.5 Mistral Phi-4 Modal Replicate RunPod MLflow Weights & Biases Ragas

Ablauf eines LLM-Fine-Tuning-Engagements

  1. 01

    Machbarkeit

    Woche 1–2: Schriftliches Memo, das beantwortet, ob Fine-Tuning das richtige Werkzeug ist, welches Basis-Modell zur Aufgabe passt, welchen Eval-Gewinn gegenüber RAG/Prompt-Baseline zu erwarten ist und wie die Gesamtkosten über 12 Monate aussehen. Go/No-Go vor jeglichen GPU-Ausgaben.

  2. 02

    Daten & Eval

    Wochen 3–5: Golden Set mit 200–1.000 annotierten Beispielen, Annotierungsrubrik, PII-Redaktions-Pipeline, Eval-Harness an W&B mit Frontier-Baselines gekoppelt. Kein Training, bevor die Eval-Suite gegen die Baseline grün läuft.

  3. 03

    Training & Ablations

    Wochen 6–8: SFT, dann DPO oder ORPO, wenn Präferenzdaten vorhanden. LoRA/QLoRA zuerst, Ablations zu Rank, Lernrate und Basis-Modell. Jeder Lauf ist aus der Konfigurationsdatei in Ihrem Repository reproduzierbar.

  4. 04

    Serving & Übergabe

    Wochen 9–12: vLLM/TGI-Deployment, Quantisierung, Lasttests bei p95-Traffic, Canary-Rollout mit Rollback-Runbook, Monitoring-Dashboards und Entwicklerübergabe. Optionaler MLOps-Retainer für kontinuierliches Training.

Engagement-Modelle

Eval-PoC

4–6 Wochen. Ein schriftliches Machbarkeitsmemo plus ein versioniertes Eval-Harness auf Ihrer realen Aufgabe: Basis-Modell-Empfehlung, erwarteter Eval-Gewinn gegenüber RAG/Prompt-Baseline, GPU-Kostenprojektion, Go/No-Go. Wird auf die nächste Stufe angerechnet. Ab 2.900 $.

RAG über Ihrer Wissensbasis

Wenn Retrieval das Tuning schlägt: RAG, verankert in Ihrem eigenen Korpus, mit Ingestion und Chunking, hybridem Retrieval und Reranking, einem Eval-Harness in CI, PII-Handling und Observability. Ab 8.100 $.

KI-Agent (autonom)

Ein mehrstufiger Agent, der über Ihre Tools hinweg Aktionen ausführt, mit Human-in-the-Loop auf kritischen Pfaden, deterministischen Evals, Output-Filtern und einem Runbook im Besitz Ihres Teams. Ab 10.400 $.

Fine-getuntes Modell in Produktion

Ein produktives Modell: Datenkuration, SFT plus DPO/ORPO und Ablations, vLLM/TGI-Inferenz mit Quantisierung, MLOps mit Drift-Erkennung, Monitoring und Entwicklerübergabe. Ab 13.800 $.

Die Preise sind all-in und in USD, mit IP-Übertragung auf Sie ab Tag eins, ohne Recruiting-Aufschlag und ohne Tool-Zuschläge. GPU-Compute läuft auf Ihrem eigenen Cloud-Account — Sie zahlen AWS/GCP/Azure direkt —, sodass Sie den Kostenhebel behalten.

Was den Preis treibt: Basis-Modell-Größe und ob es eine geschlossene API oder ein selbst gehostetes Open-Weight ist; wie viele annotierte Daten vorhanden sind versus kuratiert werden müssen; die Anzahl der eingesetzten Trainingsmethoden (nur SFT oder SFT plus DPO/ORPO und Ablations); Inferenz-SLA und Quantisierungsziele; sowie der Compliance-Umfang — ein HIPAA-BAA, EU-only-Datenresidenz oder SOC-2-Nachweise verursachen Datenhandling- und Audit-Arbeit zusätzlich zum Modell-Engineering.

Was ein LLM-Fine-Tuning-Engagement kostet

Die meisten Anbieter behalten die Zahl für den Verkaufstermin. Hier sind unsere schlanken Festpreis-Stufen, damit Sie vor der Discovery budgetieren können. Alles ist all-in, in USD ausgewiesen, mit IP-Übertragung auf Sie ab Tag eins, ohne Recruiting-Aufschlag, ohne Tool-Zuschläge und ohne versteckte Gebühren. Sie sehen das positionsweise Budget, bevor eine Zeile Code geschrieben wird, und geben es frei. GPU-Compute läuft auf Ihren eigenen Accounts, sodass Sie den Kostenhebel behalten.

Eval-PoC

ab 2.900 $

4–6 Wochen · fest

Ein schriftliches Machbarkeitsmemo plus ein versioniertes Eval-Harness auf Ihrer realen Aufgabe: Basis-Modell-Empfehlung, erwarteter Gewinn gegenüber RAG/Prompt-Baseline, GPU-Kostenprojektion, Go/No-Go. Wird auf die nächste Stufe angerechnet.

RAG über Ihrer Wissensbasis

ab 8.100 $

wenn Retrieval das Tuning schlägt

RAG, verankert in Ihrem eigenen Korpus, mit Ingestion und Chunking, hybridem Retrieval und Reranking, einem Eval-Harness in CI, PII-Handling und Observability.

KI-Agent (autonom)

ab 10.400 $

mehrstufig, tool-nutzend

Ein mehrstufiger Agent, der über Ihre Tools hinweg Aktionen ausführt, mit Human-in-the-Loop auf kritischen Pfaden, deterministischen Evals, Output-Filtern und einem Runbook im Besitz Ihres Teams.

Fine-getuntes Modell in Produktion

ab 13.800 $

vom Notebook zum Serving

Ein produktives fine-getuntes Modell: Datenkuration, SFT plus DPO/ORPO und Ablations, vLLM/TGI-Inferenz mit Quantisierung, MLOps mit Drift-Erkennung und Übergabe.

Was die Zahl bewegt: Basis-Modell-Größe und ob es eine geschlossene API oder ein selbst gehostetes Open-Weight ist; wie viele annotierte Daten vorhanden sind versus kuratiert werden müssen; die Anzahl der eingesetzten Trainingsmethoden (nur SFT oder SFT plus DPO/ORPO und Ablations); Inferenz-SLA und Quantisierungsziele; sowie der Compliance-Umfang — ein HIPAA-BAA, EU-only-Datenresidenz oder SOC-2-Nachweise verursachen Datenhandling- und Audit-Arbeit zusätzlich zum Modell-Engineering. GPU-Compute läuft auf Ihren eigenen Accounts, sodass Sie den Kostenhebel behalten. Die Preise sind indikativ und werden in einem schriftlichen Angebot für Ihren spezifischen Umfang fixiert.

Warum US- & EU-KI-Teams YuSMP für Fine-Tuning wählen

DSGVO-konform · ISO-27001-bereit · SOC 2 Type II in Vorbereitung · HIPAA-fähig · CCPA-berücksichtigt

Eval zuerst, nicht Bauchgefühl

Kein Trainingslauf beginnt, bevor das Eval-Harness gegen Ihre Frontier-Baseline grün läuft. Jedes Release wird mit einem Regressionsbericht ausgeliefert. Unterschreitet die Eval-Messlatte den Schwellenwert, wird der Merge blockiert — nicht verhandelt.

Senior MLEs, keine Prompt-Ingenieure

Die MLEs in Ihrem Engagement haben fine-getunete Modelle in der Produktion ausgeliefert. Sie wissen, welchen LoRA-Rank man wählt, warum Ihr DPO-Loss divergiert und wie man einen vLLM-Durchsatz-Cliff debuggt — ohne Twitter-Thread.

Ihre Cloud, Ihre Gewichte

Training läuft in Ihrer VPC, Gewichte verbleiben in Ihrem S3/GCS, Code liegt in Ihrem Repository. Wir arbeiten via assumed IAM Roles. Keine Daten landen jemals auf unseren Laptops, und Sie besitzen das resultierende Modell ab Tag eins.

Für regulierte Workloads unterzeichnen wir HIPAA BAAs, betreiben ausschließlich in HIPAA-fähigen Regionen und integrieren uns in Ihre bestehende Daten-Governance — nicht parallel dazu.

Was Kunden sagen

Eine Kreditentscheidungs-Engine, die zehnmal schneller genehmigt, entsteht nicht zufällig. YuSMP entwickelte die Scoring-Pipeline, die Integration mit Kreditbüros und ein Back-Office, das unsere Underwriter gerne nutzen. Die Genehmigungszeit sank von zwei Tagen auf unter vier Stunden.
Gregory Lawson, CTO, LoanFlowFallstudie ansehen →

Häufig gestellte Fragen

Wann sollten wir ein LLM fine-tunen statt ein Frontier-Modell mit Prompt-Engineering oder RAG zu verwenden?

Drei Signale rechtfertigen Fine-Tuning. Erstens Latenz oder Kosten: Ein fine-getuntes 7B-Modell auf vLLM kostet bei p95-Latenz unter 400 ms etwa ein Vierzigstel von GPT-4o für dieselbe Aufgabe. Zweitens Verhalten, das sich nicht erpromten lässt: domänenspezifischer Stil, strukturierte Ausgabetreue über 99 %, oder Ablehnungsmuster, die Frontier-Safety-Schichten nicht erlauben. Drittens Datenhebel: Sie verfügen über 5.000+ hochwertige, annotierte Paare, die niemand sonst hat. Wenn es hauptsächlich um Wissensabruf geht, beginnen Sie mit RAG. Wenn es um gelegentliche Formatierung geht, beginnen Sie mit Prompt-Engineering. Fine-Tuning ist die richtige Entscheidung, wenn Sie Verhaltensänderungen im großen Maßstab benötigen.

Tunen Sie Frontier-Modelle wie GPT-4 oder nur Open-Source-Modelle?

Beides. OpenAI Fine-Tuning (GPT-4o, GPT-4.1, GPT-4o-mini), Anthropic via Bedrock Custom Models, Google Gemini Tuning und den gesamten Open-Source-Stack: Llama 3.3, Qwen 2.5, Mistral, Phi-4, DeepSeek. Die Wahl ist eine Ingenieurentscheidung, keine Weltanschauungsfrage. Closed Models bieten schnellere Lieferung und null Infrastrukturaufwand. Open Models bieten Eigentümerschaft, günstigere Inferenz im großen Maßstab und On-Premises-Deployment bei Compliance-Anforderungen. Wir führen dasselbe Eval-Harness gegen beide Wege aus und stellen die Kosten-pro-Token, Latenz und Qualitätsabwägung schriftlich dar, bevor Sie sich festlegen.

Was enthält Ihr Eval-Harness tatsächlich, und wie verhindern Sie Regressionen?

Jedes Engagement wird mit einer versionierten Eval-Suite ausgeliefert: ein Golden Set von 200 bis 1.000 annotierten Beispielen, die gemeinsam mit dem Kunden kuratiert wurden, automatisiertes LLM-as-Judge mit Rubrik-Bewertung (Ragas, eigene Rubriken), aufgabenspezifische Metriken (BLEU, ROUGE, Exact Match, F1, Struktur-Ausgabetreue) und adversarielle Probes auf Halluzination, Jailbreak und PII-Leakage. Jeder Trainingslauf wird auf Weights & Biases mit der vollständigen Eval-Tabelle gepostet. CI blockiert jeden Merge, der das Golden Set um mehr als den vereinbarten Schwellenwert (typischerweise 2 %) zurückbringt. Die Eval-Suite gehört Ihnen, ist versionskontrolliert in Ihrem Repository und läuft bei jedem Release gegen Frontier-Baselines.

Wie halten Sie Fine-Tuning-Kosten unter Kontrolle, insbesondere bei iterativen Experimenten?

Zuerst parametereffiziente Methoden: LoRA und QLoRA reduzieren den GPU-Speicherbedarf um 60 bis 80 Prozent und ermöglichen das Ausführen eines Llama 3.3 70B SFT auf einem einzelnen A100-80GB-Knoten für unter 350 $ GPU-Zeit. Unsloth und Axolotl bieten uns den doppelten Trainingsdurchsatz im Vergleich zu Vanilla Hugging Face TRL. Wir setzen standardmäßig QLoRA 4-bit für die erste Experimentierphase ein und wechseln zu vollem Fine-Tuning nur, wenn Ablations belegen, dass es die Eval-Nadel bewegt. Die Inferenzkosten werden durch INT8/INT4-Quantisierung (AWQ, GPTQ), vLLM Continuous Batching und Speculative Decoding kontrolliert. Ein typischer Kunde wechselt von rund 20.000 $/Monat Frontier-API-Ausgaben zu etwa 3.900 $/Monat Self-Hosted-Inferenz. GPU-Compute läuft auf Ihren eigenen Accounts, sodass Sie den Kostenhebel behalten.

Was ist mit dem Datenschutz, wenn wir Trainingsdaten an Ihr Team senden?

Das Engagement beginnt mit einem gegenseitigen NDA und einem DSGVO-konformen DPA. Trainingsdaten verbleiben in Ihrem Cloud-Account: Wir arbeiten via assumed IAM Roles, kopieren keine Daten auf Laptops, und der Trainings-Cluster läuft in Ihrer VPC (AWS SageMaker, GCP Vertex, Azure ML oder Ihr Kubernetes). Für regulierte Daten unterzeichnen wir HIPAA BAAs und betreiben ausschließlich in HIPAA-fähigen Regionen. PII-Redaktions-Pipelines (Presidio, eigene Regex + NER) sind Teil des Datenkurationschritts. Wir sind DSGVO-konform, ISO-27001-bereit, SOC 2 Type II in Vorbereitung, HIPAA-fähig und CCPA-berücksichtigt.

Was kostet ein LLM-Fine-Tuning-Engagement bei YuSMP?

Engagements sind festumfänglich und schlank, all-in und in USD ausgewiesen. Ein Eval-PoC läuft ab 2.900 $ (4–6 Wochen); RAG über Ihrer Wissensbasis ab 8.100 $, wenn Retrieval das Tuning schlägt; ein autonomer KI-Agent ab 10.400 $; ein fine-getuntes Modell in Produktion ab 13.800 $. Die genaue Zahl hängt ab von Basis-Modell-Größe und ob es eine geschlossene API oder ein selbst gehostetes Open-Weight ist, wie viele annotierte Daten vorhanden sind versus kuratiert werden müssen, der Anzahl der eingesetzten Trainingsmethoden, dem Inferenz-SLA und den Quantisierungszielen sowie dem Compliance-Umfang. Sie sehen das positionsweise Budget am Ende der Discovery und geben es frei, bevor eine Zeile Code geschrieben wird. Es gibt keinen Recruiting-Aufschlag und keine Tool-Zuschläge, und GPU-Compute läuft auf Ihren eigenen Accounts, sodass Sie den Kostenhebel behalten.

Haben Sie eine Fine-Tuning-Idee und benötigen zunächst ein schriftliches Machbarkeitsmemo?

Erstgespräch vereinbaren

Angebot anfordern

Teilen Sie uns einige Details mit, und ein Senior-Consultant antwortet innerhalb eines Werktages.