Ein Large Language Model oder LLM ist ein Machine-Learning-Modell, das auf grossen Sprachdatenmengen trainiert wird, um Tokens vorherzusagen und Text zu erzeugen oder zu verändern. Moderne LLMs verarbeiten auch Code, strukturierte Daten und in multimodalen Varianten Bilder oder Audio.
Flüssiger Output wird leicht mit verifiziertem Wissen oder deterministischer Software verwechselt. Das Modell kennt nicht automatisch aktuelle private Fakten, erzwingt keine Geschäftsregeln oder Berechtigungen und antwortet nicht immer gleich. Eine Demo kann fertig wirken, während der Produktionsworkflow unsicher oder unwirtschaftlich bleibt.
Ein LLM ist eine probabilistische Komponente in einem kontrollierten Produkt. Beginnen Sie mit Nutzerentscheid und Fehlerbudget und bauen Sie Kontext, Tools, Validation, Human Review und Fallbacks um das Modell.
Systemdesign
Das Modell ist nicht das Produkt
Eine Produktionsapplikation ergänzt User Experience, Datenzugriff, Retrieval, Workflow-State, Authorization, Evaluation, Monitoring und Recovery. Bei einem Proposal Assistant formuliert das Modell, während das Produkt Quellen wählt, Zitate bewahrt, Review routet und die akzeptierte Antwort exportiert.
Diese Trennung verhindert Architektur nach Benchmark. Ein stärkeres Modell verbessert den Workflow nicht, wenn Retrieval schwach ist, Fakten fehlen oder der Review Unsicherheit versteckt. Evaluieren Sie den vollständigen Weg vom Input zum akzeptierten Outcome.
| Bedarf | Modellrolle | Applikationskontrolle |
|---|---|---|
| Aktuelle Fakten | Kontext synthetisieren | Quellen holen und autorisieren |
| Strukturierter Output | Felder entwerfen | Schema-Validation und Retry |
| Business Action | Tool empfehlen oder wählen | Policy, Bestätigung, Execution |
| Qualität | Kandidat produzieren | Evaluation, Review, Monitoring |
Auswahl
Modellwahl ist ein Portfolioentscheid
Tasks belohnen verschiedene Modelle. Ein kleines Modell klassifiziert oder extrahiert günstig; ein grosses bewältigt Ambiguität besser. Open-Weight Deployment gibt Kontrolle, verlangt aber Hosting. Managed Models beschleunigen und bringen Provider-, Standort- und Lifecycle-Fragen.
Halten Sie die Applikationsgrenze austauschbar. Nutzen Sie Task-Evaluation statt Brandpräferenz und routen Sie nur bei gemessenem Wert. Das beste Modell erfüllt den Threshold unter gesamten Produktionsbedingungen und nicht den grössten allgemeinen Benchmark.
- Mit repräsentativen Inputs und Sprachen benchmarken.
- Workflow-Qualität statt Eloquenz messen.
- Kontext-, Output- und Toolkosten einschliessen.
- Fehler- und Ausfallverhalten testen.
- Versionierung und Rollback bewahren.
Woran gute Arbeit erkennbar ist
Konkrete Ergebnisse für Large Language Model
- Tasks werden nach Wert und Fehlertoleranz statt Neuheitswert gewählt.
- Output wird bei aktuellen Fakten in erlaubtem Kontext verankert.
- Deterministische Regeln und Berechtigungen bleiben ausserhalb des Modells.
- Qualität, Latenz, Kosten und Safety werden an realer Arbeit gemessen.
- Modell- oder Providerwechsel lassen sich testen und zurückrollen.
Betriebsmodell
So wird die Arbeit ausgeführt
- 01
Task und Fehlerbudget definieren
Bestimmen Sie Input, Output, Nutzerentscheid und Fehlerfolge. Trennen Sie Drafting, Extraction, Classification, Search und Action, weil sie andere Controls verlangen. Definieren Sie Abstention, Rückfrage und menschliche Freigabe.
- 02
Die Applikationsgrenze entwerfen
Entscheiden Sie erlaubten Kontext, Tools und deterministische Regeln. Wenden Sie Identity und Authorization vor Retrieval oder Aktion an. Validieren Sie strukturierte Outputs und halten Sie Transaktionen, Policy und Berechnung möglichst in normalem Code.
- 03
An realen Fällen evaluieren
Erstellen Sie ein versioniertes Testset mit normalen, schwierigen und adversarial Inputs. Messen Sie Task-Korrektheit, unbelegte Claims, Refusal, Latenz und Kosten. Prüfen Sie Dokumenttyp, Sprache, Kundenkontext und Risiko statt nur einen Durchschnitt.
- 04
Modelländerung betreiben
Loggen Sie Modell-, Prompt-, Kontext- und Toolversionen datenschutzgerecht. Überwachen Sie Qualität und Spend. Testen Sie neue Modelle gegen dieselben Kriterien, rollen Sie gestuft aus und behalten Sie Rollback. Provider-Updates sind Dependency Changes.
Bewertung
Fragen, die den Entscheid verändern
- Profitiert der Task von flexibler Sprachverarbeitung?
- Welcher Fehler ist akzeptabel und wann ist Human Approval nötig?
- Welche Fakten müssen aus Retrieval oder Tools statt Modellgedächtnis kommen?
- Welches Modell erfüllt Qualität, Latenz, Privacy und Kosten im Realtest?
- Wie reagiert das System bei fehlendem Kontext oder Modellausfall?
Fehlermuster
Wo Teams die Kontrolle verlieren
Selbstsichere Sprache enthält unbelegte oder veraltete Aussagen.
Prompt- und Kontextänderungen verändern Verhalten ohne Codeänderung.
Private Inputs überschreiten unbeabsichtigt Processing- oder Retention-Grenzen.
Modelloutput als ausführbare Instruktion schafft Security-Risiko.
Tokenkosten und Latenz werden bei Produktionsvolumen unwirtschaftlich.
Messung
Das fertige Ergebnis messen
Gemessen wird der abgeschlossene Prozess inklusive Review-Aufwand und Ausnahmen. Reines Output-Volumen beweist noch keine bessere Arbeitsweise.
- Task Success am versionierten Evaluationsset
- Rate unbelegter Claims und Abstentions
- menschliche Korrektur nach Fehlerkategorie
- Latenz und Kosten je abgeschlossenem Outcome
- gültige Tool Calls und strukturierte Outputs
- Qualitätsänderung je Modell- und Promptversion
Fragen
Häufige Fragen
Wofür steht LLM?
LLM steht für Large Language Model, ein auf umfangreichen Sprachdaten trainiertes Modell für Tokenvorhersage und Tasks wie Drafting, Extraction, Classification und Fragen.
Ist ein LLM dasselbe wie generative KI?
Ein LLM ist eine Art generativer KI mit Fokus auf Sprache. Generative KI umfasst zusätzlich Modelle für Bilder, Audio, Video und andere synthetische Inhalte.
Kennt ein LLM Unternehmensdaten?
Nicht automatisch. Private oder aktuelle Fakten müssen über erlaubten Kontext, Retrieval oder Tools kommen. Die Anwendung erzwingt Zugriff und zeigt Quellen wichtiger Claims.
Wie wählt man ein Enterprise LLM?
Definieren Sie Task und Kriterien und testen Sie Modelle an realen Fällen auf Qualität, Safety, Sprache, Latenz, Kosten, Deployment und Datenbehandlung.
Quellen
Primärquellen
- LLM glossary entry NIST
Zeke
AI Product Engineering, das aus einem Software-Briefing ein zuverlässiges Produkt im Betrieb macht.
Produktverantwortliche, Gründungsteams und Software-Engineering-Teams. Ausgangspunkt sind der bestehende Ablauf, seine Grenzen und die vorhandenen Nachweise.
Zeke ansehen→