Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Instruction Tuning (SFT) — vom vortrainierten zum hilfreichen Modell

Instruction Tuning (SFT) — vom vortrainierten zum hilfreichen Modell — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Instruction Tuning (SFT) — vom vortrainierten zum hilfreichen Modell?

SFT wandelt die Gewohnheit eines roh vortrainierten LLM, Text bloß fortzusetzen, in Instruktionsbefolgung um, indem es auf kuratierten (Instruktion, Antwort)-Paaren fein abgestimmt wird — vermittelt aber ausschließlich Verhalten, niemals neues Wissen.

Instruction Tuning — meist Supervised Fine-Tuning oder SFT genannt — ist der Trainingsschritt, der aus einem rohen, vortrainierten Sprachmodell etwas macht, das sich wie ein Assistent verhält. Ein vortrainiertes Modell hat ausschließlich gelernt, das nächste Wort in enormen Textmengen vorherzusagen; es hat keine eingebaute Vorstellung davon, dass auf eine Frage eine Antwort folgen sollte statt weiterer Fragen. Fragt man ein rein vortrainiertes Modell „Was ist die Hauptstadt von Frankreich?“, setzt es ebenso plausibel mit „Was ist die Hauptstadt von Deutschland?“ fort, weil statistisch gesehen genau das im Trainingskorpus oft auf eine Frage folgt. SFT ist das, was dem Modell beibringt, dass eine Frage eine Antwort verdient, eine Instruktion Befolgung verdient und eine Anfrage eine hilfreiche, gut formatierte Antwort verdient.

Wie es funktioniert

Der Mechanismus ist einfach im Verhältnis zu dem, was er hervorbringt. Ein kuratierter Datensatz von Instruktions-Antwort-Paaren — irgendwo zwischen zehntausend und ein paar Millionen Beispielen — wird verwendet, um das vortrainierte Modell mit demselben Next-Token-Prediction-Loss wie im Pre-Training weiterzutrainieren, nur eben auf einem kleinen, sorgfältig verfassten Datensatz statt auf einem Auszug aus dem offenen Internet. Die Gewichte des Modells verschieben sich hin zu dem demonstrierten Antwortstil bei einem demonstrierten Instruktionsstil. Entscheidend ist: SFT fügt kein neues Weltwissen hinzu — das liegt im enormen Pre-Training-Korpus. SFT vermittelt Verhalten: Formateinhaltung, Tonalität, Ablehnungsmuster, Instruktionsbefolgung.

Warum es zählt

  • Unaufgefordert beantwortet ein vortrainiertes Modell „Was ist die Hauptstadt von Frankreich?“ mit weiteren Fragen statt mit einer Antwort — genau dieses Versagen behebt SFT.
  • Das 1,3B-SFT-Modell von InstructGPT schlug das rohe 175B-GPT-3 in menschlichen Bewertungen — der Beweis, dass Alignment-Arbeit reine Skalierung übertrifft.
  • SFT kann Demonstrationen nur imitieren, nicht Qualität bewerten — es übernimmt jedes selbstbewusst falsche Beispiel seines Trainingssets, und genau diese Lücke schließen RLHF, Constitutional AI und DPO.

Kernpunkte

  • SFT vermittelt Verhalten (Instruktionsbefolgung, Format, Tonalität, Ablehnungen), NICHT Wissen — Wissen stammt aus dem Pre-Training.
  • Datensatzgröße — 10K bis 1M (Instruktion, Antwort)-Paare; Qualität dominiert Quantität ab ~50K Beispielen (LIMA 2023).
  • Grundlegende Arbeiten — FLAN (Google 2021) Multi-Task; InstructGPT (OpenAI 2022) frei formulierte, menschlich verfasste Daten; Self-Instruct / Alpaca lehrmodell-bootstrapped.
  • Zentrales Ergebnis — 1,3B SFT-getuntes Modell von Menschen gegenüber rohem 175B-GPT-3 bevorzugt (InstructGPT 2022) — Alignment > Skalierung bei der Nützlichkeit.
  • Grenzen — keine Vorstellung von Qualitätsranking, kann nicht aus Negativbeispielen lernen, pflanzt Fehler der Demonstrationen fort; benötigt RLHF/DPO/CAI obendrauf.
  • Instruction Tuning (SFT) — vom vortrainierten zum hilfreichen Modell ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Kontrakt und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
  • Verwenden Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Supervised Fine-Tuning (SFT)
Die Instruction-Tuning-Phase, die mittels standardmäßiger überwachter Next-Token-Prediction auf einem kuratierten Datensatz von (Instruktion, Antwort)-Paaren einem vortrainierten LLM beibringt, Instruktionen zu befolgen und sich wie ein Assistent zu verhalten; die Grundlagenphase vor jeder Präferenzoptimierung.
FLAN
Googles Arbeit von 2021 (Finetuned Language Net), die zeigte, dass Multi-Task-Instruction-Tuning über 60+ als Instruktionen formatierte NLP-Datensätze eine starke Zero-Shot-Generalisierung auf ungesehene Aufgaben erzeugt.
InstructGPT
OpenAIs Paper von 2022 (Ouyang et al.), das SFT auf menschlich verfassten, frei formulierten Demonstrationen mit RLHF kombinierte; das kanonische Rezept hinter ChatGPT und der Beweis, dass ein 1,3B-aligned-Modell ein rohes 175B-Modell bei der Nützlichkeit schlägt.
LIMA
Meta-Ergebnis von 2023 (Less Is More for Alignment), das zeigt, dass 1.000 sorgfältig kuratierte SFT-Beispiele ein Modell hervorbringen, das mit 50K+ Beispielen konkurrenzfähig ist — Qualität dominiert Quantität bei Instruktionsdaten.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Kontrakt
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Ein Label, das verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Ouyang et al. — Training language models to follow instructions with human feedback (InstructGPT, OpenAI 2022)
  2. Wei et al. — Finetuned Language Models Are Zero-Shot Learners (FLAN, Google 2021)
  3. Zhou et al. — LIMA: Less Is More for Alignment (Meta 2023)
  4. Stanford Alpaca — instruction-tuned LLaMA via Self-Instruct
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →