{"id":221,"date":"2026-04-20T18:44:29","date_gmt":"2026-04-20T17:44:29","guid":{"rendered":"https:\/\/knowtech.waszmann.com\/?p=221"},"modified":"2026-04-20T21:21:06","modified_gmt":"2026-04-20T20:21:06","slug":"221","status":"publish","type":"post","link":"https:\/\/knowtech.waszmann.com\/?p=221&lang=de","title":{"rendered":"3 Prompt AI Series #4: Kalibrierung, Governance und Trade-offs"},"content":{"rendered":"<h2>Das Drei-Regeln-Framework umsetzen: Kalibrierung, Governance und Trade-offs<\/h2>\n<p>Der\u00a0<a href=\"https:\/\/knowtech.waszmann.com\/?p=214&amp;lang=de\">vorherige Beitrag<\/a>\u00a0dieser Serie hat ein allgemeines Framework f\u00fcr KI-gest\u00fctzte Szenarioplanung vorgestellt: Leerlassen erzwingen, Raten bestrafen, Quelle zeigen. Das Framework produziert Output, in dem jede Behauptung als VERIFIZIERT, ANGENOMMEN oder PROJIZIERT getaggt ist und L\u00fccken explizit markiert statt stillschweigend gef\u00fcllt werden.<\/p>\n<p>Das war das\u00a0<em>Was<\/em>. Dieser Beitrag handelt vom\u00a0<em>Wie<\/em>\u00a0\u2014 drei praktische Herausforderungen, denen jeder begegnet, der das Framework umsetzt:<\/p>\n<ol>\n<li><strong>Kalibrierung:<\/strong>\u00a0Sie haben etwas als ANGENOMMEN getaggt. Wie pr\u00fcfen Sie, ob die Annahme vern\u00fcnftig ist?<\/li>\n<li><strong>Governance:<\/strong>\u00a0Wie setzen Organisationen Tagging in tats\u00e4chlichen Workflows durch \u2014 nicht nur im Prompt einer einzelnen Person?<\/li>\n<li><strong>Trade-offs:<\/strong>\u00a0Erzeugt das ganze Tagging nicht kognitive \u00dcberlastung? Wie lesen Nicht-Experten ein Dokument voller Provenance-Labels?<\/li>\n<\/ol>\n<hr \/>\n<h2>1. Annahmen kalibrieren: Von \u201egetaggt&#8221; zu \u201egepr\u00fcft&#8221;<\/h2>\n<p>Eine Annahme zu taggen ist notwendig, aber nicht hinreichend.\u00a0<code>(ANGENOMMEN: Markt w\u00e4chst 15 % j\u00e4hrlich)<\/code>\u00a0ist besser als ein unmarkiertes 15 %, das in die Projektion eingebaut ist \u2014 aber es sagt Ihnen nicht, ob 15 % vertretbar sind. Das Framework legt Annahmen offen; Kalibrierung pr\u00fcft sie.<\/p>\n<p>Vier Kalibrierungsmethoden funktionieren gut mit dem getaggten Output:<\/p>\n<h3>Reference Class Forecasting: Die Au\u00dfenperspektive<\/h3>\n<p>Daniel Kahnemans und Amos Tverskys Unterscheidung zwischen der \u201eInnenperspektive&#8221; (Planung basierend auf den Spezifika dieses Projekts) und der \u201eAu\u00dfenperspektive&#8221; (was bei vergleichbaren Projekten historisch passiert ist) ist das n\u00fctzlichste Einzelkonzept zur Kalibrierung von Annahmen. Die Planungsfehler-Tendenz \u2014 systematisches Untersch\u00e4tzen von Kosten und Zeitpl\u00e4nen \u2014 ist so gut dokumentiert, dass die American Planning Association\u00a0<a href=\"https:\/\/www.pmi.org\/learning\/library\/nobel-project-management-reference-class-forecasting-8068\" target=\"_blank\" rel=\"noopener\">Reference Class Forecasting 2005 offiziell empfohlen hat<\/a>.<\/p>\n<p>In der Praxis bedeutet das: F\u00fcr jeden ANGENOMMEN-Tag fragen Sie das Modell (oder sich selbst), 3\u20135 vergleichbare Situationen und deren tats\u00e4chliche Ergebnisse zu identifizieren. Wenn Sie 15 % Wachstum annehmen, welches Wachstum haben \u00e4hnliche Produkte in \u00e4hnlichen M\u00e4rkten tats\u00e4chlich erzielt? Wenn Sie einen 6-monatigen Genehmigungszeitraum annehmen, wie lange haben vergleichbare Genehmigungen tats\u00e4chlich gedauert?<\/p>\n<p>Sie k\u00f6nnen das sogar in den Prompt einbauen:<\/p>\n<blockquote><p><em>F\u00fcge f\u00fcr jeden ANGENOMMEN-Tag eine \u201eKalibrierung&#8221; hinzu: Identifiziere 2\u20133 vergleichbare historische F\u00e4lle und deren tats\u00e4chliche Ergebnisse. Falls keine vergleichbaren Daten existieren, vermerke [KEINE REFERENZKLASSE].<\/em><\/p><\/blockquote>\n<h3>Sensitivit\u00e4tstest: Was bricht, wenn das falsch ist?<\/h3>\n<p>Nicht alle Annahmen sind gleich wichtig. RANDs Assumption-Based Planning nennt das \u201eKritikalit\u00e4t&#8221; \u2014 eine Annahme ist kritisch, wenn ihr Scheitern grundlegende \u00c4nderungen am Plan erfordern w\u00fcrde. In der Praxis hei\u00dft das testen: Was passiert mit der Schlussfolgerung, wenn diese Annahme um 50 % danebenliegt? Wenn die Antwort \u201enicht viel&#8221; ist, hat die Annahme niedrige Priorit\u00e4t. Wenn die Antwort \u201eder gesamte Business Case bricht zusammen&#8221; ist, ist das Ihr Validierungsziel mit h\u00f6chster Priorit\u00e4t.<\/p>\n<p>Das getaggte Format erm\u00f6glicht das direkt. Sie k\u00f6nnen das Modell fragen:<\/p>\n<blockquote><p><em>Nimm die drei ANGENOMMEN-Positionen mit dem h\u00f6chsten Einfluss auf die Endprojektion. Berechne f\u00fcr jede die Projektion neu mit der Annahme bei 50 % des angegebenen Werts und bei 150 %. Zeige mir, f\u00fcr welche Annahmen die Schlussfolgerung am empfindlichsten ist.<\/em><\/p><\/blockquote>\n<h3>Pre-Mortem: Stell dir vor, es ist gescheitert<\/h3>\n<p>Gary Kleins Pre-Mortem-Technik kehrt die Frage um: Statt \u201eWird das funktionieren?&#8221; zu fragen, startet man mit \u201eEs ist gescheitert \u2014 warum?&#8221; Das ist besonders wirksam f\u00fcr ANGENOMMEN-Tags, weil es Fehlermodi sichtbar macht, die Optimismus verbirgt:<\/p>\n<blockquote><p><em>Nimm an, dieses Szenario ist nach 12 Monaten gescheitert. Welche der ANGENOMMEN-Positionen waren am wahrscheinlichsten der Punkt des Scheiterns? Beschreibe f\u00fcr jede ein plausibles Narrativ, wie diese Annahme zusammengebrochen ist.<\/em><\/p><\/blockquote>\n<h3>Zeitlicher Verfall: Wann verf\u00e4llt die Annahme?<\/h3>\n<p>Annahmen haben ein Haltbarkeitsdatum. Eine Marktgr\u00f6\u00dfensch\u00e4tzung aus einem Gartner-Bericht von 2025 ist 2026 noch vertretbar. Eine Wettbewerbs-Landschafts-Annahme von 2024 k\u00f6nnte bereits falsch sein. Eine zeitliche Dimension zu ANGENOMMEN-Tags hinzuzuf\u00fcgen hilft:<\/p>\n<blockquote><p><em>F\u00fcge f\u00fcr jeden ANGENOMMEN-Tag eine Verfallssch\u00e4tzung hinzu: Wie lange ist diese Annahme voraussichtlich g\u00fcltig? Markiere alles, was \u00e4lter als 12 Monate ist oder auf Daten vor 2025 basiert, als [VERALTETE ANNAHME].<\/em><\/p><\/blockquote>\n<hr \/>\n<h2>2. Governance: Das Framework \u00fcber eine einzelne Person hinaus verankern<\/h2>\n<p>Das Framework funktioniert gut, wenn eine Person es in einer Chat-Session nutzt. Die Governance-Frage ist: Wie \u00fcbersteht es den Kontakt mit einer Organisation \u2014 mehrere Personen, mehrere KI-Tools, mehrere Dokumente, \u00fcber Monate?<\/p>\n<h3>Das Problem: Tags gehen in der \u00dcbersetzung verloren<\/h3>\n<p>Was typischerweise passiert: Ein Analyst erstellt ein sch\u00f6n getaggtes Szenario. Er kopiert es in eine Folienpr\u00e4sentation. Die Tags verschwinden. Ein Manager liest die Folien, sieht \u201eUmsatz Jahr 1: 310K \u20ac&#8221; ohne jeden Hinweis, dass die Zahl PROJIZIERT ist aus zwei nicht validierten ANGENOMMEN-Inputs. Das Geisterszenario lebt wieder.<\/p>\n<p>Das ist ein Wissensmanagement-Problem, kein KI-Problem. Und es hat Wissensmanagement-L\u00f6sungen.<\/p>\n<h3>Stufe 1: Template-Pflicht<\/h3>\n<p>Der einfachste Governance-Mechanismus ist ein Template. Wenn Ihre Organisation KI f\u00fcr Szenarioplanung nutzt, sollte das Output-Template Provenance-Spalten fest eingebaut haben. Nicht optional, nicht \u201ebei Bedarf hinzuf\u00fcgen&#8221; \u2014 strukturell erforderlich. Ein Szenario-Dokument ohne Quellen-Tags sollte genauso behandelt werden wie ein Finanzbericht ohne Belege: unvollst\u00e4ndig.<\/p>\n<p>Konkret: Erstellen Sie ein Standardtabellenformat f\u00fcr alle KI-gest\u00fctzten Szenario-Outputs:<\/p>\n<table>\n<thead>\n<tr>\n<th>Variable<\/th>\n<th>Wert<\/th>\n<th>Quelle<\/th>\n<th>Basis \/ Falls falsch<\/th>\n<th>Gepr\u00fcft von<\/th>\n<th>Datum<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td colspan=\"6\"><em>(Alle KI-generierten Szenario-Outputs m\u00fcssen dieses Format verwenden)<\/em><\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Die Spalten \u201eGepr\u00fcft von&#8221; und \u201eDatum&#8221; sind die Governance-Erg\u00e4nzungen. Sie machen aus einer Prompt-Technik eine Pr\u00fcfspur. Jemand muss jede ANGENOMMEN-Position abzeichnen, bevor sie in die Planung eingeht.<\/p>\n<h3>Stufe 2: Review-Workflow<\/h3>\n<p>F\u00fcr Organisationen mit strukturierteren Prozessen integrieren Sie das Tagging in den Review-Zyklus:<\/p>\n<p><strong>Schritt 1 \u2014 Generierung:<\/strong>\u00a0KI produziert getaggten Output mit dem Drei-Regeln-Prompt.<br \/>\n<strong>Schritt 2 \u2014 Annahmen-Review:<\/strong>\u00a0Ein Fachexperte pr\u00fcft alle ANGENOMMEN- und PROJIZIERT-Positionen. Jede bekommt eine von drei Dispositionen:\u00a0<em>best\u00e4tigt<\/em>\u00a0(wird zu VERIFIZIERT umklassifiziert),\u00a0<em>hinterfragt<\/em>\u00a0(zur Kalibrierung geschickt) oder\u00a0<em>mit Risiko akzeptiert<\/em>\u00a0(bleibt als ANGENOMMEN mit dokumentierter Begr\u00fcndung).<br \/>\n<strong>Schritt 3 \u2014 L\u00fccken-Triage:<\/strong>\u00a0Alle DATENL\u00dcCKE- und ANNAHMEL\u00dcCKE-Positionen werden triagiert:\u00a0<em>aufl\u00f6sbar<\/em>\u00a0(jemandem zuweisen, die Daten zu finden),\u00a0<em>irreduzibel<\/em>\u00a0(die Unsicherheit ist inh\u00e4rent \u2014 dokumentieren und drum herumplanen) oder\u00a0<em>zur\u00fcckgestellt<\/em>\u00a0(f\u00fcr diese Entscheidungsphase nicht n\u00f6tig).<br \/>\n<strong>Schritt 4 \u2014 Entscheidungspaket:<\/strong>\u00a0Das finale Dokument trennt \u201ewas wir wissen&#8221; (VERIFIZIERT), \u201ewas wir glauben&#8221; (ANGENOMMEN, mit Kalibrierungsnotizen) und \u201ewas wir nicht wissen&#8221; (verbleibende L\u00fccken). Entscheidungstr\u00e4ger sehen alle drei.<\/p>\n<h3>Stufe 3: System-Prompt-Standardisierung<\/h3>\n<p>Wenn Ihre Organisation KI team\u00fcbergreifend nutzt, standardisieren Sie den System-Prompt. Verlassen Sie sich nicht darauf, dass einzelne Analysten sich daran erinnern, die drei Regeln anzuwenden. Verankern Sie das Framework in jedem KI-Zugangspunkt \u2014 ob Claude-Projekt, Custom GPT, API-Wrapper oder n8n-Workflow. Der Prompt wird Infrastruktur, nicht pers\u00f6nliche Praxis.<\/p>\n<h3>Die kulturelle Herausforderung<\/h3>\n<p>Das schwierigste Governance-Problem ist nicht technisch. Es ist, dass Unsicherheit zu taggen sich nach Schw\u00e4che anf\u00fchlt. Ein Szenario voller ANGENOMMEN- und DATENL\u00dcCKE-Labels einem Vorstand zu pr\u00e4sentieren wirkt weniger \u00fcberzeugend als saubere Zahlen. Die organisationale Antwort darauf muss explizit sein: Ein getaggtes Szenario ist kein unvollst\u00e4ndiges Szenario \u2014 es ist ein ehrliches. Die sauberen Zahlen waren nie sauber; sie haben nur versteckt, wo die Vermutungen waren.<\/p>\n<p>Genau das zeigt Bent Flyvbjergs jahrzehntelange Forschung zu Gro\u00dfprojekt-Fehlschl\u00e4gen: Die Projekte, die am katastrophalsten das Budget sprengten, waren nicht die mit der meisten Unsicherheit \u2014 es waren die, bei denen die Unsicherheit versteckt war. Transparenz \u00fcber Annahmen ist eine Risikoreduktionsstrategie, kein Eingest\u00e4ndnis von Schw\u00e4che.<\/p>\n<hr \/>\n<h2>3. Trade-offs: Wenn Tags zu Rauschen werden<\/h2>\n<p>Ein Dokument, in dem jeder Satz ein Provenance-Label tr\u00e4gt, ist anstrengend zu lesen. Das Framework erzeugt realen kognitiven Overhead, und so zu tun als w\u00e4re das nicht so, w\u00e4re unehrlich. Die Frage ist nicht, ob es Kosten gibt \u2014 die gibt es \u2014, sondern wie man sie steuert.<\/p>\n<h3>Das \u00dcberlastungsproblem<\/h3>\n<p>Stellen Sie sich ein 20-Variablen-Szenario vor mit Quellen-Tags, Kalibrierungsnotizen und \u201eFalls falsch&#8221;-Anmerkungen an jeder ANGENOMMEN-Position. F\u00fcr den Analysten, der es erstellt hat, ist das wertvoll \u2014 er sieht genau, wohin er seine Aufmerksamkeit richten muss. F\u00fcr die F\u00fchrungskraft, die darauf basierend entscheiden muss, ist es eine Wand von Einschr\u00e4nkungen, die das Ergebnis verdeckt.<\/p>\n<p>Beide Perspektiven sind berechtigt. Die L\u00f6sung ist nicht, sich f\u00fcr eine zu entscheiden \u2014 sondern beide mit verschiedenen Sichten auf dieselben zugrundeliegenden Daten zu bedienen.<\/p>\n<h3>L\u00f6sung: Geschichtete Darstellung<\/h3>\n<p>Das getaggte Szenario sollte in mindestens zwei Schichten existieren:<\/p>\n<p><strong>Schicht 1 \u2014 Entscheidungszusammenfassung:<\/strong>\u00a0Eine Seite. Kernschl\u00fcsse, Kernzahlen, Kernrisiken. Keine Tags im laufenden Text. Stattdessen ein einzelner Abschnitt \u201eKonfidenzprofil&#8221; am Ende:<\/p>\n<blockquote><p><em>Dieses Szenario st\u00fctzt sich auf 14 verifizierte Datenpunkte, 6 genannte Annahmen und 3 Projektionen. Zwei Datenl\u00fccken sind ungel\u00f6st (marktspezifischer CAC, regulatorischer Zeitplan). Die Annahme mit dem h\u00f6chsten Einfluss auf nachgelagerte Ergebnisse ist [X] \u2014 bei 50 % Abweichung verschiebt sich der projizierte Umsatz von 310K \u20ac auf 180K \u20ac.<\/em><\/p><\/blockquote>\n<p>Das ist die F\u00fchrungskr\u00e4fte-Sicht: Wie viel davon ist solide, wie viel ist unsicher, und was konkret k\u00f6nnte es zum Kippen bringen.<\/p>\n<p><strong>Schicht 2 \u2014 Vollst\u00e4ndige getaggte Analyse:<\/strong>\u00a0Der komplette Output mit allen Provenance-Tags, Kalibrierungsnotizen, L\u00fccken-Labels und Sensitivit\u00e4tsanalyse. Das ist das Arbeitsdokument. Der Analyst nutzt es, der Reviewer zeichnet es ab, und es wird archiviert. Es ist die Pr\u00fcfspur.<\/p>\n<p>Die Beziehung zwischen den Schichten ist wie die zwischen einem Jahresabschluss und seinen Fu\u00dfnoten. Der Abschluss zeigt die Zahlen; die Fu\u00dfnoten zeigen, worauf die Zahlen ruhen. Beides existiert. Verschiedene Leser nutzen verschiedene Schichten.<\/p>\n<h3>Wie Nicht-Experten Tags lesen<\/h3>\n<p>F\u00fcr Teams, in denen nicht jeder das Tagging-System beherrscht, vereinfachen Sie die visuelle Sprache. Drei Farben funktionieren besser als drei Akronyme:<\/p>\n<ul>\n<li>VERIFIZIERT \u2192 als normaler Text dargestellt (keine besondere Markierung n\u00f6tig \u2014 es ist die Baseline)<\/li>\n<li>ANGENOMMEN \u2192 hervorgehoben oder mit einem visuellen Signal markiert (z. B. kursiv, farbige Seitenleiste oder ein einfaches \u26a0-Symbol)<\/li>\n<li>DATENL\u00dcCKE \u2192 als explizite Leerstelle mit kurzem Hinweis<\/li>\n<\/ul>\n<p>Die Kernbotschaft, die Nicht-Experten verinnerlichen m\u00fcssen, ist einfach:\u00a0<strong>Unmarkierter Text ist fundiert; markierter Text ist unsicher; Leerstellen sind ehrlich.<\/strong>\u00a0Das ist ein Zehn-Sekunden-Briefing. Wer eine Wettervorhersage lesen kann, die \u201eaktuelle Temperatur&#8221; von \u201eMorgenprognose&#8221; unterscheidet, kann ein getaggtes Szenario lesen.<\/p>\n<h3>Wann weniger Tags reichen<\/h3>\n<p>Nicht jeder Anwendungsfall braucht volle Provenance. Der richtige Tagging-Grad h\u00e4ngt von den Eins\u00e4tzen ab:<\/p>\n<table>\n<thead>\n<tr>\n<th>Einsatz<\/th>\n<th>Tagging-Grad<\/th>\n<th>Beispiel<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Niedrig<\/td>\n<td>Nur L\u00fccken taggen<\/td>\n<td>Internes Brainstorming, fr\u00fche Ideenfindung<\/td>\n<\/tr>\n<tr>\n<td>Mittel<\/td>\n<td>L\u00fccken + Annahmen taggen<\/td>\n<td>Projektvorschl\u00e4ge, Budget-Entw\u00fcrfe, Team-Planung<\/td>\n<\/tr>\n<tr>\n<td>Hoch<\/td>\n<td>Volles Tagging + Kalibrierung<\/td>\n<td>Vorstandspr\u00e4sentationen, Investitionsentscheidungen, regulatorische Einreichungen<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Bei einem lockeren Strategie-Brainstorming VERIFIZIERT\/ANGENOMMEN\/PROJIZIERT auf jede Zeile zu verlangen, w\u00fcrde den kreativen Fluss t\u00f6ten. Bei einer 2-Millionen-Euro-Investitionsentscheidung f\u00fcr den Vorstand ist alles unter vollem Tagging unverantwortlich. Passen Sie die Intensit\u00e4t des Frameworks an die Konsequenzen der Entscheidung an.<\/p>\n<hr \/>\n<h2>Das Framework-Reifegradmodell<\/h2>\n<p>Zusammengenommen k\u00f6nnen Organisationen, die das Drei-Regeln-Framework einf\u00fchren, die Umsetzung in drei Stufen denken:<\/p>\n<p><strong>Stufe 1 \u2014 Individuelle Praxis:<\/strong>\u00a0Eine Person nutzt den Drei-Regeln-Prompt in ihren eigenen KI-Gespr\u00e4chen. Getaggter Output bleibt in ihrem Workspace. Nutzen: pers\u00f6nliche Qualit\u00e4tskontrolle. Kosten: nahezu null.<\/p>\n<p><strong>Stufe 2 \u2014 Team-Standard:<\/strong>\u00a0Der Prompt wird in gemeinsame KI-Workspaces eingebettet (Claude-Projekte, Custom GPTs). Templates erzwingen das Tabellenformat. Annahmen bekommen informelles Peer-Review. Nutzen: gleichbleibende Qualit\u00e4t im Team. Kosten: Template-Erstellung, kurzes Training.<\/p>\n<p><strong>Stufe 3 \u2014 Organisationale Governance:<\/strong>\u00a0Das Framework wird in Planungsprozesse integriert. Annahmen-Review ist ein formaler Workflow-Schritt. Kalibrierung (Referenzklasse, Sensitivit\u00e4t, Pre-Mortem) ist Standardpraxis. Entscheidungspakete trennen Konfidenzschichten. Nutzen: systematische Risikoreduktion. Kosten: Prozess\u00e4nderung, kultureller Wandel.<\/p>\n<p>Die meisten Teams sollten bei Stufe 1 beginnen und sofort Ergebnisse sehen. Ob man zu Stufe 2 oder 3 fortschreitet, h\u00e4ngt davon ab, wie viel auf dem Spiel steht, wenn KI-generierte Szenarien reale Entscheidungen informieren. Je h\u00f6her die Eins\u00e4tze, desto mehr zahlt sich die Governance-Investition aus.<\/p>\n<hr \/>\n<h2>Limitierungen und bekannte L\u00fccken<\/h2>\n<p>Das Drei-Regeln-Framework ist ein Praktiker-Muster, keine peer-reviewte Methode. Es verdient dieselbe kritische Pr\u00fcfung, die es Nutzer auf KI-Output anwenden l\u00e4sst. Hier sind die Dinge, die es nicht l\u00f6st \u2014 und die Wege, auf denen es missbraucht werden kann.<\/p>\n<h3>1. Nicht empirisch validiert<\/h3>\n<p>Es gibt keine kontrollierten Experimente, keine Vorher\/Nachher-Fehlerratenmessungen und keine Nutzerstudien hinter diesem Framework. Forschung zeigt, dass Provenance-Tagging und strukturiertes Prompting Halluzinationen reduzieren k\u00f6nnen \u2014 manchmal erheblich \u2014, aber das wurde f\u00fcr spezifische Tagging-Schemata unter kontrollierten Bedingungen nachgewiesen, nicht f\u00fcr das exakte VERIFIZIERT\/ANGENOMMEN\/PROJIZIERT-Muster, das hier vorgeschlagen wird. Behandeln Sie das Framework als eine Engineering-Heuristik, die in vielen F\u00e4llen wahrscheinlich hilft, nicht als etwas, dessen Wirksamkeit Sie ohne eigene Messung voraussetzen k\u00f6nnen. Wenn Sie es einf\u00fchren, verfolgen Sie, ob es Ihre Outputs tats\u00e4chlich verbessert.<\/p>\n<h3>2. Der Prompt ist ein Hebel, nicht der einzige<\/h3>\n<p>Das Framework st\u00fctzt sich stark auf Prompt-Design als prim\u00e4ren Mechanismus zur Steuerung des Modellverhaltens. In der Praxis k\u00f6nnen Prompts Halluzinationen reduzieren, aber Modelle verletzen Anweisungen dennoch unter Druck \u2014 besonders wenn Optimierung, Reward-Modelle oder Fine-Tuning auf Sprachfluss und Vollst\u00e4ndigkeit dr\u00e4ngen. F\u00fcr Produktionssysteme sollten Prompt-Regeln durch architektonische Kontrollen erg\u00e4nzt werden: Retrieval-Augmented Generation (RAG) zur Verankerung von Outputs in tats\u00e4chlichen Daten, regelbasierte Filter zum Abfangen unbelegter Aussagen, Enthaltungsmechanismen, die die Generierung verweigern, wenn die Konfidenz niedrig ist, und menschliche Review-Workflows. Der Prompt ist der nutzer-zug\u00e4ngliche Hebel. Er ist nicht der einzige, und in Hochrisiko-Deployments ist es fragil, sich allein darauf zu verlassen.<\/p>\n<h3>3. VERIFIZIERT bedeutet \u201ebelegt&#8221;, nicht \u201eunfehlbar&#8221;<\/h3>\n<p>Die Tag-Hierarchie des Frameworks impliziert einen Konfidenz-Gradienten: VERIFIZIERT = solide, ANGENOMMEN = fragil, PROJIZIERT = abgeleitet. Aber \u201everifizierte&#8221; Daten k\u00f6nnen selbst erhebliche Probleme enthalten. Historische Zahlen k\u00f6nnen Messfehler widerspiegeln. Marktdaten k\u00f6nnen Anbieter-Annahmen oder Stichprobenverzerrungen kodieren. Finanz-Ist-Werte k\u00f6nnen nicht-station\u00e4r sein \u2014 eine Q4-2024-Umsatzzahl kann f\u00fcr Q4-2026-Projektionen in einem Post-Schock-Markt irref\u00fchrend sein. Das Framework verfolgt\u00a0<em>Provenance<\/em>\u00a0(woher kommt diese Zahl?), nicht\u00a0<em>Qualit\u00e4t<\/em>\u00a0(ist diese Zahl noch ein zuverl\u00e4ssiger Leitfaden?). Nutzer sollten der Versuchung widerstehen, VERIFIZIERT als \u201egesichert&#8221; zu behandeln. Datenfundamentalismus \u2014 die Annahme, dass belegte Daten korrekte Daten sind \u2014 ist ein anderer Fehlermodus als Halluzination, kann aber gleicherma\u00dfen schlechte Entscheidungen antreiben.<\/p>\n<h3>4. Tags legen Inputs offen, nicht strukturelle Validit\u00e4t<\/h3>\n<p>Ein Szenario kann perfekt getaggt sein \u2014 jede Zahl belegt, jede Annahme markiert, jede L\u00fccke gekennzeichnet \u2014 und dennoch fundamental irref\u00fchrend sein, weil das zugrundeliegende Kausalmodell falsch ist. Kundenabwanderung als preisunabh\u00e4ngig behandeln. R\u00fcckkopplungsschleifen zwischen Marketingausgaben und Markenwahrnehmung ignorieren. Lineare Skalierung annehmen, wo die realen Dynamiken nichtlinear sind. Das Framework f\u00e4ngt faktische Halluzinationen (falsche Inputs) ab, aber nicht strukturelle Fehler (falsches Modell davon, wie die Inputs zusammenh\u00e4ngen). Die Kalibrierungsmethoden \u2014 Sensitivit\u00e4tstest, Pre-Mortem \u2014 helfen teilweise, testen Annahmen aber isoliert, nicht die Beziehungen zwischen ihnen. ABP- und Szenarioplanungs-Literatur betonen strukturelles Denken und die Exploration alternativer Logiken. Dieses Framework fokussiert auf Tagging und L\u00fcckenmarkierung, nicht auf die Qualit\u00e4t des mentalen Modells. Ein gut getaggtes schlechtes Modell ist immer noch ein schlechtes Modell.<\/p>\n<h3>5. Labels legen nicht offen, wessen Annahmen kodiert werden<\/h3>\n<p>Die Kategorien VERIFIZIERT\/ANGENOMMEN\/PROJIZIERT k\u00f6nnen einen Anschein von Objektivit\u00e4t vermitteln, der Machtdynamiken verbirgt. Management kann optimistische Wachstumsziele als ANGENOMMEN kodieren, ohne den politischen Druck hinter der Zahl offenzulegen. Die Marktgr\u00f6\u00dfensch\u00e4tzung eines Anbieters, als VERIFIZIERT getaggt, kann dessen kommerzielle Interessen einbetten. Die PROJIZIERT-Berechnung eines Analysten kann ein Modell verwenden, das institutionelle Voreingenommenheit zugunsten bestimmter Ergebnisse widerspiegelt. Das Framework verlangt weder vom Modell noch vom Menschen offenzulegen, wessen Annahmen kodiert werden oder wie sie entstanden sind. Die Frage ist nicht nur \u201eist das belegt oder angenommen?&#8221;, sondern \u201ewessen Interessen haben diese Annahme geformt?&#8221; Das Framework beantwortet diese Frage nicht \u2014 und zu behaupten, es tue es, w\u00e4re eine Form derselben falschen Zuversicht, die es verhindern soll.<\/p>\n<h3>6. Zu viele L\u00fccken k\u00f6nnen Entscheidungen l\u00e4hmen<\/h3>\n<p>Das Framework bestraft Raten explizit und ermutigt das Modell, bei jeder Gelegenheit [DATENL\u00dcCKE] und [ANNAHMEL\u00dcCKE] zu markieren. In Hochunsicherheits-Dom\u00e4nen \u2014 was die meiste strategische Planung betrifft \u2014 kann das zu Outputs f\u00fchren, die von L\u00fccken und Vorbehalten dominiert werden. ABP-Literatur betont, dass manche Annahmen \u201ef\u00fcr Planungszwecke&#8221; gemacht werden m\u00fcssen, oder Planung kann nicht fortschreiten. Die Stakes-basierte Skalierungstabelle weiter oben adressiert dies teilweise, aber die zugrundeliegende Spannung bleibt: Das Framework f\u00f6rdert eine Norm, in der \u201estille Erfindung schlimmer ist als markierte Unsicherheit&#8221;, ohne explizit zu diskutieren, wann zu viel Unsicherheitssignalisierung die Entscheidungsfindung untergr\u00e4bt. Passen Sie die Intensit\u00e4t des Frameworks nicht nur an die Entscheidungseins\u00e4tze an, sondern auch an die Risikobereitschaft und Entscheidungszeitpl\u00e4ne der Organisation.<\/p>\n<h3>7. Dom\u00e4nenspezifische Anpassung erforderlich<\/h3>\n<p>Die Serie behauptet, das Framework sei dom\u00e4nen\u00fcbergreifend portabel \u2014 Dokumentextraktion, Worldbuilding, Szenarioplanung, Cybersecurity, wissenschaftliches Arbeiten. Aber diese Dom\u00e4nen haben sehr unterschiedliche Eins\u00e4tze, epistemische Strukturen und regulatorische Umgebungen. In der Medizin ist etwas als ANGENOMMEN zu taggen bei Weitem nicht ausreichend, um es sicher zu machen \u2014 existierende Richtlinien erfordern RAG, externe Verifikation und menschliche Aufsicht. In der juristischen Arbeit kann ein individuelles Label-Schema mit etablierten Zitationsstandards kollidieren oder von Gerichten fehlinterpretiert werden. In regulierten Branchen k\u00f6nnen Compliance-Frameworks eigene Provenance-Anforderungen haben. Das allgemeine Muster bietet eine Ausgangsstruktur; dom\u00e4nenspezifische Anpassung und Validierung sind erforderlich, bevor man sich in regulierten oder Hochrisiko-Umgebungen darauf verl\u00e4sst.<\/p>\n<p>Diese Limitierungen entkr\u00e4ften das Framework nicht \u2014 sie begrenzen es. Die drei Regeln sind eine erhebliche Verbesserung gegen\u00fcber dem Default (keine Provenance, keine L\u00fcckenmarkierung, keine Bestrafung f\u00fcr Raten), aber sie sind keine vollst\u00e4ndige L\u00f6sung. Sie sind der Beginn einer Praxis, nicht ihr Ende.<\/p>\n<hr \/>\n<h3>Quellen und weiterf\u00fchrende Lekt\u00fcre<\/h3>\n<ul>\n<li><strong>Kahneman, D. &amp; Tversky, A. (1979):<\/strong>\u00a0\u201eProspect Theory: An Analysis of Decision under Risk.&#8221; Das grundlegende Werk zu kognitiven Verzerrungen bei Entscheidungen, einschlie\u00dflich der Unterscheidung Innen- vs. Au\u00dfenperspektive.<\/li>\n<li><strong>Flyvbjerg, B. (2008):<\/strong>\u00a0\u201e<a href=\"https:\/\/www.researchgate.net\/publication\/233258056_Curbing_Optimism_Bias_and_Strategic_Misrepresentation_in_Planning_Reference_Class_Forecasting_in_Practice\" target=\"_blank\" rel=\"noopener\">Curbing Optimism Bias and Strategic Misrepresentation in Planning: Reference Class Forecasting in Practice<\/a>.&#8221; Das definitive Paper zur Nutzung der Au\u00dfenperspektive zur Korrektur von Planungsprognosen.<\/li>\n<li><strong>Cantarelli, C.C. et al. (November 2025):<\/strong>\u00a0\u201e<a href=\"https:\/\/www.tandfonline.com\/doi\/full\/10.1080\/09537287.2025.2578708\" target=\"_blank\" rel=\"noopener\">Reference Class Forecasting: Promises, Problems, and a Research Agenda Moving Forward<\/a>.&#8221; Systematisches Review zu RCF, 2001\u20132025.<\/li>\n<li><strong>Klein, G. (2007):<\/strong>\u00a0\u201ePerforming a Project Premortem.&#8221; Harvard Business Review. Die Pre-Mortem-Technik zum Aufdecken von Fehlermodi vor ihrem Eintreten.<\/li>\n<li><strong>Dewar, J.A. (2002):<\/strong>\u00a0\u201eAssumption-Based Planning: A Tool for Reducing Avoidable Surprises.&#8221; Cambridge University Press \/ RAND.<\/li>\n<li><strong>Lambdin, C. (2024):<\/strong>\u00a0\u201e<a href=\"https:\/\/thelaterallens.substack.com\/p\/assumption-based-planning\" target=\"_blank\" rel=\"noopener\">Assumption-Based Planning<\/a>.&#8221; \u00dcber das \u201eGeisterszenario&#8221; und tragende Annahmen.<\/li>\n<li><strong>Ram\u00edrez, R. et al. (Dezember 2025):<\/strong>\u00a0\u201e<a href=\"https:\/\/sloanreview.mit.edu\/article\/scenario-planning-examples\/\" target=\"_blank\" rel=\"noopener\">A Faster Way to Build Future Scenarios<\/a>.&#8221; MIT Sloan. \u00dcber KI-gest\u00fctzte Szenarioplanung und das Aufdecken ungepr\u00fcfter Annahmen.<\/li>\n<li><strong>Vorherige Beitr\u00e4ge in dieser Serie:<\/strong><br \/>\n<a href=\"https:\/\/knowtech.waszmann.com\/?p=191&amp;lang=de\">Beitrag 1: KI-Ehrlichkeit\u00a0<\/a><br \/>\n<a href=\"https:\/\/knowtech.waszmann.com\/?p=199&amp;lang=de\">Beitrag 2: Worldbuilding<\/a><br \/>\n<a href=\"https:\/\/knowtech.waszmann.com\/?p=214&amp;lang=de\">Beitrag 3: Szenarioplanung<\/a><\/li>\n<\/ul>\n","protected":false},"excerpt":{"rendered":"<p>Das Drei-Regeln-Framework umsetzen: Kalibrierung, Governance und Trade-offs Der\u00a0vorherige Beitrag\u00a0dieser Serie hat ein allgemeines Framework f\u00fcr KI-gest\u00fctzte Szenarioplanung vorgestellt: Leerlassen erzwingen, Raten bestrafen, Quelle zeigen. Das Framework produziert Output, in dem jede Behauptung als VERIFIZIERT, ANGENOMMEN oder PROJIZIERT getaggt ist und L\u00fccken explizit markiert statt stillschweigend gef\u00fcllt werden. Das war das\u00a0Was. Dieser Beitrag handelt vom\u00a0Wie\u00a0\u2014 drei &hellip;<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[45,70],"tags":[88,47,51,53,49],"class_list":["post-221","post","type-post","status-publish","format-standard","hentry","category-ai","category-ai-in-practice-de","tag-3rulespart4","tag-ai","tag-gpt","tag-halucination","tag-llm"],"_links":{"self":[{"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=\/wp\/v2\/posts\/221","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=221"}],"version-history":[{"count":5,"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=\/wp\/v2\/posts\/221\/revisions"}],"predecessor-version":[{"id":228,"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=\/wp\/v2\/posts\/221\/revisions\/228"}],"wp:attachment":[{"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=221"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=221"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/knowtech.waszmann.com\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=221"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}