Vor ein paar Wochen hatten unsere KI-bewerteten Chat-Reports ein Problem. Jeden Morgen markierte der Report eine Handvoll „verpasster Verkaufschancen“ in unseren Live-Chats. Und jeden Morgen schaute sich unser Vertriebsteam die Fälle an und sagte: Nein, das war keine Chance. Dieser Kunde hatte schon einen Partner. Diese Frage war rein technisch.
Die KI war nicht dumm. Sie lag jeden Tag auf dieselbe Weise selbstbewusst falsch, weil ihr niemand etwas anderes gesagt hat.
In dem Moment habe ich die wichtigste Designregel für KI-Reports im Marketing verstanden: Eine Analyse, der niemand widersprechen kann, wiederholt ihre Fehler jeden Tag.
Daumen runter, mit Begründung
Die Lösung war fast peinlich einfach. Jede KI-Bewertung in unseren Reports hat jetzt einen Daumen hoch und einen Daumen runter. Für den Daumen runter gibt es eine Bedingung: Du musst eine Begründung schreiben. Ein Satz reicht. „Kunde arbeitet schon mit einem Partner.“ „Das war eine Support-Frage, kein Sales-Lead.“
Der Durchlauf am nächsten Tag liest diese Begründungen, bevor er irgendetwas bewertet. Die Fehler verschwinden nicht über Nacht, aber sie wiederholen sich nicht mehr. Und genauso wichtig: Das Vertriebsteam hat aufgehört, den Report zu ignorieren, weil es jetzt eine Möglichkeit hatte, ihn mitzugestalten.
Zwei Dinge habe ich dabei gelernt:

Nachgestellte Ansicht mit erfundenen Daten: So sieht das echte Tool aus, aber alle Namen und Zahlen hier sind ausgedacht.
- Die Begründung zählt mehr als die Stimme. Ein Daumen runter allein sagt der KI, dass sie falschlag, aber nicht warum. Ohne das Warum wird sie einfach überall vorsichtiger.
- Feedback ist auch ein Vertrauenssignal. Einem Report, mit dem die Leute streiten können, vertrauen sie viel mehr als einem polierten, bei dem das nicht geht.
Lass die KI keine Kategorien erfinden
Die zweite Lektion kam von den Themen-Labels. Wir ordnen jeden Chat und jedes Ticket einem Thema zu, damit wir sehen, wonach Kunden am häufigsten fragen. Für einen Durchlauf habe ich den KI-Sub-Agenten eine Liste mit Beispielthemen mitgegeben, als kleine Hilfe.
Sie haben sie als Inspiration verstanden. Zurück kamen fünfzehn neue, erfundene Labels, alle leicht unterschiedlich, die ich dann von Hand wieder unseren echten Kategorien zuordnen musste. Ein Trenddiagramm auf Basis von Labels, die sich von Durchlauf zu Durchlauf ändern, ist wertlos.
Die Regel lautet jetzt: Die Labels sind eine geschlossene Liste. Passt ein Gespräch nicht dazu, antwortet der Sub-Agent mit „Sonstiges“ und ergänzt einen Vorschlag. Am Ende des Durchlaufs schaut sich die Hauptsession alle Vorschläge auf einmal an und entscheidet, ob sich ein neues Label lohnt. Von den ersten acht Vorschlägen wurden drei zu echten Labels. Die anderen fünf waren Varianten bestehender.
Wenn du Zahlen über die Zeit vergleichen willst, gilt: Die KI darf Kategorien befüllen, aber nicht festlegen.
Ablehnen statt raten
Wir haben außerdem einen Dokumentations-Bot gebaut, der Produktfragen aus unserer Wissensdatenbank beantwortet. Bevor wir ihn auf Kunden losgelassen haben, haben wir ihn mit 200 echten Fragen aus Support-Tickets getestet und die Antworten von einem anderen Modell beurteilen lassen.
Das Ergebnis war ernüchternd und nützlich. Nur ein kleiner Teil der Antworten war vollständig richtig. Die meisten waren teilweise richtig: hilfreich, um jemanden zum passenden Artikel zu schicken, aber unvollständig. Ein paar Prozent waren falsch, und eine war eine echte Halluzination: ein Befehl, den es gar nicht gibt.
Wir haben den Bot nicht aufgegeben. Wir haben seine Aufgabe geändert. Er ist jetzt ein Wegweiser durch die Dokumentation, kein Ersatz für den Support. Und wir haben eine Konfidenzschwelle eingebaut: Deckt die gefundene Dokumentation die Frage nicht eindeutig ab, sagt der Bot, dass er es nicht weiß, und übergibt. Ein ehrliches „Weiß ich nicht“ ist mehr wert als eine flüssige falsche Antwort.

Nachgestellte Ansicht mit erfundenen Daten: So sieht das echte Tool aus, aber alle Namen und Zahlen hier sind ausgedacht.
Dasselbe Prinzip gilt für unsere Analyse-Tools. Eine unserer Regeln für den Report zu Dokumentationslücken: Behaupte nie, etwas sei „nicht dokumentiert“, ohne mit mindestens zwei unterschiedlichen Formulierungen danach gesucht zu haben. Kunden und die Leute, die Dokumentation schreiben, verwenden selten dieselben Wörter.
Abbrechen, nicht erfinden
Viele unserer Reports laufen jeden Morgen automatisch, ohne dass jemand zuschaut. Deshalb ist eine Regel nicht verhandelbar: Fehlen Daten oder bricht eine Verbindung ab, stoppt der Durchlauf und sagt das auch. Er füllt die Lücken nicht mit plausiblen Zahlen.
Klingt selbstverständlich. Ist es nicht. Der Instinkt eines Sprachmodells ist, hilfreich zu sein, und „hilfreich“ heißt bei fehlenden Daten: etwas erfinden. Du musst ihm ausdrücklich und schriftlich sagen, dass ein abgebrochener Report besser ist als ein erfundener.
Den Beleg direkt neben das Urteil
Das letzte Muster ist das einfachste. Jede Bewertung, jedes markierte Ticket, jede Content-Idee in unseren Tools verlinkt zurück auf die Quelle: das vollständige Chat-Protokoll, das tatsächliche Ticket, die echten Instagram-Kommentare, auf denen eine Idee beruht. Jeder kann durchklicken und nachprüfen.
Das bewirkt zweierlei. Fehler werden schnell sichtbar. Und die Menschen behalten die Gewohnheit, sich die echten Gespräche anzuschauen, wo die eigentlichen Erkenntnisse ohnehin liegen.
Eine Checkliste für deine eigenen KI-Reports
Wenn du KI-gestützte Reports im Marketing baust, würde ich das hier vom ersten Tag an einbauen:
- Ein Daumen runter, der eine Begründung verlangt, und ein nächster Durchlauf, der sie liest.
- Geschlossene Listen für alles, was du über die Zeit zählen willst. „Sonstiges plus Vorschlag“ statt erfundener Labels.
- Eine Konfidenzschwelle. Ablehnen statt raten.
- Abbruch bei fehlenden Daten. In den Anweisungen festgeschrieben, nicht vorausgesetzt.
- Ein Beleg neben jedem Urteil. Ein Link zur Quelle, immer.
Bei alldem geht es nicht um bessere Modelle. Es geht darum, die Arbeit der KI zu etwas zu machen, das Menschen prüfen, anzweifeln und verbessern können. Genau das macht aus einer beeindruckenden Demo ein Tool, auf das sich ein Team wirklich verlässt.




No comments yet