Warum KI schlechte Daten nicht repariert, sondern verbreitet
Wer seit zehn Jahren im Vertrieb arbeitet, weiß, dass "Mueller GmbH" und "Müller Antriebstechnik GmbH & Co. KG" dieselbe Firma sind. Er überliest den Testeintrag "XXX bitte löschen" und weiß, welcher von drei Ansprechpartnern noch zuständig ist. Dieses Wissen steht nirgends. Ein Ablauf, der automatisch Anfragen zuordnet, Kampagnen auswählt oder Angebote vorbereitet, hat es nicht. Er nimmt den Bestand wörtlich.
Daraus folgt eine einfache Regel: Ein Fehler im Bestand wird durch einen automatischen Ablauf nicht kleiner, sondern häufiger benutzt. Eine Dublette, die einen Menschen einmal im Quartal stört, stört einen Ablauf, der nachts 300 Anfragen zuordnet, jede Nacht. Darum steht die Bereinigung vor jedem KI-Projekt, das auf Kundendaten arbeitet, und nicht danach. Bei uns ist sie eine eigene Leistung mit eigenem Festpreis: Daten in Ordnung bringen.
Die fünf Fehlerarten, die in fast jedem CRM stecken
Die Namen ändern sich von Haus zu Haus, die Muster nicht. Wenn wir einen Bestand zum ersten Mal sehen, suchen wir nach diesen fünf.
- Dubletten. Dieselbe Firma oder Person mehrfach, angelegt von verschiedenen Kollegen, über Formulare, Messen und Importe aus dem ERP. Die Schreibweise weicht ab, die Adresse ist eine alte, die Mail eine andere.
- Datenmüll. Testeinträge, Platzhalter wie "unbekannt" oder "n/a", abgebrochene Importe mit halb gefüllten Zeilen, interne Notizen im Namensfeld.
- Leere Pflichtfelder. Branche, Land, Unternehmensgröße, Zuständigkeit: Felder, nach denen der Vertrieb filtert, sind bei einem Teil der Datensätze leer, weil sie es bei der Anlage sein durften.
- Uneinheitliche Werte. "Deutschland", "DE", "Germany" und "BRD" im selben Feld. Anreden in vier Varianten. Branchen als Freitext statt aus einer Liste.
- Veraltetes. Ansprechpartner, die das Unternehmen verlassen haben, Firmen, die übernommen oder umfirmiert wurden, Adressen von vor dem Umzug.
Erst zählen, dann bereinigen
Bevor eine Regel geschrieben wird, braucht es den Befund: den Bestand in Zahlen. Er beantwortet, ob sich eine Bereinigung lohnt und wo sie anfangen sollte. Die meisten CRM-Systeme liefern die Zahlen über einen Export und eine Auswertung, die Ihre IT an einem Tag erstellen kann. Fünf Fragen genügen:
- Wie viele Datensätze gibt es je Objekt (Firmen, Kontakte, Interessenten), und wie viele davon wurden in den letzten 24 Monaten angefasst?
- Wie viele mögliche Dubletten findet ein einfacher Abgleich auf normalisierten Firmennamen und Mail-Domains?
- Wie hoch ist der Füllgrad der Felder, nach denen Vertrieb und Marketing filtern?
- Wie viele verschiedene Werte stehen in Feldern, die eigentlich eine feste Liste haben sollten, etwa Land, Branche, Anrede?
- Wie viele Mail-Adressen sind nachweislich unzustellbar, und wie viele Kontakte hängen an keiner aktiven Firma mehr?
Aus diesen fünf Zahlen ergibt sich die Reihenfolge. Ein Bestand mit wenigen Dubletten, aber leerer Branche braucht Anreichern, kein Zusammenführen. Ein Bestand mit 40 Schreibweisen für Deutschland braucht zuerst Vereinheitlichen, weil sonst der Dublettenabgleich danebenliegt.
Prüfregeln für Dubletten: was automatisch zusammengeführt wird und was nicht
Das Kernproblem jeder Dublettensuche ist nicht das Finden, sondern das Entscheiden. Zu streng, und die Hälfte bleibt doppelt. Zu locker, und zwei verschiedene Firmen mit ähnlichem Namen werden eine, samt Verkaufshistorie. Der Ausweg sind abgestufte Regeln mit drei Ausgängen: zusammenführen, einem Menschen vorlegen, getrennt lassen. Die folgende Tabelle ist ein Ausgangspunkt, den Sie auf Ihren Bestand anpassen können.
| Merkmal | Was es bedeutet | Ausgang |
|---|---|---|
| Mail-Adresse identisch (kleingeschrieben, ohne Leerzeichen) | dieselbe Person | automatisch zusammenführen |
| Umsatzsteuer-ID oder Handelsregisternummer identisch | dieselbe juristische Person | automatisch zusammenführen |
| Normalisierter Firmenname und Postleitzahl gleich | Name ohne Rechtsform, Umlaute aufgelöst, Sonderzeichen entfernt; sehr wahrscheinlich dieselbe Firma | automatisch zusammenführen, wenn kein anderes Feld widerspricht |
| Normalisierter Name gleich, Ort verschieden | kann eine Niederlassung oder Tochter sein | einem Menschen vorlegen |
| Mail-Domain gleich, Firmenname verschieden | Konzern, Marke oder Umfirmierung | vorlegen, nie automatisch |
| Name ähnlich, sonst keine Übereinstimmung | Tippfehler oder Abkürzung, etwa "Hofmann" und "Hoffmann" | vorlegen |
| Freemail-Domain als einziges gemeinsames Merkmal | sagt nichts über die Firma | getrennt lassen |
| Ein Datensatz hat offene Verkaufschancen oder Verträge | Historie geht vor Sauberkeit | vorlegen, der zuständige Vertriebler führt zusammen |
Zwei Regeln gehören dazu, die mit Ähnlichkeit nichts zu tun haben. Erstens: Beim Zusammenführen gewinnt nicht der ältere oder der neuere Datensatz, sondern je Feld der verlässlichere Wert. Die Rangfolge legen Sie fest, zum Beispiel Adresse aus dem ERP vor Adresse aus dem Webformular. Zweitens: Jede Zusammenführung wird protokolliert, mit beiden Ursprungsdatensätzen, damit sie sich rückgängig machen lässt.
Schreibweisen und Pflichtfelder: Regeln aus dem Bestand ableiten
Für das Vereinheitlichen gilt dasselbe Prinzip wie für Dubletten: ein Wert je Bedeutung, und die Zuordnung steht in einer Tabelle, die Sie lesen und bestätigen. Für Länder ist das schnell gemacht. Für Branchen dauert es länger, weil der Bestand oft eigene Begriffe enthält, die der Vertrieb wirklich benutzt. Die gehören in die Zielliste, nicht in den Papierkorb.
Für leere Pflichtfelder gibt es drei Wege, in dieser Reihenfolge. Zuerst aus vorhandenen Daten ableiten (Land aus Postleitzahl und Vorwahl, Branche aus anderen Kontakten derselben Firma). Dann aus öffentlichen Quellen anreichern (Website der Firma, Handelsregister). Und wo beides nicht reicht, das Feld leer lassen und kennzeichnen. Ein erfundener Wert ist schlimmer als ein leeres Feld, weil ihm niemand mehr misstraut. Jeder angereicherte Wert bekommt deshalb eine Quellenangabe.
Wo ein Sprachmodell hilft und wo Regeln reichen
Ein großer Teil der Bereinigung braucht keine KI. Normalisieren, Abgleichen, Zählen und Zusammenführen nach festen Regeln erledigt gewöhnliche Software, schnell, nachvollziehbar und vollständig in Ihrem System. Das ist auch beim Datenschutz der einfachere Weg. Ein Sprachmodell lohnt sich dort, wo Regeln an Sprache scheitern:
- Freitextfelder auslesen, in denen Notizen, Telefonnummern und Ansprechpartner durcheinanderstehen.
- Die Branche aus der Selbstbeschreibung einer Firmenwebsite einer festen Liste zuordnen.
- Bei den vorgelegten Grenzfällen eine Einschätzung mit Begründung vorbereiten, damit der Mensch schneller entscheidet.
- Datenmüll erkennen, der keinem Muster folgt, etwa eine Zeichnungsnummer im Namensfeld.
Kundendaten sind Personendaten. Wo ein Modell sie liest, laufen sie bei uns über europäische Rechenzentren oder offene Modelle im Haus, nach Ihrer Entscheidung. Wie das je Leistung aussieht, steht unter Datensouveränität.
Der Lauf: Sicherung, Probelauf, Protokoll
Wenn die Regeln stehen, ist der eigentliche Lauf der kleinere Teil der Arbeit. Er folgt immer derselben Reihenfolge:
- Vollständige Sicherung des Bestands, bevor irgendetwas geändert wird.
- Probelauf auf einer Stichprobe von einigen hundert Datensätzen. Ihr Team prüft das Ergebnis, Abweichungen werden zu neuen Regeln.
- Lauf über den ganzen Bestand, mit Protokoll je Änderung: alter Wert, neuer Wert, angewendete Regel, Zeitpunkt.
- Vorlage der Grenzfälle an die Zuständigen, gebündelt in einer Liste, nicht als Einzelmails.
- Kontrolle mit denselben fünf Zahlen wie im Befund, vorher und nachher nebeneinander.
Ein Punkt wird bei Cloud-CRMs gern übersehen: Salesforce, HubSpot und andere begrenzen die Zahl der Schnittstellenabfragen je Zeitraum. Ein Lauf über hunderttausende Datensätze muss so gebaut sein, dass er das Kontingent nicht aufbraucht, sonst funktioniert am nächsten Morgen das Formular auf der Website nicht mehr. Wie das bei Millionen Datensätzen aussieht, zeigt die Fallstudie eines Ersatzteilhändlers, der seine Produktdaten aus Salesforce bezieht: Dort fliegt der Datenmüll vor jeder weiteren Verarbeitung heraus, und die Abfragen sind so gebaut, dass das Limit hält.
Damit der Bestand sauber bleibt
Ein bereinigter Bestand läuft schnell wieder auseinander, wenn nur der Bestand bereinigt wurde und nicht der Zufluss. Drei Maßnahmen halten ihn sauber:
- Dieselben Regeln gelten für jeden Import und jedes Formular: Ländercode statt Freitext, Suche nach der vorhandenen Firma vor jeder Neuanlage.
- Pflichtfelder sind nur die, die wirklich gebraucht werden. Ein Pflichtfeld, das niemand sinnvoll füllen kann, erzeugt Platzhalter.
- Eine wiederkehrende Prüfung zählt monatlich neue Dubletten und leere Felder und meldet, wenn die Werte steigen.
Ein sauberer Bestand ist auch die Voraussetzung für den häufigsten KI-Ablauf im Vertrieb, die automatische Zuordnung eingehender Anfragen. Findet der Ablauf eine Firma dreimal im CRM, mit drei verschiedenen Zuständigen, kann er nicht richtig verteilen. Wie dieser Ablauf gebaut wird, beschreibt der Artikel zur Lead-Qualifizierung mit KI im B2B-Vertrieb.
Dazu kommt eine rechtliche Seite. Artikel 5 Absatz 1 Buchstabe d DSGVO verlangt, dass personenbezogene Daten sachlich richtig und erforderlichenfalls auf dem neuesten Stand sind; Buchstabe e verlangt, dass sie nicht länger gespeichert werden, als es für den Zweck nötig ist. Eine Bereinigung, die veraltete Kontakte findet, liefert damit zugleich die Liste für die Löschprüfung. Ob und wann Sie löschen müssen, klären Sie mit Ihrem Datenschutzbeauftragten; dieser Absatz ersetzt keine Rechtsberatung.
Was das für Sie heißt
Wenn Sie einen KI-Ablauf auf Ihren Kundendaten planen, zählen Sie zuerst. Die fünf Zahlen aus dem Befund zeigen, ob Ihr Bestand trägt oder ob die Bereinigung der erste Ablauf wird. Die Prüfregeln für Dubletten können Sie mit Ihrer IT auch ohne uns auf eine Stichprobe anwenden; danach wissen Sie, wie viel Arbeit in Ihrem Bestand steckt.
Ihr nächster Schritt: Machen Sie den Potenzial-Check. Er fragt auch nach der Qualität Ihrer Daten und zeigt Ihnen das Ergebnis sofort auf der Seite.
