Zum Hauptinhalt springen
Daten & Analytics

Die abgelehnten Zeilen sind der Datensatz, der Ihnen sagt, was vorgeschaltet falsch ist

Wenn Pipelines Daten bereinigen, verwerfen sie alles, was sie nicht verarbeiten können. Die saubere Tabelle sieht in Ordnung aus. Sie erklärt nicht, warum 11 % der Zeilen gescheitert sind.

Diese Ausfälle zeigen auf ein Problem im vorgeschalteten System. Steigt die Ablehnungsrate an einem bestimmten Feld, hat sich ein Formular geändert, ist eine Integration gebrochen oder schickt ein neuer Lieferant Daten in einem anderen Format. Die saubere Tabelle zeigt das nicht.

Doppelte Zeilen brauchen ebenfalls Sorgfalt. Zwei Zeilen, die gleich aussehen, können zwei reale Ereignisse sein. Ein Deduplizierungsschritt, der sie automatisch zusammenführt, entfernt eine Zahl, die niemand rekonstruieren kann.

Der Urteilspunkt ist die Stelle, an der eine Regel der Interpretation weicht. Eine Regel kann ein schlecht formatiertes Datum mechanisch parsen. Ein Firmenname in drei unterschiedlichen Schreibweisen verlangt die Entscheidung, ob die Varianten dasselbe Unternehmen meinen.

So läuft der ActionFlow auf der Canvas

Rohe Zeilen kommen über einen Document Upload-Knoten, einen Google-Sheets-Knoten oder einen HTTP Request-Knoten, der sie aus dem Quellsystem holt.

Der Validate-Knoten handelt zuerst. Er erledigt die mechanische Arbeit: Typen prüfen, Pflichtfelder verifizieren und das Format validieren. Wenn eine Regel etwas entscheiden kann, übernimmt dieser Knoten es. Nichts geht an ein Modell, wenn eine Regel es hätte erledigen können.

Ein Filter-Knoten trennt gültige Zeilen von ungültigen. Er verwirft die ungültigen Zeilen nicht. Er legt sie in eine eigene Tabelle, mit dem gescheiterten Feld in jeder Zeile aufgeführt.

Ein Uniq-Knoten entfernt exakte Duplikate. Ein Sort-Knoten ordnet den Rest dann so, dass Beinahe-Duplikate nebeneinander sitzen.

Ein Generate Object-Knoten behandelt nur die Fälle, die überlebt haben und weiter uneindeutig wirken: Variantenschreibweisen, inkonsistente Kategorien und Werte, die möglich, aber ungewöhnlich sind. Er schreibt die Zeilen nicht um. Er schlägt je Zeile eine Normalisierung und ein Konfidenzniveau vor.

Ein zweiter Filter-Knoten nutzt die Konfidenzschwelle. Normalisierungen hoher Konfidenz kommen über einen PostgreSQL-, MySQL- oder Google-Sheets-Knoten in die saubere Tabelle. Die anderen gehen in eine Prüftabelle.

Ein Create Excel-Knoten erzeugt eine Datei, die jemand offline als Teil der Prüfmenge durcharbeiten kann.

Knoten, die dieser ActionFlow verwendet

  • Document Upload (Data): nimmt die Rohdatei entgegen. Google Sheets und HTTP Request decken andere Quellen ab.
  • Validate (Data): erledigt alles, was eine Regel entscheiden kann, bevor ein Modell beteiligt ist.
  • Filter (Data): trennt gültig von ungültig und behält die ungültige Menge mit ihrem Ausfallgrund.
  • Uniq (Control): entfernt exakte Duplikate, ohne echte Wiederholungsereignisse zusammenzuführen.
  • Generate Object (AI Core): schlägt Normalisierungen mit einer Konfidenz je Zeile vor und schreibt nichts um.
  • PostgreSQL (Data): nimmt die saubere Tabelle entgegen. MySQL und Google Sheets passen in denselben Slot.
  • Create Excel (Data): erzeugt eine Datei für die Prüfmenge, wenn jemand offline arbeitet.

Häufige Fragen

KI-Workflows bauen

Legen Sie ein kostenloses Konto an, öffnen Sie eine Vorlage oder eine leere Fläche und führen Sie Ihren ersten ActionFlow aus.

Newsletter

Produktupdates erhalten

Neue Nodes, Agents und Produktnotizen. Wir senden E-Mails nur, wenn sich das Öffnen lohnt.

Sie können das Abonnement jederzeit beenden.