sharedexpense.top • Blog

Von OCR zu kodierten Belegen: So bewerten Sie die Datenqualität Ihrer Invoices-Pipeline

Multilingual invoice processing
Auditierbarkeit & Compliance
Zürich & Genf

OCR liefert Rohdaten. Entscheidend ist, wie zuverlässig daraus kodierte Belege werden. In diesem Beitrag zeigen wir Ihnen, welche Qualitätsmetriken Sie in Ihrer Invoices-Pipeline erheben sollten, wie Sie Fehlerquellen identifizieren und wie Sie die nächste Verbesserung messbar machen.

Artikel lesen Pipeline-Workflow ansehen
Tipp Beginnen Sie mit Stichproben, dann erweitern Sie auf echtes Volumen. Messen Sie durchgehend, nicht nur am Ende.

Invoices-Pipeline · OCR · Coding · Auditierbarkeit

Von OCR zu kodierten Belegen: So bewerten Sie die Datenqualität Ihrer Invoices-Pipeline

Datenqualität ist kein einmaliger Test, sondern ein fortlaufendes Qualitätsmanagement. Wenn OCR-Texte, Stammdaten und Kodierungsregeln zusammenkommen, entscheiden kleine Fehler über große Folgen: falsche Buchung, wiederkehrende Nacharbeit und lückenhafte Audit-Trails.

1) Messen Sie, was zählt: ein Datenqualitätsmodell für jede Pipeline-Stufe

Bewerten Sie Datenqualität nicht nur am Ende der Pipeline. Definieren Sie Kennzahlen pro Schritt: OCR-Extraktion, Tabellen-/Layout-Erkennung, Feldnormalisierung, Entity-Matching (z. B. Lieferant, Kunde, Kostenstelle), Regelerzeugung sowie die finale Kodierung für das ERP.

Ein praxistaugliches Modell trennt Genauigkeit (richtig/fehlerhaft) von Vollständigkeit (fehlende Felder) und Stetigkeit (Konsistenz über Dokumenttypen und Länder hinweg). Für ein Switzerland-fokussiertes Setup ist außerdem relevant, wie gut Ihre Pipeline Landesspezifika in Layout, Sprache und Nummernformaten abbildet.

  • OCR-Feldgenauigkeit je Schlüsselattribut (z. B. IBAN, Belegdatum, USt/Tax, Summen).
  • Validierungsquote nach Regeln (Format, Summenlogik, Pflichtfelder).
  • Match-Rate für Lieferanten und Geschäftspartner (inkl. „unsicher“).
  • Kodierungsabschluss ohne manuelle Korrektur, getrennt nach Dokumenttyp.

2) Starten Sie mit einer Feldlandkarte: Wo entstehen Fehler in der Invoices-Pipeline?

Erstellen Sie eine Feldlandkarte, die jedes Zielattribut mit Ursprung, Konfidenzsignal und Downstream-Auswirkung verknüpft. So wird sichtbar, ob Fehler aus OCR kommen, aus Mapping-Regeln entstehen oder erst im ERP-Context auffallen.

Typische Fehlerquellen:

  • Summenabweichungen: OCR liest Positionen, aber die Gesamtsumme oder Dezimaltrennzeichen werden inkonsistent.
  • Datumsvarianten: unterschiedliche Schreibweisen, fehlende Jahresangaben oder abweichende Formatlogik.
  • USt/Tax-Zuordnung: Tax-Labels werden erkannt, aber nicht zuverlässig in Ihr Kodierschema überführt.
  • Stammdatentreffer: Lieferantenname vs. Handelsname, historische Varianten, Schreibfehler.

Die Feldlandkarte ist die Grundlage für saubere Ursachenanalyse und priorisiert Verbesserungen nach Impact.

3) Konfidenz verstehen: Wann ist „unsicher“ wirklich unsicher?

Konfidenzwerte sind nur dann nützlich, wenn sie kalibriert sind. Sonst optimieren Teams am falschen Signal: zu hohe Thresholds reduzieren Recall, zu niedrige erhöhen Korrekturaufwand.

Definieren Sie dafür eine Bewertungslogik:

  • Belegstufe: Gesamtbewertung des Dokuments, z. B. Layoutqualität und Felderdichte.
  • Feldstufe: Konfidenz je Feld, gekoppelt an Validierungsregeln.
  • Entscheidungsstufe: Was passiert bei Unsicherheit (z. B. „Review Queue“ statt harter Ablehnung)?

4) Data Quality in der Praxis: Validierung, Regeln und „Golden Records“

Eine stabile Pipeline kombiniert maschinelle Erkennung mit nachvollziehbarer Prüfung. Validierungen sollten so gebaut sein, dass sie sich automatisiert auswerten lassen und direkt in Ihren Audit-Prozess einfließen.

Bausteine:

  1. Format-Checks (z. B. Datum, Währung, Dezimaltrennzeichen).
  2. Summenlogik (Positionssumme vs. Belegsumme, Rundungsregeln).
  3. Entitätskonsistenz (Lieferant, Kostenstelle, GL-Konto).
  4. Auditierbare Entscheidungen: welche Regel hat gegriffen, welche Datenquelle war führend.

„Golden Records“ helfen, die Entitätserkennung zu verbessern. Halten Sie dafür eine kuratierte Referenzliste für häufige Lieferanten und wiederkehrende Belegmuster vor, inklusive historischer Schreibvarianten.

5) Audit-Trails als Qualitätsnachweis: Warum bessere Historie weniger Fehler bedeutet

Wenn Teams den Weg vom OCR-Text zur kodierten Buchung nachvollziehen können, wird die Fehlerbehebung schneller und konsequenter. Eine saubere Historie zeigt, wann Daten unsicher wurden, welche Felder abgeleitet wurden und warum ein bestimmter Code gewählt wurde.

So wird Qualität messbar statt nur diskutierbar. Das reduziert nicht nur Nacharbeit, sondern stärkt auch die Governance für prüfpfade und interne Kontrollen.

6) Realistische Benchmarks: Qualität ohne Betriebsblindheit steigern

Definieren Sie Benchmarks so, dass sie zum Betrieb passen. Ein gutes Ziel ist nicht „100% automatisch“, sondern ein planbarer Mix aus Automatisierung, Review und Korrekturraten.

Geben Sie Ihrer Organisation klare Zuständigkeiten:

  • Finance prüft, ob Kodierungen sachlich stimmen.
  • Ops/IT sorgt für stabile Schnittstellen und saubere Stammdatenlogik.
  • Data Quality steuert Thresholds, Golden Records und Validierungsregeln.

Wenn Sie diese Rollen sauber trennen, lassen sich Verbesserungen wiederholen und Skalierung wird einfacher, auch über mehrere Standorte und Sprachen.

Nächster Schritt: Datenqualität als Prozess etablieren

Starten Sie mit einer Feldlandkarte und einem KPI-Set pro Pipeline-Stufe. Danach kalibrieren Sie Konfidenzsignale und bauen auditierbare Entscheidungen in Ihre Prüfpfade ein.

Blog ansehen Kontakt aufnehmen