Nicht jeder Beleg kommt als saubere E-Rechnung: Der Tankbeleg ist ein Foto, die Lieferantenrechnung ein gescanntes PDF. Für diese Fälle betreibt acourse eine eigene Extraktions-Pipeline, die mehr tut als Text zu erkennen — sie versteht, was für ein Dokument vorliegt und welche Felder darin stecken.
Die Stufen der Pipeline
- 1Klassifizieren
Zuerst wird der Dokumenttyp bestimmt: Eingangs- oder Ausgangsrechnung, Kassenbeleg, Kontoauszug. Der Typ steuert, welche Felder gesucht und wie sie geprüft werden.
- 2Extrahieren
Rechnungsnummer, Datum, Netto/Steuer/Brutto, Zahlungsdaten und die einzelnen Positionen werden ausgelesen — mit Confidence-Score je Feld.
- 3Prüfen und lernen
Unsichere Felder werden zur Prüfung markiert statt still übernommen. Jede Korrektur trainiert die Erkennung für den jeweiligen Absender — die Trefferquote steigt mit der Nutzung.
Dublettenerkennung läuft direkt in der Pipeline mit: Ein Beleg, der bereits erfasst wurde, wird markiert, bevor er ein zweites Mal gebucht werden kann.
Das bringt es Ihnen
- Abtippen entfällt — auch bei Fotos und Scans.
- Der Dokumenttyp wird erkannt, nicht abgefragt.
- Confidence je Feld: geprüft wird nur, was unsicher ist.
- Selbstlernend je Absender — wiederkehrende Lieferanten werden immer besser erkannt.