Automatische Dokumententrennung: Guide 2026 | Docusplit
Mehrseitige PDFs automatisch trennen und nach Inhalt benennen: Wie die KI Dokumentgrenzen erkennt, was sie pro Seite liest, was im ZIP steckt und wo sie typischerweise scheitert.
Automatische Dokumententrennung bedeutet, dass eine KI jede Seite eines Sammel-PDFs liest und am Inhalt entscheidet, wo ein Dokument endet: neuer Briefkopf, neues Datum, neue Rechnungsnummer, oder eben „Seite 2 von 3“ und eine Tabelle, die mittendrin weiterläuft. Das ist der ganze Trick. Er braucht weder Trennblätter noch Regeln, und er scheitert genau dort, wo die Seite selbst nichts verrät: bei leeren Rückseiten, Anlagen ohne Briefkopf und Handschrift. Aus Scan_2026_03_15.pdf mit 50 Seiten werden so Dateien wie RE-2025-0281_Mustermann-GmbH.pdf oder Mahnung_Finanzamt_2025-03-15.pdf, plus eine CSV, die Ihnen sagt, wo Sie nachsehen sollten.
Warum die Seitenzahl nicht reicht
Klassische PDF-Werkzeuge trennen nach festen Intervallen: alle zwei Seiten, alle fünf Seiten. Das funktioniert, solange jedes Dokument gleich lang ist. Ein Posteingang ist das nie. Eine Rechnung hat eine Seite, der Vertrag dahinter sieben, die Mahnung wieder eine.
Die zweite klassische Lösung sind Trennblätter oder Barcodes zwischen den Dokumenten. DATEV beschreibt diesen Weg in den eigenen Scan-Tipps: Nur Scanner mit Multipage-Funktion erkennen mehrseitige Belege, wenn zwischen zwei Belegen ein leeres Blatt liegt. Das setzt voraus, dass jemand den Stapel vor dem Scannen sortiert und die Blätter einlegt. Genau diese Vorarbeit entfällt, wenn die Trennung am Inhalt stattfindet.
So entscheidet die KI Seite für Seite
Der Ablauf ist einfacher, als das Wort „KI“ vermuten lässt:
- Das PDF wird in Einzelseiten zerlegt. Jede Seite wird als Bild gerendert und an ein Bildmodell (GPT-4.1 über die OpenAI-API) geschickt. Es gibt keine Textebene im Spiel, deshalb funktioniert das bei Scans genauso wie bei digital erzeugten PDFs.
- Das Modell beantwortet pro Seite vier Fragen. Im Rechnungsmodus: Welche Firma hat das ausgestellt? Welche Rechnungs- oder Dokumentnummer steht darauf? Welches Rechnungsdatum? Ist das eine Folgeseite? Im Dokumentmodus kommt vorher die Frage, ob es überhaupt eine Rechnung ist; wenn nicht, fragt es nach Dokumenttyp, Absender, Datum und Folgeseite.
- Die Antworten werden zu Dokumenten gruppiert. Eine Seite, die als Folgeseite erkannt wurde, hängt am vorherigen Dokument. Eine Seite mit eigener Nummer oder eigenem Briefkopf beginnt ein neues. Merkmale für „Folgeseite“ sind laut Prompt: „Seite X von Y“, kein neuer Briefkopf, keine neue Anrede, Text oder Tabelle läuft weiter, nur Summen, Unterschrift oder Fußzeile.
- Die gruppierten Seiten werden unverändert in neue PDFs kopiert und nach den gelesenen Daten benannt.
Die Verarbeitung läuft in parallelen Stapeln. Die App rechnet mit etwa 6 Sekunden pro Seite im Rechnungsmodus und etwa 10 im Dokumentmodus, weil dort zwei Anfragen pro Seite nötig sind. Ein 30-Seiten-Scan braucht also einige Minuten, nicht Sekunden.
Zwei Modi, zwei Namensschemata
Sie wählen den Modus vor dem Upload, und er bestimmt das Namensschema:
| Modus | Erwartet | Dateiname | Beispiel |
|---|---|---|---|
| Rechnungsmodus | nur Rechnungen | Rechnungsnummer_Firma.pdf | RE-2025-0281_Mustermann-GmbH.pdf |
| Dokumentmodus | gemischte Stapel | Dokumenttyp_Absender_JJJJ-MM-TT.pdf | Mahnung_Finanzamt_2025-03-15.pdf |
Im Dokumentmodus werden Rechnungen automatisch erkannt und nach dem Rechnungsschema benannt; alles andere bekommt Typ, Absender und Datum. Die Typ-Bezeichnung vergibt das Modell frei in der Sprache Ihrer Oberfläche, etwa „Vertrag“, „Bescheid“, „Kündigung“ oder „Inkassoschreiben“. Leerzeichen werden zu Unterstrichen, Umlaute und Punkte bleiben erhalten, ein Dateiname ist höchstens 100 Zeichen lang.
Liest das Modell auf einer Seite nichts Verwertbares, entsteht ein Fallback-Name: Rechnung_Seite_7.pdf bzw. Dokument_Seite_7.pdf. Diese Dateien sind Ihre Prüfliste. Beträge, Mehrwertsteuer, Positionen oder IBAN liest die KI nicht aus; dafür ist das Tool nicht gebaut. Wie Trennen und Benennen zusammenspielen, zeigt die Seite PDF trennen und benennen in einem Schritt.
Was im ZIP steckt
Der Download ist ein ZIP mit drei Bestandteilen:
- die getrennten Einzel-PDFs, auf Wunsch in Ordnern nach Monat (
2025-03/) oder nach Absender (Mustermann-GmbH/); ohne erkennbares Datum bzw. Absender landet eine Datei im OrdnerUnbekannt/ _uebersicht.csvmit Dateiname, Seite, Rechnungsnummer, Firma, Datum und einem Konfidenz-Richtwert; im Dokumentmodus zusätzlich „Ist Rechnung“, Dokumenttyp, Verfasser und Datum. Nicht gelesene Felder stehen als „Nicht erkannt“ drin._metadata.jsonmit denselben Daten für Skripte oder den Import in ein DMS
Die Ordnerstruktur wählen Sie zusammen mit dem Modus vor dem Upload. Die Seiten selbst werden unverändert kopiert; eine OCR-Textebene wird dabei nicht hinzugefügt.
Was typischerweise schiefgeht
Die folgenden Fälle sind keine Ausnahmen, sondern das, was bei Posteingangs-Scans regelmäßig passiert. Rechnen Sie damit und planen Sie fünf Minuten Kontrolle ein.
Leere Rückseiten. Ein Duplex-Scan ohne Leerseitenunterdrückung liefert leere Seiten. Das Modell sieht keinen Briefkopf und kein Datum und hängt die Seite entweder als Folgeseite an das vorherige Dokument oder legt sie als Dokument_Seite_14.pdf ab. Beides ist harmlos, aber Sie sollten es wissen. Am Scanner die Leerseitenunterdrückung einzuschalten erspart den Fall ganz.
Lieferschein direkt hinter der Rechnung. Ein Lieferschein hat oft denselben Briefkopf und eine eigene Nummer. Im Rechnungsmodus bekommt er dann eine eigene Datei wie LS-2026-0457_Mustermann-GmbH.pdf, weil das Modell nach „Rechnungs- oder Dokumentnummer“ fragt. Ohne eigene Nummer und ohne Kopf wird er als Folgeseite an die Rechnung gehängt. Im Dokumentmodus wird er als „Lieferschein“ klassifiziert.
Anlagen ohne Briefkopf. AGB, Stundennachweise, Datenblätter: Seiten ohne Absender und Datum werden meist als Folgeseite des vorhergehenden Dokuments behandelt. Gehören sie zu einem anderen Dokument, ist die Zuordnung falsch.
Kassenbons und Thermobelege. Blasser Druck, kein lesbares Datum: Die Datei heißt dann zum Beispiel Kassenbon_REWE.pdf ohne Datum und liegt bei Sortierung nach Monat im Ordner Unbekannt/.
Verlesene Namen. Bei schrägen Scans, Handyfotos mit Schatten oder Auflösungen unter etwa 200 dpi kann aus „Mustermann“ ein „Musterrnann“ werden. Der Dateiname ist dann fast richtig, aber die Suche findet ihn nicht. Die CSV zeigt den gelesenen Namen pro Datei.
Falsche Nummer. Steht auf der ersten Seite die Kundennummer größer als die Rechnungsnummer, kann das Modell die falsche wählen. Der Dateiname beginnt dann mit KD-10234_ statt mit der Rechnungsnummer.
Scan-Einstellungen, die die Trennung erleichtern
Ab etwa 200 dpi liest das Modell zuverlässig, 300 dpi ist die sichere Wahl und entspricht der Empfehlung von DATEV für Belegscans. Schalten Sie Leerseitenunterdrückung ein, legen Sie Blätter gerade ein und entfernen Sie Klammern. Schwarz-Weiß spart Speicherplatz, nimmt blassen Belegen aber den letzten Kontrast; Graustufen sind bei Thermobelegen die bessere Wahl. Scannen Sie Kassenbons zeitnah, sie verblassen.
Rechenbeispiel mit Annahmen
Die Zahlen unten sind Annahmen, keine Messung. Passen Sie sie an Ihren Stapel an.
Angenommen, ein Sammelscan hat 50 Seiten mit etwa 20 Dokumenten. Von Hand rechnen wir mit einer Minute pro Seite für Durchsehen, Schneiden und Benennen, also 50 Minuten. Bei Arbeitskosten von 43,40 Euro je geleistete Stunde (Destatis, Arbeitskosten 2024) sind das rund 36 Euro pro Stapel.
Automatisch läuft die Verarbeitung fünf bis acht Minuten ohne Ihr Zutun. Rechnen wir fünf Minuten für die Kontrolle der CSV und der Fallback-Dateien, sind das rund 3,60 Euro Arbeitszeit plus der anteilige Tarif (50 von 100 Seiten im Starter-Tarif für 9,99 Euro, also etwa 5 Euro). Ab zwei solchen Stapeln im Monat liegt der Unterschied im zweistelligen Eurobereich; ob sich das für Sie lohnt, hängt von Ihrem Volumen ab. Unter etwa 20 Seiten im Monat reichen Bordmittel: Seiten im PDF-Viewer extrahieren, mit F2 umbenennen.
Wann welche Lösung passt
Für einzelne Dokumente pro Woche brauchen Sie kein Tool. Für gleichförmige Stapel (immer dieselbe Rechnung, immer zwei Seiten) reicht ein Intervall-Splitter. Für gemischte Posteingangs-Scans, bei denen die Länge variiert und die Dateien hinterher nach Inhalt heißen sollen, ist die Trennung am Inhalt die einzige Methode, die ohne Vorsortierung auskommt. Andere Anbieter trennen inzwischen ebenfalls per KI; der Unterschied bei Docusplit ist, dass Trennen und Benennen ein Upload sind und keine Vorlagen oder Regeln nötig sind.
Häufige Fragen (FAQ)
Wie genau ist die automatische Erkennung?
Eine gemessene Quote gibt es nicht, und wir nennen deshalb keine. Gut lesbare Scans mit Briefkopf, Datum und Dokumentnummer werden zuverlässig getrennt. Schwächen zeigen sich bei Handschrift, sehr blassen Thermobelegen, Scans unter etwa 200 dpi, leeren Rückseiten und Anlagen ohne Briefkopf. Prüfen Sie nach dem Download zuerst die Datei _uebersicht.csv und Dateien mit Fallback-Namen wie Dokument_Seite_7.pdf.
Funktioniert das auch mit handschriftlichen Dokumenten?
Eingeschränkt. Gedruckter Text wird gelesen, handschriftliche Ergänzungen werden meist ignoriert. Rein handschriftliche Seiten bekommen häufig keinen Absender und kein Datum und landen unter einem Fallback-Namen wie Dokument_Seite_12.pdf.
Werden meine Dokumente sicher verarbeitet?
Dateien werden TLS-verschlüsselt übertragen, nur für die Verarbeitung gehalten und danach von unseren Servern gelöscht. Die KI-Auswertung läuft über die OpenAI-API (Auftragsverarbeitungsvertrag mit OpenAI Ireland, Standardvertragsklauseln, keine Nutzung für Training; OpenAI hält API-Daten bis zu 30 Tage zur Missbrauchserkennung). Details stehen in der Datenschutzerklärung.
Welche Dateiformate werden unterstützt?
Nur PDF, maximal 50 MB pro Datei. Bilder (JPG, PNG) exportieren Sie vorher als PDF; jede Scan-App und jeder Scanner-Treiber kann das.
Wie viele Seiten können gleichzeitig verarbeitet werden?
Es gibt kein Seitenlimit pro PDF, nur die Dateigröße von 50 MB und Ihr Kontingent: 30 Seiten einmalig im kostenlosen Test, danach 100 (Starter), 300 (Pro) oder 1.000 Seiten pro Monat (Max). Rechnen Sie mit etwa 6 Sekunden pro Seite im Rechnungsmodus und etwa 10 im Dokumentmodus; ein 100-Seiten-Scan läuft also zehn bis siebzehn Minuten, der Fortschritt wird live angezeigt.
Was passiert, wenn die KI falsch trennt oder etwas nicht liest?
Kann die KI auf einer Seite weder Nummer noch Absender lesen, bekommt die Seite einen Fallback-Namen (Rechnung_Seite_7.pdf bzw. Dokument_Seite_7.pdf) und steht in der CSV mit „Nicht erkannt“. Falsch zusammengefasste Seiten trennen Sie mit einem PDF-Werkzeug Ihrer Wahl nach; falsch getrennte fügen Sie zusammen. Eine Vorschau der Trennstellen oder manuelle Trennpunkte gibt es nicht.
Fazit
Die Trennung am Inhalt ist der Teil der Dokumentenverarbeitung, der sich ohne Vorsortierung und ohne Trennblätter automatisieren lässt. Was bleibt, ist eine kurze Kontrolle der CSV und der Fallback-Dateien. Wer das einplant, bekommt aus einem Posteingangs-Scan in wenigen Minuten Dateien, die sich nach Nummer, Absender und Datum sortieren lassen.
Testen Sie es mit 30 Seiten gratis: kostenlosen Account anlegen und ersten Sammelscan hochladen, ohne Kreditkarte.