Aktenlage · Technik

Wie es arbeitet

Der Weg vom Blatt im Einzug bis zur abgelegten PDF, das Regelwerk dahinter und die gemessenen Werte aus dem Echtbetrieb.

01

Was zwischen Einzug und Ablage passiert

Jeder Schritt läuft auch einzeln und schreibt mit, was er getan hat.

Schritt 1

Scannen

Der Scanner liefert unveränderte Rohbilder. Seine eigenen Funktionen zum Verwerfen, Entzerren und Drehen bleiben abgeschaltet.

Schritt 2

Aufbereiten

Leerseiten aussortieren, Ausrichtung erkennen, Ränder beschneiden, Text erkennen. Jeder Schritt lässt sich wiederholen und zurücknehmen.

Schritt 3

Trennen

Wo endet ein Schreiben, wo beginnt das nächste? Acht Signale werden gewichtet zusammengeführt, ohne dass Trennblätter dazwischen müssen.

Schritt 4

Verstehen

Erst feste Regeln mit Prüfziffern, dann ein Sprachmodell auf dem eigenen Rechner. Widersprüche zwischen beiden werden vermerkt statt überschrieben.

Schritt 5

Ablegen

Ein durchsuchbares PDF, daneben ein lesbarer Beileger. Ordner und Dateiname folgen einem frei einstellbaren Muster.

Abzweig Quarantäne

Was als leer erkannt wurde, wird nicht gelöscht, sondern zurückgelegt, mit dem gemessenen Wert daneben.

Abzweig Prüfstapel

Unsichere Dokumente warten auf eine Freigabe. Die Konfidenz bestimmt die Reihenfolge der Vorlage, nicht ob vorgelegt wird.

Im Zweifel behalten. Nichts wird verworfen. Der Preis: gelegentlich eine überzählige Leerseite und ein längerer Prüfstapel.

02

Wie das Programm liest

Zuerst rechnen, dann deuten.

Erst feste Regeln

IBAN nach ISO 7064, Steuer-Identifikationsnummer nach Modulo 11,10, USt-IdNr., Datumsformate, Beträge, zwölf Arten von Referenznummern, Anschrift, Kontaktwege.

Gerechnet, nicht geraten: Jeder Fund muss seine Prüfziffer erfüllen. Aus einem DEO2 wird nur dann DE02, wenn die Summe danach stimmt.

Dann das Sprachmodell

Es läuft auf dem eigenen Rechner und bekommt die geprüften Funde vorangestellt. Seine Antwort wird dagegen geprüft; Widersprüche werden vermerkt.

Trennen ohne Trennblätter

Acht Signale: Seitenangabe, Referenznummer, Absenderwechsel, Briefkopf, Anrede, Formatwechsel, Datumswechsel, kurze Schlussseite. Dazu die Probe, ob ein Dokument so viele Seiten hat, wie es angibt.

Leere Seiten ohne Verluste

Dunkle Pixel zu zählen scheitert an Schatten, Lochung und Durchschein. Aktenlage zieht von der Rückseite ab, was die Vorderseite erklärt. Was übrig bleibt, ist eigener Inhalt.

03

Das Archiv bleibt ohne das Programm lesbar

Kein eigenes Dateiformat, keine Bindung an den Hersteller.

  • Das Dateisystem ist die Wahrheit

    Neben jeder PDF liegt eine lesbare Textdatei mit allen Angaben. Die Datenbank ist nur ein Index und daraus neu aufzubauen.

  • Umzug ohne Werkzeug

    Ordner kopieren, Index neu aufbauen, fertig. Wer aufhört, behält durchsuchbare PDFs mit Klartext daneben.

  • Nichts wird gelöscht

    Leerseiten gehen in die Quarantäne und lassen sich zurückholen. Dubletten werden gemeldet, nicht verworfen.

  • Freigabe nur durch den Nutzer

    Kein Dokument gilt automatisch als geprüft. Jede Datei trägt ihre Prüfsumme.

04

Was den Rechner verlässt

Die Dokumente nie. Sonst eine regelmäßige Verbindung und ein einmaliger Download auf Knopfdruck.

VorgangWas übertragen wird
Scannen, Erkennen, Verstehen, Ablegennichts
Sprachmodell
spricht mit einem Dienst auf demselben Rechner (127.0.0.1)
nichts, solange die voreingestellte Adresse steht. Sie ist änderbar; wer dort einen fremden Rechner einträgt, schickt den Dokumenttext dorthin.
Lizenzprüfungnichts
Suche im Archivnichts
Nachsehen, ob es eine neuere Fassung gibt
höchstens einmal wöchentlich, abschaltbar
die Anfrage nach einer öffentlichen Datei auf timobritz.de. Keine Kennung, keine Lizenznummer, keine Zählung. Heruntergeladen wird nichts.
Sprachmodell einmalig laden
nur auf Knopfdruck, rund 5 GB
der Abruf des Modells über den mitgelieferten Ollama-Dienst aus dem öffentlichen Modellverzeichnis von Ollama. Der Anbieter sieht IP-Adresse und Modellname; keine Dokumente, keine Lizenzdaten.

Die Fassungsdatei ist signiert. Besteht sie die Prüfung nicht, zeigt das Programm weder Meldung noch Link. Ein gefälschter Update-Hinweis geht damit nicht.

Für Kanzleien und Praxen: Da keine Daten an Dritte gehen, braucht es keinen Vertrag zur Auftragsverarbeitung.

05

Gemessen, nicht geschätzt

Aus einem echten Durchlauf auf einem gewöhnlichen Arbeitsplatzrechner. Die Werte hängen von Vorlage und Hardware ab und sind nicht zugesichert.

1,3 s
je Seite Texterkennung
Konfidenz 92 bis 93
4,7 s
je Dokument Sprachmodell
vollständig auf der Grafikkarte
7 / 7
Einordnungen richtig
Kategorie und Dokumenttyp
740 KB
je Seite im Archiv
Farbe, 300 dpi, durchsuchbar
571
Tests, alle bestanden
bei jeder Fassung neu

Geprüft wird vor allem dort, wo ein Archiv still Schaden nimmt: Leerseiten, Windows-Dateinamen, Absenderzuordnung, Wiederaufbau des Index, einzelne gekippte Bits.

06

Stand der Entwicklung

Elf Fassungen seit dem 1. September 2026. Alle 1.x sind im Preis enthalten.

1.0 bis 1.2

Die Kette läuft durch

Scannen, Aufbereiten, Trennen, Verstehen, Ablegen, Suchen. Alle Einstellungen im Programm, Statistik, Sicherung, Dublettenerkennung.

1.3 und 1.4

Suchen und Pflegen

Suche mit Vorschau und Filtern. Nachbewertung des Gesamtbestands: Wird die Erkennung besser, läuft das Archiv erneut durch.

1.4.2 bis 1.4.4

Was der Gebrauch gezeigt hat

Sicherungen ließen sich nicht einlesen, aus der Quarantäne kam nichts zurück, Dokumentdaten konnten in der Zukunft liegen. Alles behoben.

1.5.0

Kein zweiter Installationsschritt

Der Dienst für das Sprachmodell liegt jetzt bei. Und ohne Modell landete bisher jedes Dokument in „Sonstiges“.

Als Nächstes

Zusammenfassen und Trennen von Hand

Die größte bekannte Lücke.

07

Zurück zum Programm

Preis, Bildschirmfotos, Grenzen und Download stehen auf der Produktseite.