Von bestehender PDF zu PDF/UA: rekonstruieren statt nachträglich taggen

Die ursprüngliche Word-, XML- oder Layoutquelle ist verschwunden. Die PDF ist noch vorhanden, sieht gut aus und enthält Text, besitzt aber keine brauchbare Struktur für assistive Technologien. Lässt sie sich automatisiert in PDF/UA umwandeln?

In einem früheren Artikel haben wir den Weg beschrieben: analysieren, klassifizieren, rekonstruieren, neu generieren und validieren. Der Rekonstruktionskern läuft inzwischen. Die wichtigste Entscheidung war dabei nicht ein intelligenterer Auto-Tagging-Algorithmus, sondern ein anderer Ausgangspunkt: Die alte PDF wird als messbares Quellmaterial behandelt, aus dem ein neues semantisches Dokument entsteht.

Das ist kein Versprechen, dass jede beliebige PDF auf Knopfdruck barrierefrei wird. Es ist ein reproduzierbarer Weg, gleichartige, digital erzeugte Dokumente serienweise zu sanieren und dabei sowohl PDF/UA-Konformität als auch Inhaltserhalt zu prüfen.

Warum nachträgliche Tags oft auf dem falschen Fundament stehen

Eine PDF legt sehr genau fest, wo Buchstaben, Linien und Bilder auf einer Seite stehen. Was diese Elemente bedeuten, ist häufig verloren gegangen.

  • Zwei Textblöcke nebeneinander können Spalten oder eine Tabelle sein.
  • Fettdruck kann eine Überschrift oder eine normale Hervorhebung markieren.
  • Ein wiederkehrendes Logo kann Seitenzubehör sein, während ein ähnliches Bild Inhalt trägt.
  • Eine Zahl links neben Text kann Listenkennzeichen, Paragrafennummer oder Tabellenzelle sein.
  • Der sichtbare Text eines Links und die zugehörige PDF-Annotation können in unterschiedlichen Objekten liegen.

Auto-Tagging muss Bedeutung innerhalb der bestehenden PDF-Objekte erraten. Wenn diese Objekte weder Lesereihenfolge noch Inhaltsstruktur abbilden, werden saubere Tags an das falsche Modell gehängt. Deshalb reparieren wir nicht in erster Linie den Strukturbaum der alten Datei. Wir lesen die Datei und erzeugen eine neue Struktur.

PDF mit markierten Elementen und Pfeilen zu verschiedenen möglichen Deutungen.

Vier Messungen ergeben gemeinsam das Quellbild

Kein einzelner Extraktor enthält alle benötigten Informationen. Die Rekonstruktionskette liest daher vier Seiten derselben PDF:

  1. Text und Koordinaten: Wörter, Zeilen, Blöcke, Spalten und ihre Begrenzungen.
  2. Typografie: Fontfamilie, Größe, Gewicht und Farbe je Textfragment.
  3. Gezeichnete Formen: Linien, Rahmen und Flächen, die beispielsweise eine Tabelle oder Abbildung sichtbar machen.
  4. Annotationen: externe und interne Links, Ziel, Position und sichtbarer Linktext.

Diese Signale werden anhand ihrer Koordinaten in einem Zwischenmodell zusammengeführt. Erst danach folgen Lesereihenfolge und Semantik:

bestehende PDF
  → Text + Typografie + Formen + Annotationen
  → Lesereihenfolge
  → Überschriften, Absätze, Listen, Tabellen, Abbildungen und Links
  → semantisches XSL-FO
  → neue getaggte PDF

Die alte PDF bleibt dabei unverändert. Die neue PDF ist ein separates, vollständig neu aufgebautes Artefakt.

Vier PDF-Messungen — Text, Typografie, Formen und Annotationen — ergeben gemeinsam ein Modell.

Zuerst messen, nur Ausnahmen konfigurieren

Skalierbar ist nicht „eine universelle Regel für alle PDFs“, sondern die Kombination aus generischen Messungen und einer kleinen Konfiguration je Dokumentfamilie.

Seitenformat, Ränder, Spalten, Spaltenabstand, Schriftgröße, Zeilenhöhe, Einzüge und Abstände werden aus den Dokumenten selbst gemessen. Ausreißer dürfen dabei nicht den gesamten Satzspiegel bestimmen; robuste Perzentile funktionieren besser als Minimum oder Maximum.

Eine Serienkonfiguration beschreibt nur, was sich nicht zuverlässig aus der Geometrie ableiten lässt, zum Beispiel:

  • welche Typografie und Textmuster Überschriftenebenen kennzeichnen;
  • welches wiederkehrende Bild ein Logo oder anderes Seitenzubehör ist;
  • wann eine scheinbare Tabelle tatsächlich nummerierter Fließtext ist;
  • welche Beschreibung ein wiederkehrendes inhaltliches Bild erhält.

Metadaten aus der Quell-PDF wählen automatisch die richtige Serienkonfiguration. Eine neue Dokumentfamilie beginnt daher mit Messungen, nicht mit einer handgeschriebenen Vorlage voller fester Positionen.

Seitenmessungen, Ausreißer und eine Konfigurationscheckliste für eine Dokumentfamilie.

Spalten sind keine Tabellen

Die schwierigsten Fehler entstehen, wenn Geometrie mit Bedeutung verwechselt wird. Ein früherer Rekonstruktionsversuch legte 96 Prozent des Fließtextes in Tabellen ab. Zwei Seitenspalten waren als Tabellenspalten interpretiert worden; ein Dokument mit einigen Dutzend Seiten wuchs auf 126 Seiten, teilweise mit nur einem Wort pro Zeile.

Die neue Kette bestimmt deshalb zuerst die Lesereihenfolge. Die Tabellenerkennung folgt erst danach und muss ausreichend Belege für Zeilen und Spalten finden. Bestätigte Tabellen werden mit Table, TR, TH und TD neu aufgebaut, einschließlich expliziter Beziehungen zwischen Daten- und Kopfzellen. Textspalten bleiben normaler Text.

Dieser Unterschied ist entscheidend: Eine Tabelle ist keine visuelle Anordnung, sondern eine semantische Beziehung zwischen Zellen.

Vergleich von Textspalten und Tabellen mit dem Hinweis, beide nicht zu verwechseln.

Neugenerierung macht Qualität erzwingbar

XSLT erzeugt aus dem Zwischenmodell neues XSL-FO. Apache FOP erstellt daraus einen neuen PDF/UA-1-Kandidaten, unter anderem mit:

  • einem logischen Strukturbaum und einer Lesereihenfolge;
  • Dokumentsprache und Titel;
  • echten Listen und Tabellen;
  • getaggten Links mit Beschreibungen;
  • eingebetteten Fonts und zuverlässigem Unicode-Text;
  • als Artifact ausgezeichnetem Seitenzubehör außerhalb des Inhalts.

Formatter, Stylesheets, Fonts, Extraktoren und Validator sind auf feste Versionen gesetzt. Bei einem fehlgeschlagenen Build bleiben XSL-FO und Berichte erhalten, sodass derselbe Fehler später exakt reproduziert werden kann.

Workflow von XSLT über XSL-FO zu einem strukturierten PDF/UA-1-Dokument.

Was der aktuelle Serientest tatsächlich belegt

Eine Serie von dreizehn deutschen Regierungsdokumenten aus derselben Publikationsfamilie wurde über Metadaten automatisch erkannt und Dokument für Dokument neu aufgebaut. Der Regressionstest vom 29. Juli 2026 ergab:

  • 13 von 13 neue PDFs waren laut qpdf technisch intakt;
  • 146.393 von 146.393 Unicode-Buchstaben blieben erhalten;
  • die einzige eindeutige externe URI der Quellserie blieb 1 → 1 erhalten;
  • 13 von 13 neue Artefakte bestanden mit veraPDF 1.30.2 und dem expliziten Profil ua1 die PDF/UA-1-Prüfung mit null fehlgeschlagenen Regeln;
  • die jeweils erste und letzte Quell- und Ergebnisseite aller dreizehn Dokumente wurde gerendert und visuell geprüft.

Die Gesamtseitenzahl änderte sich von 114 auf 104. Das war nicht automatisch ein Fehler: Beim Neuumbruch wurden einige kurze Titelseiten mit dem Beginn des Inhalts kombiniert. „Gleiche Seitenzahl“ ist deshalb kein allgemeines Qualitätsmaß. Vollständiger Buchstabenstrom, Links, semantische Struktur und visuelle Nutzbarkeit sind stärkere Kontrollen.

Das Ergebnis belegt die kontrollierte Serie und die von den Tests abgedeckten Dokumentkonstruktionen. Es belegt nicht, dass bereits jede Art von PDF automatisch verarbeitet werden kann.

PDF-Stapel mit 13/13 Ergebnissen, 146.393 erhaltenen Buchstaben und grünem Haken.

Ein grüner Validator reicht nicht

Die Kette nutzt bewusst mehrere Qualitätstore:

  1. Form: veraPDF prüft die maschinenprüfbaren Anforderungen von PDF/UA-1.
  2. Inhalt: Textstrom und URIs werden mit der Quelle verglichen.
  3. Integrität: qpdf prüft die technische Gültigkeit der neuen Datei.
  4. Erscheinungsbild: Repräsentative Seiten werden gerendert und angesehen.
  5. Menschliche Prüfung: Aussagekräftige Alternativtexte, komplexe Lesereihenfolge und semantische Entscheidungen bleiben bei Bedarf Prüfpunkte.

Das zweite Tor ist nicht theoretisch. Während der Entwicklung entstand eine PDF, die die formale PDF/UA-Prüfung bestand, obwohl ein großer Teil des Textes fehlte. Konformität der Dateistruktur und Erhalt der Publikation sind zwei verschiedene Fragen.

veraPDF weist selbst darauf hin, dass seine PDF/UA-Validierung nur maschinenprüfbare Kontrollen ausführt. Ein grüner ua1-Bericht darf daher als technischer Konformitätsnachweis für genau diese Datei gelten, nicht als vollständiger Nutzertest oder allgemeine rechtliche Freigabe.

Fünf verbundene Prüfungen für Struktur, Inhalt, Integrität, Erscheinungsbild und menschliche Bewertung.

Wo Automatisierung passt – und wo nicht

Dieser Ansatz eignet sich für digital erzeugte PDFs mit Textschicht, erkennbaren Dokumentfamilien und wiederkehrender Gestaltung. Eine getestete Serienkonfiguration kann dann viele Dokumente bedienen; jede spätere Änderung lässt sich gegen denselben Regressionsvertrag prüfen.

Scans ohne zuverlässige Textschicht, Formulare, Infografiken, komplexe Mathematik und Dokumente, deren Bedeutung nur dem Autor bekannt ist, erfordern zusätzliche Extraktion oder menschliche Entscheidungen. Auch Alternativtexte lassen sich nicht verantwortbar allein aus Geometrie ableiten.

Ein Projekt beginnt deshalb nicht mit einem Mengenversprechen, sondern mit einem repräsentativen Korpus:

  1. Dokumentfamilien und Ausnahmen bestimmen;
  2. Quellqualität und Extrahierbarkeit messen;
  3. Akzeptanzkriterien für Inhalt, Struktur und Erscheinungsbild vereinbaren;
  4. eine Serie Ende-zu-Ende rekonstruieren;
  5. menschliche Prüfpunkte ausdrücklich festlegen;
  6. erst nach einer grünen Regressionsserie skalieren.

So wird die Sanierung bestehender PDFs von einer undurchsichtigen Konvertierung zu einem wiederholbaren Produktionsprozess mit Nachweisen je Datei.

Automatische Verarbeitung von PDFs mit Textschicht neben Dokumenten, die menschliches Eingreifen erfordern.

Quellen und Abgrenzung

Die genannten Testergebnisse gelten für die am 29. Juli 2026 geprüften Artefakte und die darin abgedeckten Dokumentkonstruktionen. PDF/UA-Konformität wird nur für ein Artefakt mit erfolgreichem veraPDF-Bericht im Profil ua1 beansprucht; wo die Norm eine inhaltliche Beurteilung verlangt, bleibt eine menschliche Barrierefreiheitsprüfung erforderlich.

ISO 14289-1, Matterhorn Protocol und veraPDF als Quellen für die PDF/UA-Prüfung.

Möchten Sie mehr erfahren?

Kontaktieren Sie uns, um zu besprechen, was das für Ihre Organisation bedeuten könnte.

Kontakt aufnehmen