Die meisten veröffentlichten Anleitungen zur Erstellung barrierefreier PDFs sind für Dokumente geschrieben, bei denen alles glattläuft: ein sauberer Export, ein Diagramm, keine Tabellen, fertig in zwanzig Minuten. Solche Dokumente gibt es. Wahrscheinlich ist es jedoch nicht das, das auf Ihrem Schreibtisch liegt.
Im Folgenden finden Sie denselben Workflow, ergänzt um die fehlenden Teile: Was jeder Schritt kostet, ob eine Maschine ihn erledigen kann und – da wir es gemessen statt geraten haben – welcher Anteil eines echten Stapels von PDF/UA-Fehlern tatsächlich einen Menschen erfordert.
Beginnen Sie mit dem, was die Leute tatsächlich herunterladen
Vor jedem Workflow-Schritt steht eine Entscheidung, die nicht auf der Checkliste steht: Welche Datei zuerst? Der Instinkt sagt, mit dem zu beginnen, was zuletzt veröffentlicht wurde, weil das im CMS sichtbar ist. Das ist der falsche Ansatz. Eine fünf Jahre alte Gebührenordnung, die jede Woche heruntergeladen wird, richtet mehr Schaden an, wenn sie defekt bleibt, als ein Bericht, den seit dem Tag der Veröffentlichung niemand mehr geöffnet hat.
Wenn Ihr CMS oder Ihre Web-Logs Ihnen sagen können, was tatsächlich heruntergeladen wird, sortieren Sie danach. Falls nicht, sind die Seitenaufrufe der Seite, die auf das PDF verlinkt, ein brauchbarer Ersatz. So oder so lautet die Frage: „Wer ist jetzt gerade betroffen?“, nicht „Was haben wir gerade veröffentlicht?“ – und das ist der einzige Schritt in diesem gesamten Prozess, den eine Maschine Ihnen nicht abnehmen kann, da er davon abhängt, was Ihre Organisation tut, nicht von der Datei selbst.
Der Workflow, Schritt für Schritt
„Maschine“ bedeutet, dass Software die gesamte Aufgabe erledigen kann, ohne dass jemand entscheiden muss, was der Inhalt bedeutet. „Person“ bedeutet, dass jemand das Dokument ansehen und eine Entscheidung treffen muss.
| Schritt | Maschine oder Person | Ungefähre Dauer | Wie Sie die Umsetzung prüfen |
|---|---|---|---|
| 1. Ermitteln, was Sie tatsächlich haben | Maschine | Sekunden pro Datei | Strukturbaum, Sprache, Titel – vorhanden oder nicht |
| 2. An der Quelle korrigieren, falls noch vorhanden | Person, toolgestützt | Minuten bis Stunden, je nach Länge | Der eigene Barrierefreiheits-Checker des Autorentools |
| 3. Exportieren, ohne es zu beschädigen | Maschine – eine Einstellung, keine Aufgabe | Sekunden, sobald es Routine ist | Das Feld Producer in der Datei, die Sie veröffentlichen |
| 4. Die mechanischen Reparaturen | Maschine | Sekunden bis wenige Minuten | Validator erneut ausführen; die Klausel ist weg |
| 5. Die Ermessensentscheidungen | Person | Minuten pro Bild oder Tabelle | Eine zweite Person liest es Korrektur |
| 6. Vor der Veröffentlichung validieren | Maschine | Etwa 3 Sekunden pro Dokument | Der Bericht selbst, über die erste Zeile hinaus gelesen |
1. Ermitteln, was Sie tatsächlich haben
Bevor Sie irgendetwas reparieren, finden Sie heraus, was vorhanden ist und in welchem Zustand es sich befindet. Digital erstellt oder gescannt? Ist eine Sprache deklariert? Und gibt es einen Strukturbaum – wobei man wissen muss, dass ein vorhandenes Tag und ein korrektes Tag zwei verschiedene Fragen sind, geben Sie sich also nicht mit Ja oder Nein zufrieden. Dies ist der einzige Teil der Arbeit, der rein mechanisch und nahezu sofort erledigt ist: Ein Skript oder ein kostenloser In-Browser-Checker kann diese Signale bei hunderten Dateien in der Zeit auslesen, die Sie für eine Tasse Kaffee brauchen.
Betrachten Sie das Ergebnis als Triage-Liste, nicht als Urteil. Ein vorhandener Strukturbaum sagt Ihnen nur, dass das Dokument irgendwann einmal getaggt wurde; er sagt nichts darüber aus, ob die Tags korrekt sind – hier kommt Schritt 5 ins Spiel.
2. An der Quelle korrigieren, falls noch vorhanden
Wenn Sie noch die Word- oder InDesign-Datei haben, ist dies der Punkt, an dem sich die Arbeit einer Person auszahlt: echte Überschriftenformate statt fettem 14-pt-Text, Alt-Texte, die beschreiben, was ein Bild bedeutet, statt nur zu sagen, dass es ein Bild ist, Tabellenüberschriften, die als solche markiert sind, statt sie nur fett zu drucken. Der Barrierefreiheits-Checker von Word markiert einen Großteil davon während der Arbeit – wir haben separat darüber geschrieben, welcher Teil das ist und wo er stillschweigend aufhört.
Bei einem einseitigen Formular dauert dieser Schritt Minuten. Bei einem fünfzigseitigen Jahresbericht ist es die Arbeit eines halben Tages, denn das Lesen ist der eigentliche Aufwand: Sie können keinen Alternativtext für ein Diagramm schreiben, ohne zu lesen, was das Diagramm aussagt.
Wenn Sie die Quelle nicht mehr haben – ein Scan, ein alter Export, eine Datei, die per E-Mail von jemandem kam, der nicht mehr im Unternehmen ist –, existiert dieser Schritt für Sie nicht. Gehen Sie direkt zu Schritt 4.
3. Exportieren, ohne es zu beschädigen
Zwei Einstellungen sind wichtig, und keine davon ist überall standardmäßig aktiviert: Betten Sie die Schriftarten ein – wir haben genau beschrieben, wo sich diese Einstellung versteckt – und lassen Sie die Datei danach nicht komprimieren oder „optimieren“. Ein einziger Durchlauf eines gängigen PDF-Komprimierungstools kann die Struktur direkt aus einer bereits getaggten Datei entfernen; wir haben genau gemessen, was das bewirkt, und es ist schlimmer, als die meisten Leute erwarten.
Es kostet nichts, sobald es zur Gewohnheit wird, aber es kostet alles an dem Tag, an dem Sie entdecken, dass ein „PDF verkleinern“-Schritt, den jemand hinzugefügt hat, um Speicherplatz zu sparen, jetzt automatisch auf jeden Anhang angewendet wird.
4. Die mechanischen Reparaturen
Hier lohnt sich Automatisierung, denn diese Korrekturen werden bei größeren Mengen nicht langsamer. Einen PDF/UA-Identifikator in die Metadaten schreiben, einen Titel ausfüllen, eine Schriftart einbetten, eine zufällige Markierung als Dekoration statt als Inhalt kennzeichnen – nichts davon erfordert Wissen darüber, worum es in dem Dokument eigentlich geht.
Ein kleines, reales Beispiel, keine allgemeine Behauptung: Einer der 59 kommunalen Word-Exporte aus unserem früheren Beispiel scheiterte an genau zwei Prüfungen – kein PDF/UA-Identifikator, kein dc:title im XMP-Metadatenstrom. Ein kurzes pikepdf-Skript schrieb beide Felder in 8–23 Millisekunden über fünf Durchläufe; nach der erneuten Validierung hatte die Datei null statt zwei Fehler. Das ist das einfache Ende des Stapels – das Einbetten einer fehlenden Schriftart oder das Klassifizieren hunderter ungetaggter Markierungen in einem Dokument ohne jegliche Struktur ist echte Programmierung, nicht zwei Zeilen Code. Nichts davon, ob einfach oder schwer, erfordert, dass eine Person entscheidet, was das Dokument bedeutet – das ist es, was diesen Schritt von Schritt 5 unterscheidet.
5. Die Ermessensentscheidungen
Diesen Schritt kann man nicht überspringen. Zu entscheiden, was ein Bild kommunizieren soll, ob eine verbundene Zelle eine echte Unterüberschrift oder eine Formatierungsgewohnheit ist, ob eine Seitenleiste vor oder nach der Spalte daneben gelesen werden sollte – dafür braucht man jemanden, der das Dokument lesen kann, nicht jemanden, der ein Tool bedienen kann. Es dauert Minuten pro Bild oder Tabelle, und anders als bei Schritt 4 wird es nicht günstiger, wenn man mehr davon macht.
Dies ist auch der Schritt, den die meisten Anleitungen zur Erstellung barrierefreier PDFs mit einem Satz wie „Fügen Sie Ihren Bildern Alt-Texte hinzu“ überspringen, als ob das Schreiben von vierhundert Beschreibungen dieselbe Art von Aufgabe wäre wie das Ankreuzen eines Kontrollkästchens.
6. Vor der Veröffentlichung validieren, nicht nach dem Schreiben
veraPDF ist der Open-Source-Validator für PDF/UA- und PDF/A-Konformität. PAC ist der kostenlose PDF-Barrierefreiheits-Checker für PDF/UA und WCAG. Führen Sie einen der beiden gegen PDF/UA-1 für die Datei aus, die tatsächlich auf die Website gestellt wird – nach jedem der oben genannten Schritte, nicht nach Schritt 2. Bei unserem eigenen Stapel von 59 Dateien benötigte veraPDF 1.30.2 im Durchschnitt 3,2 Sekunden pro Dokument (188 Sekunden für den gesamten Stapel, eine Datei nach der anderen). Die Validierung ist nicht der Flaschenhals in diesem Workflow; Schritt 2 und 5 sind es.
Ein Bestehen bedeutet, dass der maschinell prüfbare Teil sauber ist. Es bedeutet nicht, dass das Dokument gut ist – das ist das Problem von Schritt 5, und kein ehrlicher Validierungsbericht behauptet etwas anderes, wenn man über die erste Zeile hinaus liest.
Wie viel davon ist tatsächlich mechanisch
Jede Anleitung sagt, dass einige Korrekturen automatisch sind und andere eine Person erfordern. Fast keine sagt, wie viel in welchen Stapel fällt, also haben wir es gezählt – unter Verwendung derselben 59 validierten Word-Export-PDFs aus unserem früheren Artikel, ungarische kommunale Dokumente, die mit veraPDF 1.30.2 gegen PDF/UA-1 geprüft wurden.
Die Regel: Ein Fehler landete im mechanischen Stapel, wenn die Korrektur bedeutet, einen festen, berechenbaren Wert zu schreiben, der nicht davon abhängt, was das Dokument sagt – eine Schriftart, ein Identifikator, ein Metadatenfeld, ein strukturelles Flag. Er landete im Stapel erfordert eine Person, wenn die Korrektur bedeutet, zu entscheiden, was etwas bedeutet – Alternativtext, die echten Überschriften einer Tabelle, die alternative Beschreibung eines Links, eine unregelmäßige Zeile von Zellen, die eine echte Untertabelle sein könnte oder ein Fehler.
Wir haben alle 23 verschiedenen PDF/UA-1-Regeln, an denen die Stichprobe scheiterte, auf diese Weise klassifiziert und dann gezählt, wie viele Dateien von welcher Regel betroffen waren. Gesamt: 277 dateibasierte Fehler. 184 davon (66 %) waren mechanisch. 93 (34 %) erforderten eine Person.
Ein einzelner Balken, zweigeteilt. 66 Prozent — 184 von 277 dateibasierten Fehlern in der Stichprobe — sind mechanisch, ein Werkzeug kann sie beheben. 34 Prozent — 93 Fehler — erfordern die Entscheidung einer Person.
Diese 66 % liegen nahe an einer anderen Zahl, die bereits auf dieser Website steht: Etwa zwei Drittel der ~136 Fehlerbedingungen des Matterhorn-Protokolls sind maschinell prüfbar. Das ist nicht dieselbe Behauptung – prüfbar bedeutet, ein Validator kann das Problem erkennen, korrigierbar bedeutet, eine Maschine kann es auch beheben. Die beiden Zahlen landeten hier in der gleichen Größenordnung; es ist erwähnenswert, sollte aber nicht als allgemeine Regel missverstanden werden.
Wie wir gezählt haben
Die JSON-Ausgabe von veraPDF meldet jede Regel als clause und testNumber (zum Beispiel 7.1 / 9 für ein fehlendes dc:title), mit einer failedChecks-Anzahl und einem ruleStatus. Wir haben die von jeder Regel betroffenen Dateien über alle 59 Berichte hinweg summiert und jede Regel in einen der beiden oben genannten Stapel sortiert.
~/.local/share/verapdf/verapdf -f ua1 --format json document.pdf
Die Grenze selbst ist eine Ermessensentscheidung: Tabellenstrukturregeln (7.5-1, 7.2-42, 7.2-43, 7.2-10) landeten bei „erfordert eine Person“, weil das Korrigieren einer unregelmäßigen Tabelle bedeutet, zu entscheiden, was ihre Zellen aussagen sollten, nicht nur einen Wrapper darum zu legen.
Auf Dateiebene liest sich die Aufteilung anders, und für die Planung eines Rückstands ist dies die nützlichere Zahl: 19 der 59 Dateien (32 %) hatten überhaupt keinen Fehler, der eine Person erforderte – jeder Fehler darin war mechanisch. Die anderen 40 hatten mindestens eine Sache, die eine Maschine nicht allein entscheiden kann. Wenn Sie abschätzen, wie viel von einem Rückstand ein Skript allein beseitigen kann, bevor jemand eine Datei öffnen muss, ist das die Zahl, die Sie verwenden sollten – nicht die 66 %.
Was das nicht löst
Die Automatisierung der mechanischen zwei Drittel lässt das andere Drittel nicht verschwinden. Ein Rückstand von fünftausend Dokumenten mit demselben 34 %-Profil hat immer noch fast zweitausend Dateien, bei denen eine Person sie öffnen, lesen und entscheiden muss, was ein Bild oder eine Tabelle tatsächlich aussagt. Kein Tool – unseres eingeschlossen – ändert diese Rechnung. Es ändert nur, wie viel übrig bleibt, sobald der einfache Teil erledigt ist.
Die Klassifizierung ist ebenfalls eine Ermessensentscheidung, die man als solche zugeben sollte. Tabellenzeilenregeln wie 7.2-10 landeten im Stapel „erfordert eine Person“, weil die Bedeutung einer unregelmäßigen Tabelle meist nicht allein aus dem Markup ersichtlich ist; eine strengere Lesart könnte das stattdessen als mechanisch bezeichnen. Verschieben Sie es, und die Aufteilung verschiebt sich um ein paar Punkte in die eine oder andere Richtung – nicht genug, um die Schlagzeile zu ändern, aber genug, um zu zeigen, dass 66/34 eine Auswertung eines Datensatzes ist, keine Konstante.
Wo man anfängt
Nicht mit einem Plan für alles – ein Rückstand, der als ein undifferenzierter Haufen behandelt wird, ist der Grund, warum diese Projekte ins Stocken geraten. Sortieren Sie Ihre Dateien danach, wie viele Leute sie tatsächlich öffnen. Führen Sie den mechanischen Durchlauf für alles aus, einschließlich der Dateien, die nicht dringend sind, da dies fast nichts kostet. Reservieren Sie die tatsächlichen Personenstunden für das Drittel der Fehler, die sie benötigen, und wenden Sie diese Stunden zuerst auf die Dokumente ganz oben auf der Download-Liste an.
Wenn Sie möchten, dass die mechanische Ebene für Sie erledigt wird, sehen Sie sich an, wie unsere Pipeline das macht – eine kostenlose Analyse, Preis im Voraus angezeigt. Wenn Sie lieber Ihren eigenen Validator-Bericht Zeile für Zeile durcharbeiten möchten, erklärt unsere Referenz, was jede PDF/UA-Klausel bedeutet und ob es sich um die Art von Sache handelt, die eine Maschine selbst beheben kann.