Altbestände mit KI aufbereiten
Sechs Aufgaben, die KI im Dokumenten-Altbestand wirklich übernehmen kann – und wo sie an Grenzen stößt.Altbestände mit KI aufbereiten: Was wirklich hilft
Wenn eine Redaktion über den Einsatz von KI nachdenkt, taucht der Altbestand fast immer als Erstes auf – und das aus gutem Grund. Da liegen vierhundert Dokumente, die niemand mehr überblickt, zwanzig Jahre gewachsen, mit Dubletten, Widersprüchen und Fassungen, deren Status niemand kennt. Das Aufräumen wäre nötig, ist aber unbezahlbar, weil es Lesearbeit bedeutet, für die kein Mensch Zeit hat.
Genau hier setzt die Hoffnung an: Eine Maschine, die unermüdlich liest und nie den Überblick verliert, klingt nach der Lösung für ein Problem, das seit Jahren vor sich hin schwelt. Und tatsächlich ist das einer der wenigen KI-Anwendungsfälle in der Technischen Redaktion, bei dem der Nutzen unmittelbar messbar ist – vorausgesetzt, man setzt die Werkzeuge dort ein, wo sie etwas können, und erwartet nicht, dass sie die Arbeit übernehmen.
Dieser Artikel liefert den realistischen Werkzeugkasten: sechs Aufgaben, die KI im Altbestand gut erledigt, fünf Fragen, die sie prinzipiell nicht beantworten kann, und die Einordnung in die fünf Phasen der Migration. Die tragende Regel steht am Anfang: Jede dieser Aufgaben erzeugt eine Liste – keine einzige verändert den Bestand.
|
★ Fakten kompakt |
|---|
Was den Altbestand so teuer macht
Bevor es um Werkzeuge geht, lohnt der genaue Blick auf das Problem – denn er erklärt, warum ausgerechnet hier ein Sprachmodell nützlich ist. Der Aufwand beim Aufräumen entsteht nicht durch komplizierte Entscheidungen, sondern durch schiere Lesearbeit. Um zu wissen, ob zwei Dokumente dasselbe beschreiben, muss man beide lesen. Um zu wissen, welche Themen im Bestand vorkommen, muss man alles überfliegen. Um Widersprüche zu finden, muss man Angaben aus verschiedenen Dokumenten nebeneinanderlegen.
Diese Arbeit ist nicht schwierig, sie ist nur umfangreich – und deshalb unterbleibt sie. In den meisten Häusern weiß niemand genau, was im Bestand steht; man kennt die aktiven Dokumente und ahnt den Rest. Und weil man ihn nicht kennt, kann man ihn auch nicht triagieren, was wiederum bedeutet, dass jede Migrationsplanung mit einer geschätzten Menge beginnt statt mit einer gezählten.
Genau dieses Nadelöhr löst ein Sprachmodell auf. Es liest unermüdlich, vergleicht ohne zu ermüden und liefert Übersichten über Bestände, die sonst niemand durchgesehen hätte. Der Nutzen ist also nicht, dass es besser liest als ein Mensch – das tut es nicht. Der Nutzen besteht darin, dass es überhaupt liest, wo sonst schlicht niemand liest. Das klingt bescheiden und ist der Unterschied zwischen einem unbekannten und einem beschriebenen Bestand.
Der Werkzeugkasten: sechs Aufgaben
Aufgabe eins ist das Inventarisieren: Worum geht es in diesem Dokument, zu welchem Produkt gehört es, welche Themen behandelt es? Auf hundert Dokumente angewendet entsteht daraus eine Bestandstabelle, die als Grundlage der Triage taugt – und die man sonst nie bekommen hätte. Aufgabe zwei ist das Auffinden von Dubletten: Welche Passagen sagen dasselbe, auch wenn sie es mit anderen Worten tun? Das ist die Kandidatenliste für Wiederverwendung und für Streichung gleichermaßen.
Aufgabe drei ist die wertvollste und zugleich unangenehmste: Widersprüche aufspüren. Wo stehen zu derselben Sache unterschiedliche Werte, unterschiedliche Reihenfolgen, unterschiedliche Angaben? In gewachsenen Beständen fördert das zuverlässig Funde zutage, die niemandem aufgefallen sind, weil nie jemand beide Dokumente gleichzeitig gelesen hat. Diese Funde sind unangenehm – und genau deshalb wertvoll: Ein Widerspruch, den man kennt, lässt sich klären; einer, den man nicht kennt, steht bei einem Kunden im Regal und wartet.
Aufgabe vier ist das Typisieren: Welcher Abschnitt ist eine Handlungsanweisung, welcher erklärt ein Konzept, welcher listet Referenzdaten? Diese Vorsortierung ist der Einstieg in die Topic-Zerlegung. Aufgabe fünf ist das Finden von Kontextverweisen – „wie oben beschrieben", „auf Seite 42", „im vorigen Kapitel". Alles, was beim Zerlegen ins Leere zeigt, wird als Fundliste sichtbar. Und Aufgabe sechs sind Titel- und Metadatenvorschläge: Aus einem Kapitel namens „Allgemeines" wird ein sprechender Titel, dazu Vorschläge für Produkt und Dokumentart.
Eine Voraussetzung gehört vorab geklärt, weil sie über die Machbarkeit entscheidet: Der Text muss lesbar vorliegen. Word-Dokumente, textbasierte PDFs und HTML sind unproblematisch. Gescannte Dokumente ohne Texterkennung dagegen sind für jedes Werkzeug leere Seiten mit einem Bild darauf — und ausgerechnet im Altbestand liegt davon oft mehr, als man denkt. Vor dem großen Durchlauf lohnt deshalb eine Sichtung: Wie viele Dokumente sind Scans? Für die aktiven lohnt eine nachträgliche Texterkennung, für das Archiv selten.

Abb.: Sechs Aufgaben mit demselben Ergebnistyp – einer Liste, die ein Mensch abarbeitet.
Die Regel: Listen statt Änderungen
Was diese sechs Aufgaben eint, ist kein Zufall, sondern die Regel, die den ganzen Einsatz risikoarm macht: Sie erzeugen Beschreibungen des Bestands, keine Eingriffe in ihn. Eine Dublettenliste sagt, wo sich Passagen ähneln – gestrichen wird von Hand. Eine Widerspruchsliste sagt, wo Angaben auseinandergehen – geklärt wird mit der Konstruktion. Eine Typisierung schlägt vor – bestätigt wird durch die Redaktion.
Der Grund für diese Strenge liegt in der Beschaffenheit des Materials. Ein Altbestand ist genau der Ort, an dem man am wenigsten weiß, was richtig ist – und damit der schlechteste Ort für automatische Änderungen. Wenn ein Werkzeug eigenständig Dubletten zusammenführt, entscheidet es dabei, welche Fassung überlebt. Diese Entscheidung setzt Produktwissen voraus, das es nicht hat. Das Ergebnis wäre ein aufgeräumter Bestand mit Fehlern, die niemand mehr findet, weil die Ausgangslage verschwunden ist.
Praktisch heißt die Regel: Jeder Auftrag an ein Werkzeug endet mit dem Satz „Ändere nichts am Text; gib eine Liste mit Fundstelle und Befund aus." Das ist derselbe Grundsatz, der im Beitrag zur KI-Praxis für die erkenntnisliefernden Muster gilt – hier ist er noch wichtiger, weil das Material ungeprüft ist. Und er hat einen angenehmen Nebeneffekt: Wer nur Listen erzeugt, kann ohne Sorge experimentieren. Ein schlechter Auftrag liefert eine unbrauchbare Liste, mehr nicht.
Ein Wort zur Ergebnisform, weil sie über die Weiterverarbeitbarkeit entscheidet: Was die Werkzeuge liefern, sollte in eine Tabelle passen — eine Zeile je Fund, mit Dateiname, Fundstelle und Befund. Fließtext-Antworten sind schön zu lesen und mühsam zu verarbeiten; eine Tabelle lässt sich sortieren, filtern und abhaken. Deshalb steht in jedem der Aufträge weiter unten eine ausdrückliche Formatvorgabe. Wer hundert Dokumente auswertet, dankt es sich später — die Sammlung der Ergebnisse ist sonst eine eigene Fleißaufgabe.
Fünf Fragen ohne Antwort
Ebenso wichtig wie der Werkzeugkasten ist die Grenze, und sie verläuft klarer, als man vermuten würde. Fünf Fragen kann kein Sprachmodell beantworten, weil die Antwort schlicht nicht im Bestand steht. Erstens: Gilt das noch? Ein Wartungsintervall von 2016 sieht in einem Dokument genauso aus wie eines von 2025 – die Information, welche Angabe aktuell ist, steckt in der Konstruktion oder im Service, nicht im Text.
Zweitens: Welche Fassung wurde ausgeliefert? Drei Dateien, drei Stände, kein Freigabevermerk – welche lag der Maschine bei? Diese Antwort steht in der Auftragsakte oder im Versand, und dorthin kommt kein Werkzeug, das nur den Dokumentbestand kennt. Drittens: Fehlt hier eine Warnung? Ein Modell erkennt durchaus, dass an einer Stelle ein Warnhinweis erwartbar wäre – ob die entsprechende Gefahr bei dieser Maschine tatsächlich besteht, ergibt sich aus der Risikobeurteilung, nicht aus dem Text.
Viertens: Welche von zwei widersprüchlichen Angaben stimmt? Ein Werkzeug findet den Widerspruch zuverlässig – die Auflösung braucht Zeichnung, Berechnung oder die Konstruktion. Und fünftens: Brauchen wir das noch? Ob eine Baureihe im Feld ist und ihre Dokumentation vorgehalten werden muss, wissen Vertrieb und Service, und es hängt an Aufbewahrungsregeln. Alle fünf Fragen haben eines gemeinsam: Die Antwort steht in anderen Systemen, in Zeichnungen oder in Köpfen – und dort kommt kein Sprachmodell hin.
Ein zusätzliches Risiko verdient Erwähnung, weil es sich vom sonstigen KI-Einsatz unterscheidet: Beim Zusammenfassen von Altdokumenten kann ein Modell Angaben glätten, die im Original widersprüchlich oder unvollständig waren. Aus zwei abweichenden Werten wird in der Zusammenfassung womöglich einer — und zwar ohne Hinweis darauf, dass da etwas nicht zusammenpasste. Das ist genau der Fund, den man eigentlich sucht, und er verschwindet in der Verdichtung. Deshalb gehört in jeden Zusammenfassungsauftrag der Zusatz, Widersprüche und Lücken ausdrücklich zu benennen statt sie aufzulösen.

Abb.: Fünf Fragen, die den Aufwand bestimmen – und bei denen KI nicht hilft.
|
Aufgabe |
Was dabei herauskommt |
Wo die Grenze liegt |
|---|---|---|
|
Inventarisieren |
Bestandstabelle mit Thema und Produkt |
Produktzuordnung nur, wenn sie im Text steht |
|
Dubletten finden |
Kandidatenliste ähnlicher Passagen |
Welche Fassung bleibt, entscheidet der Mensch |
|
Widersprüche aufspüren |
Liste abweichender Angaben |
Welche stimmt, klärt die Konstruktion |
|
Typisieren |
Vorschlag je Abschnitt mit Sicherheitsangabe |
Grenzfälle gehören ins Team |
|
Kontextverweise finden |
Fundliste mit Stellenangabe |
Auflösung ist redaktionelle Arbeit |
|
Titel vorschlagen |
Sprechende Titel statt „Allgemeines" |
Fachliche Richtigkeit prüfen |
Zur Vertraulichkeitsfrage gilt hier eine Besonderheit, die man beachten sollte: Altbestände enthalten oft mehr, als man erwartet — kundenspezifische Anlagenbeschreibungen, interne Kommentare in Word-Dokumenten, Preisangaben in alten Angeboten, die versehentlich im Doku-Ordner gelandet sind. Bevor ein Bestand durch ein externes Werkzeug läuft, lohnt deshalb eine grobe Sichtung genau darauf. Das ist ein weiteres Argument für ein Werkzeug im eigenen Rahmen — und ein Nebenbefund, der die Aufräumaktion ohnehin rechtfertigt.
Was das kostet — und was es bringt
Eine nüchterne Einordnung des Aufwands, weil sie für die Entscheidung im Haus gebraucht wird. Die maschinelle Vorarbeit selbst ist erstaunlich günstig: Ein Bestand von einigen hundert Dokumenten lässt sich in Tagen durch Inventarisierung und Typisierung schicken, wenn die Aufträge stehen. Der Löwenanteil des Aufwands entfällt auf zwei andere Posten — die Aufbereitung des Materials, also das Zusammenstellen und Konvertieren, und die Prüfung der Ergebnisse.
Die Prüfung lässt sich dabei sinnvoll dosieren, wenn die Werkzeuge Sicherheitsangaben liefern. Was als eindeutig gekennzeichnet ist, wird stichprobenartig geprüft; was als wahrscheinlich gilt, einzeln; was als unklar markiert ist, kommt ins Team. Diese Dreiteilung senkt den Prüfaufwand erheblich gegenüber einer gleichmäßigen Vollprüfung — und sie ist der Grund, warum die Sicherheitsangabe in jeden Auftrag gehört.
Der Ertrag lässt sich in zwei Größen fassen. Erstens die Planungsgrundlage: Statt einer geschätzten Menge steht eine gezählte, und die Triage wird belastbar — das allein rechtfertigt den Aufwand in den meisten Fällen, weil es die gesamte Migrationsplanung trägt. Zweitens die Funde: Widersprüche und Lücken, die vorher niemand kannte. Deren Wert lässt sich nicht in Stunden ausdrücken, sondern in vermiedenen Rückrufen und Rückfragen — und die tauchen in keiner Statistik auf, was die Argumentation nicht leichter macht.
Einordnung in die fünf Migrationsphasen
Damit zur Frage, wo diese Werkzeuge im Migrationsverlauf ansetzen – und die Antwort folgt dem Fünf-Phasen-Modell aus dem Beitrag zum Word-Grab. In Phase eins, der Inventur, ist die Wirkung am größten. Genau hier braucht man die Übersicht, die sonst niemand erstellt: Bestandstabelle, Themenübersicht, Dublettenliste, Widerspruchsliste. Was früher eine geschätzte Menge war, wird zu einer gezählten – und die Triage in die vier Stapel bekommt endlich eine belastbare Grundlage.
In Phase zwei, der Modellarbeit, ist die Wirkung dagegen gering. Welche Topic-Typen das Haus braucht, wie granular geschnitten wird und welche Metadaten mitlaufen, sind Redaktionsentscheidungen mit Wirkung auf Jahre. Ein Werkzeug kann hier als Sparringspartner dienen – Argumente für und gegen einen Zuschnitt sammeln –, aber die Entscheidung ist eine fachliche. Wer sie delegiert, bekommt ein Modell, das plausibel klingt und nicht zum Haus passt.
In Phase drei, dem Piloten, ist die Wirkung wieder hoch – und zwar in doppelter Hinsicht. Erstens hilft KI bei Typisierung, Titeln und Kontextverweisen am konkreten Dokument. Zweitens ist der Pilot der Ort, an dem man die Aufträge schärft: Welche Formulierung liefert brauchbare Typisierungen, welche Ausgabeform lässt sich weiterverarbeiten? Diese Vorlagen zahlen sich in Phase vier aus, wo dieselben Aufgaben in Serie laufen. Und in Phase fünf, dem Betrieb, bleibt eine mittlere Wirkung: regelmäßige Konsistenzprüfungen über den überführten Bestand.

Abb.: Die fünf Phasen mit der jeweiligen KI-Wirkung – die Modellphase bleibt menschliche Arbeit.
Für die Verarbeitung größerer Bestände lohnt eine praktische Anmerkung zur Portionierung: Sehr lange Dokumente werden ungleichmäßig behandelt — der Anfang gründlicher als das Ende. Wer verlässliche Ergebnisse will, arbeitet deshalb kapitelweise statt dokumentweise, auch wenn das mehr Durchläufe bedeutet. Bei mehreren hundert Dokumenten ist das ohne Automatisierung mühsam; ein einfaches Skript, das Kapitel trennt und die Ergebnisse wieder zusammenführt, ist an dieser Stelle gut investierte Arbeit — und in wenigen Stunden gebaut, wenn jemand im Haus skripten kann.
Die Pipeline in der Praxis
Wie sieht der Ablauf konkret aus? In fünf Stationen, von denen drei erheblich von KI profitieren. Station eins ist das Sichten – die Bestandsübersicht mit Themen, Dubletten und Widersprüchen. Station zwei das Klassifizieren nach Topic-Typ, mit einer Angabe, wie sicher der Vorschlag ist. Station drei das Aufbereiten: Titel schärfen, Kontextverweise finden, Metadaten vorschlagen. Bis hierhin ist die Arbeit gut automatisierbar, und das Ergebnis besteht durchweg aus Listen.
Station vier ist das Entscheiden, und sie bestimmt den Aufwand des gesamten Vorhabens: Was gilt noch, was wird gestrichen, welche Fassung ist richtig, was muss inhaltlich überarbeitet werden? Diese Station braucht Menschen mit Produktwissen, und sie lässt sich nicht abkürzen. Station fünf ist das Überführen in die Zielstruktur – hier helfen eher Konvertierungswerkzeuge und Skripte als Sprachmodelle, weil es um Formatumwandlung geht.
Die realistische Erwartung lautet damit: KI verkürzt die Stationen eins bis drei erheblich – sie macht aus Wochen Tage. Station vier bleibt, wie sie ist, und sie ist der größere Posten. Wer mit dieser Erwartung startet, erlebt eine spürbare Entlastung. Wer erwartet, dass das Vorhaben insgesamt zur Nebensache wird, erlebt eine Enttäuschung, die dann meist dem Werkzeug angelastet wird statt der eigenen Erwartung angelastet wird.

Abb.: Fünf Stationen – drei profitieren stark, eine gar nicht, und genau die bestimmt den Aufwand.
|
⚠ Warnung: Der aufgeräumte Bestand mit unklarer Herkunft Die verführerischste Abkürzung in diesem Themenfeld ist der Wunsch, ein Werkzeug möge den Bestand nicht nur beschreiben, sondern gleich bereinigen — Dubletten zusammenführen, Formulierungen vereinheitlichen, Kapitel neu ordnen. Das Ergebnis sieht hervorragend aus: ein konsistenter, gut lesbarer Bestand. Was man ihm nicht ansieht, ist, welche der zusammengeführten Fassungen überlebt hat und ob dabei eine gültige Angabe durch eine überholte ersetzt wurde. Besonders heikel wird es, wenn die Ausgangsdokumente danach aufgeräumt werden — dann ist die Rekonstruktion unmöglich. Die Regel lautet deshalb doppelt: erstens nur Listen erzeugen lassen, zweitens den Ausgangsbestand unverändert aufbewahren, bis der überführte Stand fachlich abgenommen ist. Der Speicherplatz dafür kostet nichts; die fehlende Rückfallebene kostet im Zweifel ein Projekt. |
|---|
Wie man die Aufträge formuliert
Für die drei ergiebigen Stationen lohnen ausformulierte Aufträge, die man einmal schreibt und dann in Serie nutzt. Für die Inventur etwa: „Fasse für das folgende Dokument in maximal drei Sätzen zusammen, worum es geht. Nenne anschließend die behandelten Themen als Stichwortliste und das Produkt oder die Baureihe, sofern im Text genannt. Wenn kein Produkt genannt ist, schreibe UNBEKANNT. Erfinde keine Angaben. Gib das Ergebnis als Tabelle mit den Spalten Dateiname, Zusammenfassung, Themen, Produkt aus."
Für die Typisierung: „Zerlege den folgenden Text in Abschnitte und ordne jedem Abschnitt einen Typ zu: Handlungsanweisung, Konzept, Referenzdaten, Warnung oder Sonstiges. Gib zusätzlich an, wie eindeutig die Zuordnung ist: eindeutig, wahrscheinlich, unklar. Formuliere nichts um. Ergebnis als Tabelle mit Abschnittsanfang, Typ, Sicherheit." Diese dreistufige Sicherheitsangabe ist der entscheidende Kunstgriff: Sie lenkt die menschliche Aufmerksamkeit dorthin, wo sie gebraucht wird, statt sie gleichmäßig über den Bestand zu verteilen.
Und für die Widerspruchssuche, den wertvollsten Einsatz: „Vergleiche die folgenden Textabschnitte und nenne alle Stellen, an denen sie zu derselben Sache unterschiedliche Angaben machen – Zahlenwerte, Reihenfolgen, Bedingungen, Bauteilbezeichnungen. Bewerte nicht, welche Angabe richtig ist. Gib eine Tabelle mit Sachverhalt, Angabe A, Angabe B und Fundstelle aus." Der Satz „Bewerte nicht, welche Angabe richtig ist" ist dabei nicht Bescheidenheit, sondern Notwendigkeit – eine Bewertung wäre geraten und würde die Klärung eher behindern als befördern.
|
✓ Praxis-Tipp: Der Zehn-Dokumente-Testlauf Bevor du hundert Dokumente durch die Pipeline schickst, nimm zehn — und zwar bewusst gemischt: ein aktuelles, ein sehr altes, ein besonders langes, ein gescanntes, eines mit vielen Tabellen. Lass die Inventur und die Typisierung darauf laufen und prüfe die Ergebnisse vollständig gegen die Dokumente. Das dauert einen halben Tag und zeigt drei Dinge: ob die Aufträge taugen, wie hoch die Trefferquote realistisch ist, und welche Dokumentarten gar nicht funktionieren. Der letzte Punkt ist der wichtigste: Gescannte Dokumente ohne Texterkennung liefern gar nichts, sehr lange Dokumente werden ungleichmäßig behandelt, und stark tabellenlastige Inhalte brauchen einen eigenen Auftrag. Wer das nach zehn Dokumenten weiß, plant den Rest realistisch — statt nach dreihundert Dokumenten festzustellen, dass ein Fünftel des Ergebnisses unbrauchbar ist. |
|---|
|
ℹ Ein typischer Fall aus der Praxis Ein typischer Fall sieht so aus: Eine Redaktion lässt für die Inventur rund zweihundertfünfzig Altdokumente durch eine Inventarisierung und eine Dublettensuche laufen. Der Aufwand: zwei Tage inklusive Aufbereitung und Prüfung. Das Ergebnis fällt anders aus als erwartet — die Zahl der Dubletten ist geringer als befürchtet, dafür fördert die Widerspruchssuche neun Stellen zutage, an denen zu denselben Bauteilen unterschiedliche Werte stehen. Die Klärung dieser neun Stellen mit der Konstruktion dauerte länger als die gesamte maschinelle Vorarbeit — in drei Fällen war die ältere Angabe die richtige, in vier die neuere, und zwei ließen sich gar nicht auflösen, weil die Quelle fehlte. Der Befund war unbequem und der eigentliche Gewinn des Vorhabens: Neun potenzielle Fehlerquellen waren vorher nicht bekannt, und keine davon hätte sich bei einer reinen Formatmigration gezeigt. |
|---|
Ein vierter Auftrag lohnt für die Kontextverweise, weil er die Migrationsplanung unmittelbar füttert: „Finde im folgenden Text alle Stellen, die sich auf anderen Inhalt beziehen, ohne ihn zu benennen — etwa „wie oben beschrieben", „siehe Kapitel 4", „im vorherigen Abschnitt", „dort" oder „dabei" mit unklarem Bezug. Gib eine Tabelle mit Fundstelle, Formulierung und der Frage aus, worauf sich der Verweis vermutlich bezieht. Löse die Verweise nicht auf." Die Vermutung ist dabei nur ein Hinweis für die Nacharbeit — auflösen muss die Redaktion, weil dazu der Gesamtzusammenhang gehört.
Bleibt die Frage, wer diese Arbeit macht. Die Verlockung ist groß, sie an externe Dienstleister zu geben — schließlich ist es Fleißarbeit. In der Praxis lohnt das nur begrenzt, und zwar aus einem Grund, der sich erst beim Tun zeigt: Die Ergebnisse müssen gegen Produktwissen geprüft werden, und das liegt im Haus. Ein Externer kann die Durchläufe organisieren und die Aufträge bauen; die Prüfung der Funde bleibt bei denen, die die Maschinen kennen. Sinnvoll ist deshalb eine Arbeitsteilung — Vorarbeit außer Haus, Bewertung innen.
Was danach kommt
Ein letzter Gedanke zur Nachhaltigkeit dieses Aufwands. Die Aufbereitung eines Altbestands ist eine einmalige Anstrengung, und sie lohnt nur, wenn sie nicht wieder entsteht. Das heißt: Die Erkenntnisse aus der Bestandsanalyse gehören in die laufende Arbeit übersetzt. Wenn die Widerspruchssuche zeigt, dass Werte an mehreren Stellen gepflegt werden, ist die Antwort Wiederverwendung. Wenn die Typisierung zeigt, dass Handlungsanweisungen und Erklärungen ständig vermischt sind, ist die Antwort das Informationsmodell.
Umgekehrt gilt: Wer den Altbestand aufbereitet, ohne die Arbeitsweise zu ändern, hat in fünf Jahren denselben Zustand wieder – nur mit einem sauber dokumentierten Zwischenstand. Die Aufbereitung ist deshalb kein Selbstzweck, sondern der eigentliche Einstieg in die Migration, und der Beitrag zum Word-Grab beschreibt, wie es danach weitergeht. KI verkürzt in diesem Zusammenhang die unangenehmste Phase – sie ersetzt nicht die Entscheidung, es anders zu machen.
Und eine Beobachtung zum Schluss, die diesen Einsatz von anderen KI-Themen unterscheidet: Der Altbestand ist der einzige Bereich, in dem KI-Nutzung praktisch risikofrei ist. Es entsteht kein Text, der ausgeliefert wird; es werden keine Werte formuliert; nichts geht ungeprüft an Kunden. Das macht ihn zum idealen Einstiegsfeld für Redaktionen, die mit diesen Werkzeugen erste Erfahrungen sammeln wollen – man lernt am realen Material, ohne etwas zu riskieren — und hat am Ende einen Befund, den man ohnehin gebraucht hätte.
Und ein Hinweis für Häuser, die den Altbestand gar nicht migrieren wollen: Auch dann lohnt die Analyse. Wer entscheidet, den alten Bestand einzufrieren und nur Neues strukturiert aufzubauen, braucht trotzdem die Antwort auf zwei Fragen — welche Dokumente zu noch laufenden Maschinen gehören und ob darin gefährliche Widersprüche stecken. Die erste Frage betrifft die Aufbewahrungspflicht, die zweite die Haftung. Beide lassen sich mit den beschriebenen Werkzeugen in Tagen beantworten, ohne dass ein einziges Dokument angefasst wird.
Fazit
Für Altbestände ist KI der seltene Fall eines KI-Einsatzes mit klarem Nutzen und geringem Risiko: Sie liest, was sonst niemand liest, und macht aus einem unbekannten Bestand einen beschriebenen. Sechs Aufgaben lohnen – inventarisieren, Dubletten finden, Widersprüche aufspüren, typisieren, Kontextverweise finden, Titel und Metadaten vorschlagen –, und alle sechs erzeugen Listen statt Änderungen. Genau diese Regel macht den Einsatz sicher.
Ebenso klar sind die Grenzen: Was noch gilt, welche Fassung ausgeliefert wurde und ob eine Warnung fehlt, steht nicht im Bestand – diese Fragen bestimmen den Aufwand und bleiben menschliche Arbeit. Der beste erste Schritt ist der Zehn-Dokumente-Testlauf: einen halben Tag, gemischte Auswahl, Ergebnisse vollständig prüfen. Wenn du bei der Bestandsanalyse, den Auftragsvorlagen oder der Einordnung in die Migrationsplanung Unterstützung willst: Genau dabei unterstütze ich dich gern; die Details findest du auf der Beratungsseite zur Technischen Dokumentation.
Häufige Fragen zur KI-Aufbereitung von Altbeständen
Kann KI unseren Altbestand automatisch aufräumen?
Beschreiben ja, aufräumen nein. Sie kann inventarisieren, Dubletten und Widersprüche finden, Abschnitte typisieren, Kontextverweise aufspüren und Titel vorschlagen – all das erzeugt Listen. Was sie nicht kann, ist entscheiden: welche von zwei Fassungen bleibt, welcher von zwei Werten stimmt, was gestrichen werden darf. Diese Entscheidungen setzen Produktwissen voraus, das nicht im Bestand steht. Ein Werkzeug, das eigenständig zusammenführt, erzeugt einen aufgeräumten Bestand mit Fehlern, die anschließend niemand mehr findet.
Was ist der wertvollste Einsatz?
Die Widerspruchssuche. Sie legt Stellen offen, an denen zu derselben Sache unterschiedliche Angaben stehen – Werte, Reihenfolgen, Bauteilbezeichnungen. Solche Widersprüche fallen im Alltag nie auf, weil niemand zwei Dokumente gleichzeitig liest, und sie sind das eigentliche Risiko in gewachsenen Beständen. Der Befund ist unangenehm und deshalb wertvoll: Ein bekannter Widerspruch lässt sich klären, ein unbekannter steht beim Kunden im Regal. Wichtig ist der Zusatz im Auftrag: nicht bewerten, welche Angabe stimmt.
Wie stellen wir sicher, dass nichts kaputtgeht?
Mit zwei Regeln. Erstens: Jeder Auftrag endet mit „Ändere nichts am Text; gib eine Liste mit Fundstelle und Befund aus." Was geändert wird, entscheidet und tut ein Mensch. Zweitens: Der Ausgangsbestand bleibt unverändert erhalten, bis der überführte Stand fachlich abgenommen ist. Der Speicherplatz kostet nichts, die fehlende Rückfallebene im Zweifel ein Projekt. Wer beides beachtet, kann ohne Sorge experimentieren – ein schlechter Auftrag liefert dann eine unbrauchbare Liste, mehr nicht.
Wie viel Aufwand spart das tatsächlich?
Erheblich bei den Stationen Sichten, Klassifizieren und Aufbereiten – dort werden aus Wochen Tage, weil die Lesearbeit entfällt, für die sonst niemand Zeit hat. Nicht dagegen bei der Station, die den Aufwand bestimmt: dem Entscheiden. Was noch gilt, welche Fassung ausgeliefert wurde und ob eine Angabe stimmt, klärt sich nur mit Konstruktion, Service und Auftragsakte. Realistische Erwartung: spürbare Entlastung bei der Vorarbeit, unveränderter Aufwand bei den fachlichen Entscheidungen.
Womit fangen wir an?
Mit einem Testlauf über zehn bewusst gemischte Dokumente: ein aktuelles, ein sehr altes, ein langes, ein gescanntes, eines mit vielen Tabellen. Darauf Inventarisierung und Typisierung laufen lassen und die Ergebnisse vollständig gegen die Dokumente prüfen – ein halber Tag. Das zeigt, ob die Aufträge taugen, wie hoch die Trefferquote ist und welche Dokumentarten gar nicht funktionieren. Vor allem Letzteres ist wichtig: Gescannte Dokumente ohne Texterkennung liefern nichts, und das sollte man vor dem großen Durchlauf wissen.
|
Interne Links: Pillar (/technische-dokumentation/) · Vom Word-Grab zu strukturierter Doku (/word-grab-migration-strukturierte-doku/) · KI beim Schreiben (/ki-schreiben-technische-redaktion/) · Claude, ChatGPT und Co. (/claude-chatgpt-technische-dokumentation/) · Beratung (/technische-dokumentation-beratung/) |
|---|
