<?xml version="1.0" encoding="utf-8"?>
<?xml-model href="https://zfdg.de/sites/default/files/medien/zfdg.rng" type="application/xml" schematypens="http://relaxng.org/ns/structure/1.0"?>
<?xml-model href="https://zfdg.de/sites/default/files/medien/zfdg.rng" type="application/xml" schematypens="http://purl.oclc.org/dsdl/schematron"?>
<TEI xmlns="http://www.tei-c.org/ns/1.0" xmlns:tei="http://www.tei-c.org/ns/1.0">
   <teiHeader>
      <fileDesc>
         <titleStmt>
            <title level="m" type="full">Topic Modeling für die Geschichtswissenschaft</title>
            <title level="m" type="short">Topic Modeling für die Geschichtswissenschaft</title>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/aut">Author</resp>
               <resp ref="https://credit.niso.org/contributor-roles/conceptualization/">Conceptualization</resp>
               <resp ref="https://credit.niso.org/contributor-roles/data-curation/">Data curation</resp>
               <resp ref="https://credit.niso.org/contributor-roles/formal-analysis/">Formal Analysis</resp>
               <resp ref="https://credit.niso.org/contributor-roles/investigation/">Investigation</resp>
               <resp ref="https://credit.niso.org/contributor-roles/methodology/">Methodology</resp>
               <resp ref="https://credit.niso.org/contributor-roles/project-administration/">Project administration</resp>
               <resp ref="https://credit.niso.org/contributor-roles/resources/">Resources</resp>
               <resp ref="https://credit.niso.org/contributor-roles/software/">Software</resp>
               <resp ref="https://credit.niso.org/contributor-roles/supervision/">Supervision</resp>
               <resp ref="https://credit.niso.org/contributor-roles/validation/">Validation</resp>
               <resp ref="https://credit.niso.org/contributor-roles/visualization/">Visualization</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-original-draft/">Writing – original draft</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-review-editing/">Writing – review &amp; editing</resp>
               <persName>
                  <forename>Dennis</forename>
                  <surname>Möbus</surname>
                  <email>dennis.moebus@fernuni-hagen.de</email>
                  <idno type="gnd">1238567746</idno>
                  <idno type="orcid">0009-0008-9064-7460</idno>
                  <affiliation>FernUniversität in Hagen</affiliation>
               </persName>
            </respStmt>
            
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/aut">Author</resp>
               <resp ref="https://credit.niso.org/contributor-roles/conceptualization/">Conceptualization</resp>
               <resp ref="https://credit.niso.org/contributor-roles/data-curation/">Data curation</resp>
               <resp ref="https://credit.niso.org/contributor-roles/formal-analysis/">Formal Analysis</resp>
               <resp ref="https://credit.niso.org/contributor-roles/methodology/">Methodology</resp>
               <resp ref="https://credit.niso.org/contributor-roles/software/">Software</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-original-draft/">Writing – original draft</resp>
               <persName>
                  <forename>Philipp</forename>
                  <surname>Bayerschmidt</surname>
                  <email>philipp.bayerschmidt@fernuni-hagen.de</email>
                  <idno type="gnd">139340135X</idno>
                  <idno type="orcid">0009-0002-2743-2455</idno>
                  <affiliation>FernUniversität in Hagen</affiliation>
               </persName>
            </respStmt>
            
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/aut">Author</resp>
               <resp ref="https://credit.niso.org/contributor-roles/conceptualization/">Conceptualization</resp>
               <resp ref="https://credit.niso.org/contributor-roles/data-curation/">Data curation</resp>
               <resp ref="https://credit.niso.org/contributor-roles/formal-analysis/">Formal Analysis</resp>
               <resp ref="https://credit.niso.org/contributor-roles/methodology/">Methodology</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-original-draft/">Writing – original draft</resp>
               <persName>
                  <forename>Tobias</forename>
                  <surname>Hodel</surname>
                  <email>tobias.hodel@unibe.ch</email>
                  <idno type="gnd">1211116379</idno>
                  <idno type="orcid">0000-0002-2071-6407</idno>
                  <affiliation>Universität Bern</affiliation>
               </persName>
            </respStmt>
            
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/aut">Author</resp>
               <resp ref="https://credit.niso.org/contributor-roles/conceptualization/">Conceptualization</resp>
               <resp ref="https://credit.niso.org/contributor-roles/data-curation/">Data curation</resp>
               <resp ref="https://credit.niso.org/contributor-roles/formal-analysis/">Formal Analysis</resp>
               <resp ref="https://credit.niso.org/contributor-roles/methodology/">Methodology</resp>
               <resp ref="https://credit.niso.org/contributor-roles/software/">Software</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-original-draft/">Writing – original draft</resp>
               <persName>
                  <forename>Ina</forename>
                  <surname>Serif</surname>
                  <email>ina.serif@unibas.ch</email>
                  <idno type="gnd">1209225409</idno>
                  <idno type="orcid">0000-0003-2419-4252</idno>
                  <affiliation>Universität Basel</affiliation>
               </persName>
            </respStmt>
         </titleStmt>
         <editionStmt>
            <edition n="1.0"/>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/dtm">Technische Redaktion</resp>
               <persName>
                  <forename>Martin</forename>
                  <surname>de la Iglesia</surname>
                  <idno type="gnd">1095143719</idno>
                  <idno type="orcid">0000-0002-9319-4793</idno>
               </persName>
            </respStmt>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/dtm">Technische Redaktion</resp>
               <persName>
                  <forename>Maximilian</forename>
                  <surname>Görmar</surname>
                  <idno type="gnd">1077317964</idno>
                  <idno type="orcid">0000-0003-3608-1140</idno>
               </persName>
            </respStmt>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/pfr">Textredaktion</resp>
               <persName>
                  <forename>Karoline</forename>
                  <surname>Lemke</surname>
                  <idno type="gnd">1187840033</idno>
                  <idno type="orcid">0000-0002-1604-672X</idno>
               </persName>
            </respStmt>
         </editionStmt>
         <publicationStmt>
            <publisher n="Redaktionssitz">
               <orgName>Herzog August Bibliothek</orgName>
               <address>
                  <addrLine>Lessingplatz 1</addrLine>
                  <addrLine>38304 Wolfenbüttel</addrLine>
               </address>
            </publisher>
            <publisher n="herausgebendes Organ">
               <orgName>Forschungsverbund Marbach Weimar Wolfenbüttel</orgName>
               <address>
                  <addrLine>Burgplatz 4</addrLine>
                  <addrLine>99423 Weimar</addrLine>
               </address>
            </publisher>
            <publisher n="herausgebendes Organ">
               <orgName>Digital Humanities im deutschsprachigen Raum e. V.</orgName>
               <address>
                  <addrLine>Hamburg</addrLine>
               </address>
            </publisher>
            <date n="1.0" when="2026-06-17">17.06.2026</date>
            <idno type="doi">10.17175/wp_2026b</idno>
            <idno type="ppn">1965738915</idno>
            <availability status="free">
               <licence target="https://creativecommons.org/licenses/by-sa/4.0/">CC BY-SA 4.0, sofern nicht anders angegeben.</licence>
            </availability>
         </publicationStmt>
         <seriesStmt>
            <title level="j">Zeitschrift für digitale Geisteswissenschaften</title>
            <title level="s">Working Papers</title>
            <idno type="ppn">1839710241</idno>
            <idno type="doi">10.17175/working-papers</idno>
            <biblScope unit="volume">5</biblScope>
         </seriesStmt>
         <sourceDesc>
            <p>Born digital: no previous source exists.</p>
         </sourceDesc>
      </fileDesc>
      <encodingDesc>
         <editorialDecl>
            <p>Letzte Überprüfung aller Verweise: <date when="2026-03-20">20.03.2026</date>
            </p>
         </editorialDecl>
         <schemaRef url="https://zfdg.de/sites/default/files/medien/zfdg.odd"/>
      </encodingDesc>
      <profileDesc>
         <textClass>
            <keywords n="Beitragstyp">
               <term>Working Paper</term>
            </keywords>
            <keywords n="GND">
               <term ref="https://d-nb.info/gnd/4020535-6">Geschichtswissenschaft</term>
               <term ref="https://d-nb.info/gnd/4265353-8">Automatische Inhaltsanalyse</term>
               <term ref="https://d-nb.info/gnd/4027503-6">Interview</term>
               <term ref="https://d-nb.info/gnd/4023287-6">Handschrift</term>
               <term ref="https://d-nb.info/gnd/301940-8">Kanton Zürich. Regierungsrat</term>
               <term ref="https://d-nb.info/gnd/4050926-6">Ruhrgebiet</term>
               <term ref="https://d-nb.info/gnd/1214672965">Jakob Twinger von Königshofen: Chronik</term>
            </keywords>
         </textClass>
      </profileDesc>
   </teiHeader>
   <text xml:lang="de">
      <front>
         <div type="abstract" xml:lang="de">               
            <p>Das Working Paper untersucht die Anwendung von <term type="dh">Topic Modeling</term> in den Geschichtswissenschaften mit Fokus auf der praxisorientierten Reflexion des gesamten Arbeitsprozesses. Im Zentrum stehen <term type="dh">Preprocessing</term> und <term type="dh">Topic Estimation</term>. Es wird gezeigt, dass gängige Evaluations-Metriken für letztere keine aussagekräftigen Ergebnisse liefern. Daher wird ein ›Human-in-the-Loop‹-Ansatz vorgestellt, der mit <term type="dh">Scalable Readings</term> zwischen Wortlisten und korrespondierenden Textpassagen wechselt. Darüber hinaus werden klassische <term type="dh">LDA</term>-Modelle mit neueren Verfahren wie <term type="dh">BERTopic</term> verglichen und deren Stärken und Schwächen diskutiert. Die Autor*innen plädieren für eine methodenkritische Anwendung von Topic Modeling, die quellenkritische und hermeneutische Ansätze umfasst. Dies eröffnet neue Möglichkeiten für die historische Forschung, insbesondere bei heterogenen, umfangreichen Quellen wie mittelalterlichen Handschriften, Verwaltungsdokumenten des 19. Jahrhunderts oder zeitgeschichtlichen Oral-History-Quellen.</p>
         </div>
         <div type="abstract" xml:lang="en">
            <p>This working paper explores the application of <term type="dh">topic modeling</term> in historical research, concentrating on methodological and practical challenges. A central focus lies on <term type="dh">preprocessing</term> and <term type="dh">topic estimation</term>. It is shown that common evaluation scores do not yield meaningful results for the latter. Thus, we propose a ›human-in-the-loop‹ approach which switches between word lists and corresponding text passages via <term type="dh">scalable readings</term>. In addition, the paper compares classical <term type="dh">LDA</term> models with more recent approaches such as <term type="dh">BERTopic</term>. Both approaches have strengths and limitations, suggesting a complementary relationship. Overall, the authors advocate a critical, methodologically informed use of topic modeling, which closely integrates hermeneutic and source-critical approaches. This provides historians with powerful tools for analyzing vast or heterogeneous sources, including medieval manuscripts, 19th-century administrative records, and 20th-century oral history interviews.</p>
         </div>
      </front>
      <body>    
         <div type="chapter">
            <head>1. Einleitung</head>
            <p>Auch wenn sich manche Historiker*innen mit eher klassischen hermeneutischen Zugängen zur Analyse ihrer Quellen lange Zeit unbeeindruckt von <term type="dh">Big Data</term> zeigten, hat sich in den letzten Jahren eine historische <term type="dh">Data Science</term> entwickelt. Angesichts der stetig wachsenden Zahl digitaler (Text-)Quellen sind neue Heuristiken zum Erfassen, Messen und Analysieren historischer Daten gefragt.<note type="footnote">Vgl. <ref type="bibliography" target="#linseisen_data_2022">Linseisen 2022</ref>; <ref type="bibliography" target="#zaagsma_historiker_2023">Zaagsma 2023</ref>; für eine praktische Einführung vgl. <ref type="bibliography" target="#graham_et_al_exploring_2022">Graham et&#160;al. 2022</ref>.</note> Eine weit verbreitete Methode, die auf (historische) Texte angewendet werden kann und auch von Nicht-Datenwissenschaftler*innen genutzt wird, ist <term type="dh">Topic Modeling</term>. Dabei handelt es sich um eine Methode des <term type="dh">maschinellen Lernens (ML)</term>, die Wortgruppen (bezeichnet als ›<term type="dh">Topics</term>‹) aus großen Textkorpora extrahiert, um den Inhalt dieser Dokumente zu indizieren. Der Vorteil einer solchen Informationsextraktion ist, dass riesige Textsammlungen mit Millionen von Wörtern in kurzer Zeit indexiert und verarbeitet werden können. Die daraus resultierenden thematischen Cluster stellen eine induktive Alternative zur deduktiven Suche nach isolierten Begriffen dar. Die oft zeitraubende und ermüdende Praxis des Querlesens zum Aufbau eines Samples kann so umgangen oder ergänzt werden.</p>
            <p>Dieses Working Paper widmet sich zunächst dem komplexen und zum Teil umstrittenen <term type="dh">Preprocessing</term> (<ref type="intern" target="#hd8">Kapitel 3</ref>), das die Ergebnisse des Topic Modelings maßgeblich und deutlicher als das <term type="dh">Parametertuning</term> beeinflusst bzw. die Anwendung von Topic Modeling überhaupt erst ermöglicht. Die hier ausführlich dokumentierten Schritte umfassen <term type="dh">Normalisierung</term> (<term type="dh">Lower Casing</term>, <term type="dh">Lemmatisierung</term>) und <term type="dh">Cleaning</term> (die Entfernung von Interpunktion und <term type="dh">Stopwords</term>, <term type="dh">Pruning</term>). Ein eigenes Kapitel <ref type="intern" target="#hd24">(4)</ref> ist dem <term type="dh">Chunking</term>, also dem Aufteilen großer Dokumente in kleinere Abschnitte, gewidmet. Anschließend (<ref type="intern" target="#hd30">Kapitel 5</ref>) wird die <term type="dh">Topic Estimation</term> in den Blick genommen, um herauszufinden, wie viele Topics in einem Korpus (unterschiedlicher historischer Quellen) überhaupt vertreten sind. Dazu werden verschiedene Metriken korreliert und nach dem Finden eines oder mehrerer optimaler Werte Topic-Listen manuell evaluiert. Am Ende des Kapitels wird auf Grundlage eines der drei untersuchten Korpora ein weiteres Parametertuning dokumentiert, bevor im letzten Kapitel<ref type="intern" target="#hd44">(6)</ref> der auf <term type="dh">Latent Dirichlet Allocation (LDA)</term> basierende Ansatz mit vektorisierten&#160;/ neuronalen Methoden des Topic Modeling, repräsentiert durch <term type="dh">BERTopic</term>, verglichen wird.</p>
            <p>Entsprechend beschränkt sich das Working Paper auf zwei Ansätze: den jahrelang gültigen Quasi-Standard LDA und die vektorbasierte Themenextraktion mit Sprachmodellen, hier anhand von BERTopic demonstriert, die zur Zeit einige Popularität genießt. Es existieren auch andere Topic-Modeling-Ansätze, diese werden aber basierend auf dem erarbeiteten Forschungsstand aus unserer Sicht weniger häufig verwendet.<note type="footnote">Alternativen zu LDA sind beispielsweise <term type="dh">Latent Semantic Analysis (LSA)</term> oder <term type="dh">Latent Semantic Indexing (LSI)</term>. Vgl. <ref type="bibliography" target="#blei_et_al_lda_2003">Blei et&#160;al. 2003</ref>, S.&#160;993–994.</note> In Vorarbeiten zu den hier vorliegenden Darlegungen sowie in einem früheren Paper konnte bereits demonstriert werden, dass die <term type="dh">Mallet</term>-Implementation von LDA aufgrund des verwendeten <term type="dh">Gibbs-Sampling</term> als <term type="dh">Inferenzalgorithmus</term> der <term type="dh">Gensim</term>-Implementierung&#160;– zumindest für historische Quellen&#160;– überlegen ist.<note type="footnote">Vgl. <ref type="bibliography" target="#hodel_et_al_inferenzen_2022">Hodel et&#160;al. 2022</ref>.</note>
            </p>
            <p>Die abschließenden Ergebnisse nach der Topic Estimation werden in einem Wechsel zwischen <term type="dh">Distant</term> und <term type="dh">Close Readings</term> (<term type="dh">Scalable Readings</term>), d.&#160;h. einer quantitativ gestützten Lektüre, analysiert. Das dient der Validierung des Topic Models und der quellenkritischen Auseinandersetzung mit dessen Ergebnissen, indem diese in die analysierten Texte zurückverfolgt werden (<term type="dh">human in the loop</term>).</p>
            <p>Die Daten, die dieser Analyse zugrunde liegen, sind drei sehr unterschiedliche historische Textkorpora: spätmittelalterliche Sammelhandschriften, Zürcher Regierungsratsbeschlüsse aus dem 19. Jahrhundert und biographische Interviews aus den 1980er Jahren. Durch die Verwendung von drei verschiedenen Korpora soll einerseits gezeigt werden, wie Preprocessing und Topic Estimation zu unterschiedlichen Ergebnissen für die einzelnen Korpora führen. Andererseits ermöglicht der Ansatz eine kritische und vergleichende Betrachtung der Bearbeitung sehr unterschiedlicher historischer Fragestellungen mit Hilfe von Topic Modeling.<note type="footnote">Eine Einführung, die stärker auf eine praktische Anwendung der Methode in den Geisteswissenschaften zielt, findet sich in <ref type="bibliography" target="#grant_et_al_topic_2021">Grant et&#160;al. 2021</ref>.</note>
            </p>
         </div>
         <div type="chapter">
            <head>2. Von Quellen zu Korpora und Daten</head>
            <p>Die historische Forschung beschäftigt sich typischerweise mit Quellen, weniger mit Korpora und&#160;– außer in der Wirtschaftsgeschichte&#160;– selten mit Daten. Diese terminologischen Aspekte zeigen bereits, dass die Transformation von analogen <term type="dh">Quellen</term> zu digitalen <term type="dh">Daten</term> mit gewissen erkenntnistheoretischen Herausforderungen verbunden ist. Aus einer Quellensammlung wird ein mehr oder weniger kohärentes Textkorpus, das für die weitere Berechnung&#160;– in unserem Fall für die sogenannte <term type="dh">Topic-Extraktion</term>&#160;– weiterverarbeitet werden muss. Im folgenden Teil beschäftigen wir uns mit den theoretischen Grundlagen von Topic-Modeling-Ansätzen sowie mit der Aufbereitung der Korpora, die für unser Vorgehen verwendet wurden.<note type="footnote">Fragen bezüglich <term type="dh">Encoding</term> (z.&#160;B. die Nutzung von Unicode&#160;/ UTF-8) oder der Darstellung analoger&#160;/ mündlicher Quellen im digitalen Raum werden hier nicht adressiert. Natürlich müssen diese Transformationen dokumentiert und standardisierten Prozessen folgend durchgeführt werden.</note>
            </p>
            <div type="subchapter">
               <head>2.1 Topic Modeling: Funktionsweise und Implementierung</head>
               <p>Topic Modeling ist ein methodischer Ansatz, um Themen aus Texten zu extrahieren. Dabei handelt es sich jedoch nicht um eine feste Methode, die in einem einzigen Algorithmus abgebildet wird, sondern es haben sich in den letzten 20 Jahren zahlreiche Ansätze etabliert, um Topic-Modelle zu berechnen. Diese reichen von <term type="dh">Latent Semantic Analysis (LSA)</term>, in welcher die Verteilung der vorkommenden Wörter in Dokumenten über <term type="dh">Cosinus-Ähnlichkeiten</term> zur Berechnung von Dokumentenähnlichkeiten genutzt werden,<note type="footnote">Vgl. <ref type="bibliography" target="#dumais_analysis_2004">Dumais 2004</ref>.</note> über probabilistische Verfahren wie Latent Dirichlet Allocation (LDA) bis hin zu vektor- und embeddingbasierten Clustering-Ansätzen, insbesondere mittels BERTopic.<note type="footnote">Einen Überblick bieten <ref type="bibliography" target="#churchill_singh_evolution_2022">Churchill&#160;/ Singh 2022</ref>.</note> Aktuell werden noch vorwiegend zwei Ansätze unter dem Begriff Topic Modeling verstanden und auch eingesetzt: LDA und <term type="dh">Neural Topic Models</term> bzw. vektorisierte Ansätze. Diese beiden sind damit die interessantesten Untersuchungsobjekte für die Beschäftigung im Anwendungsfall.</p>
               <p>Lange Zeit galt LDA als Quasi-Standard-Algorithmus für Topic Modeling. LDA ist eine probabilistische Methode des maschinellen Lernens, die zur Identifizierung und Extraktion von Themenfeldern in großen Textkorpora verwendet werden kann. Durch die Berechnung von Wahrscheinlichkeitsverteilungen werden Hypothesen generiert und iterativ verfeinert und verifiziert. Um genau zu sein: Annahmen über die Verbindungen zwischen Wörtern (<term type="dh">a-priori-Wahrscheinlichkeit</term>) werden durch ständig wiederholte Berechnungen dieser Verbindungen (<term type="dh">a-posteriori-Wahrscheinlichkeit</term>) verbessert. Die Methode zielt also darauf ab, zu erkennen, welche Wörter und Wortgruppen häufig zusammen mit anderen Wörtern und Wortgruppen auftreten (in der Computerlinguistik auch als <term type="dh">Kookkurrenz</term> bezeichnet).<note type="footnote">Für eine erste Einführung ins Topic Modeling vgl. <ref type="bibliography" target="#brett_topic_2012">Brett 2012</ref>; für eine mathematische Perspektive vgl. <ref type="bibliography" target="#blei_topic_2012">Blei 2012</ref>.</note>
               </p>
               <p>Der Schlüssel zum Verständnis von LDA ist das <term type="dh">Bag-of-Words</term>-Modell: Die Reihenfolge der Wörter sowie sprachliche oder semantische Abhängigkeiten werden aktiv ignoriert, die Wörter müssen lediglich im selben Dokument vorkommen. Der Algorithmus iteriert fortwährend in tausendfacher Wiederholung über das Korpus, greift sich einen ›Sack‹ Wörter und berechnet so im Verlauf, welche davon unabhängig von ihrer Bedeutung korpusweit miteinander verwandt sind. Die Wörter werden also ohne semantisches Vorwissen alleine auf Grundlage von Wahrscheinlichkeitsrechnung zu Gruppen&#160;– den Topics&#160;– gebündelt.<note type="footnote">In diesem Paper unterscheiden wir zwischen <term type="dh">Topic</term> und <term type="dh">Themenfeld</term>, wobei ersteres eine algorithmisch berechnete Wortgruppe bezeichnet, letzteres eine semantisch kohärente Themengruppe.</note> Das bedeutet wiederum, dass solche Topics Wörter enthalten können, die semantisch nichts gemeinsam haben. Es bedeutet aber auch, dass Wörter, die ein*e Forscher*in als etwaige Suchbegriffe nicht im Sinn hatte, in den Listen auftauchen können, weil sie in der Nähe zu anderen, bekannten Begriffen stehen. </p>
               <p>Anhand der Topics kann analysiert werden, welche Teile des Korpus&#160;– d.&#160;h. welche Dokumente oder Abschnitte von Dokumenten&#160;– einen Anteil an bestimmten Topics haben. Eine große Errungenschaft der LDA ist in dieser Hinsicht, dass, anders als beim klassischen <term type="dh">Clustering</term>, Themenüberlagerungen in Dokumenten gefunden werden können, da für jedes Dokument das Gewicht eines jeden Topics berechnet werden kann.</p>
               <p>Angetrieben durch neuere Entwicklungen in der Generierung und Anwendung von <term type="dh">Language Models</term>, die auf <term type="dh">Machine Learning</term> basieren, haben sich mit <term type="dh">BERTopic</term>, <term type="dh">word2vec</term> und <term type="dh">LDA2vec</term> auch vektorbasierte Topic-Modeling-Verfahren etabliert.<note type="footnote">Alle neueren Ansätze basieren auf <term type="dh">Transformer</term>-Modellen und damit verbunden dem Google-Ansatz <term type="dh">BERT  (Bidirectional Encoder Representations from Transformers)</term>. Vgl. <ref type="bibliography" target="#devlin_et_al_2018">Devlin et&#160;al. 2018</ref>. Mittels BERT werden sogenannte <term type="dh">Embeddings</term> erzeugt, die semantische Strukturen als Vektoren ausgeben. Vgl. beispielsweise <ref type="bibliography" target="#bubenhofer_aequivalenz_2020">Bubenhofer 2020</ref>. BERTopic ist eine Erweiterung von BERT mit Ausrichtung auf Topic Modeling-Anwendungen. Vgl. <ref type="bibliography" target="#grootendorst_bertopic_2022">Grootendorst 2022</ref>.</note> Als umfangreichstes und prominentestes wird BERTopic mit in die vorliegende Analyse aufgenommen. Es handelt sich dabei um ein stark modularisiertes Paket für unterschiedlichste Topic-Modeling-Verfahren. </p>
               <p>Derzeit werden in den digitalen Geisteswissenschaften und der Informatik hauptsächlich drei Programmiersprachen für Topic Modeling verwendet: Python, das mit <ref target="https://radimrehurek.com/gensim/">Gensim</ref> und <ref target="https://maartengr.github.io/BERTopic/index.html">BERTopic</ref> eine ›traditionelle‹ und eine vektorbasierte Bibliothek anbietet, <ref target="https://mimno.github.io/Mallet/index">Mallet</ref>, eine JAVA-basierte Implementierung für Topic Modeling, sowie spezielle R-Pakete. Alle drei Sprachen und die damit verbundenen Pakete sind in der Informatik und in den Geisteswissenschaften weit verbreitet. Es gibt ausgezeichnete Tutorials (z.&#160;B. <ref target="https://programminghistorian.org/">Programming Historian</ref>)<note type="footnote">Vgl. 
                     <ref type="bibliography" target="#graham_et_al_topic_2012">Graham et&#160;al. 2012</ref>.</note> sowie Implementierungen mit grafischen Benutzeroberflächen (z.&#160;B. <ref target="https://dariah-de.github.io/TopicsExplorer/">DARIAH Topics Explorer</ref>)<note type="footnote">
                     Vgl. <ref type="bibliography" target="#simmler_et_al_topic_2019">Simmler et&#160;al. 2019</ref>.</note> für Forscher*innen ohne Programmiererfahrung. </p>
            </div>
            <div type="subchapter">
               <head>2.2 Korpora</head>
               <div type="subchapter">
                  <head>2.2.1 Erstes Korpus: Zürcher Regierungsratsbeschlüsse aus dem 19. Jahrhundert</head>
                  <p>Die Regierungsratsbeschlüsse des Kantons Zürich stellen eine umfangreiche serielle Quelle dar, die durch Close-Reading-Verfahren kaum bewältigt werden kann. Die Einblicke in die Prozesse der Exekutive einer geographisch umfangreichen Verwaltungseinheit versprechen vielfältige Erkenntnisse zur ganzen Schweiz und des nahen Auslands während des 19. Jahrhunderts. Darüber hinaus legt der Blick in die Regierungs- und Verwaltungstätigkeit drängende Probleme und Aushandlungsformen offen und macht das Korpus so zu einem optimalen Untersuchungsgegenstand. Die Texte liegen bereits seit längerer Zeit als digitale Dokumente in maschinenlesbarer Form vor.<note type="footnote">Der Zugriff erfolgt über das Staatsarchiv Zürich: <ref target="https://www.zentraleserien.zh.ch/documents?query=&amp;sort=date&amp;collection=RRB&amp;type=&amp;dates=&amp;date-min=&amp;date-max=&amp;field=text&amp;start=1">Regierungsratsbeschlüsse</ref>.</note>
               </p>
               <p>Die Reihe beginnt nach dem Ende der französischen Besatzung und der Helvetischen Republik 1803 und wurde handschriftlich bis 1898 fortgeführt. Sie enthält die schriftlichen Entscheide der Regierungsexekutive und deckt viele verschiedene Themen ab: von Infrastrukturprojekten über Entscheide zu Einbürgerungen und Ausweisungen einzelner Menschen bis hin zu Glückwünschen zur Geburt von königlichen Nachkommen in Nachbarstaaten. Insgesamt liegen mehr als 150.000 Entscheidungen vor. Die Dokumente sind alle in deutscher Sprache verfasst, wobei sich die Sprache im Laufe der Zeit verändert und nach und nach einer Norm zu folgen beginnt. Im Vergleich zum heutigen Deutsch lassen sich daher mehr Schreib- und Wortvarianten (›hujus‹ für ›diesjährig‹) finden, und bestimmte Schreibweisen unterscheiden sich immer noch (›bey‹&#160;/ ›bei‹, ›Theil‹&#160;/ ›Teil‹). Aus diesem Grund können bestehende Stopword-Listen für das Preprocessing (mehr dazu weiter unten) nicht verwendet werden. Gleichzeitig ist die Sprache stark formalisiert, sodass bestimmte Begriffe sehr häufig vorkommen (etwa ›Regierungsrat‹).</p>
               <p>Dank der Aufbereitung durch das Staatsarchiv Zürich stehen der Forschung Tausende von Zürcher Regierungsratsbeschlüssen über Volltextsuche zur Verfügung. Die wichtige Frage, welche Themen wann diskutiert wurden, lässt sich aufgrund der schieren Größe des Korpus nicht einfach beantworten. Sie ließe sich allenfalls umständlich durch die Suche nach den Häufigkeiten von Schlüsselwörtern klären, die vor einer solchen Analyse ermittelt werden müssten.</p>
               <p>Mit dem Korpus wird exemplarisch aufgezeigt, wie die immer umfangreicher werdenden Dokumentenserien der Frühen Neuzeit und des 19. Jahrhunderts thematisch bearbeitet werden können. Eine manuelle Durchsicht ist bei diesen Reihen nicht nur erschwert, sondern eigentlich unmöglich. Die naheliegende Konsequenz ist die Hinwendung zur computergestützten Informationsanalyse. Die Regierungsratsbeschlüsse des Kantons Zürich stellen eine solche Reihe dar, welche die Abläufe in der Exekutive einer Verwaltungseinheit im Verlauf des 19. Jahrhunderts zu erhellen verspricht.</p></div>
               <div type="subchapter"><head>2.2.2 Zweites Korpus: lebensgeschichtliche Interviews aus den 1980er Jahren</head>
               <p><title>Lebensgeschichte und Sozialkultur im Ruhrgebiet</title> (LUSIR) war das erste große Oral-History-Projekt in Deutschland. Zwischen 1980 und 1988 wurden rund 300 biographische Interviews mit Arbeitenden, Angestellten sowie Funktionär*innen aus Gewerkschaften und Betriebsräten aus den großen Industriebetrieben des Ruhrgebiets geführt. Das ursprüngliche Forschungsinteresse galt den Faschismuserfahrungen und der Sozialkultur in der Kohle- und Stahlindustrie des Ruhrgebiets zwischen 1930 und 1980.<note type="footnote">Vgl. 
                     <ref type="bibliography" target="#niethammer_hg_jahre_1983">Niethammer 1983</ref>.</note> Die dabei entstandenen Quellen werden heute als analoge Tonbänder und digitale Kopien vom Archiv <title>Deutsches Gedächtnis</title> des Instituts für Geschichte und Biographie der FernUniversität in Hagen verwahrt.<note type="footnote">Vgl. 
                     <ref type="bibliography" target="#igubfuhagen_hg_archiv_2025a">Institut für Geschichte und Biographie der FernUniversität in Hagen (Hg.) 2025a</ref>.</note> In vergangenen und laufenden Forschungsprojekten wurden bereits zahlreiche Interviews transkribiert, sodass für das vorliegende Paper 167 Volltexte verwendet werden konnten.<note type="footnote">Vgl. 
                     <ref type="bibliography" target="#igubfuhagen_hg_projekt_2025b">Institut für Geschichte und Biographie der FernUniversität in Hagen (Hg.) 2025b</ref>; <ref type="bibliography" target="#fuberlin_ub_hg_oralhistory_2025">Freie Universität Berlin. Universitätsbibliothek (Hg.) 2025</ref>. </note>
               </p>
               <p>Eine Laufzeit von bis zu acht Stunden pro Interview bedeutet zum einen eine enorme Textmenge, zum anderen enthalten die Stegreiferzählungen der Interviewten Abschweifungen in die unterschiedlichsten Lebensbereiche&#160;– und damit Themen. Ein kursorischer Überblick oder eine einfache Suche nach Schlagwörtern ist aussichtslos, sodass Topic Modeling das Potenzial bietet, Inhalte aufzudecken, die manuell kaum wahrnehmbar sind, etwa Mikroerzählungen über Freizeittrends der 1950er Jahre oder erste Erfahrungen mit Computern im Büro. Solche thematischen Ausreißer sind zwischen den dominierenden Interviewpassagen zu ›Industriearbeit‹ und ›Faschismuserfahrungen‹ leicht zu übersehen.</p></div>
               <div type="subchapter"><head>2.2.3 Drittes Korpus: Spätmittelalterliche Chronikhandschriften</head>
               <p>Vormoderne Handschriften (gebundene Bücher) bestehen selten aus nur einem Werk, sondern enthalten oft mehrere Texte, die mitunter von verschiedenen Schreiber*innen und&#160;/ oder Besitzer*innen über mehrere Jahre oder Jahrzehnte hinweg eingefügt wurden. Dabei wurden Texte nicht immer originalgetreu abgeschrieben, sondern oft gekürzt, ergänzt, sprachlich angepasst oder auf andere Weise verändert, sodass Forscher*innen mit zahlreichen Herausforderungen auf mehreren Ebenen konfrontiert sind, wenn sie versuchen, die Überlieferung eines bestimmten Werkes zu rekonstruieren: Nicht nur sind manche Textveränderungen so radikal, dass sich die Frage stellt, ob eine solche veränderte Abschrift nicht bereits ein eigenständiges Werk ist, das einer gesonderten Analyse bedarf. Auch die Kombination verschiedener Texte in einer Handschrift hat Einfluss auf die jeweilige Lesart, sodass Gattungszuordnungen möglicherweise neu überdacht werden müssen&#160;– ein Bericht über Alexander den Großen erfüllte in einer Textgemeinschaft mit Heldensagen vermutlich eine andere Funktion als in seinem ursprünglichen Kontext als Teil einer Weltchronik. Solche Anpassungen deuten auf interessante Kopiervorgänge hin, können aber nur durch zeitaufwändiges Close Reading aufgedeckt werden, das selbst bei kleinen Korpora einen enormen Aufwand bedeutet. Laufende Fortschritte in der <term type="dh">automatischen Handschriftenerkennung (HTR)</term> eröffnen nun die Möglichkeit, solche heterogenen Dokumente wie mittelalterliche Sammelhandschriften mit mehreren Schreiber*innenhänden automatisch in ein maschinenlesbares Format zu bringen und weiter zu untersuchen. </p>
                  <p>Die spätmittelalterliche Chronik des Straßburger Klerikers Jakob Twinger von Königshofen ist in knapp 130 Handschriften überliefert.<note type="footnote">Vgl. <ref type="bibliography" target="#handschriftencensus_hg_twinger_2025">Handschriftencensus (Hg.) 2025</ref>; <ref type="bibliography" target="#serif_geschichte_2020">Serif 2020</ref>.</note> Während es sich bei etwa 30 um integrale Abschriften handelt, ist der Text in der großen Mehrheit der Codices auf verschiedene Weise verändert und häufig durch zahlreiche andere Fremdtexte ergänzt. Durch diese Mitüberlieferung von Texten kann die Migration von Handschriften sichtbar gemacht werden, obwohl unvollständige kodikologische Beschreibungen und nicht standardisierte Werktitel die Analyse erschweren. Nach der Anwendung von HTR kann Topic Modeling Verbindungen zwischen einzelnen Sammelhandschriften auf einer linguistischen Ebene aufdecken, die durch das Zählen von Worthäufigkeiten allein oder durch den Abgleich spezifischer Begriffe nicht sichtbar wären. Als Fallstudie wurden sieben Handschriften aus dem Korpus ausgewählt,<note type="footnote">Dresden, Landesbibliothek, Mscr. F 98 [Dre1]; Freiburg, Universitätsbibliothek, Hs. 471 [Fre2]; Heidelberg, Universitätsbibliothek, Cpg 116 [Hei2]; Heidelberg, Universitätsbibliothek, Cpg 475 [Hei4]; München, Staatsbibliothek, Cgm 568 [Mue5]; Stuttgart, Landesbibliothek, Cod. HB V 22 [Stu3]; Wolfenbüttel, Herzog August Bibliothek, Cod. 16.17 Aug. 4° [Wol2]. Kodikologische Beschreibungen der einzelnen Handschriften finden sich in: <ref type="bibliography" target="#handschriftencensus_hg_twinger_2025">Handschriftencensus (Hg.) 2025</ref>. Eine aktuell gehaltene Liste aller bekannten Textzeugen zusammen mit den Siglen findet sich in <ref type="bibliography" target="#serif_chronist_2015">Serif 2015</ref>.</note> von denen vier neben der Chronik mehrere Texte gemeinsam haben oder sich hauptsächlich mit Ereignissen rund um die Stadt Konstanz befassen und in abhängigen Kopierprozessen entstanden sind.<note type="footnote">Die drei Codices [Fre2], [Hei4] und [Mue5] enthalten außer der <title>Twingerchronik</title> die <title>Konstanzer Jahrgeschichten</title>, eine Liste der Konstanzer Bischöfe und einen Bericht über den Mord an Guillaume de Menthonay, Bischof von Lausanne, im Jahr 1406. [Stu3] wurde in Konstanz hergestellt und enthält neben der <title>Twingerchronik</title> und anderen Texten die <title>Konstanzer Weltchronik</title>.</note> Dieses Vorwissen hilft bei der Einordnung und Interpretation der Ergebnisse und bei den Überlegungen zur Anwendung von Topic Modeling auf größere Korpora mit nicht-standardsprachlichen Texten.<note type="footnote">Die Texterkennung wurde mit <ref target="https://www.transkribus.org/">Transkribus</ref> mit insgesamt vier verschiedenen Modellen durchgeführt, die alle mit Material trainiert wurden, das mehrere Jahrhunderte umfasst, und die also gute Erkennungsraten für heterogene Schriftbilder liefern. Die für die Modelle genutzte CitLab HTR-&#160;/ HTR+-Engine wird nicht mehr von Transkribus unterstützt, die Details zu den Modellen und die erkannten Texte finden sich in <ref type="bibliography" target="#serif_tmdata_2024">Serif 2024</ref>. Die Ergebnisse der Texterkennung wurden nicht korrigiert, weil der Zeitaufwand erheblich und die Methode damit nicht skalierbar wäre. Die große Textmenge in den einzelnen Handschriften dürfte viele Fehler ausgleichen, und eine Betrachtung der Topic-Listen lässt vermuten, dass eine fehlerfreie Textgrundlage Akzente vielleicht verschöbe, die Ergebnisse aber nicht grundlegend verändern würde. Zu ähnlichen Ergebnissen kommen <ref type="bibliography" target="#mutuvi_et_al_evaluating_2018">Mutuvi et&#160;al. 2018</ref>. Sie fanden einen messbaren, aber relativ kleinen Einfluss von Texterkennungsfehlern auf das Ergebnis von Topic Modeling, ohne dass diese den durchschnittlichen <term type="dh">Coherence-Score</term> aber merklich beeinflussen würden. Vgl. <ref type="bibliography" target="#mutuvi_et_al_evaluating_2018">Mutuvi et&#160;al. 2018</ref>, S.&#160;12. </note>
               </p></div>
            </div>
         </div>
         <div type="chapter">
            <head>3. Preprocessing: Texte auf- und vorbereiten</head>
            <p>Berechnet man ein Topic-Modell auf einem Korpus, das lediglich <term type="dh">tokenisiert</term> wurde&#160;– d.&#160;h., aus dem zusammenhängenden Dokument in Form eines <term type="dh">Strings</term> wurde anhand einer <term type="dh">Whitespace-Split-Funktion</term> eine Liste mit Wörtern erstellt&#160;–, erhält man nur minimale Spuren eines Themenfelds. Des Weiteren wird augenfällig, dass der Text erheblich bereinigt werden muss. Folgendes Topic stammt aus einem Modell, das auf dem unvorbereiteten Interviewkorpus trainiert wurde:</p>
               <list type="unordered">
                  <item>4 [-, Mhh., habe, nich., es, Ja, dINT_AVPe, du, sicherlich, Lager, (...)., man, also,, [räuspert, [hustet], d.&#160;h., Nö,, INT_AVPch, nich,, Äh,, dort, nö,,&#160;–, hab, Ja,, wurde, INT_AVPn, [—], Mal, ne, nämlich, zunächst, nö., IG, sich], gewählt, habe,, Essen, äh, SPD., Amerikaner, Metall, Kollegen, Kontakt, versucht, Mensch,, Anfang, Er, Also,, diskutiert]</item>
               </list>
            <p>Interpunktion, die an den Wörtern ›klebt‹, muss ebenso entfernt werden wie nichtssagende Wörter (Partikel, Pronomen etc.) und disziplinspezifische Funktionswörter (hier etwa Sprecherkürzel wie ›INT_AVP‹). Groß- und Kleinschreibung sowie Flexion führen zu Redundanzen in den Topics.</p>
            <p>Alle drei Korpora müssen entsprechend&#160;– unabhängig davon, welchen Zeitraum sie abdecken oder wie umfangreich sie sind&#160;– aufbereitet werden, damit die Topic-Modeling-Algorithmen mit den Texten umgehen können. Diese Schritte werden als Preprocessing bezeichnet. Da es sich dabei um eine Manipulation der historischen Quellen handelt und im eigentlichen Sinn eine Anpassung des <term type="dh">Inputs</term> (also des Quelleninhalts) vorgenommen wird, ist <term type="dh">Datenbereinigung&#160;/Data Cleaning</term> seit einiger Zeit Gegenstand einer intensiven kritischen Diskussion in den digitalen Geisteswissenschaften.<note type="footnote">Vgl. <ref type="bibliography" target="#rawson_munoz_cleaning_2019">Rawson&#160;/ Muñoz 2019</ref>. </note>
            </p>
            <p>Die für unsere Analysen durchgeführten Schritte sollten daher nicht als standardisierte Abfolge verstanden werden, die immer auf diese Weise ablaufen muss. Im Gegenteil sollte jeder Schritt des Preprocessings immer reflektiert und auf den Anwendungsfall angepasst werden. </p>
            <p>Folgende Schritte werden traditionell bei Topic Modeling zum Preprocessing gezählt: </p>
            <list type="unordered">
               <item>Entfernung von Satzzeichen,</item>
               <item>Umwandlung aller Zeichen in Kleinschreibung,</item>
               <item>Entfernung von Stopwords,</item>
               <item>Reduktion von Wortformen auf ihre Grundform (Lemmatisierung).</item>
            </list>
            <p>Bei sehr langen Dokumenten kann es zudem sinnvoll sein, diese in kleinere Teile aufzuteilen, da zumindest LDA lange Texte nicht optimal verarbeiten kann und Dokumente mit ungleicher Länge die Analyse verzerren. Der dafür notwendige Schritt wird Chunking genannt.</p>
            <p>Die Konsequenzen dieser einzelnen Schritte lassen sich am einfachsten am konkreten Beispiel, das heißt, an den drei vorliegenden Korpora demonstrieren. Um die Auswirkungen der beschriebenen Preprocessing-Schritte nachvollziehbar zu machen, wird im Folgenden nicht nur aufgezeigt, welche Ergebnisse mit Topic Modeling bestenfalls erzielt werden können, sondern auch, inwieweit die Verfahren zu ›lesbareren‹ und vor allem interpretierbaren Ergebnissen führen. Alle Modelle zur Beurteilung der Preprocessing-Schritte wurden mit Mallet berechnet. Hierbei wurde zunächst von 20 Topics ausgegangen. Anschließend wurden 50 Optimierungsdurchläufe mit jeweils 500 Iterationen durchgeführt (dazu ausführlich in <ref type="intern" target="#hd24">Kapitel 4</ref>). Mallet wurde gewählt, weil es zum einen die erste LDA-Implementierung war, zum anderen hat eine Vorstudie gezeigt, dass es auf historischen Korpora eine bessere Performance bietet als Gensim.<note type="footnote">Vgl.
                  <ref type="bibliography" target="#hodel_et_al_inferenzen_2022">Hodel et&#160;al. 2022</ref>.</note> Ein Vergleich der verschiedenen Implementierungen (Mallet, Gensim, BERTopic) erfolgt in <ref type="intern" target="#hd44">Kapitel 6</ref>.</p>
            <div type="subchapter">
               <head>3.1 Entfernen von Satzzeichen</head>
               <p>Verfahren, die&#160;– wie LDA&#160;– ohne Sprachmodelle arbeiten, verfügen über kein Sprachwissen und können Wörter nicht selbst identifizieren. Das heißt, was ein Wort ist, muss im Preprocessing für den Algorithmus eindeutig sein. Hingen Satzzeichen an Wörtern, weil diese üblicherweise in digitalen Texten nicht durch ein Leerzeichen getrennt werden, würden etwa alle Wörter, die an einem Satzende stehen, als andere Wörter gewertet werden als ihr Pendant ohne anhängendes Satzzeichen (›Ein schönes <hi rend="bold">Erlebnis.</hi>‹ / ›Ein schönes Erlebnis war das.‹). Für eine vollständige Entfernung und nicht etwa ein Lösen der Satzzeichen vom davorstehenden Wort spricht, dass die isolierten Satzzeichen im Topic Modeling als eigenes Wort gezählt und nachher eigene Topics bilden oder andere verrauschen würden.</p>
               <div type="subchapter">
                  <head>3.1.1 Interviews</head>
               <p>Die Entfernung von Interpunktion und sämtlichen Sonderzeichen im Interviewkorpus ergibt zwar ein optisch, aber nicht auch inhaltlich besseres Bild. Die einzige Spur deutet auf das Thema ›Arbeit‹ hin:</p>
               <list type="unordered">
                  <item>15 [der, war, ich, die, da, nicht, den, hab, waren, noch, von, ein, auch, und, mit, im, Ja, jetzt, dem, Ich, Da, weiß, bei, mehr, das, Der, ist, irgendwie, <hi rend="background-color(FFFF00)">Betrieb</hi>, hat, <hi rend="background-color(FFFF00)">Betriebsrat</hi>, wie, hatte, alles, oder, Essen, er, später, mal, <hi rend="background-color(FFFF00)">Kollegen</hi>, worden, mich, für, damals, schon, Die, als, dabei, wieder, haben]</item>
               </list>
               </div>
            </div>
            <div type="subchapter">
               <head>3.2 Kleinschreibung (Lower Casing)</head>
               <p>Die Umwandlung aller Zeichen in Kleinschreibung gehört zu den gängigen Preprocessingschritten. Topic-Modeling-Algorithmen, insbesondere LDA, funktionieren wie ein Vergleichsalgorithmus, der zwischen Groß- und Kleinschreibung unterscheidet: Das gleiche Wort, einmal groß- und einmal kleingeschrieben, würde als zwei unterschiedliche Wörter gewertet werden. Aus den drei Beispielsätzen ›Das wäre schön.‹, ›Wäre das schön?‹, ›Schön wäre das!‹ würde nicht ein Vokabular mit drei Wörtern erstellt, sondern mit sechs: ›Das, das, Wäre, wäre, Schön, schön‹. </p>
               <p>Die Kehrseite des Lower Casing ist, dass zwei unterschiedliche Wörter, von denen eines ein Nomen ist, nachher nicht mehr unterschieden werden können (›Die Kriege des 20. Jahrhunderts.‹ / ›Ich kriege die Krise.‹). Es ist letztlich eine Frage von Gewinn und Verlust und ggf. am Anwendungsfall zu prüfen, ob Lower Casing im jeweiligen Falle sinnvoll ist oder nicht.</p>
               <p>Bei Topic-Modeling-Ansätzen, die auf Sprachmodellen basieren, wie dies bei BERT der Fall ist, kann auf das Lower Casing verzichtet werden, weil die Groß- und Kleinschreibung in Sprachmodellen repräsentiert wird. Wie überall gibt es auch hier Ausnahmen; bei manchen Ansätzen mit Sprachmodellen wie z.&#160;B. <term type="dh">BERT Lower cased</term> wird nur mit Kleinbuchstaben gearbeitet.</p>
               <div type="subchapter">
                  <head>3.2.1 Regierungsratsbeschlüsse</head>
               <p>Lower Casing ist insbesondere bei Wörtern hilfreich, deren Groß- bzw. Kleinschreibung diachron oder anderweitig im Korpus variiert. Aufgrund der fehlenden Normalisierung der deutschen Sprache kommt dies im Korpus der Regierungsratsbeschlüsse relativ häufig vor. Mit dieser Vorgehensweise werden auch Satzanfänge nicht separiert. Da im Korpus wenige Wörter sehr häufig vorkommen, reduziert und verbessert das Lower Casing somit die Anzahl der sehr häufigen Token.  </p>
               </div>
               <div type="subchapter">
               <head>3.2.2 Handschriften</head>
               <p>Nach Anwendung von Lower Casing (und der Entfernung der wenigen Satzzeichen) ergeben auch die Topics für die Chronikhandschriften noch ein sehr vages Bild:</p>
               <list type="unordered">
                  <item>4 [und, der, die, er, das, den, von, dem, mit, des, uff, im, als, nit, es, nach, man, sich, dar, sin, ander, ir, ist, wider, umb, sant, wie, kam, alle, noch, ich, da, sprach, tag, vil, aber, wol, gen, oder, gar, selben, hie, wan, stat, durch, doch, wolt, gottes, allen, disen] </item>
                  <item>17 [von, vnd, zu, sie, die, das, unnd, auch, der, den, da, vnnd, man, mit, vor, wart, wan, anno, dem, ine, bey, ein, viel, weyssenburg, widder, nit, eyn, des, din, gem, es, hett, uff, dag, warent, dan, statt, de, stat, im, doch, sein, als, wie, uf, alle, alles, wardt, sich, andern] </item>
               </list>
               </div>
               <div type="subchapter">               
                  <head>3.2.3 Interviews</head>
                  <p>Bei den Interviews bringt das Lower Casing eine minimale Steigerung angedeuteter Themenfelder, weil Redundanzen herausgefiltert werden und so Platz für sinntragende ›Nachrücker‹ schaffen. Neben dem wenig veränderten Topic ›Arbeit‹ (11) zeichnet sich ein Topic zum ›Bergbau‹ (12) ab:</p>
               <list type="unordered">
                  <item>11 [der, ich, die, da, hmm, wir, den, sie, mal, jetzt, im, haben, bei, wie, sagen, wenn, dass, damals, ist, man, war, äh, zu, dann, <hi rend="background-color(FFFF00)">betriebsrat</hi>, <hi rend="background-color(FFFF00)">betrieb</hi>, kann, mich, mehr, waren, bin, <hi rend="background-color(FFFF00)">kollegen</hi>, hier, als, sind, worden, gesagt, noch, auf, wieder, mit, ein, natürlich, heute, uns, wo, nur, zeit, dabei, muss]</item>
                  <item>12 [wir, man, das, die, dann, ja, und, der, haben, jetzt, da, wenn, ist, du, hat, es, sind, mal, dass, den, auch, immer, uns, war, oder, mit, aber, damals, noch, von, wieder, wo, <hi rend="background-color(FFFF00)">zeche</hi>, auf, gesagt, heute, kann, <hi rend="background-color(FFFF00)">bergbau</hi>, im, wie, waren, <hi rend="background-color(FFFF00)">steiger</hi>, ich, gemacht, dort, oben, gehabt, diese, <hi rend="background-color(FFFF00)">kohle</hi>, eigentlich]</item>
               </list>
               </div>
            </div>
            <div type="subchapter">
               <head>3.3 Stopwords: Semantisch bedeutungslose Wörter entfernen</head>
               <p>Ein Schritt im Preprocessing, der umstrittener ist als die bislang behandelten Verfahren, ist das mögliche Entfernen von Stopwords. Da beim Topic Modeling nicht nur das gemeinsame Wortvorkommen, sondern auch die Worthäufigkeit gemessen wird, erscheinen hochfrequente Wörter auch häufig in Topics. Dies erschwert die Interpretation und das Verständnis von Topics als thematische Felder, da es sich bei den hochfrequenten Wörtern meist um Funktionswörter handelt, die allenfalls bedingt bedeutungstragend sind. Durch deren Entfernung wird eine höhere Konsistenz der Topics und damit auch eine Erleichterung bei der inhaltlichen Analyse angestrebt. Der Ausschluss wird am zuverlässigsten über eine Auflistung der Wörter in einer sogenannten <term type="dh">Stopword-Liste</term> nachvollziehbar gemacht&#160;– auf alternative Varianten wird weiter unten eingegangen. </p>
               <p>Aus einer erkenntnistheoretisch-hermeneutischen Perspektive stellt sich die Frage, wie die Bedeutung von Textelementen identifiziert wird und welche Kriterien man dabei anwendet, d.&#160;h. auf welche Annahmen man das Data Cleaning stützt. Hier ist die Forschungsfrage von großer Bedeutung, denn sie beeinflusst die Entscheidung, ob eine Zeichenkette a priori als Stopword zu betrachten ist oder ob ihre Bedeutung erst im Nachhinein durch den Kontext sichtbar wird. Begriffe wie ›Mann‹ und ›Frau‹ sind äußerst häufig und sehr allgemein, können aber auf Gender-Aspekte aufmerksam machen, wenn sie im Korpus enthalten bleiben. Entsprechend können beide Begriffe, je nach Forschungsfrage, hochgradig aussagekräftig oder obsolet sein für die Interpretation der Topic-Cluster. </p>
               <p>Für viele moderne Sprachen existieren spezifische Stopword-Listen, die für das Preprocessing genutzt werden können. Für das hier behandelte Korpus lebensgeschichtlicher Interviews waren vorhandene Listen jedoch nicht geeignet, da die Quellen dialektale Wortformen enthalten. Ebenso wie für Dokumente mit formelhaftem Charakter, wie die Regierungsratsbeschlüsse, sind hier gut kuratierte Listen sinnvoll. Bei vormodernen Quellen ist die Situation noch schwieriger, da es keine einheitliche Schreibweise für Wörter und Wortformen gibt, entsprechend werden die Zeichenketten häufig mehrfach in ähnlicher Schreibung (jedoch als distinkt, unterschiedlich verstandene Wörter) in ein Topic aufgenommen. </p>
               <p>Die Stopword-Bereinigung erfolgt in einem einfachen Vorgang. Die Wörter in den Stopword-Listen werden in den zugrundeliegenden Korpora in einer iterativen Schleife automatisch gesucht und für die weitere Verarbeitung entfernt.</p>
               <p>Dennoch ist die Anwendung problematisch, da die Listen, wie oben beschrieben, individuell auf die Korpora angewendet werden. Dieser Filterprozess greift für die nachfolgende Generierung der Topics massiv in den Inhalt der Quellen ein. Im Sinne einer transparenten und reproduzierbaren Forschung sollten Stopword-Listen daher ebenfalls separat oder mit dem Paper veröffentlicht werden. Nur so wird hinreichend nachvollziehbar, wie die Ergebnisse zustande gekommen sind und inwieweit dadurch in die Quellen bzw. in die Datengrundlage, die eine Quelle repräsentiert, eingegriffen wurde. Die hier <ref target="https://github.com/moebusd/Topic-Modeling-Workingpaper-ZfdG/tree/main">verwendeten Listen</ref> sind zusammen mit zwei der drei Korpora zugänglich und können bearbeitet, wiederverwendet oder für eine eigene Analyse ignoriert werden.
               </p>
               <p>Neben dem Ausschluss bestimmter Wörter über die Listen gibt es die Möglichkeit, sehr häufig vorkommende Wörter über einen <term type="dh">Schwellenwert (Threshold)</term> zu entfernen. Eine undefinierte Äußerung wie ›mmh‹ taucht häufig in transkribierten Interviews auf und der ›Regierungsrat‹ wird in fast jedem Eintrag seines Protokolls erwähnt, ohne dass einem Topic hierdurch viel oder überhaupt Bedeutung hinzugefügt würde. Beide Ansätze, sowohl die Nutzung einer Stopword-Liste als auch der Ausschluss von hochfrequenten Wörtern, müssen jeweils korpusspezifisch angewendet und iterativ getestet werden.<note type="footnote">Zur Konstruktion von Stopword-Listen siehe <ref type="bibliography" target="#burns_constructing_2018">Burns 2018</ref>.</note>
               </p>
               <p>Ein letzter, artverwandter Eingriff, der mit beiden Herangehensweisen kombiniert werden kann, ist die Definition von Mindest- und Maximalwortlängen, um Partikel, Indizes von Aufzählungen oder Fehler in den Transkripten auszuschließen. Gerade im Umgang mit automatisch prozessierten Texten, die beispielsweise aus der Texterkennung kommen, finden sich häufig Relikte und falsch identifizierte Zeichen. Um nicht ein einzelnes Topic bestehend aus solchen eher zufälligen Zeichen zu generieren, können diese gelöscht werden. Im Korpus der mittelalterlichen Handschriften führt dies dazu, dass alle ›Wörter‹, die nur aus einem Zeichen bestehen, entfernt werden. Das ist semantisch nicht ganz ungefährlich, da etwa das Wort ›ê‹ entfernt wird, das als Substantiv (›Ehe‹) und in adverbialer Bedeutung vorkommt.<note type="footnote">›ê‹&#160;/ ›e‹ ist das einzige mittelhochdeutsche Substantiv, das aus nur einem Buchstaben besteht; es bedeutet Ehe, Ewigkeit, und im Kontext von ›alter&#160;/ neuer ê‹ nimmt es Bezug auf das Alte und Neue Testament. Das adverbiale Homonym bedeutet ›früher‹ oder ›eher‹, ist Teil der Stopword-Liste und wird somit im Preprocessing entfernt. (Die Schreibungen ›ee&#160;/ êe‹ und ›êwe&#160;/ ewe‹ sind Varianten mit denselben Bedeutungen, die nicht entfernt werden.) </note> Auf die Möglichkeit, spezifisch für ›ê‹&#160;/ ›e‹ einen Suchlauf durch alle Dokumente zu machen, um das Adverb vom Substantiv zu unterscheiden und nur ersteres für die folgenden Analysen zu entfernen, wurde jedoch verzichtet, weil dies für andere, mehrkettige Homonyme nicht gemacht wurde.<note type="footnote">Je nach Forschungsinteresse wäre dieser Schritt aber nachzuholen. Eine grobe Durchsicht der Korpustexte lässt vermuten, dass der Anteil an gelöschten, bedeutungsarmen Adverbien höher ist als derjenige des bedeutungstragenden Substantivs, bei der Dresdner Handschrift etwa ist das Verhältnis ungefähr 4:1, in der Münchner Handschrift 20:1. Die Schreibvariante als ›ee‹ kommt in derselben Handschrift etwa gleich häufig adverbial wie als Substantiv vor.</note>
               </p>
               <p>Die Entfernung von Stopwords hat sich nicht zuletzt wegen begrenzter Rechenkapazitäten als gängiges Vorgehen etabliert. Seit wenigen Jahren können unsupervisierte maschinelle Lernverfahren aufgrund von höherer Rechenleistung aber verbessert unterstützt und entsprechend reibungsloser durchgeführt werden; dies hat die Diskussion um die Entfernung von Stopwords neu entfacht und Alexandra Schofield, Måns Magnusson und David Mimno (letzterer einer der ›Erfinder‹ von LDA) argumentieren mittlerweile für die Beibehaltung von Stopwords und ein ›Ausblenden‹ erst bei der Interpretation der Resultate.<note type="footnote">Vgl. <ref type="bibliography" target="#schofield_et_al_stops_2017">Schofield et&#160;al. 2017</ref>. </note>
               </p>
               <div type="subchapter">
                  <head>3.3.1 Regierungsratsbeschlüsse</head>
                  <p>Das Stopword Removal ist essentiell für die Auswertung der Regierungsratsbeschlüsse, unabhängig davon, ob eine Lemmatisierung erfolgt (die Lemmatisierung wird weiter unten behandelt). Eine Vielzahl von Wörtern (man denke an ›Zürich‹, ›Regierungsrat‹ oder ›Beschluss‹) tritt in praktisch jedem der Dokumente auf. Dementsprechend sind die Token auch in fast jedem Topic zu finden, was die Identifikation der Dokumentencluster merklich erschwert. Auch nach Entfernung von Stopwords finden sich noch diverse Token, die in einer Vielzahl von Beschlüssen auftauchen. Dadurch wird es schwierig, den Themenfeldern eine inhaltliche Ausrichtung zuzuschreiben.</p>
                  <list>
                     <item>48 [<hi rend="background-color(FFFF00)">bericht</hi>, beschloßen, hoch, derselbe, anhörung, <hi rend="background-color(FFFF00)">behörde</hi>, welch, mein, erstatten, weisung, seyn, beauftragen, laßen, obern, antrag, seye, commißion, zwey, klein, anzeigen, statt, gegenwärtig, <hi rend="background-color(FFFF00)">regierung</hi>, <hi rend="background-color(FFFF00)">berichtes</hi>, deßen, hingegen, erforderlich, rath, uhherren, beschluß]</item>
                  </list>
                  <p>Ein zusätzliches Problem entsteht durch das Vorkommen von Verben oder anderen Wortformen, die nicht mehr gebräuchlich sind (v. a. aus der ersten Hälfte des Korpus bis etwa 1850). Damit sind zwei Konsequenzen verbunden, wenn diese nicht entfernt werden. Erstens werden die Themen faktisch zweigeteilt, da die veraltete Verbform als zugehörig identifiziert wird. Zweitens entstehen mehrfache Cluster mit ähnlichen Inhalten, jeweils mit neuer und alter Form. Die Aussagekraft der Resultate ist damit reduziert.</p>
                  <list>
                     <item>
                     37 [danken, mein, alle, allgemein, wichtig, bezeugen, sorgfältig, regierung, kräftig, bemühungen, krankheit, viel, sorgfalt, besonders, zufriedenheit, unterstützung, sämtlich, kanton, lieb, eifer, gut, kantons, öffentlich, unsers, ich, treue, verordnung, vergnügen, thun, august]
                  </item>
                  </list>
                  <p>Im Vergleich zwischen der Entfernung hochfrequenter gegenüber spezifischer Stopwords schwingt wiederum die zielgerichtete Stopword-Liste oben aus, da die Verteilung der unterschiedlichen Token noch konzentrierter ist als in anderen Korpora: Ganz wenige Token treten enorm häufig auf. Auch nach der Entfernung der 0,5&#160;% häufigsten Token findet sich entsprechend eine Vielzahl von Wörtern, die als bedeutungslos für die historische Auswertung verstanden werden müssen. In jedem Fall wurde entsprechend mit manuellen Stopword-Listen gearbeitet.</p>
               </div>
               <div type="subchapter">
                  <head>3.3.2 Handschriften</head>
                  <p>Auf den mittelalterlichen Handschriften wurden beide Vorgehen&#160;– Threshold und Stopword-Liste&#160;– getestet. Während auch bei Texten in standardisierter Sprache bestehende Stopword-Listen nicht unbesehen genutzt werden sollten, stellen sie Forscher*innen bei der Analyse vormoderner bzw. dialektal geprägter Texte vor ein weiteres Problem: Hier existieren einerseits auch Listen,<note type="footnote">Das <ref target="http://cltk.org/">Classical Language Toolkit</ref> (CLTK), eine Python-Library für <term type="dh">Natural Language Processing</term> vormoderner Sprachen, verfügt über entsprechende <ref target="https://github.com/cltk/cltk">Listen</ref>.</note> andererseits sind sie wegen der großen Varianz an Schreibungen in vormodernen Texten kaum direkt anwendbar. Zwar werden beispielsweise für das Mittelhochdeutsche verschiedene Schreibungen eines Wortes integriert; durch große Unterschiede zwischen den verschiedenen deutschen Dialekträumen können diese aber kaum alle Wortformen abdecken.<note type="footnote">Für Mittelhochdeutsch vgl. die <ref target="https://github.com/Middle-High-German-Conceptual-Database/stopwords">Stopword-Liste</ref>, die in das CLTK bereits integriert wurde. Während verschiedene existierende Stopword-Listen für modernes Deutsch rund 600 Einträge aufweisen, hat die vorgenannte Liste für Mittelhochdeutsch knapp 500 Einträge, was vermuten lässt, dass weniger Wörter und mehr Varianten enthalten sind. <quote>alle, allem, allen, aller, alles</quote> steht beispielsweise <quote>al, all, alle, allem, allen, aller, alles, allez, alle&#x225;, elliu</quote> gegenüber, wobei weitere Formen wie ›alliu‹ oder ›elle‹ nicht abgedeckt sind.</note> Spezifische Listen für Früh- oder Spätmittelhochdeutsch fehlen wiederum vollständig. Eine weitere, mitunter zeitintensive Bearbeitung und Ergänzung der Stopword-Liste ausgehend vom jeweiligen Korpus ist daher unumgänglich.<note type="footnote">Für das vorliegende Korpus wurde die CLTK-Liste entsprechend erweitert und online <ref target="https://github.com/wissen-ist-acht/tm_data/blob/main/textual_data/gmh_stopwords_edited.txt">publiziert</ref>.</note> Die Ergebnisse der beiden Vorgehen unterscheiden sich bisweilen deutlich.</p>
                  <p>Das Topic bezüglich der <title>Chronik der Stadt Weißenburg</title>, das in einer Handschrift [Hei2] vorkommt, wird nach dem Entfernen der Wörter, die einen Anteil von 0,5&#160;% oder mehr im Korpus haben, minimal deutlicher, mit <quote>stat</quote>&#160;/ <quote>statt</quote> für ›Stadt‹ und <quote>anno</quote> als Hinweis auf datierte Einträge, wie sie für Chroniken typisch sind:</p>
                  <list>
                     <item>
                        <p>Stopwords &lt;&#160;0,5</p> 
                        <p>19 [vnd, zu, sie, unnd, auch, da, man, vnnd, nit, des, vor, wan, wart, es, im, <hi rend="background-color(FFFF00)">anno</hi>, ine, als, sich, ein, bey, viel, alle, <hi rend="background-color(FFFF00)">weyssenburg</hi>, <hi rend="background-color(FFFF00)">widder</hi>, wie, eyn, gem, hett, din, warent, doch, <hi rend="background-color(FFFF00)">stat</hi>, dag, dan, <hi rend="background-color(FFFF00)">statt</hi>, aber, nach, de, alles, sein, wol, ander, umb, uf, wardt, inn, wurdent, andern, sant]</p>
                     </item>
                  </list>
                  <p>Setzt man den Threshold auf &lt;&#160;0,25 (wodurch Wörter mit einem Vorkommen von mindestens 0,25&#160;% entfernt werden), fehlt das Topic; ebenfalls bei einem Threshold &lt;&#160;0,05. Bei einem Wert von &lt;&#160;0,01 (bei dem nur Wörter in das Topic Modeling einbezogen werde, die weniger als 0,01&#160;% Anteil am Korpus haben) hingegen wird das Topic etwas deutlicher, das neu hinzugekommene »ite[m]« verweist auf ein chronikalisches Element, die »stat«&#160;/ »statt« hingegen fiel heraus:</p>
                  <list>
                     <item>
                        <p>Stopwords &lt;&#160;0,01</p>
                        <p>2 [vnd, sie, unnd, vnnd, <hi rend="background-color(FFFF00)">anno</hi>, ine, bey, viel, <hi rend="background-color(FFFF00)">widder</hi>, <hi rend="background-color(FFFF00)">weyssenburg</hi>, eyn, gem, hett, din, dag, warent, dan, alles, uf, wardt, andern, wurdent, abt, <hi rend="background-color(FFFF00)">ite</hi>, vff, <hi rend="background-color(FFFF00)">herren</hi>, hette, darumb, inn, <hi rend="background-color(FFFF00)">landt</hi>, syn, sagt, darinn, wurden, <hi rend="background-color(FFFF00)">herr</hi>, juncker, leut, synen, namen, <hi rend="background-color(FFFF00)">weyssenbung</hi>, gemacht, drey, vom, gefangen, darnach, dis, hetten, ob, keyser, kament]</p>
                     </item>
                  </list>
                  <p>Am besten sieht das Ergebnis nach Anwendung der spezifischen Stopword-Liste aus, das in Topic 4 nicht nur die chronikalischen Elemente wie <quote>anno</quote>&#160;/ <quote>anne</quote>, <quote>ite[m]</quote>&#160;/ <quote>it₎</quote> und  <quote>dannach</quote>&#160;/  <quote>arnach</quote> enthält, sondern auch auf Auseinandersetzungen zwischen Personen und Gruppierungen (<quote>widder</quote>&#160;– gegen, <quote>gefangen</quote>, <quote>gewonnen</quote>, <quote>pferden</quote>, <quote>herren</quote>, <quote>burger</quote>, <quote>manne</quote>, <quote>leut</quote>) und auf einzelne Personen (<quote>keyser</quote>, <quote>ludwig</quote>, <quote>juncker</quote>, <quote>abt</quote>, <quote>herr</quote>, <quote>jacob</quote>, <quote>sant</quote>) und Orte&#160;/ Regionen (<quote>weyssenburg</quote>&#160;/ <quote>weyssenbung</quote>&#160;/ <quote>weissenburg</quote>, <quote>baden</quote>, <quote>pfaltz</quote>) hinweist:</p>
                  <list>
                     <item>4 [<hi rend="background-color(FFFF00)">anno</hi>, <hi rend="background-color(FFFF00)">weyssenburg</hi>, <hi rend="background-color(FFFF00)">widder</hi>, gem, <hi rend="background-color(FFFF00)">statt</hi>, dag, <hi rend="background-color(FFFF00)">stat</hi>, <hi rend="background-color(FFFF00)">abt</hi>, <hi rend="background-color(FFFF00)">ite</hi>, landt, sagt, <hi rend="background-color(FFFF00)">herr</hi>, <hi rend="background-color(FFFF00)">juncker</hi>, <hi rend="background-color(FFFF00)">gefangen</hi>, <hi rend="background-color(FFFF00)">leut</hi>, drey, <hi rend="background-color(FFFF00)">weyssenbung</hi>, babst, <hi rend="background-color(FFFF00)">stett</hi>, <hi rend="background-color(FFFF00)">herren</hi>, <hi rend="background-color(FFFF00)">keyser</hi>, <hi rend="background-color(FFFF00)">ludwig</hi>, kament, <hi rend="background-color(FFFF00)">burger</hi>, <hi rend="background-color(FFFF00)">manne</hi>, inen, auß, <hi rend="background-color(FFFF00)">dannach</hi>, eynen, <hi rend="background-color(FFFF00)">pfaltzgraue</hi>, <hi rend="background-color(FFFF00)">gewonnen</hi>, darzu, <hi rend="background-color(FFFF00)">sant</hi>, <hi rend="background-color(FFFF00)">jacob</hi>, <hi rend="background-color(FFFF00)">it₎</hi>, <hi rend="background-color(FFFF00)">arnach</hi>, lag, <hi rend="background-color(FFFF00)">baden</hi>, <hi rend="background-color(FFFF00)">weissenburg</hi>, <hi rend="background-color(FFFF00)">pfaltz</hi>, <hi rend="background-color(FFFF00)">anne</hi>, <hi rend="background-color(FFFF00)">vitter</hi><note type="footnote">›vitter‹ ist ein konsistenter, systematischer Texterkennungsfehler für ›ritter‹. Das Wort kommt in dieser Schreibung 36 Mal in der Transkription der Heidelberger Handschrift 116 [Hei2] vor. In solchen Fällen, wo es sich nicht um einzelne, sondern systematische Falscherkennungen handelt, wäre zu überlegen, die Textgrundlage, also das Korpus, entsprechend zu korrigieren, um die Topic-Listen auch für diejenigen verständlich zu machen, die mit den Inhalten nicht vertraut sind und die Verbindung von ›vitter‹ zu ›ritter‹ nicht machen können.</note>, gulden, nechst, <hi rend="background-color(FFFF00)">graue</hi>, <hi rend="background-color(FFFF00)">hertzog</hi>, <hi rend="background-color(FFFF00)">pfaltzgrauen</hi>, vonn, <hi rend="background-color(FFFF00)">pferden</hi>, vber]</item>
                     </list>                  
                  <p>Ein anderes Topic beinhaltet die Legende des heiligen Ulrich, die ebenfalls nur in einer Handschrift im Korpus vorkommt [Mue5]. Hier gibt es kaum inhaltliche Verbesserungen beim Herabsetzen des Thresholds, die Unterschiede zwischen &lt;&#160;0,5&#160;% und &lt;&#160;0,05&#160;% sind minimal:</p>
                  <list>
                     <item>
                        <p>Stopwords &lt;&#160;0,5</p>
                        <p>0 [vō, auch, sein, <hi rend="background-color(FFFF00)">babst</hi>, un̄, sol, het, ist, seinen, sind, hat, zu, <hi rend="background-color(FFFF00)">heren</hi>, de, auf, <hi rend="background-color(FFFF00)">bischoff</hi>, <hi rend="background-color(FFFF00)">uolrich</hi>, hand, recht, <hi rend="background-color(FFFF00)">rome</hi>, wann, ge, dir, ich, <hi rend="background-color(FFFF00)">frawen</hi>, unser, <hi rend="background-color(FFFF00)">reich</hi>, tuon, bey, hundert, vo, bis, <hi rend="background-color(FFFF00)">lande</hi>, seiner, mocht, <hi rend="background-color(FFFF00)">vater</hi>, <hi rend="background-color(FFFF00)">orden</hi>, <hi rend="background-color(FFFF00)">item</hi>, hab, dy, min, ussz, oder, wolt, dann, zechen, ein, ward, inn, vnd]</p>
                     </item>
                     <item>
                        <p>Stopwords &lt;&#160;0,05</p>
                        <p>7 [seinen, auf, <hi rend="background-color(FFFF00)">uolrich</hi>, wann, <hi rend="background-color(FFFF00)">orden</hi>, <hi rend="background-color(FFFF00)">frawen</hi>, werden, recht, vo, bis, tuon, <hi rend="background-color(FFFF00)">reich</hi>, <hi rend="background-color(FFFF00)">kind</hi>, unser, bey, dann, seiner, vater, dy, <hi rend="background-color(FFFF00)">item</hi>, ussz, <hi rend="background-color(FFFF00)">zechen</hi>, denne, jare, hab, sey, dab, ware, <hi rend="background-color(FFFF00)">kaiser</hi>, hann, kament, <hi rend="background-color(FFFF00)">cristen</hi>, ame, acht, grosse, nicht, tet, seine, fast, <hi rend="background-color(FFFF00)">ulrich</hi>, <hi rend="background-color(FFFF00)">priester</hi>, gesait, <hi rend="background-color(FFFF00)">ee</hi>, innen, dn, hetten, zitten, <hi rend="background-color(FFFF00)">haiden</hi>, lassen, usser]</p>
                     </item>
                  </list>
                  <p>Nach Herausfiltern mittels der Stopword-Liste ergeben sich zwei Topics, die um die Heiligenlegende kreisen; beide allerdings mit Einsprengseln aus anderen Topics (Fremdbegriffe orange eingefärbt):</p>
                  <list>
                     <item>8 [vō, <hi rend="background-color(FFFF00)">heren</hi>, <hi rend="background-color(FFFF00)">frawen</hi>, dy, sey, <hi rend="background-color(FFFF00)">ee</hi>, monat, acht, seine, dn, <hi rend="background-color(FFFF00)">ulrich, kaiser</hi>, zeitten, <hi rend="background-color(FFFF00)">pfaffen</hi>, gesait, <hi rend="background-color(FFFF00)">tansent</hi>, drey, fraw, seinem, zeit, ausz, wō, <hi rend="background-color(FF9900)">strasspurg</hi>, leib, spch, <hi rend="background-color(FF9900)">consily</hi>, grossz, innen, <hi rend="background-color(FFFF00)">uolrichs</hi>, nichs, niemant, soelt, woelte, liessz, gelt, weil, ewer, <hi rend="background-color(FFFF00)">streit, bischoff, syben, gelauben</hi>, wan̄, <hi rend="background-color(FFFF00)">gaistlich, babst</hi>, seyen, <hi rend="background-color(FF9900)">meyses</hi>, <hi rend="background-color(FFFF00)">bruder, gueter</hi>, den̄, vber]</item>
                     <item>10 [hand, <hi rend="background-color(FFFF00)">recht, uolrich, orden, reich</hi>, machet, <hi rend="background-color(FFFF00)">zechen, gottes</hi>, vater, mocht, <hi rend="background-color(FFFF00)">bischoff, priester, ame</hi>, fast, zitten, <hi rend="background-color(FFFF00)">hailigen, muter, cristen, kind</hi>, nacht, <hi rend="background-color(FF9900)">franckrich</hi>, stund, soellent, nū, bracht, wenn, sond, zwaintzig, viertzig, <hi rend="background-color(FFFF00)">hertzog</hi>, dick, zwan, sechs, <hi rend="background-color(FFFF00)">knecht</hi>, ye, gesechen, gnad, mem, um̄, siben, stet, schickt, sechen, werb, selbs, stetten, ans, drin, fand, stuck]</item>
                  </list>
                  
               </div>
               <div type="subchapter">
                  <head>3.3.3 Interviews</head>
                  <div type="subchapter">
                     <head>Stopword Removal (Threshold)</head>
                     <p>Auch für die Interviews wurden beide Verfahren getestet. Als erste Methode wird das Entfernen von Stopwords mit Hilfe eines Thresholds angewendet. Zunächst werden alle Wörter entfernt, die einen Anteil von mehr als 0,5&#160;% am Gesamttext haben. Die Auswirkungen gegenüber beiden ungefilterten Topics oben (Thema ›Arbeit‹ und Thema ›Bergbau‹) sind deutlich: </p>
                     <list>
                        <item>9 [<hi rend="background-color(FFFF00)">krupp</hi>, er, jetzt, für, bei, <hi rend="background-color(FFFF00)">betrieb</hi>, im, <hi rend="background-color(FFFF00)">betriebsrat</hi>, später, eine, irgendwie, hatte, dat, essen, wo, auf, damals, <hi rend="background-color(FFFF00)">kollegen</hi>, alles, dem, gewesen, worden, <hi rend="background-color(FFFF00)">firma</hi>, wieder, dabei, mich, weil, praktisch, vielleicht, denn, kam, vorher, nix, paar, <hi rend="background-color(FFFF00)">arbeit</hi>, bisschen, weiter, einmal, kann, tun, <hi rend="background-color(FFFF00)">heimaterde, chef</hi>, kurz, wat, durch, <hi rend="background-color(FFFF00)">aeg</hi>, ihm, namen, wohnung, hmh]</item>
                        <item>11 [jetzt, er, du, wenn, auf, mhh, <hi rend="background-color(FFFF00)">bergbau, zeche, steiger</hi>, gehabt, <hi rend="background-color(FFFF00)">kohle</hi>, wo, damals, uns, eine, son, immer, weil, se, sich, de, dort, wieder, <hi rend="background-color(FFFF00)">arbeit</hi>, für, <hi rend="background-color(FFFF00)">tage</hi>, um, gab, drin, diese, anderen, <hi rend="background-color(FFFF00)">schicht</hi>, dem, beispiel, musste, kam, sind, im, hast, <hi rend="background-color(FFFF00)">betriebsrat</hi>, als, <hi rend="background-color(FFFF00)">unter</hi>, oben, wurden, muss, <hi rend="background-color(FFFF00)">bergmann, meter, bergleute</hi>, zum, <hi rend="background-color(FFFF00)">mark</hi>]</item>
                     </list>
                     <p>Senkt man den Threshold auf 0,25&#160;% Anteil am Gesamttext (nur Wörter, deren Anteil am Korpus kleiner als 0,25&#160;% ist, werden im Topic Modeling berücksichtigt), treten die Themenfelder deutlicher hervor&#160;– und das Thema ›Arbeit‹ entwickelt sich mehr in Richtung ›Arbeiter*inneninteressenvertretung‹. Allerdings fällt ›Krupp‹ raus, weil das Unternehmen in den Transkripten sehr häufig genannt wird:</p>
                     <list>
                        <item>5 [kam, später, herr, <hi rend="background-color(FFFF00)">betrieb</hi>, alle, weiß, frau, wurde, dat, einen, sagte, <hi rend="background-color(FFFF00)">spd</hi>, essen, einer, irgendwie, hieß, <hi rend="background-color(FFFF00)">gewerkschaft</hi>, drin, dortmund, heißt, hmh, leute, jahre, <hi rend="background-color(FFFF00)">betriebsrat</hi>, viele, durch, vorher, <hi rend="background-color(FFFF00)">kollegen</hi>, gesagt, <hi rend="background-color(FFFF00)">partei</hi>, ihm, nix, büchler, steht, namen, doktor, dabei, du, wat, direkt, <hi rend="background-color(FFFF00)">kammer</hi>, franz, wollte, <hi rend="background-color(FFFF00)">metall, chef</hi>, kommen, ordner, <hi rend="background-color(FFFF00)">aeg</hi>, sag, damals] </item>
                        <item>7 [ähm, du, einmal, sage, naja, <hi rend="background-color(FFFF00)">bergbau</hi>, etwas, damals, gab, <hi rend="background-color(FFFF00)">steiger, zeche</hi>, dort, nichts, aus, <hi rend="background-color(FFFF00)">mark, kohle, tage</hi>, hast, konnte, nun, einen, anderen, oben, kannst, kam, <hi rend="background-color(FFFF00)">schicht, unter</hi>, bekamen, um, usw, bekam, heute, über, wurden, bekommen, wird, wäre, jahre, geld, viel, einer, weil, einem, <hi rend="background-color(FFFF00)">arbeiten</hi>, wurde, darin, <hi rend="background-color(FFFF00)">bergleute</hi>, viele, <hi rend="background-color(FFFF00)">kumpel</hi>, jedenfalls] </item></list>
                     <p>Auch wenn bereits nicht hinnehmbare Verluste im Wortschatz ausgemacht werden konnten, wurde der Threshold zur Demonstration weiter abgesenkt. Ab einem Anteil von 0,1&#160;% am Gesamttext werden erstmals einigermaßen geschlossene Themenfelder erkennbar:</p>
                     <list>
                        <item>4 [bergbau, dort, gab, zeche, kohle, steiger, usw, menschen, mark, bekam, tage, hast, unter, 2, hause, bekamen, bekommen, schicht, 3, bergleute, geld, kumpel, selbst, meter, zur, jaja, wohnung, beim, bergmann, schachtanlage, alt, walsum, hauer, herne, kannst, nö, robert, 6, des, oben, 5, wäre, arbeiten, bruder, alten, jedenfalls, gedinge, bist, zechen, heimat] </item>
                        <item>11 [betriebsrat, betrieb, kollegen, des, essen, nee, gewerkschaft, spd, beispiel, gab, krupp, nochmal, worden, dinge, dabei, aeg, betriebsräte, frage, gewählt, ig, denen, hmh, vorhin, grunde, gewerkschaften, sogar, metall, heißt, belegschaft, unheimlich, mitglied, politische, wollen, zur, eh, kpd, cdu, kommunisten, beim, gefangenschaft, gerade, gewerkschaftlich, schwierig, praktisch, sagten, wäre, diskutiert, entsinnen, beiden, innerhalb]</item>
                     </list>
                     <p>Wenn man den Threshold auf 0,05&#160;% Anteil am Gesamttext senkt (alle Wörter, deren Anteil größer als 0,05&#160;% ist, werden entfernt), fällt auf, dass auch die in den Interviews so zentrale Stadt Essen und die Partei SPD verschwindet, ohne dass die Topics weiter an Konsistenz gewinnen:</p>
                     <list>
                        <item>12 [steiger, zeche, bergbau, kohle, son, de, dort, schicht, tage, naja, arbeiten, meter, bergleute, bergmann, betriebsrat, kumpel, usw, hauer, unter, kumpels, dabei, bekamen, ah, beispiel, manchmal, betriebsführer, franzosen, meinetwegen, bekam, hast, streb, nö, wagen, gewerkschaft, 2, verdienen, gedinge, ihn, schacht, welche, kohlen, leistung, bruder, schachtanlage, robert, kommunisten, verdient, stempel, menschen, gearbeitet]</item>
                        <item>17 [krupp, betrieb, betriebsrat, dabei, kollegen, firma, och, partei, gewerkschaft, wer, kommunisten, vorher, sogar, herr, hieß, ihn, direkt, heißt, spd, nazis, nix, namen, mai, meister, wat, 1, soll, wegen, sa, erzählen, arbeiter, chef, gearbeitet, gegen, mülheim, gewählt, ihm, komm, nebenbei, jeder, kpd, keiner, deutschen, wahrscheinlich, verboten, kollege, mitgemacht, gabs, praktisch, bloß]</item>
                     </list>
                  </div>
                  <div type="subchapter">
                     <head>Stopword Removal (Liste)</head>
                     <p>Nach wie vor sind die Topics verrauscht von nicht bedeutungstragenden Wörtern, während gleichzeitig bedeutsame Wörter aus den Topics verschwinden. Es muss also ein gezielteres Verfahren angewendet werden: die Arbeit mit einer kuratierten Stoplist. Die <ref target="https://github.com/moebusd/mensch_und_maschine/blob/main/german_stopwords_full_BE_MOD%20Topics.txt">verwendete Stoplist</ref> wurde ursprünglich von <ref target="https://github.com/solariz/german_stopwords">Github</ref> heruntergeladen, kritisch geprüft und maßgeblich ergänzt. Wendet man diese Stoplist beim Preprocessing an, erhält man als Ergebnis 20 größtenteils konsistente Themenfelder. Auch wurde der optionale Schritt, Wörter mit weniger als zwei Buchstaben herauszufiltern, zur weiteren Straffung eingesetzt (eine Anhebung der Mindestbuchstabenzahl wäre fatal, da historisch relevante Abkürzungen wie NS, KZ, SS oder SA aus den Topics herausfallen würden).</p>
                     <p>Topic 0 zum Thema ›Bergbau‹ soll für die weiteren Optimierungsschritte als Referenz herangezogen werden, wenngleich sich ein zweites Thema&#160;– die ›Heimatvertriebenen‹&#160;– in das Topic hineinmischt. Das ist ein erster Hinweis darauf, dass die Anzahl der Topics erhöht werden muss, um diese beiden Themen zu trennen oder ein Bergbau-Topic zu ermöglichen, das nicht mit dem Schicksal der Heimatvertriebenen verknüpft ist. </p>
                     <list>
                        <item>0 [steiger, bergbau, zeche, kohle, schicht, kumpel, meter, bergleute, bekamen, hauer, bergmann, kumpels, betriebsrat, kohlen, menschen, walsum, betriebsführer, gedinge, geld, schachtanlage, wagen, lager, verdienen, robert, verdient, heimat, stempel, gefangenschaft, lohn, knappschaft, nu, schlesien, schacht, vertriebene, tonnen, zechen, leistung, ruhrgebiet, ruhrkohle, vertriebenen, nachtschicht, revier, pütt, bergschule, kameradschaftsgedinge, schichten, arbeiter, helmut, kollegen, ernst]</item>
                     </list>
                  </div>                  
               </div>               
            </div>
            <div type="subchapter">
               <head>3.4 Lemmatisierung: Arbeiten mit Grundformen von Wörtern</head>
               <p>Stopwords werden verwendet, um den potenziellen Einfluss von sehr häufig vorkommenden Wörtern zu beseitigen. Eine weitere Herausforderung bei der Anwendung von Topic Modeling besteht darin, dass die für die Verfahren verwendeten Algorithmen nicht mit Sprachwissen ausgestattet sind und sie stattdessen das bloße Vorkommen von Wörtern in Form von Zeichenketten zählen. Das bedeutet, dass unterschiedliche Flexionsformen als unterschiedliche Wörter betrachtet werden. Dies führt dazu, dass relativ häufige Wörter in einem (oder mehreren) Topic(s) in verschiedenen flektierten Formen vorkommen.</p>
               <p>Um die durch Flexion entstehende lexikalische Heterogenität zu minimieren, können Texte lemmatisiert werden, d.&#160;h. die verschiedenen Formen eines Wortes können auf die Grundform reduziert werden. Das bedeutet, dass die Texte (bereits ohne Stopwords, um Ressourcen zu schonen) so modifiziert werden, dass nicht die flektierten Wortformen, sondern die Lemmata das zu untersuchende Korpus bilden. Bei der <term type="dh">Lemmatisierung</term> wird das jeweilige flektierte Wort mit einer Referenzliste abgeglichen, die möglichst alle flektierten Formen des gesamten Wortschatzes enthält. Wird das Wort gefunden, wird es durch die Grundform im Originaltext ersetzt, sodass z.&#160;B. ›bin‹, ›bist‹ und ›war‹ als dreimal ›sein‹ gezählt werden. Die Referenzliste&#160;– das Sprachmodell&#160;– in der für dieses Paper verwendeten Pipeline ist <ref target="https://spacy.io/">spaCy</ref> und dessen Sprachmodell <ref target="https://spacy.io/models/de#de_core_news_lg">de_core_news_lg</ref>, das auf Zeitungskorpora trainiert wurde und etwa 500.000 vektorisierte Wörter enthält. Ein schmerzliches Desiderat aus Sicht der Geschichtswissenschaft ist die mangelnde Abdeckung historischer Schreibweisen in solchen Sprachmodellen. So werden beispielsweise in mittelalterlichen Handschriften praktisch keine, in den Ratsbeschlüssen des 19. Jahrhunderts nur wenige und in dialektalen Interviews des 20. Jahrhunderts nur ein Teil aller Wörter korrekt erkannt und ersetzt.<note type="footnote">Neben Lemmatisierung wäre Normalisierung eine Möglichkeit, Varianz in Schreibungen zu reduzieren. Auch hier gibt es für historische bzw. nicht standardisierte Sprachstufen (noch) keine zufriedenstellenden Ergebnisse. Der Normalizer <ref target="https://www.linguistics.rub.de/comphist/resources/norma/index.html">Norma</ref> wird zurzeit nicht weiterentwickelt, der letzte <ref target="https://github.com/comphist/norma/releases/tag/v0.5.0">Release</ref> war 2017. Für einen Vergleich verschiedener Normalisierungsansätze, inklusive Norma, vgl. <ref type="bibliography" target="#bollmann_comparison_2019">Bollmann 2019</ref>; <ref type="bibliography" target="#flachs_et_al_text_2019">Flachs et&#160;al. 2019</ref>.</note> Für unseren Ansatz ist es entsprechend sinnlos, die Lemmatisierung für das Manuskript-Korpus oder die Regierungsratsbeschlüsse des 19. Jahrhunderts anzuwenden.</p>
               <p>Über die reine Lemmatisierung hinaus geht das <term type="dh">Part-of-Speech-Filtern (POS-Filtering)</term>, also das gezielte Ausschließen bestimmter Wortformen, wie Artikel oder Pronomen. Mit spaCy werden die Korpora mit Hilfe von Vokabularen und vektorisierten Sprachmodellen vollständig mit <term type="dh">POS-Tags</term> ausgezeichnet. Wurde das Wort korrekt identifiziert&#160;– was bei Texten in deutscher Sprache grundsätzlich nicht ganz zuverlässig funktioniert und durch dialektale und historische Sprache noch deutlich erschwert wird&#160;–, können im Anschluss Wortgruppen, die inhaltlich wenig beitragen, aus den Korpora herausgefiltert werden. </p>
               <div type="subchapter">
                  <head>3.4.1 Interviews</head>
                  <p>Bereits ohne POS-Filter fällt auf, dass Lemmatisierung im Deutschen fehleranfällig ist. Das verwendete spaCy löst den Plural von ›Menschen‹ nicht zum Singular auf, das gleiche gilt für die ›Kumpels‹&#160;– könnte man Letzteres noch damit erklären, dass es als Teil eines regionalen Soziolekts in vortrainierten Sprachmodellen unterrepräsentiert sein könnte, trifft das auf das erste Beispiel nicht zu. Bei dem Begriff ›Kohlen‹ scheint die Zusammenführung funktioniert zu haben, da sich hier nur der Singular findet. Darüber hinaus ändert sich die Gesamtbeschaffenheit des Topics allerdings nicht signifikant&#160;– der dialektale Begriff ›Pütt‹ für den sogenannten ›Kohlenpott‹ Ruhrgebiet ›rückt nach‹:</p>
                  <list>
                     <item>1 [steiger, zechen, kohle, bergbau, mensch, schicht, verdienen, betriebsführer, meter, arbeit, hauer, geld, kumpels, vertrieben, kumpel, bergleute, betriebsrat, wagen, bergmann, gedinge, lager, welch, robert, lohn, stempel, deutsch, menschen, schacht, bentheim, nachtschicht, abhauen, gewerkschaft, wohnen, strecken, nu, schichten, schlesien, 50, kameradschaft, tonnen, bergschule, verbinden, draht, revier, kameradschaftsgedinge, kaufen, schnaps, helmut, pütt, ernst]</item>
                  </list>
                  <p>Filtert man alle Wortformen bis auf Nomen heraus, trägt das nicht zur weiteren Konsistenz des Topics bei. Nun rücken weitere Wörter aus dem Zusammenhang Vertreibung und einige semantisch fremde Wörter nach:</p>
                  <list>
                     <item>19 [zechen, steiger, bergbau, kohle, schicht, geld, meter, kumpel, kumpels, bergmann, bergleute, hauer, schacht, arbeit, betriebsrat, robert, gedinge, lager, königsberg, ruhrgebiet, vertrieben, wagen, knappschaft, stempel, gefangenschaft, polen, heimat, schlesien, mensch, schnaps, jungs, lohn, woche, kameraden, hats, betriebsführer, nachtschicht, menschen, revier, monate, schichten, bergschule, steine, strecken, ostpreußen, bauern, helmut, kameradschaft, gewerkschaft, kameradschaftsgedinge]</item>
                  </list>
                  <p>Gleiches gilt für die Kombination von Nomen und Verben:</p>
                  <list>
                     <item>4 [bergbau, steiger, zechen, kohle, verdienen, schicht, meter, kumpel, bergmann, kumpels, bergleute, wagen, hauer, arbeit, geld, kohlen, schachtanlage, menschen, betriebsrat, robert, vertrieben, walsum, herne, gedinge, leistung, schacht, lager, heimat, betriebsführer, gewerkschaft, stempel, bauen, lohn, schaffen, strecken, gefangenschaft, schichten, kameradschaft, fördern, recklinghausen, bergschule, schlesien, tonnen, reden, ruhrkohle, kaufen, helmut, revier, schnaps, türken]</item>
                  </list>
                  <p>Bzw. für die Kombination von Nomen und Adjektiven:</p>
                  <list>
                     <item>14 [steiger, zechen, bergbau, kohle, schicht, meter, kumpel, bergleute, geld, kumpels, betriebsführer, hauer, bergmann, vertrieben, betriebsrat, schacht, kohlen, gedinge, walsum, schachtanlage, lager, wagen, robert, stempel, tonnen, leistung, menschen, schlesien, lohn, kameradschaft, russen, heimat, steine, ruhrkohle, revier, arbeit, ruhrgebiet, bergschule, deutsch, nächst, helmut, pütt, nachtschicht, kameradschaftsgedinge, kameraden, einheimisch, schnaps, gewerkschaft, ostpreußen, schachtanlagen]</item>
                  </list>
                  <p>Entsprechend bringt auch die Kombination von Nomen, Verben und Adjektiven keine weitere Verbesserung:</p>
                  <list>
                     <item>8 [bergbau, zechen, kohle, steiger, vertrieben, walsum, kumpel, verdienen, bergleute, herne, schicht, bergmann, kohlen, meter, bevölkerung, schachtanlage, ruhrkohle, gedinge, ruhrgebiet, kontakt, wohnung, recklinghausen, schaffen, gefangenschaft, schlesien, heimat, hauer, kollegen, bergschule, thyssen, leistung, duisburg, soldat, zimmermann, lager, kameradschaftsgedinge, ansehen, gesamt, schachtanlagen, böse, tonnen, sogenannt, bauen, studieren, fördern, industrie, kumpels, schnaps, wohnungen, möglichkeit]</item>
                  </list>
                  <p>Insgesamt strafft die Lemmatisierung&#160;– ob mit oder ohne POS-Filter&#160;– das Topic noch einmal minimal. Der Ertrag ist allerdings als ambivalent zu betrachten, die Eingrenzung auf Wortformen kann zu stringenteren Topics, aber auch zu einer Glättung führen. Was im Beispiel deutlicher hervorgetreten ist, ist die Vermischung der Themenbereiche ›Lebenswelt Kohlebergbau‹ und ›Heimatvertriebene‹. </p>
               </div>               
            </div>
            <div type="subchapter">
               <head>3.5 Schlussfolgerungen zum Preprocessing</head>
               <p>Ziel dieses Unterkapitels war es, zu zeigen, dass für jedes Korpus jeweils unterschiedliche Entscheidungen getroffen und unterschiedliche Schritte durchgeführt werden müssen, um die Daten für eine Analyse weiterzuverarbeiten. Das bedeutet, dass nach unserem Verständnis die Anwendung von Topic Modeling eine Vertrautheit mit den technischen (Vor-)Bedingungen erfordert, um verständliche und reproduzierbare Ergebnisse zu erzielen.</p>
               <p>Unsere Erkenntnisse über die verschiedenen Preprocessing-Schritte für die einzelnen Korpora sind dabei das Ergebnis längerer Phasen des Ausprobierens und Experimentierens, im Sinne eines <term type="dh">tinkering</term> mit den Daten und den unterschiedlichen Schritten.</p>
               <p>Dabei stellte sich heraus, dass die Schritte des Preprocessing unterschiedlichen Einfluss auf die Ergebnisse des Topic Modeling haben. Je nach Korpus werden ganz unterschiedliche Resultate erzielt, weshalb die Methode nicht eine Vorgehensweise erlaubt, sondern mehrere evaluierende Schritte benötigt, um sie produktiv zu machen. </p>
            </div>
         </div>
         <div type="chapter">
            <head>4. Weitere Optimierung: Chunking und Random Seeds</head>
            <div type="subchapter">
               <head>4.1 Chunking</head>
               <p>Das sogenannte <term type="dh">Chunking</term> unterteilt große Dokumente in kleinere Teile (<term type="dh">Chunks</term>) gleicher Länge, die ihrerseits als ein Dokument eines Topic Models verstanden werden können. Das Chunking dient zwei Zielen: zum einen dem Optimieren des Topic-Modeling-Verfahrens, weil zu lange Dokumente und Korpora mit Dokumenten von sehr unterschiedlicher Länge die Ergebnisse verschlechtern. Zum anderen ermöglicht das Chunking eine feingranulare Topic-Verteilung über lange Texte. Wenn es also darum geht, Entwicklungsprozesse anhand von Themenwechseln einzufangen, müssen Texte in kleinere Abschnitte zerteilt und für jeden Abschnitt eine Topic-Repräsentation berechnet werden. Chunking sollte entsprechend nicht nur eine technische Vorgehensweise sein, sondern eine wohlüberlegte Aufteilung in (thematisch) möglichst homogene Sequenzen. Da dies bei großen Korpora, die hier im Zentrum stehen, nicht manuell geleistet werden kann, müssen automatisierte Ansätze verfolgt werden.</p>
               <p>Die Aufteilung in Chunks kann auf der Basis einer festen Chunkgröße, also Anzahl von Wörtern oder Sätzen, erfolgen. Die Entscheidung über die Chunkgröße hängt von verschiedenen Faktoren ab, nicht zuletzt von der Forschungsfrage und der Größe des Korpus bzw. der zu untersuchenden einzelnen Dokumente. Mit lebensgeschichtlichen Interviews und mittelalterlichen Handschriften liegen zwei sehr unterschiedliche Anwendungsfälle vor, bei denen Chunking erforderlich ist. Die Regierungsratsbeschlüsse hingegen sind so kurz und bleiben in den meisten Fällen thematisch recht eng gefasst, dass das Chunking bei diesen problemlos entfallen kann. </p>
               <p>Beim Ermitteln der optimalen Chunkgröße für das Topic-Training handelt es sich um ein komplexes Verfahren: Topic-Anzahl und Chunkgröße sind reziprok und oft wird erst in einem iterativen Verfahren eine Annäherung an ein Optimum möglich. Während man bei den Handschriften auf Grundlage der für das Preprocessing festgelegten 20 Topics Unterschiede zwischen den verschieden gechunkten Korpora feststellen kann, wirken sich die unterschiedlichen Chunkgrößen mit 20 Topics bei den Interviews nicht merklich aus. Das ist auf die für dieses Korpus wesentlich zu niedrige Topic-Anzahl im Preprocessing-Szenario zurückzuführen. Deshalb greifen wir an dieser Stelle im Arbeitsprozess etwas vor und legen das finale Modell mit 50 Topics für die Analyse des Chunkings zugrunde. Allerdings sind auch bei optimaler Topic-Anzahl die Unterschiede graduell, weshalb durchaus pragmatisch vorgegangen werden und eine für das Forschungsvorhaben angemessene Chunkgröße gewählt werden kann. Für die Repräsentation der Topics in den lebensgeschichtlichen Interviews haben sich im Close Reading etwa 50 Sätze als gute Chunklänge herausgestellt. Dieses Chunking bildet den Default-Wert für die spätere Schätzung der optimalen Topic-Anzahl. </p>
            </div>
            <div type="subchapter">
               <head>4.2 Random Seed</head>
               <p>Der <term type="dh">Random Seed</term> bestimmt das zufällig gewählte erste Sample beim Iterieren des LDA-Algorithmus. Der Random Seed kann eine Zahl zwischen 1 und 2.147.483.647 sein&#160;– dem Limit für die Darstellung von Zahlen in 32 bit. Im Falle von Mallet sollte nicht die 0 verwendet werden, da diese die Systemzeit des ausführenden Rechners als Random Seed setzt und somit wiederum kaum reproduzierbar ist. </p>
               <p>Für das wissenschaftliche Arbeiten ist das von großer Bedeutung: Ohne gesetzten Random Seed ist auch unter vollständig gleichen Rahmenbedingungen, mit denselben Daten und Parametereinstellungen, das Ergebnis jedes Mal ein anderes. Der Ausgangspunkt der Berechnung (<term type="dh">apriori-Wahrscheinlichkeit</term>) ist jeweils ein anderer und der Optimierungsalgorithmus führt zu (leicht) unterschiedlichen Ergebnissen. Zur Bestimmung eines optimalen Modells ist es also sinnvoll, immer mehrere Modelle mit verschiedenen Random Seeds zu berechnen, um festzustellen, ob bestimmte Topics nicht in allen Modellen vertreten sind. Im Preprocessing haben wir einen Random Seed von 100 gesetzt, um die Auswirkungen der einzelnen Schritte deutlich zu machen. Allerdings muss man einschränkend sagen, dass sich mit zunehmender Veränderung der Daten von Schritt zu Schritt im Preprocessing auch der Zugriff auf das erste, aus dem Korpus gezogene Sample verändert: Das Setzen eines Random Seeds ist also nicht unbedingt sinnvoll bzw. erforderlich, um die Auswirkungen des Preprocessings zu verdeutlichen (ermöglicht aber, wie erwähnt, die Reproduzierbarkeit jedes einzelnen Schritts). Geht es um die Schätzung der optimalen Chunkgröße und Topic-Anzahl, ist das Setzen eines Random Seeds von größerer Bedeutung, um die Ergebnisse nach dem Vergleich dokumentieren und im Zweifel reproduzieren zu können.</p>
            </div>
            <div type="subchapter">
               <head>4.3 Anwendung</head>
               <div type="subchapter">
                  <head>4.3.1 Handschriften</head>
                  <p>Der Umfang der 7 Handschriften unterscheidet sich stark und reicht von 78 [Hei2] bis 287 Blättern [Mue5], was nach der Texterkennung einem Umfang von rund 190.000 bzw. 1,1 Millionen Zeichen entspricht. Auch auf inhaltlicher Ebene gibt es größere Unterschiede: Manche Handschriften enthalten neben der Chronik Jakob Twingers nur wenig andere Inhalte (wie [Fre1]), andere hingegen vereinen viele verschiedene (und umfangreichere) Texte (wie [Mue5] oder [Wol2]). Um diese Unterschiede auszugleichen, kann das Korpus in kleinere Einheiten unterteilt werden. Da auch die Zeichensetzung sehr uneinheitlich ist, lassen sich Sätze nicht zuverlässig abgrenzen, sodass diese als Einheit wegfallen und auf wortbasierte Chunks zurückgegriffen wurde. Trainiert wurden Modelle für Chunks zu 5.000, 2.500, 1.000, 500 und 250 Wörtern. </p>
                  <p>Für das Topic um die <title>Weißenburg-Chronik</title> liefern die 5.000er-Chunks bereits recht klare Begriffe:</p>
                 <list>
                    <item>3 [<hi rend="background-color(FFFF00)">anno, widder, weyssenburg,</hi> gem, <hi rend="background-color(FFFF00)">stat, statt</hi>, dag, <hi rend="background-color(FFFF00)">ite, abt, herren</hi>, landt, sagt, <hi rend="background-color(FFFF00)">gefangen, sant, herr, leut</hi>, drey, <hi rend="background-color(FFFF00)">juncker, weyssenbung</hi>, lag, <hi rend="background-color(FFFF00)">manne</hi>, kament, <hi rend="background-color(FFFF00)">schaden, pfaltzgraue</hi>, babst, <hi rend="background-color(FFFF00)">ludwig</hi>, darzu, <hi rend="background-color(FFFF00)">keyser</hi>, auß, <hi rend="background-color(FFFF00)">arnach, baden</hi>, inen, <hi rend="background-color(FFFF00)">it₎</hi>, eynen, <hi rend="background-color(FFFF00)">jacob</hi>, bischoff, <hi rend="background-color(FFFF00)">graue, pferden</hi>, vonn, gulden, <hi rend="background-color(FFFF00)">gewonnen, pfaltz, pfaltzgrauen</hi>, nechst, <hi rend="background-color(FFFF00)">burger</hi>, bischof, vber, hundert, <hi rend="background-color(FFFF00)">stett, gewan</hi>]</item>
                 </list>
                  <p>Kleinere Chunks führen zu minimalen Unterschieden. Hier beispielsweise eine Topicliste für 500er-Chunks:</p>
                  <list>
                     <item>12 [<hi rend="background-color(FFFF00)">anno, widder, weyssenburg</hi>, gem, dag, <hi rend="background-color(FFFF00)">statt, stat, ite, abt, herren, landt, gefangen</hi>, sagt, <hi rend="background-color(FFFF00)">herr, leut, weyssenbung</hi>, drey, <hi rend="background-color(FFFF00)">juncker, keyser</hi>, lag, <hi rend="background-color(FFFF00)">manne, baden, stett, pfaltzgraue</hi>, inen, <hi rend="background-color(FFFF00)">ludwig</hi>, auß, eynen, <hi rend="background-color(FFFF00)">it₎, arnach</hi>, kament, <hi rend="background-color(FFFF00)">gewonnen, anne, schaden</hi>, darzu, <hi rend="background-color(FFFF00)">weissenburg, dannach, burger, vitter, jacob</hi>, nechst, <hi rend="background-color(FFFF00)">pfaltz, bischof</hi>, dorff, <hi rend="background-color(FFFF00)">hans</hi>, gulden, <hi rend="background-color(FFFF00)">pfaltzgrauen</hi>, vmb, thun, <hi rend="background-color(FFFF00)">graue</hi>]</item>
                  </list>
                  <p>Anders verhält es sich bei der <title>Ulrichslegende</title>. Auch hier ergibt sich bei 5.000er-Chunks schon ein deutliches Topic, das mit 2.500 etwas präziser umrissen wird. 1.000er-Chunks liefern einzelne zusätzliche Begriffe, allerdings auch aus anderen Topics. Die deutlichsten Hinweise auf die <title>Ulrichslegende</title> finden sich auf Basis von 500er- und 250er-Chunks, wobei in beiden auch fremde Begriffe aus dem Topic um die ersten Straßburger Bischöfe, St. Arbogast und St. Florentin, enthalten sind (Fremdbegriffe orange eingefärbt):</p>
                  <list>
                     <item>
                        <p>chunking 5.000 </p>
                        <p>13 [<hi rend="background-color(FFFF00)">sant, uolrich</hi>, dy, <hi rend="background-color(FFFF00)">bischoff, ulrich, grab, uolrichs</hi>, selbs, mocht, <hi rend="background-color(FFFF00)">kirchen</hi>, ausz, <hi rend="background-color(FFFF00)">hailigen, menschen</hi>, ad, <hi rend="background-color(FFFF00)">angspurg, ulrichs</hi>, stund, <hi rend="background-color(FFFF00)">frawen</hi>, est, tags, <hi rend="background-color(FFFF00)">priester, adelbero</hi>, selbig, <hi rend="background-color(FFFF00)">graff</hi>, sagt, grosz, <hi rend="background-color(FFFF00)">gesund</hi>, pald, seinem, <hi rend="background-color(FFFF00)">capitel, pfaffen</hi>, ut, <hi rend="background-color(FFFF00)">hailig</hi>, ansz, liesz, tem, volbracht, <hi rend="background-color(FFFF00)">leichnam</hi>, yederman, pruder, ant, arnach, solichs, <hi rend="background-color(FFFF00)">closter</hi>, <hi rend="background-color(FF9900)">costentz</hi>, qui, wolten, nō, <hi rend="background-color(FFFF00)">altar</hi>, weil]</p>                  
                     </item>
                     <item>
                        <p>chunking 2.500 </p>
                        <p>18  [<hi rend="background-color(FFFF00)">sant, uolrich</hi>, vō, dy, <hi rend="background-color(FFFF00)">ulrich, bischoff</hi>, spch, wō, mocht, <hi rend="background-color(FFFF00)">grab</hi>, dier, <hi rend="background-color(FFFF00)">uolrichs</hi>, dn, um̄, <hi rend="background-color(FFFF00)">frawen, kind</hi>, <hi rend="background-color(FF9900)">wib</hi>, rich, <hi rend="background-color(FFFF00)">kirchen, angspurg, ulrichs</hi>, bist, ausz, bald, selbs, ad, <hi rend="background-color(FFFF00)">hailigen</hi>, liesz, ansz, mā, soch, pald, grosz, <hi rend="background-color(FFFF00)">adelbero</hi>, sagt, dù, tags, <hi rend="background-color(FFFF00)">gesund</hi>, volbracht, <hi rend="background-color(FFFF00)">fraw</hi>, berait, ais, <hi rend="background-color(FFFF00)">leichnam</hi>, stund, ser, <hi rend="background-color(FFFF00)">pruder</hi>, fast, <hi rend="background-color(FFFF00)">graff, mesz</hi>, spcht]</p>
                     </item>
                     <item>
                        <p>chunking 1.000</p>
                        <p>9 [<hi rend="background-color(FFFF00)">sant, bischoff, uolrich</hi>, dy, <hi rend="background-color(FFFF00)">closter, peter, grab, ulrich, kirchen</hi>, ant, statt, <hi rend="background-color(FF9900)">hans</hi>, peters, mocht, <hi rend="background-color(FFFF00)">leben</hi>, selbs, <hi rend="background-color(FFFF00)">uolrichs</hi>, alten, grosz, <hi rend="background-color(FFFF00)">eren, hailigen</hi>, <hi rend="background-color(FF9900)">gesellen</hi>, <hi rend="background-color(FFFF00)">priester</hi>, hann, heren, <hi rend="background-color(FFFF00)">hertzog</hi>, <hi rend="background-color(FF9900)">florentz</hi>, volbracht, <hi rend="background-color(FFFF00)">begraben</hi>, stund, ge¬, <hi rend="background-color(FFFF00)">ritter, angspurg</hi>, liesz, <hi rend="background-color(FFFF00)">ulrichs</hi>, <hi rend="background-color(FF9900)">arbogast</hi>, ausz, <hi rend="background-color(FFFF00)">volk</hi>, <hi rend="background-color(FF9900)">bekert</hi>, <hi rend="background-color(FFFF00)">frawen, graff, mesz, zaichen, lieben, stifft, hilff</hi>, machet, ere, <hi rend="background-color(FFFF00)">gesund, adelbero</hi>]</p>
                     </item>
                     <item>
                        <p>chunking 500</p>
                        <p>14 [<hi rend="background-color(FFFF00)">sant, bischoff, uolrich, closter, peter</hi>, dy, <hi rend="background-color(FFFF00)">grab, ant, ulrich, kirchen</hi>, peters, <hi rend="background-color(FFFF00)">leben, statt</hi>, selbs, mocht, grosz, alten, stund, <hi rend="background-color(FFFF00)">eren, uolrichs, hailigen, priester, pfaffen</hi>, volbracht, <hi rend="background-color(FFFF00)">frawen, stifft, wasser, lieben</hi>, <hi rend="background-color(FF9900)">gesellen, florentz, arbogast</hi>, ausz, <hi rend="background-color(FFFF00)">angspurg</hi>, liesz, <hi rend="background-color(FFFF00)">ulrichs</hi>, hann, <hi rend="background-color(FFFF00)">altar, begraben, capitel, volk, gesund</hi>, machet, <hi rend="background-color(FF9900)">kloster, burg</hi>, zaichen, seinem, <hi rend="background-color(FFFF00)">menschen</hi>, wolten, tags, <hi rend="background-color(FF9900)">bekert</hi>]</p>
                     </item>
                     <item>
                        <p>chunking 250</p>
                        <p>0 [<hi rend="background-color(FFFF00)">sant, bischoff, uolrich, closter, peter</hi>, dy, <hi rend="background-color(FFFF00)">grab, kirchen, ant, ulrich</hi>, peters, <hi rend="background-color(FFFF00)">statt</hi>, selbs, <hi rend="background-color(FFFF00)">leben</hi>, mocht, <hi rend="background-color(FFFF00)">priester, stifft, hailigen</hi>, alten, <hi rend="background-color(FFFF00)">uolrichs, stund</hi>, <hi rend="background-color(FF9900)">florentz</hi>, <hi rend="background-color(FFFF00)">begraben, wasser, lieben</hi>, grosz, ausz, gestifft, liesz, volbracht, <hi rend="background-color(FFFF00)">eren</hi>, ere, <hi rend="background-color(FF9900)">arbogast</hi>, tags, <hi rend="background-color(FFFF00)">gesund</hi>, <hi rend="background-color(FF9900)">strasspurg</hi>, <hi rend="background-color(FFFF00)">ulrichs</hi>, <hi rend="background-color(FF9900)">gesellen</hi>, <hi rend="background-color(FFFF00)">pfaffen, angspurg, frawen</hi>, <hi rend="background-color(FF9900)">bekert</hi>, <hi rend="background-color(FFFF00)">hertzog, altar</hi>, seinem, <hi rend="background-color(FFFF00)">dienst</hi>, hann, <hi rend="background-color(FFFF00)">hailig</hi>, gant, <hi rend="background-color(FF9900)">mùnster</hi>]</p>
                     </item>
                  </list>
                  <p>Ein Topic, das in vier Handschriften vertreten ist ([Dre1], [Fre2], [Hei4], [Mue5]), umfasst Begriffe um Alexander den Großen und erstreckt sich über etwa 35 Unterkapitel im ersten Kapitel der <title>Twinger-Chronik</title>. Während dieses Topic weder im ganz unprozessierten Text noch nach Anwendung der Stopword-Liste oder auf den 5.000er-Chunks erscheint, wird es ab 2.500er-Chunks sichtbarer, wobei hier noch viele ›fremde‹ Begriffe, unter anderem aus der Schöpfungsgeschichte, vorkommen. Mit 1.000er-Chunks erscheinen ebenfalls mehrere Begriffe aus anderen Topics (›Dietrich von Bern‹; ›Trojanischer Krieg‹), 500er-Chunks liefern das präziseste und sauberste Ergebnis. Mit 250er-Chunks wird das Topic nicht entdeckt (Fremdbegriffe orange eingefärbt):</p>
                  <list>
                     <item>
                        <p>chunking 2.500</p>
                        <p>0 [<hi rend="background-color(FF9900)">adam</hi>, <hi rend="background-color(FFFF00)">darins, allexander, wasser</hi>, hast, <hi rend="background-color(FF9900)">engel</hi>, alt, <hi rend="background-color(FF9900)">lebendig, noe</hi>, <hi rend="background-color(FFFF00)">persa, welt, alepander</hi>, <hi rend="background-color(FF9900)">silvester</hi>, ersten, welte, aler, ena, gebar, erste, <hi rend="background-color(FF9900)">helena</hi>, <hi rend="background-color(FFFF00)">brieff</hi>, gott, ding, <hi rend="background-color(FFFF00)">philippus</hi>, <hi rend="background-color(FF9900)">stier</hi>, <hi rend="background-color(FFFF00)">alexander</hi>, bilde, <hi rend="background-color(FF9900)">turn, paradis</hi>, jung, gestalt, <hi rend="background-color(FFFF00)">dario</hi>, menschen, ist,, <hi rend="background-color(FF9900)">beschuff</hi>, <hi rend="background-color(FFFF00)">allexand</hi>, <hi rend="background-color(FF9900)">tier</hi>, vatter, dinen, erden, hymel, <hi rend="background-color(FF9900)">verbotten</hi>, geschriben, <hi rend="background-color(FF9900)">kinden</hi>, usser, wissen, essen, hoch, <hi rend="background-color(FFFF00)">alerander</hi>, tieren]</p>
                     </item>
                     <item>
                        <p>chunking 1.000</p>
                        <p>14 [<hi rend="background-color(FF9900)">bern, dietrich</hi>, <hi rend="background-color(FFFF00)">darins, allexander, persa</hi>, hast, gochen, <hi rend="background-color(FFFF00)">alepander</hi>, <hi rend="background-color(FF9900)">hunen, silvester, berne</hi>, <hi rend="background-color(FFFF00)">lebendig, brieff</hi>, <hi rend="background-color(FF9900)">helena</hi>, <hi rend="background-color(FFFF00)">philippus</hi>, aler, mals, wort, <hi rend="background-color(FFFF00)">botten</hi>, mers, <hi rend="background-color(FF9900)">stier</hi>, <hi rend="background-color(FFFF00)">allexand, alexander</hi>, alt, bucher, guldin, <hi rend="background-color(FFFF00)">dario</hi>, gestalt, meres, menschen, todes, enpfangen, ist, bilde, bosen, gechen, dù, xxxi, wissen, <hi rend="background-color(FFFF00)">welt</hi>, werden, <hi rend="background-color(FFFF00)">darius</hi>, <hi rend="background-color(FF9900)">cristus</hi>, eren, gang, <hi rend="background-color(FFFF00)">alerander</hi>, begraben, sternen, <hi rend="background-color(FF9900)">porten</hi>, <hi rend="background-color(FFFF00)">allex</hi>]</p>
                     </item>
                     <item>
                        <p>chunking 500</p>
                        <p>10 [<hi rend="background-color(FFFF00)">vatter, brieff, darins, allexander, persa</hi>, hast, <hi rend="background-color(FFFF00)">botten</hi>, <hi rend="background-color(FF9900)">lebendig</hi>, ding, <hi rend="background-color(FFFF00)">alepander</hi>, <hi rend="background-color(FF9900)">silvester</hi>, aler, sprachent, wort, <hi rend="background-color(FFFF00)">allexand</hi>, <hi rend="background-color(FF9900)">stier</hi>, <hi rend="background-color(FFFF00)">alexander, philippus, sun</hi>, grab, <hi rend="background-color(FF9900)">helena</hi>, <hi rend="background-color(FFFF00)">ritter, tempel</hi>, leben, <hi rend="background-color(FFFF00)">gestalt</hi>, zeichen, <hi rend="background-color(FFFF00)">guldin, fùrsten</hi>, alten, sas, bilde, <hi rend="background-color(FFFF00)">dario</hi>, ist,, <hi rend="background-color(FFFF00)">welt</hi>, zoch, <hi rend="background-color(FFFF00)">palast, wunder</hi>, tragen, enpfangen, tot, sachen, helle, grabe, <hi rend="background-color(FFFF00)">begraben</hi>, dinen, dn, <hi rend="background-color(FF9900)">cristus</hi>, <hi rend="background-color(FFFF00)">betten</hi>, todes, sternen]</p>
                     </item>
                  </list>
                  <p>Für dieses sehr heterogene Korpus stellen 500er-Chunks die beste Größe dar, um Topics zu erhalten, die ausreichend aussagekräftig sind und dabei die wenigsten Fremdbegriffe aufweisen. Bei einer Textgrundlage mit besserer Texterkennung ließen sich hier womöglich Verschiebungen beobachten, da Doppelungen, die auf Erkennungsfehlern beruhen, wegfallen würden.<note type="footnote">Hier etwa ›alexander‹&#160;– ›alepander‹; Schreibvarianten hingegen, wie ›allexander‹&#160;– ›alexander‹, sollten als solche bestehen bleiben, da sie sprachhistorische Informationen besitzen.</note>
                  </p>
               </div>
               <div type="subchapter">
                  <head>4.3.2 Lebensgeschichtliche Interviews</head>
                  <p>Die Transkripte lebensgeschichtlicher Interviews sind äußerst umfangreiche und komplexe Textdokumente. Neben der Optimierung für das Topic Modeling dient das Chunking auch der besseren inhaltlichen Erschließung, weil Topics damit über den Interviewverlauf errechnet werden und Themenwechsel dargestellt werden können. Bei 20 Topics zeigen sich mit Blick auf die Konsistenz der Topics allerdings wenig Auswirkungen durch das Chunking. Verwendet wurden Korpora mit Chunks zu 10, 25 und 50 Sätzen. Insgesamt sind die Ergebnisse der gechunkten Modelle leicht konsistenter, allerdings fällt bei diesen der wichtige Terminus ›Gedinge‹ raus.</p>
                  <table xml:id="tab001">
                     <row>
                        <cell>
                           <p>Unchunked</p>
                           <p>20 Topics</p>
                        </cell>
                        <cell>1 [steiger, zechen, kohle, bergbau, mensch, schicht, verdienen, betriebsführer, meter, arbeit, hauer, geld, kumpels, vertrieben, kumpel, bergleute, betriebsrat, wagen, bergmann, gedinge, lager, welch, robert, lohn, stempel, deutsch, menschen, schacht, bentheim, nachtschicht,</cell>
                     </row>
                     <row>
                        <cell>
                           <p>50 Sätze</p>
                           <p>20 Topics</p>
                        </cell>
                        <cell>9 [zechen, arbeit, bergbau, kohle, steiger, arbeiten, meter, schicht, kohlen, bergleute, kumpel, bergmann, schwer, wagen, ruhrgebiet, betriebsführer, nachtschicht, recklinghausen, bekommen, verdienen, stempel, schacht, steine, morgens, kumpels, nennen, vertrieben, hauer, alt, leistung]</cell>
                     </row>
                     <row>
                        <cell>
                           <p>25 Sätze</p>
                           <p>20 Topics (Random Seed 123)</p>
                        </cell>
                        <cell>4 [zechen, bergbau, kohle, arbeit, steiger, arbeiten, meter, verdienen, kohlen, bergmann, schicht, kumpel, bergleute, geld, wagen, ruhrgebiet, schwer, schacht, hauer, kumpels, stempel, betriebsführer, vertrieben, schachtanlage, morgens, nennen, grube, alt, robert, fangen]</cell>
                     </row>
                     <row>
                        <cell>
                           <p>10 Sätze</p>
                           <p>20 Topics</p>
                        </cell>
                        <cell>4 [zechen, arbeit, arbeiten, bergbau, kohle, steiger, schwer, schicht, kohlen, meter, bergleute, meistern, bergmann, kumpel, wagen, nennen, verdienen, fangen, betriebsführer, maschine, hauer, schacht, schaffen, stempel, heißen, recklinghausen, vertrieben, hand, tonnen, grube]</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab1">Tab. 1</ref>: Vergleich von LUSIR-Topics mit unterschiedlichem Chunking.
                     </trailer>
                  </table>
                  <p>Interessant ist weiterhin, dass bei Random Seed 100 im Modell mit 25 Sätzen zunächst gar kein Topic zur Arbeit Untertage entsteht (vgl. <ref type="graphic" target="#topic_modeling_2026_001">Abbildung&#160;1</ref>). Zur Verdeutlichung der Auswirkungen des Random Seeds zeigt folgende Heatmap abschließend die Ähnlichkeiten und Unterschiede zweier Topic-Modelle&#160;– hier 20 Topics, 25 Chunks und Random Seed 123 (RS123) auf der X-Achse bzw. Random Seed 100 (RS100) auf der Y-Achse (je heller, desto höher die Übereinstimmung). Insgesamt haben die Modelle eine Übereinstimmung von gerade einmal 55&#160;%. Für die Heatmap wurde jede Wortliste von RS123 (X-Achse) mit jeder Wortliste von RS100 (Y-Achse) verglichen und automatisch berechnet, wie hoch die prozentuale Übereinstimmung der in den Listen enthaltenen Wörter (n=20) ist. Man kann erkennen, dass das Bergbau-Topic von RS123 (Topic 4) in RS100 zu 50&#160;% in Topic 18 und zu 35&#160;% in Topic 4 enthalten ist. Topic 0 von RS123 ist beispielsweise in keinem der Topics von RS100 enthalten, Topic 16 von RS123 zum Thema ›Familiengründung‹ korrespondiert demgegenüber mit 95&#160;% auf Topic 2 von RS100 (vgl. <ref type="graphic" target="#topic_modeling_2026_001">Abbildung&#160;1</ref>).</p>
                  <figure>
                     <graphic xml:id="topic_modeling_2026_001" url="Medien/topic_modeling_2026_001.png">
                        <desc>
                           <ref type="intern" target="#abb1">Abb.&#160;1</ref>: Vergleich zweier Topic-Modelle: 20 Topics, Chunks à 25 Sätze und Random Seed 123 auf der X-Achse bzw. Random Seed 100 auf der Y-Achse (je heller, desto höher die Übereinstimmung zweier Topics). [Grafik: Möbus et al. 2026]</desc>
                     </graphic>
                  </figure>
                  <p>Da Chunking und Topic Estimation sich gegenseitig beeinflussen, soll an dieser Stelle kurz vorgegriffen und gezeigt werden, wie sich das Chunking in Modellen mit 50 Topics&#160;– der von uns als optimal bestimmten Topic-Anzahl&#160;– auswirkt. Denn im Gegensatz zu den Modellen mit 20 Topics hat das Chunking bei der höheren Topic-Anzahl einen deutlicheren Einfluss. Vergleicht man die Bergbau-Topics des ungechunkten und des gechunkten Modells, fällt die deutlich höhere Konsistenz des zweiten auf. Im Modell ohne Chunking gibt es zwei Topics zur ›Arbeit Untertage‹, in beiden vermischt sich erneut das Phänomen der Heimatvertriebenen und viele nicht unmittelbar relevante Begriffe tauchen weit oben in der Liste auf (<ref type="graphic" target="#tab002">Tabelle 2</ref>, Zeilen 1 und 2). Das eine Untertage-Topic des gechunkten Modells liest sich hingegen annähernd wie ein semantisches Feld (<ref type="graphic" target="#tab002">Tabelle 2</ref>, Zeile drei). </p>
                  <table xml:id="tab002">
                     <row>
                        <cell>
                           <p>Ungechunkt</p>
                           <p>50 Topics</p>
                           <p>(Topic 1/2)</p>
                        </cell>
                        <cell>15 [bergbau, steiger, bekommen, kohle, vertrieben, zechen, kumpel, herne, bergmann, bruder, schachtanlage, bergleute, wohnung, versuchen, recklinghausen, schicht, menschen, heimat, gedinge, ehrlich, schaffen, schlesien, bergschule, lager, ruhrgebiet, kameradschaftsgedinge, verdienen, soldat, hauer, kontakt]</cell>
                     </row>
                     <row>
                        <cell>
                           <p>Ungechunkt</p>
                           <p>50 Topics</p>
                           <p>(Topic 2/2)</p>
                        </cell>
                        <cell>47 [steiger, bergbau, robert, königsberg, zechen, kohle, meter, schicht, ernst, helmut, denken, stempel, kumpels, hauer, gedenken, kameraden, drinne, wohnung, schichten, betriebsführer, nachtschicht, dänemark, zuhause, schacht, hamburg, ruhrgebiet, malen, heisingen, gedinge, gewerkschaft]</cell>
                     </row>
                     <row>
                        <cell>
                           <p>50 Sätze</p>
                           <p>50 Topics</p>
                        </cell>
                        <cell>26 [steiger, bergbau, zechen, kohle, meter, schicht, arbeit, arbeiten, verdienen, bergmann, wagen, hauer, kumpel, betriebsführer, bergleute, stempel, geld, kumpels, robert, gedinge, leistung, grube, schacht, schachtanlage, vertrieben, nachtschicht, bohren, bergschule, lohn, schichten]</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab2">Tab. 2</ref>: Untertage-Topics aus 2 Modellen im Vergleich: Zeilen 1 und 2 repräsentieren ein Modell mit 50 Topics, das auf nicht gechunkten Interviewtranskripten beruht, die Topic-Liste in Zeile 3 stammt vom finalen Modell mit 50 Topics, für das die Interviewtranskripte in Teile zu je 50 Sätzen zerlegt wurden.
                     </trailer>
                  </table>
                  <p>Die Berechnung des finalen Modells erfolgt nun im folgenden Kapitel. Festgehalten werden kann, dass Chunking und Topic Estimation reziprok sind und beim Training immer beide Variablen im Blick behalten werden müssen.</p>
               </div>
            </div>
         </div>
         <div type="chapter">
            <head>5. Schätzung der optimalen Anzahl von Themen</head>
            <p>Nachdem das Preprocessing abgeschlossen ist, muss für die Berechnung der Topic-Modelle die Anzahl der Topics bestimmt und eingestellt werden. Dieser Wert repräsentiert die erwartete Anzahl der Themen bzw. der Topics in den zu untersuchenden Dokumenten. Unsere Untersuchungen haben gezeigt, dass es selbst bei Dokumenten, deren Inhalt bekannt ist, sehr schwierig ist, diesen Wert zu schätzen.<note type="footnote">Vgl. auch <ref type="bibliography" target="#taddy_estimation_2012">Taddy 2012</ref>; <ref type="bibliography" target="#weston_et_al_selecting_2023">Weston et&#160;al. 2023</ref>.</note> Um sich einer optimalen Topic-Anzahl anzunähern, gibt es verschiedene Verfahren quantitativer und qualitativer Art. Im Working Paper vergleichen wir beide Ansätze, auch hinsichtlich deren Kombination und gegenseitiger Ergänzung.<note type="footnote">Vgl. <ref type="bibliography" target="#meaney_et_al_indices_2023">Meaney et&#160;al. 2023</ref>; <ref type="bibliography" target="#chang_et_al_tea_2009">Chang et&#160;al. 2009</ref>; <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>; <ref type="bibliography" target="#wallach_et_al_evaluation_2009">Wallach et&#160;al. 2009</ref>; <ref type="bibliography" target="#lau_et_al_machine_2009">Lau et&#160;al. 2009</ref>.</note> Dabei können wir allerdings nur statistische Methoden untersuchen, die lokal ausgeführt werden können. Die immer stärker aufkommenden Angebote durch <term type="dh">Large Language Models (LLMs)</term> können aktuell nicht oder nur begrenzt genutzt werden, da lebensgeschichtliche Interviews hochsensible und schutzbedürftige Daten sind, die nicht in die aktuellen Online-Pipelines eingespeist werden dürfen.</p>
            <div type="subchapter">
               <head>5.1 Quantitative Evaluationsroutine</head>
               <p>Quantitative Evaluationsroutinen mithilfe von automatischen Metriken oder Scores können dabei helfen, verschiedene Topic-Modelle vermeintlich auf einen Blick zu bewerten und so die ideale Anzahl an Topics zu bestimmen. Wir schlagen folgendes Vorgehen vor: In einem ersten Schritt sollten Modelle automatisiert mit einer ansteigenden Topic-Anzahl in großen Schritten über einen weiten Bereich trainiert werden&#160;– beispielsweise 50 bis 1.000 Topics in Fünfziger-Schritten. Die verschiedenen Metriken, mit denen jedes Modell anschließend evaluiert wird, werden weiter unten genauer vorgestellt. Wie bereits dargestellt, reagieren die verschiedenen Korpora unterschiedlich auf die einzelnen Schritte des Preprocessing. Ein ähnliches Verhalten wird auch bei den Metriken erwartet, weshalb verschiedene miteinander verglichen werden. Dadurch können aussagekräftige Ergebnisse erkannt werden, wenn mehrere Metriken bei gleichen Punkten durch Maximierung oder Minimierung in Form einer Plateau- oder Talbildung ausschlagen und so auf eine Sättigung der Optimierung hinweisen. Möglich ist auch, dass die Werte eher linear in eine Richtung verlaufen. Durch den Vergleich mehrerer Metriken können wir erkennen, welche Metriken aussagekräftige Ergebnisse liefern. Andererseits validieren sich Metriken gegenseitig, wenn ihr Verhalten korrespondiert. Auf diese Weise kann im Optimalfall ein <term type="dh">Sweet Spot</term> lokalisiert werden, wenn etwa mehrere Metriken auf ein gleiches Ziel hin maximieren bzw. minimieren.</p>
               <p>Keli Du gibt in seiner Dissertation einen guten Überblick über die verschiedenen Ansätze, Topic-Modelle und ihre Topics zu evaluieren.<note type="footnote">Vgl. <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;34–54.</note> Bei der <term type="dh">Perplexität</term> wird ein Teil des Datensatzes aus der Berechnung ausgeschlossen bzw. vorenthalten (<term type="dh">held-out document</term>), um das trainierte Modell später auf diesem Datensatz zu testen. Das Modell, das den Testdatensatz genauer beschreibt, ist das bessere Modell. Allerdings zeigt die Praxis, dass eine bessere Perplexität nicht zwingend zu besseren Topics für die Analyse der Korpora führt, weshalb wir diese Methode nicht verwendet haben.<note type="footnote">
Vgl. <ref type="bibliography" target="#jurafsky_martin_speech_2009">Jurafsky&#160;/ Martin 2009</ref>.</note> Nikita Murzintcev implementiert in seinem R-Paket <title>ldatuning</title><note type="footnote">Vgl. <ref type="bibliography" target="#murzintcev_number_2016">Murzintcev 2016</ref>.</note> vier verschiedene Metriken zur Berechnung der idealen Topic-Anzahl.<note type="footnote">Vgl. <ref type="bibliography" target="#arun_et_al_finding_2010">Arun et&#160;al. 2010</ref>; <ref type="bibliography" target="#cao_et_al_method_2009">Cao et&#160;al. 2009</ref>; <ref type="bibliography" target="#deveaud_et_al_concept_2014">Deveaud et&#160;al. 2014</ref>; <ref type="bibliography" target="#griffiths_steyvers_topics_2004">Griffiths&#160;/ Steyvers 2004</ref>.</note> Diese Evaluationsmethoden berechnen Topic-Modelle für verschiedene Topic-Anzahlen und präsentieren die Ergebnisse in einem Kurvendiagramm. Durch die Maximierung und Minimierung der verschiedenen Werte sollten so die optimalen Topic-Einstellungen gefunden werden können. Der Nachteil an dieser Pipeline ist die extrem lange Rechenzeit. Für unsere Datensätze lag die Laufzeit deutlich höher als die zehn Stunden für das im Paper von Murzintcev vorgestellte Korpus und die Berechnung konnte nicht erfolgreich abgeschlossen werden.<note type="footnote">Die Berechnung von nur zwei Modellen für das LUSIR-Korpus musste nach 20 Stunden Laufzeit abgebrochen werden.</note>
               </p>
               <p>Eine weitere Evaluationsmethode ist die Dokumentenklassifikation. Mithilfe der Dokument-Topic-Verteilung werden die einzelnen Dokumente anhand der Topics, die für diese am höchsten gewichtet wurden, bestimmten Kategorien zugeordnet. Bei Zeitungsartikeln wären das beispielsweise die Rubrik (z.&#160;B. Sport, Politik, Gesellschaft) oder bei literarischen Texten das jeweilige Genre. Anschließend wird diese Kategorisierung mit Hilfe von Klassifikationsmodellen überprüft. Diese Klassifikationsmodelle werden zuvor anhand der Metadaten und Labels der jeweiligen Dokumente mithilfe von Machine-Learning-Algorithmen berechnet. Die Ergebnisse der jeweiligen Topic-Modelle werden anschließend mit den Klassifikationsmodellen analysiert, um die Genauigkeit der Modelle abschätzen zu können.<note type="footnote">Vgl. <ref type="bibliography" target="#schoech_topic_exploration_2021">Schöch 2021</ref>, S.&#160;5–6; <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;39–41.</note> Die Dokumentklassifikation kann für unsere Korpora nicht verwendet werden, da keine externen Labels oder Klassifikationen vorhanden sind, die mit den Topics verglichen werden könnten.</p>
               <p>Schließlich berechnet das Topic-Kohärenzmaß das Vorkommen zweier Wörter aus einer Topic-Liste in einem Referenzkorpus und gibt so Aufschluss über die Qualität der Modelle. Die Idee ist, dass es ein Hinweis auf die semantische Relation beider Wörter ist, wenn sie in einem anderen Datensatz zusammen vorkommen.<note type="footnote">Vgl. <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;48–49.</note>
               </p>
            
            <div type="subchapter">
               <head>5.1.1 Verwendete Metriken</head>
               <p>Die Gensim-Pipeline besitzt vier implementierte Metriken zur Berechnung eines Kohärenzmaßes: <term type="dh">C_NPMI</term>, <term type="dh">C_UMass</term>, <term type="dh">C_UCI</term> und <term type="dh">C_V</term>. Mithilfe dieser Metriken können Durchschnittswerte für die jeweiligen Topic-Listen berechnet und so Aussagen darüber getroffen werden, ob ein Topic eine gute oder schlechte Qualität besitzt. Gensim orientiert sich bei der Implementierung der Metriken an einem Ansatz von Michael Röder, Andreas Both und Alexander Hinneburg, der die Berechnung jedes Kohärenzmaßes als Abfolge von vier verschiedenen Analyseschritten beschreibt: <hi rend="italic">Segmentation</hi>, <hi rend="italic">Wahrscheinlichkeitsrechnung</hi>, <hi rend="italic">Confirmation Measure</hi> und <hi rend="italic">Aggregation</hi>.<note type="footnote">Vgl. 
                     <ref type="bibliography" target="#roeder_et_al_space_2015">Röder et&#160;al. 2015</ref>. </note> Da jeder dieser Analyseschritte auf unterschiedliche Art und Weise durchgeführt wird, kann jedes Kohärenzmaß als Abfolge dieser vier Schritte in unterschiedlicher Kombination der Parameter verstanden werden.</p>
               <p>
                  <hi rend="bold">Segmentation:</hi> Das Verfahren, in dem die einzelnen Wörter systematisch zu verschiedenen Wortpaaren zusammengesetzt werden. </p>
               <p>
                  <hi rend="bold">Wahrscheinlichkeitsrechnung:</hi> Um die Wahrscheinlichkeit eines Wortpaares zu bestimmen, wird betrachtet, wie oft beide Wörter in einem Szenario vorkommen, dividiert durch die Anzahl aller Szenarien. Dies kann auf Basis der Dokumente (<term type="dh">boolean document</term>), der Paragraphen (<term type="dh">boolean paragraph</term>) oder der einzelnen Sätze (<term type="dh">boolean sentence</term>) erfolgen. Ein weiteres Szenario ist das <term type="dh">sliding window</term> (<term type="dh">boolean sliding window</term>). Hierbei werden die Dokumente in neue Dokumente aufgeteilt, indem ein Wortfenster mit einer bestimmten Größe (Anzahl von Worten) immer um ein Wort weitergeschoben wird. Die Berechnung erfolgt nach boolean document mit den neu geschaffenen Dokumenten als neue Gesamtmenge.</p>
               <p>
                  <hi rend="bold">Confirmation Measure:</hi> Beschreibt die Berechnungsart, auf deren Grundlage die abhängige Wahrscheinlichkeit von zwei Wörtern zueinander festgelegt wird. Dabei wird zwischen einer direkten und indirekten Berechnung unterschieden. Die direkte Berechnung berücksichtigt jeweils nur das unmittelbare Verhältnis von zwei Wörtern zueinander und berechnet demnach die Wahrscheinlichkeit direkt. Die indirekte Berechnung vergleicht das Verhältnis der beiden Wörter jeweils zum gesamten Wortschatz und vergleicht Ergebnisse miteinander. Je ähnlicher sich diese Ergebnisse sind, desto stärker ist die Abhängigkeit der beiden zu untersuchenden Wörter.</p>
               <p>
                  <hi rend="bold">Aggregation:</hi> Berechnungsart, um die Kohärenzwerte aller berechneten Wortpaare zu einer Topic-Kohärenz und zu einer Modellkohärenz zusammenzufassen. Da dieser Schritt bei allen vier Metriken gleich erfolgt, wird er nicht weiter thematisiert. </p>
               <p>Der <hi rend="italic">C_UCI</hi> basiert auf der <term type="dh">Pointwise Mutual Information (PMI)</term>, einem Ansatz der Informationstheorie, dessen Grundlage die statistische Abhängigkeit zweier zufälliger Variablen innerhalb eines Textes ist.<note type="footnote">Vgl. <ref type="bibliography" target="#newman_et_al_evaluation_2010">Newman et&#160;al. 2010</ref>.</note> Der PMI misst, inwiefern die tatsächliche Wahrscheinlichkeit des Auftretens eines Wortpaares von dem abweicht, was auf Grundlage der Wahrscheinlichkeit der einzelnen Ereignisse und der Annahme der Unabhängigkeit beider Wörter erwartet wird.<note type="footnote">Vgl. <ref type="bibliography" target="#bouma_information_2009">Bouma 2009</ref>, S.&#160;2–3.</note> Die Wortpaare werden gebildet, indem jedes einzelne Wort einer Topic-Liste mit jedem anderen Wort dieser Liste verbunden wird. Die Wahrscheinlichkeitsrechnung erfolgt mit einem Sliding Window mit einer Größe von zehn Wörtern. Der PMI dient als Confirmation Measure und wird in Gensim als <hi rend="italic">log_ratio_measure</hi> benannt. Ein PMI-Wert von 0 beschreibt, dass zwei Wörter unabhängig voneinander auftauchen. Je größer der PMI-Wert ist, desto kohärenter ist das Topic Model.</p>
               <p>Der <hi rend="italic">C_NPMI</hi> basiert auf dem <term type="dh">Normalized Pointwise Mutual Information Score (NPMI)</term> und ist eine Weiterentwicklung des PMI.<note type="footnote">Vgl. <ref type="bibliography" target="#bouma_information_2009">Bouma 2009</ref>.</note> Gerlof Bouma erklärt in seiner Forschungsarbeit dazu, dass der PMI keinen festen oberen Grenzwert besitze und so Wortpaare, die nur zusammen auftauchen, einen höheren PMI-Wert bekommen, wenn die Kombinationen eine geringere Frequenz haben. Da es keine Obergrenze gibt, macht es nach Bouma den Vergleich der Wortpaare untereinander schwierig, denn die einzige feste Aussage ist, wie nah der Wert im Vergleich zu den anderen Werten an 0 ist und damit, wie unabhängig beide Wörter sind.<note type="footnote">Vgl. <ref type="bibliography" target="#bouma_information_2009">Bouma 2009</ref>, S.&#160;4–5.</note> Deshalb schlägt er eine Normalisierung des PMI vor, indem es einen oberen Grenzwert von 1 gibt, einen festen 0-Wert und eine untere Grenze von -1. Bei einem Wert von 1 treten die beiden Wörter ausschließlich gemeinsam auf, bei einem Wert von 0 gibt es keine Abweichung von der Wahrscheinlichkeit der einzelnen Wörter und der Annahme ihrer Unabhängigkeit, sie treten quasi zufällig zusammen auf, bei -1 einzeln, aber nicht gemeinsam.<note type="footnote">Vgl. <ref type="bibliography" target="#bouma_information_2009">Bouma 2009</ref>, S.&#160;6.</note> Diese Erweiterung wird im Confirmation Measure verwendet, sie normalisiert in Gensim den <hi rend="italic">log_ratio_measure</hi>. Die Segmentierung bleibt gegenüber dem UCI gleich und bildet Wortpaare, indem jedes einzelne Wort der Liste mit jedem anderen einzelnen Wort verbunden wird. Das Sliding Window hat ebenfalls eine Größe von zehn Wörtern. Je näher der Wert des Scores an 1 ist, desto kohärenter ist das Modell.</p>
               <p>Der <hi rend="italic">C_UMass</hi><note type="footnote">Vgl. <ref type="bibliography" target="#mimno_et_al_optimizing_2011">Mimno et&#160;al. 2011</ref>.</note> erweitert ebenfalls den PMI und fokussiert sich dabei auf die bedingte Wahrscheinlichkeit eines Wortes im Verhältnis zu den anderen Wörtern einer Topic-Liste, die höher gewichtet wurden. Demnach ist die Wahrscheinlichkeit, dass ein Wort in einem Dokument vorkommt, höher, wenn das vorherige Wort in der Topic-Liste bereits in diesem Dokument vorgekommen ist.<note type="footnote">Vgl. <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;56.</note> Diese Erweiterung wird in Gensim als Confirmation Measure verwendet und <hi rend="italic">log_conditional_probability</hi> genannt. Die Wortpaare werden gebildet, indem jedes Wort der Topic-Liste nur mit jedem höher gewichteten Wort der Liste kombiniert wird. Die Wahrscheinlichkeit wird mit <hi rend="italic">boolean documents</hi> berechnet. </p>
               <p>Die systematische Gliederung der einzelnen Kohärenzmaße erlaubt es, die vier einzelnen Komponenten Segmentation, Wahrscheinlichkeitsrechnung, Confirmation Measure und Aggregation neu zu kombinieren. Röder et&#160;al. entwickeln in ihrem Aufsatz eine neue Metrik, den <hi rend="italic">C_V</hi><note type="footnote">So wird die Metrik in dem zugehörigen Aufsatz und auch in der Gensim Pipeline genannt. Vgl. <ref type="bibliography" target="#roeder_et_al_space_2015">Röder et&#160;al. 2015</ref>, S.&#160;7.</note>, der nach ausgiebigen Versuchen und Vergleichen mit über 237.912 Kohärenzmaßen die besten Ergebnisse in ihrem Versuchsaufbau lieferte.<note type="footnote">Auf <ref target="https://github.com/dice-group/Palmetto/issues/13">Github</ref> wurde am 17.08.2021 ein Problem mit der Reproduzierbarkeit der Ergebnisse von C_V berichtet und empfohlen, den Score nicht mehr zu verwenden. Ein <ref target="https://github.com/dice-group/Palmetto/issues/13#issuecomment-1603959861">Update am 23.06.2023</ref> erklärt, dass die Probleme behoben wurden.</note> Die Wortpaare werden im C_V nach dem Prinzip gebildet, dass jedes Wort zur Bildung der Wortpaare bereits Teil der Menge ist. Das Sliding Window hat in Gensim standardmäßig eine Größe von 110 Wörtern. Es wird ein indirekter Confirmation Measure verwendet, die Cosinus-Ähnlichkeit.<note type="footnote">
Vgl. <ref type="bibliography" target="#aletras_stevenson_topic_2013">Aletras&#160;/ Stevenson 2013</ref>, S.&#160;3.</note> Hierbei wird mit einbezogen, dass Wörter sich auch dann semantisch unterstützen, wenn sie selbst kaum zusammen auftauchen.<note type="footnote">Als Beispiel werden Automarken genannt, die man als Wörter eindeutig einer gemeinsamen Gruppe zuordnen würde, die in einem Dokument aber eher selten zusammen auftreten. Sie haben aber eine direkte Abhängigkeit mit dritten Wörtern wie ›Straße‹ oder ›Geschwindigkeit‹. Diese indirekten Zusammenhänge, dass zwei Wörter zusammenhängen, auch wenn sie selbst nie ein Wortpaar bilden, werden bei dieser Berechnung berücksichtigt. Vgl. <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;52.</note>  Je höher der Wert ist, desto kohärenter ist das Topic Model.</p>
               <p>Alle hier vorgestellten Metriken verwenden in ihrer ursprünglichen Form <ref target="https://www.wikipedia.de/">Wikipedia</ref> als Referenzkorpus&#160;– was aufgrund der unterschiedlichen Sprachstufen (Mittelhochdeutsch, Deutsch des 19. Jahrhunderts und gesprochene Sprache) sowie der inhaltlichen Gattung (Enzyklopädie gegenüber unterschiedlichster Themencluster) die Probleme bei der Applikation deutlich macht.<note type="footnote">Vgl. <ref type="bibliography" target="#roeder_et_al_space_2015">Röder et&#160;al. 2015</ref>, S.&#160;12.</note>
               </p>
            </div>
            <div type="subchapter">
               <head>5.1.2 Evaluation der Korpora über die Metriken</head>
               <p>Um die optimale Topic-Anzahl für die drei hier behandelten Korpora zu ermitteln, haben wir eine Evaluationsroutine durchgeführt, die auf den vier vorgestellten Metriken in Gensim basiert. Dabei wurden verschiedene Modelle mit unterschiedlichen Topic-Anzahlen und die vier Metriken berechnet sowie in eine Grafik zur visuellen Auswertung übertragen. Dies ermöglicht es, über den Verlauf der Diagramme Annäherungen von optimalen Topic-Einstellungen zu finden. Die Modelle wurden auf der Grundlage der Ergebnisse der Preprocessing-Untersuchungen berechnet:</p>
               <list type="unordered">
                  <item>LUSIR: Stopwords entfernt, Chunks von jeweils 50 Sätzen, lemmatisiert</item>
                  <item>Spätmittelalterliche Chronikhandschriften (SMCH): Stopwords entfernt, Chunks von jeweils 500 Wörtern</item>
                  <item>Zürich Regierungsratsprotokolle (ZRRP): Stopwords entfernt, kein Chunking</item>
               </list>
               <p>Für keines der Korpora wurde ein separates Referenzkorpus verwendet. Röder et&#160;al. kommen zwar in ihren Untersuchungen zu dem Ergebnis, dass die Metriken mit Wikipedia als Referenzkorpus optimal funktionieren, jedoch lässt sich das auf die hier verwendeten Quellen nicht übertragen. Bei LUSIR handelt es sich um gesprochene Sprache, die sich stark von geschriebener Sprache unterscheidet. Die anderen Korpora bestehen aus historischen Quellen mit Sprachstufen, die in Wikipedia nicht repräsentiert sind. Deshalb wurden die Korpora selbst als jeweilige Referenzkorpora verwendet. </p>
               <p>Wie bereits erwähnt, ist das Sliding Window für den C_V standardmäßig auf 110 Wörter eingestellt. Die einzelnen Chunks des LUSIR-Korpus bestehen allerdings nur aus jeweils 50 Sätzen, die nach dem Preprocessing eine Länge von durchschnittlich 98 Wörtern ergeben. Da die Chunks als eigenständige Dokumente vom C_V zur Erstellung der neuen Dokumente durch das Sliding Window verwendet werden, entstehen hier natürlich deutlich kürzere Dokumente als von der Metrik gewünscht. In einem Testdurchlauf wurden anstatt der Chunks die kompletten Interviews als Referenzkorpus verwendet; allerdings haben die Ergebnisse keine relevanten Unterschiede gezeigt, weshalb die Standardeinstellungen für die Evaluation beibehalten wurden. </p>
               <p>In einem ersten Schritt wurden Topic-Modelle zwischen 50 und 1.000 Topics in 50er-Schritten berechnet.<note type="footnote">Für alle Modelle wurden dieselben Parameter verwendet: optimize_interval_mallet = 500, iterations_mallet = 5000, alpha = 50, Anzahl der Worte pro Topic = 20. </note> Dieses sehr groß gefasste Fenster soll einen ersten Überblick über die Entwicklung der Metriken geben und helfen, einen Bereich für eine detailliertere Untersuchung zu finden. Die Graphen des C_NPMI und C_UCI zeigen sehr deutlich, dass beide Metriken auf Grundlage des PMI berechnet werden. Die Verläufe sind quasi identisch, nur zeigt sich die Normalisierung des C_NPMI in der Verschiebung auf der Y-Achse. Die von uns verwendeten Metriken optimieren zu einem Maximum hin. Würden sich also die Topic-Modelle verbessern, wäre dies anhand eines Anstiegs in den Graphen abzulesen.</p>
               <figure>
                  <graphic xml:id="topic_modeling_2026_002" url="Medien/topic_modeling_2026_002.png">
                     <desc>
                        <ref type="intern" target="#abb2">Abb.&#160;2</ref>: Evaluation 50–1.000 Topic-Anzahl in 50er-Schritten. [Grafik: Möbus et al. 2026]</desc>
                  </graphic>
               </figure>
               <p>Alle vier Metriken zeigen jedoch einen konstanten Abfall der Kohärenzwerte bei steigender Topic-Anzahl, der sich einem Minimalwert annähert. Lediglich der C_UMass des LUSIR-Korpus scheint auch nach 1.000 Topics weiter abzufallen, der C_UCI des SMCH-Korpus zeigt eine leichte Steigung nach 400 Topics. Anhand dieser Ergebnisse können wir keine Aussage darüber treffen, welche Topic-Modelle mit welcher Topic-Anzahl besser sind, da keiner der Kohärenzwerte den Anfangswert übersteigt und somit keine Optimierung der Metriken stattfindet. Die Schlussfolgerung ist, dass alle Modelle mit mehr als 50 Topics schlechter sind und keine Verbesserung stattfindet.</p>
               <p>Da die Schritte von 50 Topics pro Modell sehr groß sind und der Bereich von 50 bis 1.000 sehr weitreichend, zoomen wir im nächsten Analyseschritt weiter in die Topic-Modelle hinein. Es werden Modelle mit einer Topic-Anzahl von 20 Topics bis 500 Topics in 20er-Schritten berechnet. </p>
               <figure>
                  <graphic xml:id="topic_modeling_2026_003" url="Medien/topic_modeling_2026_003.png">
                     <desc>
                        <ref type="intern" target="#abb3">Abb.&#160;3</ref>: Evaluation 20–500 Topic-Anzahl in 20er-Schritten. [Grafik: Möbus et al. 2026]</desc>
                  </graphic>
               </figure>
               <p>Die Ergebnisse der feingranularen Analyse zeigen weiterhin einen konstanten Abfall der Metriken, ohne dass eine eindeutige Optimierung erkennbar wird. Zwar findet im Anfangsbereich des C_V bei allen drei Korpora ein leichter Anstieg statt, jedoch ist der Ausschlag sehr gering und liefert somit keinen eindeutigen Hinweis auf die optimale Topic-Anzahl. </p>
               <p>In einem letzten Schritt haben wir in einer Feinanalyse die Metriken in einem noch kleineren Bereich von 5 bis 300 Topics mit 5er-Schritten berechnet. </p>
               <figure>
                  <graphic xml:id="topic_modeling_2026_004" url="Medien/topic_modeling_2026_004.png">
                     <desc>
                        <ref type="intern" target="#abb4">Abb.&#160;4</ref>: Evaluation 5–300 Topic-Anzahl in 5er-Schritten. [Grafik: Möbus et al. 2026]</desc>
                  </graphic>
               </figure>
               <p>Auch diese feinste Analyse bestätigt die Erkenntnisse, die sich schon in der ersten Analyse abgezeichnet haben: die Metriken fallen&#160;– auf den Gesamtverlauf bezogen&#160;– konstant ab. Am deutlichsten ist dies bei den Graphen von C_NPMI, C_UCI und C_UMass zu sehen. Zwar befindet sich der Graph für das LUSIR- und ZRRP-Korpus im C_NPMI zwischen 0 und 130 Topics im positiven Bereich. Jedoch ist der Kohärenzwert mit 0,05 sehr gering und so wenig aussagekräftig, dass daraus kein Hinweis für gute Topic-Modelling-Ergebnisse abgeleitet werden kann.</p>
               <p>Die Werte des C_V verhalten sich ähnlich. Die Kohärenzwerte für das ZRRP- und das LUSIR-Korpus zeigen einen kurzen Anstieg nach dem Anfangswert, fallen danach aber konstant ab, unterbrochen von einzelnen Ausreißern. Das SMCH-Korpus bildet zwischen 5 und 70 Topics ein Plateau, jedoch bewegt sich der Ausschlag in einem Bereich von 0,02 Unterschied im Kohärenzwert. Insofern ist hier die Frage, wo der qualitative Unterschied liegt, wenn sich die Werte selbst so minimal unterscheiden. Hinzu kommt, dass die Werte bis zum Maximum sehr schwanken. Dieses Phänomen ist bei allen drei Korpora zu beobachten. Die Schwankungen in den Werten selbst zeigen eine gewisse Inkonsistenz, die keine eindeutige Entscheidung für die Topic-Anzahl mithilfe des C_V zulässt. Die einzelnen Werte des C_V folgen keinem nachvollziehbaren System, sodass die minimalen Schwankungen zwischen den verschiedenen Werten zufällig erscheinen und nicht für eine qualitative Evaluation genutzt werden können. </p>
               <p>Leider gibt es keinen objektiven Schwellenwert, mit dem wir arbeiten können. Voruntersuchungen haben gezeigt, dass Modelle für lebensgeschichtliche Interviews, die nach qualitativer Auswertung gute Ergebnisse darstellen, einen C_V Wert von um 0,45 hatten. Wenn wir diesen Schwellenwert auf alle Korpora anwenden, erhalten wir für das ZRRP-Korpus 60 Modelle, für das SMC-Korpus um die 40 und für das LUSIR-Korpus 20 Modelle, die quantitativ gute Topic-Modelle ergeben sollen. Das sind aber zu viele Modelle, um anhand der Ergebnisse eine eindeutige Entscheidung zu treffen. Letztendlich können wir die Ergebnisse des C_V nicht zur Beurteilung der optimalen Topic-Anzahl nutzen. Die anderen drei Metriken können dafür ebenfalls nicht herangezogen werden, da sie einen konstanten Abfall anzeigen. Die schlechte Performance dieser drei Metriken lässt sich auf die Berechnungsart zurückführen: Alle drei Metriken berechnen die Werte für jedes einzelne Topic und bilden dann einen durchschnittlichen Gesamtscore. Keli Du hat ebenfalls mithilfe des C_NPMI die verschiedenen Topic-Anzahlen verglichen und auf dieser Grundlage einen Boxplot erstellt. Darin ist gut zu erkennen, dass der Durchschnittswert bei steigender Topic-Anzahl sinkt: </p>
               <figure>
                  <graphic xml:id="topic_modeling_2026_005" url="Medien/topic_modeling_2026_005.png">
                     <desc>
                        <ref type="intern" target="#abb5">Abb.&#160;5</ref>: C_NPMI-Werte-Verteilung der Topics im Verhältnis zu ihrer Anzahl. [Aus: Du 2024, S.&#160;88]</desc>
                  </graphic>
               </figure>
               <p>Zwar steigt bei wachsender Topic-Anzahl die Menge an qualitativ hochwertigen Topics (hoher C_NPMI). Jedoch wird die Menge an schlechten Topics ebenso größer, sodass der Durchschnittswert insgesamt immer schlechter wird. Somit müsste für den Mallet-Wrapper der Gensim-Pipeline erst eine solche Box-Plot-Variante geschrieben werden, um zu testen, ob dieser Ansatz für unsere Daten möglich wäre.</p>
            </div>
            <div type="subchapter">
               <head>5.1.3 Bewertung der quantitativen Evaluation</head>
               <p>Diese Ergebnisse bestätigen Positionen aktueller Forschungsdebatten, die die Relevanz von Kohärenzmaßen infrage stellen.<note type="footnote">Vgl. <ref type="bibliography" target="#doogan_buntine_topic_2021">Doogan&#160;/ Buntine 2021</ref>; <ref type="bibliography" target="#hoyle_et_al_topic_2021">Hoyle et&#160;al. 2021</ref>; <ref type="bibliography" target="#rosner_et_al_topic_2014">Rosner et&#160;al. 2014</ref>; <ref type="bibliography" target="#rahimi_et_al_topic_2023">Rahimi et&#160;al. 2023</ref>; <ref type="bibliography" target="#li_et_al_improving_2024">Li et&#160;al. 2024</ref>.</note> Besonders für unterschiedliche Datentypen ist es schwierig, ein einheitliches allgemeines Evaluationssystem zu entwickeln, da die Qualität eines Topic Models immer von den jeweiligen Forschungsdaten und besonders von der Forschungsfrage abhängig ist.<note type="footnote">Vgl. <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;73.</note> Es wird sich zeigen, ob neue automatische Evaluationsmethoden entwickelt werden können, die diese Lücke schließen. So gibt es bereits Ansätze, die LLMs bei der Bewertung von Topic Modeling einbeziehen.<note type="footnote">Vgl. <ref type="bibliography" target="#rahimi_et_al_topic_2023">Rahimi et&#160;al. 2023</ref>.</note> Jedoch kann diese Methode nicht auf die lebensgeschichtlichen Interviews angewandt werden, da diese sensiblen Daten schutzbedürftig sind und nicht in die aktuellen Pipelines eingespeist werden dürfen. Insgesamt ist es eine Herausforderung, Topic-Modelle und die Ergebnisse zu bewerten und miteinander zu vergleichen, unabhängig vom quantitativen oder qualitativen Ansatz. Unsere eigenen Untersuchungen haben gezeigt, dass bei der menschlichen Bewertung und dem Labeling von Topics die Einschätzungen und die Meinungen auseinandergehen, was ein gutes Topic ist, ob es konsistent ist und welches Thema dieses Topic beschreibt.<note type="footnote">Vgl. <ref type="bibliography" target="#bayerschmidt_moebus_leben_2025">Bayerschmidt&#160;/ Möbus 2025</ref>; <ref type="bibliography" target="#doogan_buntine_topic_2021">Doogan&#160;/ Buntine 2021</ref>, S.&#160;3825.</note> Da das Forschungsinteresse einen großen Einfluss auf die Bewertung hat und sich bisher nicht in die automatischen Metriken einbinden lässt, wenden wir bei der Suche nach der optimalen Topic-Anzahl einen qualitativen Ansatz an. </p>
            </div></div>
            <div type="subchapter">
               <head>5.2 Qualitative Evaluation</head>
               <p>Über die Beurteilung der Ergebnisse eines Topic-Modells&#160;– die unmittelbar mit der Schätzung der optimalen Topic-Anzahl verbunden ist&#160;– wird seit langem intensiv interdisziplinär debattiert.<note type="footnote">Vgl. <ref type="bibliography" target="#chang_et_al_tea_2009">Chang et&#160;al. 2009</ref>; <ref type="bibliography" target="#shi_et_al_evaluation_2019">Shi et&#160;al. 2019</ref>; <ref type="bibliography" target="#dobson_outputs_2021">Dobson 2021</ref>; <ref type="bibliography" target="#khodorchenko_et_al_evaluation_2022">Khodorchenko et&#160;al. 2022</ref>; <ref type="bibliography" target="#miner_et_al_topic_2023">Miner et&#160;al. 2023</ref>.</note> Ausgehend von diesen Diskussionsbeiträgen haben Philipp Bayerschmidt und Dennis Möbus in einer Forschungsarbeit für die Berechnung eines sammlungsübergreifenden Topic-Modells für über 1.000 lebensgeschichtliche Interviews aus 6 verschiedenen Archiven ein qualitatives Vorgehen zur Bestimmung der Topic-Anzahl gewählt. Dabei werden in einem systematischen, computergestützten Verfahren zunächst Modelle mit sehr kleiner und großer Anzahl berechnet, beispielsweise 50 und 500. Anschließend werden die Topic-Listen, einzelne Textpassagen und die Topic-Verteilung kursorisch analysiert, um einen Eindruck zu bekommen, ob die Anzahl zu hoch oder zu niedrig ist. Bei zu niedriger Anzahl verschmelzen in den Topic-Listen mehrere Themen zu einem Topic, bei zu hoher Anzahl sind die Listen redundant, Themen zerfasern oder sind überspezifisch repräsentiert. Die beiden Grenzen werden einander nach und nach in größeren Schritten angenähert und fortlaufend bewertet und verglichen, um letztendlich den Punkt zu finden, an dem der ideale Wert erreicht ist&#160;– abhängig vom Anwendungszweck und dem Forschungsinteresse.<note type="footnote">Vgl. <ref type="bibliography" target="#bayerschmidt_moebus_leben_2025">Bayerschmidt&#160;/ Möbus 2025</ref>.</note> So können wenige, sehr allgemeine Topics helfen, große Quellenbestände zu sichten, während sehr detaillierte Topics den Blick auf Randphänomene lenken können.</p>
            
            <div type="subchapter">
               <head>5.2.1 Lebensgeschichtliche Interviews</head>
               <div type="subchapter">
                  <head>Distant Reading der Topic-Listen</head>
                  <p>Betrachtet man die oben im Preprocessing exemplarisch herangezogenen Modelle mit 20 Topics auf nicht gechunkten Transkripten in der Breite, fällt auf, dass dominante Themen mehrere Topics in Anspruch nehmen, während kleinere Themen miteinander vermischt oder anderen Topics beigemischt werden. Beispielsweise finden sich 5 Topics, die verschiedene Facetten der Montanindustrie im Ruhrgebiet behandeln, wohingegen Schule und Studium vermischt werden, obwohl Schule ein bedeutender Teil aller Biographien ist und das Studium eine Ausnahme darstellt: </p>
                  <list>
                     <item>4 [studieren, abitur, semester, schwester, fulda, münchen, schrecklich, praxis, bonn, professor, godesberg, richtung, studium, freundin, medizin, patienten, bevölkerung, blum, wattenscheid, münster, paris, münsterland, verwandt, krankenhaus, doktor, köln, ge, kaputt, positiv, französisch, examen, wuppertal, amerikanisch, luftschutzkeller, arbeitsdienst, kontakt, arzt, freiheit, kollegen, bein, staatsexamen, schülerinnen, sommer, eng, feiern, vorlesungen, halle, schwestern, flak, wesentlich]</item>
                  </list>
                  <p>Das spricht einerseits deutlich dafür, dass 20 Topics zu wenig sind, um die komplexen Themengebiete lebensgeschichtlicher Interviews zu repräsentieren. Dafür spricht auch, dass 5 Topics kein klares Thema repräsentieren, sondern Zusammenstellungen verschiedener Aspekte sind: </p>
                  <list>
                     <item>10 [schreiben, zeitung, handelsblatt, politik, wahnsinnig, vogel, scholven, nazis, heut, kollegen, redaktion, fußball, politisch, buer, freiheit, düsseldorf, schlagen, münchen, menge, melchers, pfarrer, lehrer, ha, link, lindau, waz, chefredakteur, verhaften, sport, schwester, franzosen, lernen, geschichte, kpd, technisch, kruse, redakteur, arbeitsdienst, moers, wissen, lizenz, bauen, berlin, lyceum, ständig, ge, gewerkschaft, hund, mim, kennenlernen]</item>
                  </list>
                  <p>Andererseits kann dieses Rauschen ein Hinweis auf einen zu großen Umfang der einzelnen Dokumente sein und der Blick in die Topic-Liste den Sinn des Chunkings unterstreichen. Tatsächlich sind die 20 Topics im gechunkten Modell wesentlich konsistenter. Die Topics mit Bezug auf die Ruhrgebietsindustrie haben sich auf 3 reduziert und sind inhaltlich klar differenziert in die Bereiche ›Fabrikarbeit‹ (Topic 4), ›Untertage‹ (Topic 9) und ›Arbeiter*inneninteressenvertretung‹ (Topic 15) (vgl. <ref type="graphic" target="#tab003">Tabelle 3</ref>).</p>
                  <table xml:id="tab003">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>4</cell>
                        <cell>arbeit, arbeiten, meistern, schwer, betrieb, bochumer, verein, krieg, krupp, werk, maschine, maschinen, fabrik, bochum, mensch</cell>
                     </row>
                     <row>
                        <cell>9</cell>
                        <cell>zechen, bergbau, steiger, kohle, arbeit, meter, kumpel, arbeiten, schicht, bergleute, bergmann, wagen, kohlen, verdienen, ruhrgebiet</cell>
                     </row>
                     <row>
                        <cell>15</cell>
                        <cell>betriebsrat, betrieb, krupp, kollegen, gewerkschaft, firma, gewerkschaften, betriebsräte, essen, aeg, angestellt, alt, belegschaft, namen, arbeiter</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab3">Tab. 3</ref>: LUSIR 20 Topics Chunks à 50 Sätze, Topics mit Bezug auf die Ruhrgebietsindustrie.
                     </trailer>
                  </table>
                  <p>Schule (Topic 7) und Studium sind nach dem Chunking gut getrennt, allerdings wird das Studium nun einem Topic beigemischt, das Ausbildung und Büroarbeit repräsentiert (Topic 19). Dieses Topic sowie ein Topic, das Freizeit, Urlaub und Kultur vermischt (Topic 6), legen nahe, dass mehr Topics erforderlich sind, um die Interviews gut zu repräsentieren (vgl. <ref type="graphic" target="#tab004">Tabelle 4</ref>).</p>
                  <table xml:id="tab004">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>6</cell>
                        <cell>lesen, urlaub, tanzen, kino, radio, theater, feiern, fernsehen, interessieren, schöne, erinnern, zeitung, auto, mädchen, freundin</cell>
                     </row>
                     <row>
                        <cell>7</cell>
                        <cell>schule, lehrer, klasse, mädchen, lernen, eltern, lehrerin, kinder, schulen, volksschule, abitur, besuchen, bdm, essen, erinnern</cell>
                     </row>
                     <row>
                        <cell>19</cell>
                        <cell>studieren, chef, büro, lernen, abteilung, lehre, thyssen, arbeiten, ausbildung, beruf, arbeit, düsseldorf, semester, prüfung, arbeitsamt</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab4">Tab. 4</ref>: LUSIR 20 Topics Chunks à 50 Sätze, Topics mit Bezug auf Freizeit und Kultur, Schule und Studium, Ausbildung, Büroarbeit.
                     </trailer>
                  </table>
                  <p>Die Erhöhung der Topic-Anzahl auf 50 führt zu einer wesentlichen Differenzierung, die eine ganze Reihe konsistenter Topics hervorbringt. So spaltet sich das Topic zu Freizeit und Kultur in mehrere, semantisch kohärente Topics (vgl. <ref type="graphic" target="#tab005">Tabelle 5</ref>). </p>
                  <table xml:id="tab005">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>5</cell>
                        <cell>lesen, zeitung, schreiben, buch, bücher, zeitungen, handelsblatt, vogel, heißen, düsseldorf, literatur, freiheit, interessieren, interessant, artikel</cell>
                     </row>
                     <row>
                        <cell>20</cell>
                        <cell>kino, tanzen, radio, fernsehen, musik, erinnern, filme, film, theater, hören, spielen, interessieren, abends, lieb, spät</cell>
                     </row>
                     <row>
                        <cell>29</cell>
                        <cell>urlaub, auto, reisen, fahren, wochen, deutschland, ausland, freude, reise, spanien, schöne, österreich, kaufen, holland, wagen</cell>
                     </row>
                     <row>
                        <cell>34</cell>
                        <cell>wahren, sport, dingens, verein, fußball, sportverein, spielen, erinnern, turnverein, garnicht, arbeitersport, erinnerung, kriege, vereine, nennen</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab5">Tab. 5</ref>: LUSIR 50 Topics Chunks à 50 Sätze, Topics mit Bezug auf Printmedien (5), Freizeit und Kultur (20), Urlaub und Reisen (29) und Sport (34).
                     </trailer>
                  </table>
                  <p>Die Themen ›Schule‹, ›Studium‹ und ›Büroarbeit‹ werden nun sauber getrennt und auf 3 Topics verteilt (vgl. <ref type="graphic" target="#tab006">Tabelle 6</ref>). </p>
                  <table xml:id="tab006">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>3</cell>
                        <cell>studieren, semester, abitur, studium, professor, universität, bonn, examen, köln, münchen, münster, studenten, berlin, medizin, praxis</cell>
                     </row>
                     <row>
                        <cell>21</cell>
                        <cell>schule, lehrer, klasse, lehrerin, volksschule, lernen, schulen, abitur, besuchen, mädchen, eltern, unterricht, gymnasium, hoch, schulzeit</cell>
                     </row>
                     <row>
                        <cell>24</cell>
                        <cell>chef, büro, abteilung, firma, arbeit, lehre, lernen, thyssen, arbeiten, angestellt, einstellen, beruf, kollegen, kaufmännisch, betrieb, sekretärin</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab6">Tab. 6</ref>: LUSIR 50 Topics Chunks à 50 Sätze, Topics mit Bezug auf Studium (3), Schule (21) und Büroarbeit (24).
                     </trailer>
                  </table>
                  <p>Auch die Topics mit Ruhrgebietsbezug gewinnen noch einmal an Schärfe. Darüber hinaus entstehen historisch interessante Topics, die auf den immensen Themenpluralismus der Lebensgeschichten hinweisen&#160;– etwa zu ›Mobilität‹ (Topic 23), ›Wohnen‹ (Topic 28) und dem ›Rechtswesen‹ (Topic 48) (vgl. <ref type="graphic" target="#tab007">Tabelle 7</ref>).</p>
                  <table xml:id="tab007">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>23</cell>
                        <cell>fahren, zug, wagen, bahnhof, essen, unterwegs, ankommen, fahrrad, laufen, fuß, mitnehmen, straßenbahn, kilometer, sitzen, hinfahren, auto</cell>
                     </row>
                     <row>
                        <cell>28</cell>
                        <cell>wohnung, zimmer, wohnen, küche, schlafzimmer, schlafen, wohnzimmer, kinder, groß, wäsche, wohnungen, räume, wasser, eltern, möbel</cell>
                     </row>
                     <row>
                        <cell>48</cell>
                        <cell>rechtsanwalt, hattingen, bochum, alt, praxis, herne, anwalt, recklinghausen, stadt, gericht, tätigen, richter, akten, ähem, kriege</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab7">Tab. 7</ref>: LUSIR 50 Topics Chunks à 50 Sätze, Topics mit Bezug auf Mobilität (23), Wohnen (28) und Rechtswesen (48).
                     </trailer>
                  </table>
                  <p>Erhöht man die Topic-Anzahl auf 100, kann man eine deutliche Zerfaserung feststellen. Zwar kommen einzelne interessante Topics hinzu, wie ›Familienfeiern‹ (Topic 22), ›Photographie und Malerei‹ (Topic 26), ›Genussmittel‹ (Topic 45), ›Feldpost‹ (Topic 46), ›Arbeitslosigkeit‹ (Topic 59), ›Judenverfolgung‹ (Topic 75) oder die ›1950er Jahre‹ (Topic 98). Dafür enthält das Modell 6 Topics, die stark verrauscht sind, und 15 weitere, die auch bei näherer Betrachtung keinen Sinn ergeben. Darüber hinaus werden starke Themen in der Interviewsammlung auf sehr viele Topics gesplittet und verwaschen damit zusehends: Etwa 3 Topics, in denen Gewerkschaftsarbeit repräsentiert wird, und 9 Topics zu Industriearbeit (davon eins ausschließlich mit Bezug zum Unternehmen Krupp). Für die weitere Suche bedeutet das, den Sweetspot zwischen 50 und 100 Topics zu finden, indem beispielsweise ein Modell mit 75 Topics berechnet wird. Des Weiteren kann auch die Chunkgröße noch variiert werden, beispielsweise ein Modell mit 25 Sätzen pro Chunk und 75 Topics. Den gesamten Prozess hin zu einem finalen Modell, das mittlerweile produktiv auf der Plattform <ref target="https://www.oral-history.digital/">Oral-History.Digital</ref> genutzt wird, dokumentieren Bayerschmidt und Möbus in einem Aufsatz in der Zeitschrift <title>BIOS</title>.<note type="footnote">Vgl. <ref type="bibliography" target="#bayerschmidt_moebus_leben_2025">Bayerschmidt&#160;/ Möbus 2025</ref>.</note>
                  </p>
               </div>
               <div type="subchapter">
                  <head>Scalable Readings zur Überprüfung der Topic-Repräsentation in den Texten</head>
                  <p>Der abschließende Schritt der Evaluation ist ein Close Reading von Textstellen, die einem bestimmten Topic zugeordnet werden. Dazu können entweder deduktiv zu einem gewünschten Topic repräsentative Textstellen oder induktiv eine beliebige Interviewpassage mit den zugeordneten Topics ausgegeben werden. </p>
                  <p>Wir wählen die deduktive Methode und ziehen als Beispiel das Bergbau-Topic des finalen Modells mit 50 Topics heran:</p>
                  <list>
                     <item>26 [zechen, bergbau, steiger, kohle, arbeiten, kohlen, schicht, meter, arbeit, wagen, bergleute, verdienen, bergmann, hauer, betriebsführer, schacht, kumpel, kumpels]</item>
                  </list>                  
                  <table xml:id="tab008">
                     <row>
                        <cell>01:14:50.16</cell>
                        <cell>IP_KB</cell>
                        <cell>Früher hatten se mit Holz ausgebaut und heu- und seit 1949 da wurde der Bruchbau bei uns eingeführt, also Eisenausbau.</cell>
                     </row>
                     <row>
                        <cell>01:15:00.26</cell>
                        <cell>IP_KB</cell>
                        <cell>Und, äh, wenn, und da gibts extra im Streb n Zähler, n Stempelzähler, der zählt ob wir auch alle Stempel…</cell>
                     </row>
                     <row>
                        <cell>01:15:09.12</cell>
                        <cell>IP_EHEFRAU</cell>
                        <cell>Rausgeholt hatten. [lacht]</cell>
                     </row>
                     <row>
                        <cell>01:15:10.00</cell>
                        <cell>IP_KB</cell>
                        <cell>Rausgeholt haben.</cell>
                     </row>
                     <row>
                        <cell>01:15:11.22</cell>
                        <cell>IP_KB</cell>
                        <cell>Und wenn welche fehlen kriegen wir weniger Prämie.</cell>
                     </row>
                     <row>
                        <cell>01:15:16.16</cell>
                        <cell>IP_KB</cell>
                        <cell>Zum Beispiel, es sind im Streb drinne, gegen tausend Stempel, sind gewöhnlich drin bei 200 Meter Länge.</cell>
                     </row>
                     <row>
                        <cell>01:15:26.20</cell>
                        <cell>IP_KB</cell>
                        <cell>1.000 Stempel und die eisernen Kappen, die oben das, das Hangende halten, zwischen den Stempeln immer.</cell>
                     </row>
                     <row>
                        <cell>01:15:30.19</cell>
                        <cell>IP_EHEFRAU</cell>
                        <cell>Da sind so zwei Stempel und dann obendrauf sone Verbindung.</cell>
                     </row>
                     <row>
                        <cell>01:15:33.10</cell>
                        <cell>IP_KB</cell>
                        <cell>Und wenn nu jetzt, jetzt zählt der Mann, der zählt jede Schicht, das is n alter Kumpel, schon so n Invalide, der zählt ob wir auch das ganze Eisen gerettet haben.</cell>
                     </row>
                     <row>
                        <cell>01:15:43.10</cell>
                        <cell>IP_KB</cell>
                        <cell>Das es nicht verschwindet, also das, also wenn der Bruch kommt, man muss da ziemlich schnell arbeiten, äh, man- manchmal schlägt man den Stempel weg mit der Kappe, fällt runter der Stempel, schnell musst man ihn wegziehn eh das Gebirge kommt. Sonst, sonst…</cell>
                     </row>
                     <row>
                        <cell>01:15:56.20</cell>
                        <cell>IP_EHEFRAU</cell>
                        <cell>Es fällt ja nach.</cell>
                     </row>
                     <row>
                        <cell>01:15:57.20</cell>
                        <cell>IP_KB</cell>
                        <cell>Es fällt nach, nich.</cell>
                     </row>
                     <row>
                        <cell>01:15:58.29</cell>
                        <cell>IP KB</cell>
                        <cell>Und wir kriegten pro Stempel, pro Schicht 2 Mark Eisenprämie.</cell>
                     </row>
                     <row>
                        <cell>01:16:06.28</cell>
                        <cell>IP_KB</cell>
                        <cell>Fehlen aber Stempel…</cell>
                     </row>
                     <row>
                        <cell>01:16:08.11</cell>
                        <cell>IP_EHEFRAU</cell>
                        <cell>Dann kam die Prämie nicht. [lacht]</cell>
                     </row>
                     <row>
                        <cell>01:16:10.00</cell>
                        <cell>IP_KB</cell>
                        <cell>Is die Präm- die Prämie-, wenn jetzt zum Beispiel 50 Stempel fehlen und 50 Kappen, is die Prämie weg, fürn ganzen Monat.</cell>
                     </row>
                     <row>
                        <cell>01:16:17.17</cell>
                        <cell>IP_KB</cell>
                        <cell>Damit jeder, äh…</cell>
                     </row>
                     <row>
                        <cell>01:16:18.21</cell>
                        <cell>IP_EHEFRAU</cell>
                        <cell>Ehrgeiz bringt.</cell>
                     </row>
                     <row>
                        <cell>01:16:19.25</cell>
                        <cell>IP_KB</cell>
                        <cell>Und von uns 6 Mann bringt…</cell>
                     </row>
                     <row>
                        <cell>01:16:20.30</cell>
                        <cell>INT_IG</cell>
                        <cell>Ja.</cell>
                     </row>
                     <row>
                        <cell>01:16:22.00</cell>
                        <cell>IP_KB</cell>
                        <cell>Jedes Eisenteil auch nicht untern Bruch gehen zu lassen sondern es, es muss da sein.</cell>
                     </row>
                     <row>
                        <cell>01:16:29.08</cell>
                        <cell>INT_IG</cell>
                        <cell>Das war doch aber manchmal auch ein Risiko, ne, dabei.</cell>
                     </row>
                     <row>
                        <cell>01:16:31.14</cell>
                        <cell>IP_EHEFRAU</cell>
                        <cell>Oh, da war ein ganz großes.</cell>
                     </row>
                     <row>
                        <cell>01:16:32.00</cell>
                        <cell>IP_KB</cell>
                        <cell>Äh, ja.</cell>
                     </row>
                     <row>
                        <cell>01:16:33.06</cell>
                        <cell>INT_IG</cell>
                        <cell>Ich meine son Stempel da zu retten, wenn das Gebirge also sehr schnell da nach rutschte.</cell>
                     </row>
                     <row>
                        <cell>01:16:36.10</cell>
                        <cell>IP_KB</cell>
                        <cell>Ja, und dann musste man sich, und da musste man den Stein, die Steine wegdingen, jetzt waren manchmal große Brocken runtergekommen.</cell>
                     </row>
                     <row>
                        <cell>01:16:42.26</cell>
                        <cell>IP_KB</cell>
                        <cell>Ja, da hat man dann Hilfsmittel bei, son Hubzug mit der Kette, das man rauszieht, nich.</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab8">Tab. 8</ref>: Eine für das Topic 26 (›Bergbau‹) repräsentative Interviewpassage.
                     </trailer>
                  </table>
                  <p>Dieses Chunk ist mit einem <term type="dh">Topic Weight</term>&#160;– also dem Gewicht, das ein Topic für eine Textpassage bekommt&#160;– von 0,8 extrem hoch und entsprechend einschlägig ist auch der Inhalt der Textpassage (<ref type="graphic" target="#tab008">Tabelle 8</ref>). Da in einem Forschungsprojekt zur Sozialgeschichte des Ruhrgebiets zwangsläufig viel über Bergbau gesprochen wird und eine qualitative Evaluation möglichst viele Facetten eines Modells berücksichtigen sollte, ziehen wir exemplarisch noch ein zweites Topic heran und stellen der Arbeit nun die ›Kultur‹ (Topic 20) gegenüber:</p>
                  <list>
                     <item>20 [kino, tanzen, radio, fernsehen, musik, erinnern, filme, film, theater, hören, spielen, interessieren, abends, lieb, spät]</item>
                  </list>
                  <table xml:id="tab009">
                     <row>
                        <cell>00:01:26.08</cell>
                        <cell>IP_WB</cell>
                        <cell>Ja, also ich würde sagen, Gründgens hat mir schon imponiert.</cell>
                     </row>
                     <row>
                        <cell>00:01:31.01</cell>
                        <cell>INT_MC</cell>
                        <cell>Ja.</cell>
                     </row>
                     <row>
                        <cell>00:01:40.03</cell>
                        <cell>IP_WB</cell>
                        <cell>Ähm. Film. [---] Kann mich jetzt an so einen, keinen [---] keinen besonders erinnern. Ich hab also nie, ähm, tja, für Filmschauspieler oder Filmschauspielerin oder so was geschwärmt. Aber ich erinnere mich an Filme mit Gründgens. Ich habe auch Gründgens auf der Bühne gesehen. Das hatte mir auch schon gefallen. Aber ich könnte jetzt im Moment nicht. Ich könnte natürlich noch einige Namen nennen. Aber ich ...</cell>
                     </row>
                     <row>
                        <cell>00:02:21.22</cell>
                        <cell>INT_MC</cell>
                        <cell>Also was Besonderes so ist Ihnen nicht in Erinnerung.</cell>
                     </row>
                     <row>
                        <cell>00:02:25.25</cell>
                        <cell>IP_WB</cell>
                        <cell>Nein.</cell>
                     </row>
                     <row>
                        <cell>00:02:27.05</cell>
                        <cell>INT_MC</cell>
                        <cell>Gut. Und sonst, Sie haben zwischen dreiunddreißig und fünfundvierzig geheiratet, ist das richtig.</cell>
                     </row>
                     <row>
                        <cell>00:02:31.19</cell>
                        <cell>IP_WB</cell>
                        <cell>Zwischen, nein. Ich hab</cell>
                     </row>
                     <row>
                        <cell>00:02:37.12</cell>
                        <cell>INT_MC</cell>
                        <cell>Oder erst nach dem Krieg.</cell>
                     </row>
                     <row>
                        <cell>00:02:40.17</cell>
                        <cell>IP_WB</cell>
                        <cell>während des Kriegs geheiratet. Ich würd sagen, ich habe 42 geheiratet.</cell>
                     </row>
                     <row>
                        <cell>00:02:45.07</cell>
                        <cell>INT_MC</cell>
                        <cell>Spielte der Ehestandsdarlehen oder Ariernachweise eine Rolle bei der Heirat. Können Sie sich daran erinnern.</cell>
                     </row>
                     <row>
                        <cell>00:02:55.14</cell>
                        <cell>IP_WB</cell>
                        <cell>Nein. Das, die besondere Schwierigkeit war, dass ich die Zustimmung des Oberbefehlshabers der Luftwaffe brauchte.</cell>
                     </row>
                     <row>
                        <cell>00:03:09.18</cell>
                        <cell>INT_MC</cell>
                        <cell>Ach so, Sie waren ja damals bei der Luftwaffe.</cell>
                     </row>
                     <row>
                        <cell>00:03:14.24</cell>
                        <cell>IP_WB</cell>
                        <cell>Ja. Das war schwer. Schwer zu erlangen damals. Aber sonst hat der keine Rolle gespielt, ob ich, nein, ich wollte sagen, ob ich ein Ehestandsdarlehen in Anspruch genommen habe, das weiß ich nicht, aber ich würde sagen, nein. Ich habe in Holland geheiratet, und ...</cell>
                     </row>
                     <row>
                        <cell>00:03:38.13</cell>
                        <cell>INT_MC</cell>
                        <cell>Ach so. Ja.</cell>
                     </row>
                     <row>
                        <cell>00:03:40.20</cell>
                        <cell>IP_WB</cell>
                        <cell>Kein</cell>
                     </row>
                     <row>
                        <cell>00:03:43.21</cell>
                        <cell>INT_MC</cell>
                        <cell>Haben Sie damals so sportliche Ereignisse verfolgt.</cell>
                     </row>
                     <row>
                        <cell>00:03:48.20</cell>
                        <cell>IP_WB</cell>
                        <cell>Ich weiß, dass die Olympiade stattgefunden hat.</cell>
                     </row>
                     <row>
                        <cell>00:03:53.13</cell>
                        <cell>INT_MC</cell>
                        <cell>Können Sie sich an die noch erinnern, an die Olympiade.</cell>
                     </row>
                     <row>
                        <cell>00:03:57.01</cell>
                        <cell>IP_WB</cell>
                        <cell>Ich bin nicht da gewesen. Habe nicht teilgenommen. Hab also keine besonderen Erinnerungen. Ich weiß, dass das damals irgendein Sprinter, einen amerikanischen Sprinter gab, der, wenn Sie den Namen nennen, würde ich den wahrscheinlich erkennen.</cell>
                     </row>
                     <row>
                        <cell>00:04:15.20</cell>
                        <cell>INT_MC</cell>
                        <cell>Mir fällt jetzt auch nur etwas wie Jessie ein.</cell>
                     </row>
                     <row>
                        <cell>00:04:20.16</cell>
                        <cell>IP_WB</cell>
                        <cell>Owens, oder sowas, ja.</cell>
                     </row>
                     <row>
                        <cell>00:04:23.10</cell>
                        <cell>INT_MC</cell>
                        <cell>Jessie Owens.</cell>
                     </row>
                     <row>
                        <cell>00:04:27.02</cell>
                        <cell>IP_WB</cell>
                        <cell>Ja, ja, ja. Das weiß ich, nicht. Und dann weiß ich, dass damals ein relativ hoher Anteil deutscher oder dass die deutschen Mannschaften insgesamt einen ziemlich viel Medaillen oder, gibt´s da Medaillen, oder so, bekommen haben.</cell>
                     </row>
                     <row>
                        <cell>00:04:51.12</cell>
                        <cell>INT_MC</cell>
                        <cell>So an Max Schmeling oder an diese Autorennen können Sie sich da erinnern.</cell>
                     </row>
                     <row>
                        <cell>00:04:55.25</cell>
                        <cell>IP_WB</cell>
                        <cell>Ich erinnere mich selbstverständlich an Max Schmeling, da hatten wir auch irgendwann mal einen Boxkampf in der Nacht gesehen, da&#160;- gehört, gehört, gehört, nicht gesehen. Und ich erinnere mich an Bernd Rosemeier, allgemein Autofahren, ähm, also der hat irgend, weiß nicht ob man das damals Formel eins nannte oder sowas, hat jedenfalls Autorennen gemacht. Wenn Sie mich nach anderen Fragen, werde ich vielleicht auch noch den einen oder anderen Namen, aber spontan fällt mir da eigentlich nichts ein, habe mich eigentlich für Sport auch nicht sonderlich interessiert.</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab9">Tab. 9</ref>: Eine für das Topic 20 (›Kultur‹) repräsentative Interviewpassage.
                     </trailer>
                  </table>
                  <p>Mit einem Gewicht von 0,7 schlägt auch dieses Topic deutlich durch und steht stellvertretend für die Vermischung von Sport und Kultur. Mit Topic 20 korreliert in dieser Passage (<ref type="graphic" target="#tab009">Tabelle 9</ref>) Topic 11, das ›Familie und Heirat‹ zum Thema hat, mit einem Gewicht von 0,11.<note type="footnote">Die 15 Top-Keywords von Topic 11: heiraten, kind, tochter, verheiraten, wohnen, kinder, gebären, sohn, arbeiten, schwester, eltern, sterben, lernen, wohnung, krieg.</note> Dadurch ist auch der mittlere Teil der Passage gut repräsentiert.</p>   
               </div>
            </div>
            <div type="subchapter">
               <head>5.2.2 Regierungsratsbeschlüsse</head>
               <p>Protokolle sind ein weitverbreitetes Genre und eine häufig genutzte Quelle der Geschichtswissenschaft, eine Vielzahl von Themen und Debatten werden in solchen Protokollen mehr oder minder ausführlich vorbereitet und schließlich als Entscheid festgehalten. Gerade für den Nachvollzug von Entscheidungen sind solche Dokumente entsprechend eine unerlässliche Quelle. Gleichzeitig gibt es eine Vielzahl von Themen, die wiederholt behandelt werden müssen und etwa jährlich wieder traktandiert und thematisiert werden. Als Konsequenz werden die Beschlüsse nur selten als Quellenkorpus ausgewertet, sondern traditionell sehr selektiv bearbeitet. Der hier beschriebene Ansatz versucht die Analyse eines Korpus, das in vielen Bereichen stark repetitiv und zudem einem semantischen Wandel unterworfen ist, der berücksichtigt werden muss.<note type="footnote">Wenn im Stadtstaat Zürich um 1805 von ›Finanzen‹ die Rede ist, meint der Begriff etwas anderes als 50 Jahre später, im Konstrukt eines Bundesstaates, der selbst eine Finanzhoheit hat. Selbiges gilt für Begrifflichkeiten wie ›Staat‹ (meint zuerst den Kanton, später den Bundesstaat) oder Fragen zur Einbürgerung, die bis 1848 von den Kantonen erfolgte und danach sowohl Kommunen als auch den Bundesstaat involvierte.</note>
               </p>
               <p>Aufgrund der repetitiven Sprache und einiger extrem hochfrequenter Wörter sind v.&#160;a. die wenig umfangreichen Topic-Listen, d.&#160;h. wenn ›nur‹ 20 oder 50 Topics errechnet wurden, redundant. Anhand des Themas ›Finanzen‹ lässt sich das aufzeigen, wobei der Begriff eben nicht immer gleichbedeutend genutzt wurde und der ›Finanzrath‹ (vor 1848) eine andere Rolle einnahm als die ›Finanzdirektion‹ (nach 1848, als eigenes Departement) oder die ›Finanzcommißion‹ (nach 1848 als Kommission der Legislative). Obwohl der <term type="dh">Coherence Score</term> immer tiefer wird, je umfangreicher die Anzahl der Topics in den Modellen wird, lässt sich doch eine bessere Verortung der semantisch angepassten Verwendungen, etwa von Finanzen, feststellen. Das heißt: Der Begriff ›Finanzen‹ oder ein Kompositum von ›Finanz-‹ ist zwar in mehr Topics vorhanden, es wird jedoch sichtbar, welche Art von Finanzen zeitlich oder thematisch (Finanzen der Gerichte, Institutionen wie Krankenhäuser oder der Universität) tatsächlich thematisiert wird. Der tiefere Coherence Score ist entsprechend nur ein Beweis der ›besseren‹ Verteilung der (hochfrequenten) Stichwörter auf die Themen.</p>
               <p>Gerade bei 200 Topics lassen sich somit ausgesprochen saubere Themenkomplexe fassen, die beispielsweise zur Filterung eines Korpus zwecks Erstellung von Subkorpora genutzt werden können:</p>
               <list>
                  <item>6 [gefangen, anstalt, aufsichtsbehörde, sträflinge, direktor, strafanstalt, inquisiten, täglich, tit, sträflingen, direktors, bediensteten, beamten, lassen, zellen, sorgen, sträfling, aufseher, hauses, kleidung, arzt, arbeit, krank, schaffner, lang, halten, etwas, entlassung, sich, verantwortlich]</item>
               </list>
               <p>Das Themenfeld der ›Strafanstalt‹ ist dabei interessant, da es über den gesamten Zeitraum im Hoheitsgebiet des Kantons bleibt und entsprechend auch Themen kombiniert, die vor und nach der Gründung des Bundesstaates zentral waren.</p>
               <p>Wenn nur mit 20 Topics operiert wird, vermengt sich der Themenkreis mit zwar ähnlichen, jedoch klar abgrenzbaren Stichwörtern:</p>
               <list>
                  <item>15 [anstalt, lehrer, dr, erziehungswesens, erziehungsrath, hochschule, erziehungsdirektion, schule, gefangen, direktor, erziehungsrathe, spitalpflege, schulgenossenschaft, schüler, sträflinge, aufsichtsbehörde, professor, prof, erziehungsrathes, aufsichtskommission, strafanstalt, zimmer, erforderlich, unterricht, krank, mein, zahl, derselbe, stunden, betreffend]</item>
               </list>
               <p>Die gewonnene Verzweigung von Themen in den umfangreicheren Topics erscheint sinnvoller, wenn Topic Modeling als heuristisches Verfahren genutzt wird, um umfangreiche und auch nur teilweise interessante Korpora zu analysieren und gegebenenfalls zu verkleinern.</p>
               <p>Die Resultate wiederholen sich für alle Themen. Unter 50 Topics lassen sich aus den gewonnenen Wortlisten keine sinnvollen Einheiten mit mehr oder minder scharf trennbaren Themenbereichen gewinnen. Erst mit 50 oder besser noch 70 bis 100 Topics lassen sich Themenfelder eruieren, die thematische Abtrennungen vornehmen. Damit widerspricht der Distant-Reading-Ansatz den gewonnenen Resultaten der Metriken.</p>
               <p>Für ein exemplarisches Close Reading betrachten wir aus dem Modell mit 50 Topics jenes zum Erziehungswesen, das sich recht konsistent ausnimmt:</p>
               <list>
                  <item>2 [schulgenossenschaft, schule, schulgemeinde, gemeinden, erziehungsrath, neu, erziehungsrathe, bezirksschulpflege, rafz, erziehungsrathes, schulhauses, schulpflege, erziehungsdirektion, kosten, schulhaus, erziehungswesens, beschließen, schulgenoßenschaft, schulhausbaute, schulgenossenschaften, dortig, lehrer, trennung, bisherig, unterstützung, besoldung, staatsbeitrag, schulen, vertheilung, fällen]</item>
               </list>
               <p>Die Resolution mit der deutlichsten Ausprägung dieses Topics liest sich im Close Reading entsprechend einschlägig und belegt die Qualität des Modells:
               <quote type="grosszitat">trennung d sek schulkreises wylrafz u erricht v zwei neuen kreisen betreffend trennung des bisherigen sekundarschulkreises wylrafz und errichtung einer sekundarschule in rafz hat sich ergeben a die gemeindsschulpflege rafz stellt mit zuschrift vom 8 l märz sic namens der dortigen schulgemeinde das gesuch um errichtung einer eigenen sekundarschule in rafz auf 1 mai 1873 und begründet dasselbe [...].</quote><note type="footnote">Staatsarchiv des Kantons Zürich: <ref target="https://www.zentraleserien.zh.ch/documents/rrb/MM_2_199_RRB_1873_0729">MM 2.199 RRB 1873/0729</ref> (hier durch die beschriebenen Preprocessing-Schritte ohne Satzzeichen und nur in Kleinschreibung).</note>
               </p>
            </div>
            <div type="subchapter">
               <head>5.2.3 Mittelalterliche Handschriften</head>
               <div type="subchapter">
                  <head>Distant Reading der Topic-Listen</head>
                  <p>Die für eine erste Übersicht erstellten 20 Topics auf nicht gechunkten Dokumenten, die nicht mittels Stopwords oder Thresholds bereinigt wurden, sind für die spätmittelalterlichen Quellen nicht sehr aussagekräftig. Zwar lassen sich auch hier schon Themen erkennen, die mit den prozessierten Texten deutlicher hervortreten, wie die <title>Alexandergeschichte</title> oder die <title>Weißenburg-Chronik</title> (gelb markiert), aber hierfür ist viel Kontextwissen notwendig. Auch gibt es viel Verrauschungen durch Begriffe aus anderen Topics (orange markiert), ebenso sind mehrere Topics enthalten, die kaum bedeutungstragende Wörter aufweisen und so keinem Themenfeld zuzuordnen sind.</p>
                  <table xml:id="tab010">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>4</cell>
                        <cell>und, der, die, er, das, den, von, dem, mit, des, uff, im, als, nit, es, nach, man, sich, dar, sin, ander, ir, ist, wider, umb, sant, wie, kam, alle, noch, ich, da, sprach, tag, vil, aber, wol, gen, oder, gar, selben, hie, wan, stat, durch, doch, wolt, gottes, allen, disen</cell>
                     </row>
                     <row>
                        <cell>5</cell>
                        <cell>richset, <hi rend="background-color(FFFF00)">dario</hi>, xxiiij, manigen, bringen, rate, <hi rend="background-color(FFFF00)">kungin</hi>, lxxxvij, <hi rend="background-color(FF9900)">capitel</hi>, siy, swang, <hi rend="background-color(FF9900)">narses, asser</hi>, vosz, wurdn, belib, <hi rend="background-color(FF9900)">stiffte</hi>, bottschafft, ass, <hi rend="background-color(FFFF00)">darius</hi>, <hi rend="background-color(FF9900)">balaan</hi>, laide, nasz, <hi rend="background-color(FF9900)">walunge</hi>, wyt, wil, nabal, fùrent,, <hi rend="background-color(FF9900)">ostùr</hi>, milt, gestarb,, zwain, hasz, wechen, sterbet, <hi rend="background-color(FF9900)">martus</hi>, dett, <hi rend="background-color(FF9900)">udaker</hi>, helliklich, gesetzte, gerichset, kom,, mùren, wabst, gefarn, belibe, damdes, lerte, wilt,, ech</cell>
                     </row>
                     <row>
                        <cell>17</cell>
                        <cell>von, vnd, zu, sie, die, das, unnd, auch, der, den, da, vnnd, man, mit, vor, wart, wan, <hi rend="background-color(FFFF00)">anno</hi>, dem, ine, bey, ein, viel, <hi rend="background-color(FFFF00)">weyssenburg, widder</hi>, nit, eyn, des, din, gem, es, hett, uff, dag, warent, dan, <hi rend="background-color(FFFF00)">statt</hi>, de, <hi rend="background-color(FFFF00)">stat</hi>, im, doch, sein, als, wie, uf, alle, alles, wardt, sich, andern</cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab10">Tab. 10</ref>: Spätmittelalterliche Handschriften, 20 Topics, ohne Chunks, Topics ohne inhaltliche Ausrichtung (4), mit Bezug auf <title>Alexandergeschichte</title> (5) und die <title>Weißenburg-Chronik</title> (17).
                     </trailer>
                  </table>
                  <p>Eine Erhöhung der Topic-Anzahl auf 30, 50 und 100 auf den ungechunkten Texten führte zu stellenweise kohärenteren Topics, wie das Topic zur <title>Weißenburg-Chronik</title>. Andere Topics hingegen fielen heraus, wie die <title>Alexandergeschichte</title>:</p>
                  <table xml:id="tab011">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>25</cell>
                        <cell><hi rend="background-color(FFFF00)">weyssenburg, widder</hi>, gem, <hi rend="background-color(FFFF00)">stat</hi>, dag, sagen, fangen, <hi rend="background-color(FFFF00)">herren, grau, landt, anno, abt, herr, gewinnen, juncker, leut, weyssenbung, keyser</hi>,legen, liegen, schaden, <hi rend="background-color(FFFF00)">baden</hi>, drey, <hi rend="background-color(FFFF00)">babst, ludwig</hi>, thun, eynen, <hi rend="background-color(FFFF00)">pfaltzgrauen, pfaltzgraue</hi>, gulden, <hi rend="background-color(FFFF00)">manne, dannach, burger</hi>, kament, <hi rend="background-color(FFFF00)">sant, weissenburg, vitter, arnach, pfaltz</hi>, auß, <hi rend="background-color(FFFF00)">knecht, jacob, bischoff</hi>, inen, <hi rend="background-color(FFFF00)">anne</hi>, gethan, <hi rend="background-color(FFFF00)">stett</hi>, nechst, <hi rend="background-color(FFFF00)">hertzog</hi>, ziehen
                        </cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab11">Tab. 11</ref>: Spätmittelalterliche Handschriften, 50 Topics, ohne Chunks mit Bezug auf <title>Weißenburg-Chronik</title> (25).
                     </trailer>
                  </table>
                  <p>Da auf den prozessierten Dokumenten 500er-Chunks als beste Größe erschien, wurden auch hierfür 30, 50 und 100 Topics erstellt und die Listen evaluiert. Eine eindeutige Aussage zur optimalen Anzahl Topics für dieses Korpus lässt sich dabei nicht treffen. Zwar kamen durch Erhöhung der Topic-Anzahl Themen hinzu, die bei 20 Topics nur erahnt werden können oder gar nicht erst auftauchen, wie beispielsweise zur biblischen Geschichte von Esau und Jakob und von dessen Sohn Joseph und seinen Brüdern (25). Auch das Topic um eine Rezeptsammlung tritt viel deutlicher hervor (3), und in manchen Topics sind weniger Fremdbegriffe (orange markiert), wie bei der <title>Weißenburg-Chronik</title> (22) oder der <title>Ulrichslegende</title> (28): </p>
                  <table xml:id="tab012">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>3</cell>
                        <cell><hi rend="background-color(FFFF00)">machen, sieden, losz, milch, bachen, bache, lot</hi>, wenne, <hi rend="background-color(FFFF00)">biren</hi>, cꝭ, sinde, <hi rend="background-color(FFFF00)">menge, stosz, mel</hi>, undernander, <hi rend="background-color(FFFF00)">wasser</hi>, wilt, nemen, slach, steine, <hi rend="background-color(FFFF00)">oley, ofen</hi>, klein, <hi rend="background-color(FFFF00)">teig, wurtze, mandel</hi>, soͤlt, <hi rend="background-color(FFFF00)">hafen</hi>, rot, <hi rend="background-color(FFFF00)">hacken</hi>, setzen, <hi rend="background-color(FFFF00)">wiltu, kalt</hi>, dn, eger, <hi rend="background-color(FFFF00)">kernen, safferon</hi>, obe, enne, <hi rend="background-color(FFFF00)">smaltz</hi>, sege, ilen, <hi rend="background-color(FFFF00)">wurtz, pfanne, olen</hi>, zuch, <hi rend="background-color(FFFF00)">heisz</hi>, schutte, ston, wiltn</cell>
                     </row>
                     <row>
                        <cell>22</cell>
                        <cell><hi rend="background-color(FFFF00)">weyssenburg, widder</hi>, gem, <hi rend="background-color(FFFF00)">stat</hi>, sagen, fangen, dag, <hi rend="background-color(FFFF00)">grau, herren, landt, gewinnen, herr</hi>, sant, <hi rend="background-color(FFFF00)">leut</hi>, liegen, <hi rend="background-color(FFFF00)">juncker, stett, schaden</hi>, gulden, legen, <hi rend="background-color(FFFF00)">keyser</hi>, drey, <hi rend="background-color(FFFF00)">ludwig, baden</hi>, kament, inen, <hi rend="background-color(FFFF00)">pfaltzgraue, manne</hi>, eynen, thun, <hi rend="background-color(FFFF00)">vitter, pfaltzgrauen</hi>, nechst, <hi rend="background-color(FFFF00)">jacob, weissenburg</hi>, auß, <hi rend="background-color(FFFF00)">dannach, pfaltz, arnach, hertzog, knecht, burger</hi>, gethan, werent, vonn, hett₎, dorff, <hi rend="background-color(FFFF00)">pferden, bischof, hertzeg</hi></cell>
                     </row>
                     <row>
                        <cell>25</cell>
                        <cell><hi rend="background-color(FFFF00)">jacob, joseph, sun, abrahain, korn</hi>, <hi rend="background-color(FF9900)">loch</hi>, <hi rend="background-color(FFFF00)">segen</hi>, gebären, <hi rend="background-color(FFFF00)">laban, bruder, vatter</hi>, geben, <hi rend="background-color(FFFF00)">esan, vater, egipten, sara, engel</hi>, <hi rend="background-color(FF9900)">agar</hi>, essen, kinde, <hi rend="background-color(FFFF00)">rachel</hi>, gehaissen, <hi rend="background-color(FFFF00)">esaw, kinden, bruoder, pfister, trome</hi>, kindes, lieb, <hi rend="background-color(FFFF00)">ysack, dochter</hi>, beschlieff, <hi rend="background-color(FFFF00)">ensan, acker, jacop, jacobs, josephs</hi>, guoten, <hi rend="background-color(FFFF00)">trom</hi>, <hi rend="background-color(FF9900)">rebetta</hi>, <hi rend="background-color(FFFF00)">garben</hi>, <hi rend="background-color(FF9900)">sodoma</hi>, swanger, soltent, sprachent, guote, hies, <hi rend="background-color(FFFF00)">ysaat</hi>, gang, <hi rend="background-color(FF9900)">erben</hi>
                        </cell>
                     </row>                     
                     <row>
                        <cell>28</cell>
                        <cell><hi rend="background-color(FFFF00)">sant, uolrich, ulrich, bischoff</hi>, dy, sagen, <hi rend="background-color(FFFF00)">uolrichs, grab, kirchen, hailigen, angspurg, ulrichs, frawen</hi>, ausz, selbs, tags, <hi rend="background-color(FFFF00)">heren</hi>, mocht, pald, <hi rend="background-color(FFFF00)">priester, adelbero</hi>, ansz, liesz, <hi rend="background-color(FFFF00)">closter</hi>, ant, grosz, arnach, <hi rend="background-color(FFFF00)">pfaffen</hi>, dienen, hann, selbig, <hi rend="background-color(FFFF00)">leichnam</hi>, legen, <hi rend="background-color(FFFF00)">capitel, wasser, kayser, pruder, menschen</hi>, stund, yederman, solichs, <hi rend="background-color(FFFF00)">gesund</hi>, fast, <hi rend="background-color(FFFF00)">volk</hi>, volbracht, <hi rend="background-color(FFFF00)">mesz</hi>, nesz, <hi rend="background-color(FFFF00)">kranck</hi>, singen, <hi rend="background-color(FFFF00)">tisch</hi></cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab12">Tab. 12</ref>: Spätmittelalterliche Handschriften, 50 Topics, 500er-Chunks, Topics mit Bezug auf Rezepte (3), <title>Weißenburg-Chronik</title> (22), Joseph und seine Brüder (25), <title>Ulrichslegende</title> (28).
                     </trailer>
                  </table>
                  <p>Andererseits spalten sich manche Topics in mehrere auf, wie beispielsweise die <title>Weißenburg-Chronik</title> (22 und 46), und es tauchen mehrere Topics auf, die auch mit Kontextwissen nicht sinnvoll mit konkreten Inhalten verbunden werden können (u.&#160;a. 8, 18, 23). Bei 100 Topics verstärken sich diese Tendenzen: Zum einen tauchen weitere neue Topics auf bzw. werden detaillierter, wie ein neues Topic mit lateinischen Wörtern (6)<note type="footnote">Inhaltlich ist in diesem Topic kaum Information enthalten, da die auf das Korpus angewandte Stopword-Liste nur deutsche Wörter beinhaltet. Für mehrsprachige Korpora können natürlich mehrere Stopword-Listen genutzt werden; gegebenenfalls müssen die Dokumente hierfür gesplittet werden, um Wörter, die in einer Sprache ein Stopword, in der anderen bedeutungstragend sind, nicht fälschlicherweise zu entfernen. Für das vorliegende Korpus wurde wegen der geringen Menge der lateinischen Texte auf eine separate Liste verzichtet.</note> oder der Auszug aus Ägypten nach Josephs Traumdeutungen für den Pharao (90) (Fremdbegriffe orange markiert):</p>
                  <table xml:id="tab013">
                     <row>
                        <cell>Topic-Nr.</cell>
                        <cell>Keywords</cell>
                     </row>
                     <row>
                        <cell>6</cell>
                        <cell>est, qui, nō, ut, ad, sunt, atqƺ, hec, qer, sut, vl̄, ac, qua, atqer, cordis, tu, essen, sua, cū, om̄ibus, omi, om̄i, cu, ecia, sic, quo, michi, minis, con, deus, fideliū, qualit, deo, divisio, om̄ibꝰ, pcta, hys, ea, dei, vl, aut, supbia, grad, qr, aliquis, sume, qs, sibi, videlz, multi</cell>
                     </row>
                     <row>
                        <cell>90</cell>
                        <cell><hi rend="background-color(FFFF00)">moyses, volk, meyses, wasser, berg, egipten, plage, sprachent, volke, gebieten, berge, gebott, gottes, voll</hi>, hiesz, ses, <hi rend="background-color(FFFF00)">wort</hi>, gang, ersach, <hi rend="background-color(FFFF00)">moises, ewarten, egipton, plag, josne</hi>, liegen, <hi rend="background-color(FFFF00)">zaichen</hi>, daran, <hi rend="background-color(FFFF00)">pharon, opfer, brot</hi>, vol, <hi rend="background-color(FF9900)">wundern</hi>, <hi rend="background-color(FFFF00)">geschlecht</hi>, <hi rend="background-color(FF9900)">arche</hi>, senden, gezelte, fùrbas, reden, <hi rend="background-color(FFFF00)">aaron, schlangen, wassers, aron</hi>, edel, <hi rend="background-color(FFFF00)">gotte</hi>, sterben, volt, sante, giengent, <hi rend="background-color(FF9900)">wolken</hi>, <hi rend="background-color(FFFF00)">geschlechte</hi></cell>
                     </row>
                     <trailer>
                        <ref type="intern" target="#tab13">Tab. 13</ref>: Spätmittelalterliche Handschriften, 50 Topics, 500er-Chunks, Topics mit lateinischen Begriffen (6) und dem Auszug aus Ägypten (90).
                     </trailer>
                  </table>
                  <p>Zum anderen verrauschen manche Topics, die bei geringerer Topic-Anzahl sehr konsistent waren, und einzelne Themen teilen sich auf mehrere Topics auf. </p>
                  <p>Ähnlich wie bei den lebensgeschichtlichen Interviews könnten noch Listen mit 60, 70, 80 oder 90 Topics evaluiert werden, um den besten Kompromiss zwischen inhaltsstarken, aber auch differenzierten Topics ohne zu viel Rauschen zu finden, wobei die optimale Topic-Anzahl sicher auch von der Forschungsfrage bzw. vom geplanten Nutzen der Methode abhängt: Falls bereits Kontextwissen zur Textgrundlage vorhanden ist, erlaubt die Arbeit mit einer Liste von 20 Topics eine schnelle Orientierung und inhaltliche Einblicke. Bei vornehmlich unerschlossenen Dokumenten werden durch eine Erhöhung der Topic-Anzahl auch kleinere Themenfelder und damit auch Einzeltexte präziser aufgespürt, was eine gute Übersicht über die Inhalte bietet, aber durch die hohe Anzahl, die Zunahme der Nonsense-Topics und die Überschneidungen bzw. Verrauschungen in den einzelnen Topics sehr viel mehr Zeit in Anspruch nimmt.</p>
               </div>
               <div type="subchapter">
                  <head>Scalable Readings zur Überprüfung der Topic-Repräsentation in den Texten</head>
                  <p>Der Wechsel von einem Distant in ein Close Reading von Textstellen, denen ein bestimmtes Topic zugewiesen wurde, stellt für (mitunter recht voluminöse) vormoderne Sammelhandschriften eine ganz neue Möglichkeit zur Erschließung und zur Arbeit mit der textuellen Überlieferung dar. Während in Handschriftenbeschreibungen Angaben zu Anfang und Ende von einzelnen Texten oder Textteilen enthalten sind, lassen sich konkrete Stellen nur mit größerem Suchaufwand finden. Wollte man beispielsweise den Umfang und die Ausgestaltung der <title>Alexandergeschichte</title> als Teil des ersten Kapitels der <title>Twinger-Chronik</title> im hier besprochenen Beispielkorpus vergleichen, müsste man innerhalb der Folioangaben für das Kapitel in den betreffenden vier Handschriften ([Dre1], [Fre2], [Hei4], [Mue5]) nach dieser Textstelle suchen&#160;– in der Handschrift [Mue5] wären dies 104 Folios&#160;/ 208 Seiten, im Codex [Dre1] immerhin noch 33 Folios&#160;/ 66 Seiten. Bei texterkannten Handschriften lässt sich natürlich nach Stichwörtern suchen, je nach Fehlerrate in der Texterkennung kann das allerdings auch länger dauern, und der Beginn eines bestimmten Themas&#160;/ einer inhaltlichen Einheit lässt sich damit nicht sehr gut bestimmen. Durch ein Rückführen der Topics in konkrete Textstellen lässt sich der Suchprozess beschleunigen und ermöglicht ein direktes Close Reading der entsprechenden Passage(n):
                  </p>
                  <p>
                     <quote type="grosszitat">disen brieff hies allexander lese vor sineer dienern de herschreckent su so sprach allernder zuo inen ir sollent uch nit forchtten von disem frouwende wissent ir nit das die hunde die all meist bellet die bissent aller muernest.
                     </quote><note type="footnote">[Dre1], chunk 39. Übersetzung: Diesen Brief hieß Alexander lesen vor seinen Dienern, da erschraken sie. So sprach Alexander zu ihnen: <quote>Ihr sollt euch nicht fürchten vor dieser Drohung. Wisst ihr nicht, dass die Hunde, die am meisten bellen, am wenigsten beißen.</quote>
                     </note>   
                  </p>
                  <p>
                     <quote type="grosszitat">disen brieff hiesz allexander vor sinen dienern lesen do erschrakent sy so sprach allexander zuͦ in ir sùllent ich nit fùrhten von desen trowen wissent ir nit dz die hunde die vil bellend aller minst byssent.</quote><note type="footnote">[Fre2], chunk 98.</note>
                  </p>
                  <p>
                     <quote type="grosszitat">disem brieff hiefs seler ander vor inen dieneren besen, do er schukent si do spnrach aleranden zo innen irsond ûch nit fûrchten von disem trowean wissent nt die hunde sie aber meist bellent, dz die aber mwust bu.</quote><note type="footnote">[Hei4], chunk 88.</note>
                  </p>
                  <p>
                     <quote type="grosszitat">isen brieff hieflesen ward wale ander vor seinen diener lesen so erschrackent sy do sprach ale pander zuo innen ir sond ouch nit frrechten von disen trowen wissent ir nit die hund die aller maist bellent das die aller minst byssent.</quote><note type="footnote">[Mue5], chunk 86.</note>
                  </p>
                  <p>Trotz zahlreicher Fehler in der Texterkennung, Unterschieden im Satzbau und in der Schreibsprache&#160;– [Dre1] ist wohl im Straßburger Raum entstanden, [Fre2] und [Hei4] in Konstanz und [Mue5] in Augsburg&#160;– lässt sich ein Unterkapitel aus dem ersten Kapitel der <title>Twingerchronik</title> über das gemeinsame Topic sehr einfach aufspüren. Kontextwissen zu den untersuchten Handschriften ist sicherlich von Vorteil, also ein Wissen darum, ob bzw. in welchem Dokument ein gewisses Thema auftauchen könnte bzw. sollte. Für das Alexander-Topic musste der Threshold, also das Gewicht des Topics im Dokument, auf 0,38 gesenkt werden, um für alle vier Handschriften, die das entsprechende Unterkapitel der <title>Twingerchronik</title> enthalten, die dazugehörigen Textstellen zu erhalten; ab einem Threshold von 0,44 wird das Topic nur noch in [Dre1] und [Hei4] entdeckt, ab 0,54 taucht es nicht mehr auf. Dies liegt wohl vor allem am großen Umfang der Handschriften, Fehler in der Texterkennung tragen aber sicher auch dazu bei. Durch ein schrittweises Absenken des Thresholds lässt sich dabei nicht nur herausfinden, wie treffsicher bzw. trennscharf das Topic den Textstellen zugewiesen wird&#160;– im Alexanderbeispiel taucht erst ab einem Wert von 0,08 eine ›falsche‹ Passage auf, eine Stelle aus [Stu3], in der <quote>persa</quote> und ein <quote>philippus</quote> vorkommen, ohne dass es sich um die <title>Alexandergeschichte</title> handelt.<note type="footnote">[Stu3], chunk 22: <quote>der was der pourern lieb und werd er tzweig die von perse und hielt dz rich in groszer er […] der strent mit den voi perse und gesiget und fide wider gen rom und do er nach zuo der statt kom do truog der hertzog philippo an mit verraterschafft dz der kayser erschlagen ward und er an dz rich ka hilippus richs not un jar und hett amen sun, der hiesz ouch phil ppus und tett der vetter der sun, mit im kayser sin, dz si beid richsnotent in dem ersten.</quote></note> Zudem bietet diese Art von Quellenlesen die Möglichkeit, bisher unbekannte Texte in Handschriften aufzuspüren, gerade, wenn es sich um Codices handelt, die nur oberflächlich erschlossen sind.<note type="footnote">Im hier untersuchten Beispielkorpus war dies bei keinem der getesteten Topics der Fall, weil eine gute Quellenkenntnis für eine fundierte Beurteilung der Methode nötig war und daher gut erschlossene Handschriften ausgewählt wurden.</note>
                  </p>
               </div>               
            </div>
            </div>
            <div type="subchapter">
               <head>5.3 Weiteres Parametertuning: Iterationen</head>
               <p>Anhand des Interview-Korpus soll abschließend noch ein weiterer Parameter in den Blick genommen werden, die Iterationen, also Trainingsdurchläufe beim Topic-Modeling-Prozess. Ein Blick auf unterschiedlich hohe Iterationen (also wiederholte Durchläufe des Trainings) bringt keine klaren Erkenntnisse&#160;– bereits bei einem <term type="dh">Optimized Interval</term> von 50 bei 500 Iterationen liest sich das Bergbau-Topic recht konsistent, bei 200&#160;/ 2.000 ändert sich kaum etwas (der Fremdbegriff ›alt‹ fällt raus, dafür kommt ›nennen‹ hinzu). Bei 500&#160;/ 5.000 gibt es weitere graduelle Veränderungen, die durch Verschieben des Random Seeds allerdings wieder neutralisiert werden könnten&#160;– es finden sich unter den ersten 30 Keywords nur zwei Fremdbegriffe. Die vier Top-Termini bestehen in allen drei Modellen aus den gleichen Begriffen: ›Zechen‹, ›Bergbau‹, ›Steiger‹, ›Kohle‹.</p>
               <table xml:id="tab014">
                  <row>
                     <cell>
                        <p>50&#160;/ 500 bei Alpha 5</p>
                     </cell>
                     <cell>200&#160;/ 2.000</cell>
                     <cell>
                        <p>500&#160;/ 5.000</p>
                     </cell>
                  </row>
                  <row>
                     <cell>26 [zechen, bergbau, steiger, kohle, arbeit, meter, schicht, verdienen, bergmann, arbeiten, bergleute, wagen, hauer, stempel, geld, kumpels, kumpel, betriebsführer, <hi rend="background-color(FFFF00)">alt</hi>, schacht, schachtanlage, <hi rend="background-color(FFFF00)">robert</hi>, grube, walsum, <hi rend="background-color(FFFF00)">bekommen</hi>, gedinge, steine, kohlen, leistung, <hi rend="background-color(FFFF00)">vertrieben</hi>]</cell>
                     <cell>26 [steiger, bergbau, zechen, kohle, meter, schicht, verdienen, arbeiten, arbeit, wagen, bergmann, kumpel, hauer, bergleute, betriebsführer, kumpels, geld, stempel, gedinge, schacht, <hi rend="background-color(FFFF00)">robert, vertrieben</hi>, leistung, grube, steine, <hi rend="background-color(FFFF00)">nennen, bekommen</hi>, lohn, bohren, nachtschicht]
                     </cell>
                     <cell>26 [steiger, bergbau, zechen, kohle, meter, schicht, arbeit, arbeiten, verdienen, bergmann, wagen, hauer, kumpel, betriebsführer, bergleute, stempel, geld, kumpels, <hi rend="background-color(FFFF00)">robert</hi>, gedinge, leistung, grube, schacht, schachtanlage, <hi rend="background-color(FFFF00)">vertrieben</hi>, nachtschicht, bohren, bergschule, lohn, schichten]</cell>
                  </row>
                  <trailer>
                     <ref type="intern" target="#tab14">Tab. 14</ref>: Vergleich der Iteration anhand des Bergbau-Topics.
                  </trailer>
               </table>
               <p>In LDA können zwei weitere Parameter Alpha und Beta, sogenannte Hyperparameter, eingestellt werden. Dabei beeinflusst Alpha die Verteilung der Wahrscheinlichkeit der Topics in den Dokumenten und Beta die Verteilung der Wahrscheinlichkeit der Wörter in den Topics.<note type="footnote">Vgl. <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;14–15.</note> Der Mallet-Wrapper bietet die Funktion Optimized Interval, die eine interne Anpassung während der Berechnung vornimmt. Dabei wird eine Zahl vorgegeben, die besagt, ab welcher Anzahl an Iterationen die Anpassung der Hyperparameter stattfindet. Unsere Untersuchungen haben gezeigt, dass die Ergebnisse mit der Optimized-Interval-Option deutlich besser sind, weshalb sie bei allen Untersuchungen genutzt wurde. Für die Berechnung im Mallet-Wrapper kann für die ersten Berechnungen bis zum Opmitzied Interval ein Alpha-Wert vorgegeben werden. Alle drei Werte beeinflussen die Ergebnisse des Topic Modelings, eine detaillierte Evaluation dieser Werte würde aber den Rahmen dieses Workingpapers sprengen, besonders, da die Einflüsse der Werte sehr nuanciert ausfallen.<note type="footnote">Eine ausführliche Beschreibung der Werte: <ref type="bibliography" target="#du_verstaendnis_2024">Du 2024</ref>, S.&#160;14–16.</note>
               </p>
            </div>
         </div>
         <div type="chapter">
            <head>6. LDA und vektorisiertes Topic Modeling im Vergleich</head>
            <div type="subchapter">
               <head>6.1 Einführung</head>
               <p>Abschließend sollen die aktuell gängigsten Topic-Modeling-Implementierungen begutachtet werden: Dabei beschränken wir uns auf LDA in JAVAs Mallet sowie BERTopic als vektorisierte Methode. Beide Methoden basieren auf der Idee, dass Wörter, die in ähnlichen Kontexten vorkommen, zugrundeliegende Themen in Texten repräsentieren. Vergleiche innerhalb der LDA-Umsetzungen existieren bereits, und unserer Ansicht nach ist die Mallet-Implementation überlegen.<note type="footnote">Vgl. dazu ausführlich: <ref type="bibliography" target="#hodel_et_al_inferenzen_2022">Hodel et&#160;al. 2022</ref>.</note>
               </p>
               <p>LDA berechnet die Ähnlichkeit zweier Wörter in einem Dokument, indem an einem zufälligen Punkt (vgl. oben <ref type="intern" target="#hd26">Kapitel 4.2</ref>) begonnen und die Wahrscheinlichkeit ihres gemeinsamen Auftretens vorausgesagt wird. In weiteren Iterationen werden ›bessere‹ (im Sinne von häufigeren) und entsprechend ›sinnvollere‹ Kombinationen von Wortpaaren ermittelt. Wörter werden in diesem Kontext als Zeichenketten verstanden und nur identische Ketten verglichen. </p>
               <p>Wie oben beschrieben, unterscheidet sich BERTopic grundlegend von LDA. Über das Verfahren werden auch ähnliche oder synonyme Wörter als ähnlich, jedoch nicht identisch verstanden und als Vektoren in naher Umgebung ausgedrückt. Dadurch wird der Kontext berücksichtigt: Homonyme (›Bank‹ als Sitzgelegenheit oder Geldinstitut) werden disambiguiert, indem dem einzelnen Wort je nach Kontext unterschiedliche Vektorwerte zugewiesen werden. Das bedeutet, dass die Dokumente nicht aus einzelnen Wörtern bestehen, sondern aus individuellen Vektoren, die in mehreren Dimensionen näher oder weiter voneinander entfernt sein können und damit die Verwandtschaft von Wörtern numerisch ausdrücken. Für den hier vorliegenden Vergleich mit BERTopic wurde sich weitestgehend an der Standardpipeline der offiziellen BERTopic-Dokumentation orientiert.<note type="footnote">Vgl. <ref type="bibliography" target="#grootendorst_bertopic_2024">Grootendorst 2024</ref>.</note>
               </p>
               <p>In diesem ersten Schritt wird eine Vektorrepräsentation des zugrundeliegenden Korpus erstellt. Dafür stehen verschiedene Verfahren und vortrainierte Modelle zur Verfügung&#160;– z.&#160;B. die für BERT und andere LLMs genutzten Transformer-Modelle oder <term type="dh">Universal-Sentence-Encoder (USE)</term>. Da es sich um sehr spezifische Daten und einen Wortschatz handelt, der stark variiert, werden wir eigene Embeddings trainieren, was mit BERTopics Custom Embeddings ohne Weiteres ermöglicht wird. In einem zweiten Schritt werden die Dimensionen des Vektormodells reduziert. Dazu stehen eine Vielzahl von gängigen Verfahren aus der Mathematik, wie <term type="dh">PCA</term>, <term type="dh">t-SNE</term> und <term type="dh">UMAP</term>, zur Verfügung, die auch von Python-Bibliotheken wie <ref target="https://scikit-learn.org/stable/">SciKit Learn</ref> unterstützt werden. Für unsere Versuche haben wir uns bei UMAP bedient. </p>
               <p>Im nächsten Schritt werden die vektorisierten und dimensionsreduzierten Dokumente geclustert. Hierzu nutzt BERTopic als Standard <term type="dh">HDBSCAN</term>. Auch <term type="dh">k-Means</term> und weitere Clustering-Verfahren sind verfügbar, jedoch hat sich HDBSCAN als gut geeignet für das Topic Modeling herausgestellt. Es zählt zu den hierarchischen Clustering-Algorithmen und ermittelt nach Vorgabe der minimalen Clustergröße die optimale Anzahl an Clustern selbst.<note type="footnote">Vgl. <ref type="bibliography" target="#mcinnes_et_al_library_2016">McInnes et&#160;al. 2016</ref>, hier: <ref target="https://hdbscan.readthedocs.io/en/latest/how_hdbscan_works.html">How HDBSCAN Works</ref>; <ref type="bibliography" target="#grootendorst_bertopic_2024">Grootendorst 2024</ref>, hier: <ref target="https://maartengr.github.io/BERTopic/getting_started/parameter%20tuning/parametertuning.html#hdbscan">Hyperparameter Tuning</ref>. </note> Es folgen ein <term type="dh">Count Vectorizer</term> und das eigentliche Herzstück von BERTopic, das <term type="dh">c-TF-IDF-Verfahren</term>, das aus den zuvor erzeugten Clustern die letztliche Topic-Verteilung errechnet. Dafür wird jedes Cluster als ein Dokument betrachtet und dem <term type="dh">TF-IDF</term>-Maß zugeführt. TF-IDF steht für <term type="dh">Term-Frequency Inverse-Document-Frequency</term> und berechnet, welche Wörter unwahrscheinlich häufig in einem Dokument vorkommen. Es wird davon ausgegangen, dass die Verteilung von Wörtern in einer Sprache stabil ist: Gewisse Wörter kommen immer häufiger vor (etwa Pronomina wie ›sie‹, ›er‹, ›es‹). Pro Dokument wird daher die Häufigkeit von Wörtern gezählt und mit allen anderen Dokumenten verglichen. Wörter, die in einem oder wenigen Dokumenten überdurchschnittlich häufig auftauchen, scheinen daher ›wichtig‹ für dieses Dokument und werden zu einem Topic hinzugefügt. </p>
               <p>Was in der Theorie komplex und voraussetzungsvoll klingt, liefert in der Anwendung dank guter Implementierung in der Programmiersprache Python recht schnell konsistente Ergebnisse. Entgegen der Annahme, man benötige beim vektorisierten Topic Modeling kein Stopwordremoval, werden wir aber zeigen, dass das Entfernen der Stopwords auch im vektorisierten Topic Modeling einen entscheidenden Unterschied macht. </p>
            </div>
            <div type="subchapter">
               <head>6.2 Anwendung</head>
            
            <div type="subchapter">
               <head>6.2.1 Lebensgeschichtliche Interviews (Stopwordremoval, Parametertuning und Chunking)</head>
               <p>Wie schon im LDA, ergibt ein Topic Modeling mit BERTopic ohne Stopwordremoval keine sinnvollen Ergebnisse, wie die folgenden vier Topics mit Spuren der Themen ›Ruhrgebietsindustrie‹ (14) und ›Bergbau‹ (32) zeigen:</p>
               <list>
                  <item>14 [ja, krupp, die, der, das, nicht, da, war, und, man, dann, sie, äh, auch, ist, ich, haben, bei, aber, den, wenn, ne, nech, noch, von, hat, denn, hm, ein, wir]</item>
                  <item>32 [die, und, der, dann, war, ich, das, bergbau, ja, da, nach, auch, zu, sie, wir, für, haben, im, hatte, von, dem, waren, noch, hatten, gewesen, hat, hier, aber, gemacht, ein]</item>
               </list>
               <p>Eine erste Kuriosität bei der Anwendung von BERTopic nach dem Stopwordremoval ist der Zusammenhang von Chunkgröße und automatisch bestimmter Topic-Anzahl. Nimmt man Chunks von 50 Sätzen, bekommt man 45 Topics&#160;– halbiert man die Chunks auf 25 Sätze, verdoppelt sich die Anzahl der Topics auf 90. Und der Trend setzt sich fort: reduziert man die Chunks auf 10 Sätze, erhält man 224 Topics. Dieses geradezu lineare Verhalten stellt die Zuverlässigkeit der Topic Estimation ohne weiteres Parametertuning&#160;– eine viel gepriesene Stärke von BERTopic&#160;– infrage. </p>
               <p>Um die Anzahl der Cluster zu beeinflussen, gibt es zwei entscheidende Parameter: <hi rend="italic">min_topic_size</hi> und <hi rend="italic">min_cluster_size</hi> (HDBSCAN-Parameter). In einem Versuchsaufbau mit einem auf 1.000 Dokumente reduzierten LUSIR-Korpus mit 50er-Chunks wurde zunächst der Parameter <hi rend="italic">min_topic_size</hi> verändert. Eine Erhöhung um das Zehnfache (von der Standardeinstellung 10 auf 100) brachte genauso wenig Veränderung, wie die Halbierung des Standardwerts (von 10 auf 5). Zum Vergleich das Topic mit Spuren zur Ruhrgebietsindustrie&#160;– Standardeinstellung:</p>
               <list>
                  <item>
                     <p><hi rend="italic">min_topic_size</hi> = 10:</p>
                     <p>0 [krupp, betrieb, betriebsrat, kommunisten, gewerkschaft, partei, gewählt, arbeit, kollegen, essen, gearbeitet, heißt, krieg, firma, 33]</p>
                  </item>
                  <item>
                     <p><hi rend="italic">min_topic_size</hi> = 100:</p>
                     <p>1 [krupp, betrieb, betriebsrat, kommunisten, partei, arbeit, gewählt, heißt, kollegen, krieg, akkord, gewerkschaft, gearbeitet, geld, mensch]</p>
                  </item>
                  <item>
                     <p><hi rend="italic">min_topic_size</hi> = 5:</p>
                     <p>1 [krupp, betrieb, betriebsrat, kommunisten, partei, gewerkschaft, gewählt, kollegen, arbeit, krieg, heißt, gearbeitet, 50, metall, essen]</p>      
                  </item>
               </list>
               <p>In einem nächsten Schritt wurde die <hi rend="italic">min_topic_size</hi> wieder auf 10 gesetzt, dafür der Standardwert der <hi rend="italic">min_cluster_size</hi> in der HDBSCAN-Instanz zunächst von 15 auf 30 verdoppelt, was zu einer Halbierung der Topic-Anzahl von acht auf vier führte. Entgegen der Erwartung, nun Topics zu erhalten, die allesamt extrem heterogen sind, bleibt das Topic zur Ruhrgebietsindustrie nahezu unverändert:</p>
               <list>
                  <item>2 [krupp, betrieb, betriebsrat, arbeit, krieg, heißt, kommunisten, partei, gewählt, kollegen, gewerkschaft, gearbeitet, metall, geschichte, mensch]</item>
               </list>
               <p>Eine Drittelung des <hi rend="italic">min_cluster_size</hi>-Werts von 15 auf 5 führte zu einer Erhöhung der Topic-Anzahl von 8 auf 27. Wieder ist, entgegen der Erwartung, eine inhaltliche Straffung nicht festzustellen:</p>
               <list>
                  <item>0 [krupp, betrieb, betriebsrat, arbeit, gewählt, partei, gearbeitet, heißt, essen, kollegen, firma, kommunisten, gewerkschaft, urlaub, krieg]</item>
               </list>
               <p>Verändert man nun die <hi rend="italic">min_topic_size</hi>, wird der Einfluss auch dieses Parameters deutlich: Erhöht man diese bei gleichzeitiger Absenkung der <hi rend="italic">min_cluster_size</hi>, erhalten wir die größte Anzahl Topics, nämlich 32. Mit der Veränderung der reziproken Parameter <hi rend="italic">min_topic_size</hi> und <hi rend="italic">min_cluster_size</hi> (in der HDBSCAN-Instanz) ließe sich also, wenn man z.&#160;B. die Chunkgröße variieren möchte, die Topic-Anzahl in BERTopic anpassen. Dabei ist zu beachten, dass eine hohe (!) <hi rend="italic">min_cluster_size</hi> die <hi rend="italic">min_topic_size</hi> limitieren kann. Allerdings funktioniert die Verteilung der tatsächlichen Themen auf die Anzahl der Topics anders als bei der LDA: Anstatt mehrere Themen in einem Topic zusammenzufassen, fallen weniger dominante Themen aus dem Modell heraus. Eine mögliche Erklärung ist, dass das Clustering, im Gegensatz zum LDA-Verfahren, harte Grenzen zieht. Für eine systematische Estimation eines eigenen Modells verweisen wir auf <ref type="intern" target="#hd30">Kapitel 5</ref>, die dort etablierte Methode kann ebenso auf die BERTopic-Parameter <hi rend="italic">min_cluster_size</hi> und <hi rend="italic">min_topic_size</hi> angewendet werden. Zur Reproduzierbarkeit kann auch bei BERTopic ein Randomseed gesetzt werden, und zwar in der UMAP-Instanz (<hi rend="italic">random_state</hi>).</p>
               <p>Da die 45 BERT-Topics des gesamten LUSIR-Korpus dem LDA-Modell sehr nahekommen, kann der Vergleich beider ›großer‹ Modelle ohne weiteres Parametertuning erfolgen. Beim Vergleich mit den 50 Topics des finalen LDA-Modells fallen verschiedene Dinge auf. Viele Topics beider Modelle haben keine Entsprechung im anderen (vgl. <ref type="graphic" target="#topic_modeling_2026_006">Abbildung 6</ref>). Für die Heatmap wurde jede Wortliste des LDA-Modells (Y-Achse) mit jeder Wortliste der BERTopic-Modells (X-Achse) verglichen und automatisch berechnet, wie hoch die prozentuale Übereinstimmung der in den Listen enthaltenen Wörter (n=20) ist. Bei besonders hohen Ausschlägen ist eine Übereinstimmung in der Heatmap an hellorangen bis gelben Punkten zu erkennen. Zum Beispiel stimmen LDA-Topic 3 und BERTopic-Topic 10 zu 93&#160;% überein (vgl. <ref type="graphic" target="#topic_modeling_2026_006">Abbildung&#160;6</ref>):</p>
               <list>
                  <item>3 [studieren, semester, abitur, studium, professor, universität, bonn, examen, köln, münchen, münster, studenten, berlin, medizin, praxis, fulda, godesberg, wuppertal, aachen, freiburg]</item>
                  <item>10 [semester, studieren, studium, studiert, examen, professor, semestern, medizin, münchen, schule, universität, studenten, freiburg, sohn, berlin, klasse, abitur, vorlesungen, volkswirtschaft, geschrieben]</item>
               </list>
               <p>Die zweithöchste Übereinstimmung findet sich beim Bergbau-Topic mit 50&#160;% (LDA-Topic 39, BERTopic-Topic 20):</p>
               <list>
                  <item>39 [betriebsrat, betrieb, kollegen, gewerkschaft, betriebsräte, aeg, belegschaft, vorsitzend, angestellt, gewerkschaften, wählen, aufsichtsrat, betriebsverfassungsgesetz, mitbestimmung, arbeitgeber, gewerkschaftlich, firma, vertreten, prozent, freistellen]</item>
                  <item>20 [betriebsrat, betrieb, kollegen, betriebsräte, betriebsverfassungsgesetz, gewählt, firma, krupp, belegschaft, betrieben, aufsichtsrat, gewerkschaft, vorsitzende, betriebsräten, geschäftsleitung, wirtschaftsausschuss, vertreten, betriebsrates, betriebsrats, aeg]</item>
               </list>
               <p>Allerdings fällt insbesondere auf, dass die letzten Topics des BERT-Modells (38–45, mit Ausnahme von 43) keine Entsprechungen im LDA-Modell haben. Bei näherem Hinschauen zeigt sich, dass es teils überspezifische Topics sind (so gibt es eins, das sich nur türkischen Gastarbeitern widmet und eins, in dem es um Kaffee geht), teils durch diffuse Wortsammlungen verrauschte Topics. In anderer Richtung fällt auf, dass viele LDA-Topics keine Entsprechung im BERT-Modell haben (z.&#160;B. Topics 8, 17 und 22), andere haben redundante Gegenstücke (z.&#160;B. LDA-Topic 4 matcht auf BERT 14 und 16, LDA-Topic 20 auf BERT 8 und 9). Der qualitative Blick in die Listen bestätigt, dass wir es mit zwei sehr verschiedenen Modellen zu tun haben. Zwar finden sich die großen Themen (›Bergbau‹, ›NS‹, ›Familie‹, ›Schule‹ etc.) in beiden Modellen, doch während LDA diese konsequent auflistet, zerfasert das BERTopic-Modell ins Überspezifische. </p>
               <figure>
                  <graphic xml:id="topic_modeling_2026_006" url="Medien/topic_modeling_2026_006.png">
                     <desc>
                        <ref type="intern" target="#abb6">Abb.&#160;6</ref>: Similarität von Topics, LDA mit 50 Topics auf der X-Achse, BERTopic mit 45 Topics auf der Y-Achse, beide mit 50er-Chunks. Je heller, desto größer die Übereinstimmung. Übereinstimmung ergibt sich aus dem prozentualen Anteil der Wörter, die in beiden Listen (n=20) vorkommen. [Grafik: Möbus et al. 2026]</desc>
                  </graphic>
               </figure>
            </div>
            <div type="subchapter">
               <head>6.2.2 Regierungsratsbeschlüsse</head>
               <p>Die Nutzung eines grossen Sprachmodells wie BERT für Dokumente aus dem 19. Jahrhundert scheint auf den ersten Blick eher kontraproduktiv. Die Bedeutung diverser Begriffe hat sich in der Zwischenzeit verschoben und die Variabilität in der Schreibung dämpft die Erwartungshaltung. Allgemein wird angenommen, dass BERT aufgrund des <term type="dh">byte-pair encoding</term>, also der Art und Weise, wie die Vektorisierung geschieht, eher schlecht auf kleine Differenzen in der Schreibung reagiert&#160;– dies im Gegensatz zu massiv kleineren Sprachmodellen, wie standardmäßige Implementationen von <ref target="https://flairnlp.github.io/">FlairNLP</ref>.</p>
               <p>Das Resultat mit 65 generierten Themen ist dennoch brauchbar und zeigt ein Bild ähnlich wie zuvor schon mittels LDA generiert, mit einigen Themen, die sich in allen ausdifferenzierten Topic Models, die auf dem Korpus basieren, finden, etwa zum Militärwesen (Topic 1) oder zum Ausbau der Eisenbahnen (Topic 7).</p>
               <list>
                  <item>1 [militärs, hauptmann, militarcommißion, infanterie, direktion, militärcommißion, regierungsrath, oberst, 1sten, 2ten, dienste, kriegsrathe, militärdirektion, oberlieutenant, zürich, entlaßung, kriegsrath, kriegsrathes, quartier, landwehr, mannschaft, major, militärpflichtersatz, stelle, herren, mittheilung, bataillon, eidg, französischen, freycompagnie]</item>
                  <item>7 [nordostbahn, station, direktion, bahn, eisenbahn, linie, winterthur, arbeiten, bundesrath, zuschrift, öffentlichen, schweiz, regierungsrath, expropriationen, nationalbahn, genehmigung, zuggoldau, präsidialverfügungen, mts, tößthalbahn, eisenbahngesellschaft, erledigung, projekt, js, winterthurweiach, eingabe, ii, straße, st]</item></list>
               <p>Einige der Topics sind jedoch schwierig zu interpretieren und es ist nicht nachvollziehbar, wie das Clustering zum entsprechenden Resultat geführt hat (etwa Topic 15). Insbesondere die unterschiedlichen Ebenen führen zu Verwirrung. ›Vorort‹ bezieht sich auf die Rolle Zürichs vor der Gründung des Bundesstaats im alten Staatenbund. Die Orte sind zwar kantonal von Interesse, haben aber darüber hinaus nur wenig Ausstrahlung (beispielsweise ›Bülach‹). Und der Verweis auf Gesuche und Gemeinden (›metzgretchsgesuch‹ oder ›gemeindsstelle‹) ist nur auf kommunaler Ebene verständlich.</p>
               <list>
                  <item>15 [rrb, fortsetzung, bezirksrathes, datirte, winterthur, eingesandte, beilagen, prüfung, verrichtungen, niederlaßungsgesuche, statthalteramtes, jahresbericht, ms, belaßung, bülach, hünikon, überwiesen, knonau, innern, barbou, greiffensee, bericht, gemeinden, gem, eingabe, statthalteramt, gesuch, rathe, begutachtung, recurs]</item>
               </list>
               <p>Das Experiment mit BERTopic bleibt somit für die Regierungsratsbeschlüsse unentschieden und wird aufgrund der schwierigen bzw. fehlenden Nachvollziehbarkeit für historische Sprachformen nicht empfohlen. Die Nutzung von BERT und anderer LLMs für die Extraktion von Themenfeldern&#160;– insbesondere wenn spezifische Modelle für die Sprachstufe genutzt werden könnten&#160;– muss natürlich weiterhin und vertieft ausgetestet werden. </p>
               <p>Insgesamt und abschließend muss festgehalten werden, dass eine Übereinstimmung von Topics zwar anzeigt, dass qualitativ als gut evaluierte Themenfelder über beide Methoden gefunden werden und beide Ansätze nützlich sind. Das bedeutet indes nicht, dass dies die einzige Metrik sein kann. Wie die Auseinandersetzungen um Topic Modeling in den Geisteswissenschaften seit Jahren zeigen, ist es eine Herausforderung aufzuzeigen, was ›sinnvolle‹ von ›unbrauchbaren‹ Themenextraktionen unterscheidet.</p>
            </div>
            <div type="subchapter">
               <head>6.2.3 Spätmittelalterliche Chronikhandschriften (Chunking)</head>
               <p>Das BERT-Modell gibt für die spätmittelalterlichen Sammelhandschriften auf 500er-Chunks 16 Topics aus; inhaltlich sind diese dabei ähnlich geschlossen wie die Mallet-Topics auf 500er-Chunks mit 20 Topics (Fremdbegriffe orange eingefärbt):</p>
               <table xml:id="tab015">
                  <row>
                     <cell>BERT, 500er-Chunks, 16 Topics</cell>
                     <cell>Mallet, 500er-Chunks, 20 Topics</cell>
                  </row>
                  <row>
                     <cell>5 [<hi rend="background-color(FFFF00)">sant, uolrich</hi>, dy, <hi rend="background-color(FFFF00)">ulrich, peter, priester, grab, hailigen, bischoff</hi>, selbs, <hi rend="background-color(FFFF00)">kirchen, closter, peters, volk, statt, stat, leben, uolrichs, frawen</hi>, mocht, ausz, <hi rend="background-color(FFFF00)">gottes</hi>, grosz, alten, ant, sagt, <hi rend="background-color(FFFF00)">mesz</hi>, <hi rend="background-color(FF9900)">strasspurg</hi>, <hi rend="background-color(FFFF00)">gesund, grabe</hi>, stund, <hi rend="background-color(FFFF00)">ulrichs</hi>, <hi rend="background-color(FF9900)">arbogast</hi>, <hi rend="background-color(FFFF00)">eren, stab, tags, begraben</hi>, pald, undertan, yederman, hand, <hi rend="background-color(FFFF00)">menschen</hi>, hann, <hi rend="background-color(FF9900)">wasser</hi>, volbracht, <hi rend="background-color(FFFF00)">pfaffen</hi>, liesz, sunt, <hi rend="background-color(FFFF00)">capitel</hi>, <hi rend="background-color(FF9900)">gesellen</hi>]</cell>
                     <cell>14 [<hi rend="background-color(FFFF00)">sant, bischoff, uolrich, closter</hi>, peter, dy, <hi rend="background-color(FFFF00)">grab, ant, ulrich, kirchen</hi>, peters, <hi rend="background-color(FFFF00)">leben, statt</hi>, selbs, mocht, grosz, alten, stund, <hi rend="background-color(FFFF00)">eren, uolrichs, hailigen, priester, pfaffen</hi>, volbracht, <hi rend="background-color(FFFF00)">frawen, stifft, wasser, lieben</hi>, <hi rend="background-color(FF9900)">gesellen, florentz, arbogast</hi>, ausz, <hi rend="background-color(FFFF00)">angspurg</hi>, liesz, <hi rend="background-color(FFFF00)">ulrichs</hi>, hann, <hi rend="background-color(FFFF00)">altar, begraben, capitel, volk, gesund</hi>, machet, kloster, <hi rend="background-color(FF9900)">burg</hi>, <hi rend="background-color(FFFF00)">zaichen</hi>, seinem, <hi rend="background-color(FFFF00)">menschen</hi>, wolten, tags, <hi rend="background-color(FF9900)">bekert</hi>]</cell>
                  </row>
                  <row>
                     <cell>10 [<hi rend="background-color(FFFF00)">weyssenburg</hi>, gem, <hi rend="background-color(FFFF00)">widder, ite, abt, dag</hi>, sagt, <hi rend="background-color(FFFF00)">weyssenbung, statt, leut, gefangen, pfaltzgrauen, juncker, pfaltzgraue, weissenburg</hi>, eynen, <hi rend="background-color(FFFF00)">stat</hi>, auß, obgut, <hi rend="background-color(FFFF00)">baden, ludwig</hi>, drey, <hi rend="background-color(FFFF00)">pfaltz, pferdt</hi>, nichts, lag, <hi rend="background-color(FFFF00)">herr, grauen, graue</hi>, hett, <hi rend="background-color(FFFF00)">dorff, vitter, gewonnen</hi>, gethan, <hi rend="background-color(FFFF00)">manne, dannach, arnach</hi>, sambt, knecht, darzu, thun, <hi rend="background-color(FFFF00)">jacob, mannen, schlos, hertzeg</hi>, gebauwern, <hi rend="background-color(FFFF00)">gulden</hi>, gutt, <hi rend="background-color(FFFF00)">burger</hi>, gelegt]</cell>
                     <cell>12 [<hi rend="background-color(FFFF00)">anno, widder, weyssenburg</hi>, gem, dag, <hi rend="background-color(FFFF00)">statt, stat, ite, abt, herren, landt, gefangen</hi>, sagt, <hi rend="background-color(FFFF00)">herr, leut, weyssenbung</hi>, drey, <hi rend="background-color(FFFF00)">juncker, keyser</hi>, lag, <hi rend="background-color(FFFF00)">manne, baden, stett, pfaltzgraue</hi>, inen, <hi rend="background-color(FFFF00)">ludwig</hi>, auß, eynen, <hi rend="background-color(FFFF00)">it₎, arnach</hi>, kament, <hi rend="background-color(FFFF00)">gewonnen, anne, schaden</hi>, darzu, <hi rend="background-color(FFFF00)">weissenburg, dannach, burger, vitter, jacob</hi>, nechst, <hi rend="background-color(FFFF00)">pfaltz, bischof</hi>, dorff, <hi rend="background-color(FFFF00)">hans</hi>, gulden, <hi rend="background-color(FFFF00)">pfaltzgrauen</hi>, vmb, thun, <hi rend="background-color(FFFF00)">graue</hi>]</cell>
                  </row>
                  <row>
                     <cell>14 [<hi rend="background-color(FFFF00)">jacob, joseph, korn, laban</hi>, bru, der, <hi rend="background-color(FFFF00)">vater, esaw, rachel, esan, segen, egipten, josephs, bruder, sun</hi>, vo, kùng, <hi rend="background-color(FFFF00)">land, bruoder</hi>, vatt, lya, <hi rend="background-color(FFFF00)">vatter, trome, grosz, kind, gebar</hi>, gehaissen, hann, <hi rend="background-color(FFFF00)">lant, muter, kùnig, jacobs</hi>, hiesz, gib, <hi rend="background-color(FFFF00)">pfister, jaren, garben</hi>, <hi rend="background-color(FF9900)">gebain</hi>, zwen, kament, <hi rend="background-color(FFFF00)">kinden, kinde</hi>, <hi rend="background-color(FF9900)">grab</hi>, lein, gebe, hies, <hi rend="background-color(FFFF00)">volk, lande</hi>, lebte, <hi rend="background-color(FFFF00)">ysack</hi>]</cell>
                     <cell>13 [<hi rend="background-color(FFFF00)">volk</hi>, wasser, moyses, <hi rend="background-color(FFFF00)">kùng</hi>, hiesz, vō, kind, meyses, engel, <hi rend="background-color(FFFF00)">gottes, sun, vatter, jacob</hi>, <hi rend="background-color(FF9900)">haiden</hi>, kament, gebot, sprachent, kung, damd, <hi rend="background-color(FFFF00)">joseph, berg, grosz, gang, gebar, egipten</hi>, werb, <hi rend="background-color(FFFF00)">land, sterben, absolon, kint</hi>, vol, <hi rend="background-color(FFFF00)">kinden, kinde</hi>, geborn, <hi rend="background-color(FFFF00)">opfer</hi>, beschach, <hi rend="background-color(FFFF00)">vater, korn</hi>, lag, mem, <hi rend="background-color(FF9900)">essen</hi>, dand, <hi rend="background-color(FFFF00)">alt, hand</hi>, abrahain, ains, hann, wort, amen, enweg]</cell>
                  </row>
                  <trailer>
                     <ref type="intern" target="#tab15">Tab. 15</ref>: Auswirkungen des Chunking auf Mallet- und BERTopic-Modelle, angewendet auf mittelalterliche Sammelhandschriften.
                  </trailer>
               </table>
               <p>Bereits für die 500er-Chunks mit BERT fällt auf, dass einzelne Themen z.&#160;T. sehr spezifisch und trennscharf sind, wie Topic 14 zur biblischen Erzählung von Esau und Jakob, dessen Sohn Joseph und seinen Brüdern. Dieser Befund verstärkt sich für die 250er-Chunks, die mit 32 Topics doppelt so viele wie die 500er-Chunks erhalten. Hier tritt beispielsweise der Sündenfall in der Schöpfungsgeschichte in Topic 19 sehr deutlich hervor:</p>
               <list>
                  <item>19 [adam, noe, ena, gebar, abel, alt, welte, arch, welt, paradis, fluch, smertzen, archen, enoch, verbotten, slangen, wasser, gottes, frowen, essen, opfel, warumb, jaret, adams, tier, erste, hundert, vo, caym, arche]</item>
               </list>
               <p>Allerdings finden sich in beiden BERT-Modellen mehr überlappende Topics&#160;– das Topic um die Stadt Weißenburg kommt auf 250er-Chunks in 3 Topics vor, die <title>Ulrichslegende</title> in 2&#160;–, andere wirken teilweise sehr inhaltsleer bzw. mit vielen Verrauschungen aus anderen Themen. Und manche Topics im 250er-Chunking fehlen im 500er-Chunking erstaunlicherweise, trotz häufigem Auftauchen im Korpus. So fehlt das Alexander-Topic gänzlich, obwohl es in vier Handschriften vorkommt und einen relativ großen Textumfang besitzt. </p>
               <p>Für die Arbeit mit umfangreichen vormodernen Quellen empfiehlt sich in Abhängigkeit von der spezifischen Fragestellung womöglich eine Kombination aus beiden Implementierungen. Die Anwendung von Mallet mit 500er-Chunks hat im Fall der spätmittelalterlichen Sammelhandschriften die lesbarsten und sinnvollsten Topics geliefert; je nach Wahl der Topic-Anzahl können hier auch unterschiedliche Interessen verfolgt werden: Bei eher unbekannten Textkonvoluten bietet sich eine höhere Anzahl Topics an, um auch kleinere Einzeltexte zu erkennen, bei bereits gut erschlossenen Quellen bieten weniger Topics eine gute Orientierung im Text. Die kleineren Themen, die mit BERTopic sichtbar geworden sind und die in verschiedensten Mallet-Modellen mit größeren oder kleineren Chunks und verschiedenen Topic-Anzahlen nicht enthalten waren, sind beispielsweise die Erzählung um die beiden rivalisierenden Trierer Stadtherren Dulcimer und Signator, die um 50 v.&#160;Chr. um die Vorherrschaft in der Stadt kämpften. Je nach Forschungsinteresse kann also auf eine der beiden Implementierungen oder auf eine Kombination zurückgegriffen werden, um bestmögliche Resultate für die eigene Arbeit zu erzielen.</p>
            </div>
            </div>
         </div>
         <div type="chapter">
            <head>7. Resumé</head>
            <p>In diesem Working Paper wurden drei historische Korpora mit verschiedenen Topic-Modeling-Verfahren untersucht. Ziel war eine systematische Dokumentation und Bewertung der Auswirkungen von Preprocessing (<ref type="intern" target="#hd8">Kapitel 3</ref>), Parametertuning (<ref type="intern" target="#hd43">Kapitel 5.3</ref>) und Topic Estimation (<ref type="intern" target="#hd31">Kapitel 5.1</ref> und <ref type="intern" target="#hd35">5.2</ref>) bei der Anwendung von Latent Dirichlet Allocation sowie ein Vergleich der Ergebnisse mit BERTopic, einem Verfahren, das auf Vektorisierung von Texten aufbaut.</p>
            <p>Es konnte festgestellt werden, dass die verschiedenen Korpora vor allem beim Preprocessing ausgesprochen unterschiedliche Anforderungen stellen und dass einzelne Preprocessing-Schritte für bestimmte Quellenarten gar nicht umsetzbar sind. Insbesondere der Nutzen der Lemmatisierung ist ambivalent und hängt stark von den zugrundeliegenden Daten und verfügbaren Sprachmodellen ab (<ref type="intern" target="#hd21">Kapitel 3.4</ref>). </p>
            <p>Die Zürcher Regierungsratsbeschlüsse aus dem 19. Jahrhundert standen nicht nur im Preprocessing vor spezifischen Hürden, da die Verteilung der Wörter noch ungleicher ist als bei anderen Korpora und entsprechend individualisierte Stopword-Listen entworfen werden mussten (<ref type="intern" target="#hd15">Kapitel 3.3</ref>). Aufgrund des Umfangs und der thematischen Breite war es dann vor allem die Anzahl der Topics, die erst ab 50 und mehr les- und nutzbare Cluster zeigte (<ref type="intern" target="#hd39">Kapitel 5.2.2</ref>). Erst wenn aufgrund der hohen Topic-Zahl eindeutige Zuordnungen zu thematisch mehr oder minder geschlossenen Themen erzielt wurden, konnte die Stärke des Ansatzes für diese Quelle aufgezeigt werden. BERTopic führte zwar zu teilweise aussagekräftigen Themenfeldern (<ref type="intern" target="#hd48">Kapitel 6.2.2</ref>), jedoch nur bedingt zu nachvollziehbaren Resultaten für das gesamte Korpus.</p>
            <p>Für die lebensgeschichtlichen Interviews, die der Gegenwart(ssprache) am nächsten sind, konnten die meisten Schritte durchgeführt (<ref type="intern" target="#hd9">Kapitel 3.1</ref>–<ref type="intern" target="#hd21">3.4</ref>) und repräsentativ weitere Parametertunings vorgenommen werden (<ref type="intern" target="#hd43">Kapitel 5.3</ref>, <ref type="intern" target="#hd47">6.2.1</ref>). Es hat sich herausgestellt, dass für diese zeitgeschichtlichen Dokumente ein Topic Modeling mit LDA auch nach dem Aufkommen von LLMs eine adäquate Methode zur Inhaltserschließung darstellt (<ref type="intern" target="#hd36">Kapitel 5.2.1</ref>). Als beinahe kurios ist das Verhalten von BERTopic bei der Anwendung auf dieses Korpus mit unterschiedlichen Chunkgrößen zu bewerten (<ref type="intern" target="#hd47">Kapitel 6.2.1</ref>), das darüber hinaus eine der größten Stärken von LDA vermissen lässt: das Zuweisen aller Topics zu allen Dokumenten (bzw. gechunkt: Textpassagen) (vgl. <ref type="intern" target="#hd25">Kapitel 4.1</ref> und <ref type="intern" target="#hd27">4.3</ref>). Dadurch sind mit LDA Korrelationen, Themenüberlagerungen und Themenwechsel wesentlich präziser einzufangen als mit BERTopic. </p>
            <p>Die Ergebnisse der Analyse für die spätmittelalterlichen Sammelhandschriften legt eine Anwendung von Topic Modeling mit LDA und mit BERTopic auf vormoderne Quellen für verschiedene Zwecke nahe: Umfangreiche Manuskripte mit mehreren Texten können mithilfe von LDA genauer erschlossen werden (<ref type="intern" target="#hd40">Kapitel 5.2.3</ref>), wenn die Texte gechunkt (vgl. <ref type="intern" target="#hd25">Kapitel 4.1</ref> und <ref type="intern" target="#hd27">4.3</ref>) und die Anzahl der Topics erhöht wird. Bei größtenteils unerschlossenen Quellen mit fehlender oder nur grober Inhaltsbeschreibung ermöglicht eine Erhöhung der Topic-Anzahl eine Übersicht auch über eher marginale Themen und Inhalte. Eine Absenkung der Topics reicht bei besser bekannter Textgrundlage aus, da weniger Begriffe in einem Topic ausreichen, um von der Forscherin erkannt zu werden, was eine große Zeitersparnis beim Durcharbeiten der Topic-Listen bedeutet. Durch ein Zurückverfolgen der Topics in die einzelnen Dokumente wird die Orientierung im Gesamttext einer umfangreichen Sammelhandschrift deutlich erleichtert und ein Vergleich von verwandten Textstellen über mehrere Manuskripte hinweg um ein Vielfaches vereinfacht. Die Anwendung von BERTopic empfiehlt sich je nach Forschungsinteresse als zusätzlicher Ansatz, um kleine, spezifische Topics nicht zu übersehen (<ref type="intern" target="#hd49">Kapitel 6.2.3</ref>).</p>
            <p>Insgesamt kann festgehalten werden, dass die Anwendbarkeit von Topic Modeling von den Quellen und deren Aufbereitung, der Fragestellung und der methodischen Herangehensweise eines Forschungsvorhabens abhängt. Zunächst einmal muss bei nicht standard- und&#160;/ oder gegenwartssprachlichen Texten eine gewisse Mindestmenge an Daten vorhanden sein, um ein eigenes Modell trainieren zu können. Es bedarf keiner weiteren Erläuterung, dass die Fragestellung eine quantitative Perspektive begünstigen sollte. Die Forschung der letzten Jahre hat gezeigt, dass quantitative Ansätze und hermeneutisches Arbeiten sich keinesfalls ausschließen, sondern maschinelles Lernen beim Filtern, Samplen und Spurensuchen wichtige vorbereitende, begleitende oder validierende Schritte leisten kann. Auf diese Weise können sich Methoden&#160;– analog zu klassischen Mixed-Methods-Ansätzen der Sozialwissenschaften&#160;– ergänzen: Eine Outlieranalyse von lebensgeschichtlichen Interviews mit einem hochspezifischen Topic Model kann beispielsweise historische Phänomene sichtbar machen, die sonst schwierig zu finden sind.<note type="footnote">Vgl. <ref type="bibliography" target="#moebus_vermaechtnis_2020">Möbus 2020</ref>.</note>
            </p>
            <p>Unser Ziel war es, das für viele Methoden des maschinellen Lernens unabdingbare Preprocessing (<ref type="intern" target="#hd5">Kapitel 3</ref>) und insbesondere die Aus- und Wechselwirkungen der vielen Variablen (vgl. auch <ref type="intern" target="#hd11">Kapitel 4</ref>, <ref type="intern" target="#hd20">5.2</ref>, <ref type="intern" target="#hd24">5.3</ref> und <ref type="intern" target="#hd27">6.2</ref>) ausführlich zu testen und zu untersuchen. Zum Teil unterschieden sich die Ergebnisse nach zwei verschiedenen Preprocessing-Schritten nur in subtilen Nuancen, wie die Lemmatisierung mit und ohne POS-Filter (<ref type="intern" target="#hd9">Kapitel 3.4</ref>) oder die Veränderung der Anzahl der Iterationen (<ref type="intern" target="#hd24">Kapitel 5.3</ref>). Sehr viel größer hingegen ist der Einfluss der Stopword-Entfernung auf die resultierenden Topic-Listen (<ref type="intern" target="#hd8">Kapitel 3.3</ref>). Hier konnte gezeigt werden, dass eine bloße Entfernung der häufigsten Wörter über einen Threshold riskant sein kann und sich für die drei sehr unterschiedlichen Beispielkorpora als wenig zielführend erwiesen hat. Daher kamen eigens angelegte Stopword-Listen zur Anwendung, die die sprachlichen Eigenheiten der einzelnen Korpora berücksichtigen. Solche kuratierten Listen bieten sich für die meisten historischen Quellen an und sollten zur Nachvollziehbarkeit der erzielten Ergebnisse stets dokumentiert und mitveröffentlicht werden.</p>
            <p>Die kontrovers debattierte Thematik der Identifikation der optimalen Anzahl von Topics war ein weiterer Fokus des Papers, und überraschenderweise stellte sich keine der etablierten quantitativen Metriken als zielführend heraus (<ref type="intern" target="#hd16">Kapitel 5.1</ref>). Alle Metriken führten zu mehr oder minder schwer nachvollziehbaren Resultaten, die durch die qualitative Evaluation nicht gestützt werden konnten (<ref type="intern" target="#hd20">Kapitel 5.2</ref>). Das bestehende Problem, dass für Korpora, die mit Topic Modeling behandelt werden, eine Anzahl von Themen vorgegeben werden muss, konnte entsprechend nicht durch Evaluationsmetriken gelöst werden. Eine weitere Diskussion über quantitative Ansätze zur Messung von Topic-Modeling-Resultaten ist demnach nötig.</p>
            <p>Mit der Notwendigkeit qualitativer Evaluation ist auch Wissen um die Spezifik von Korpora gefragt. Das sogenannte <term type="dh">Domain Knowledge</term> muss auch weiterhin Teil der Auswertungs- und Interpretationspraxis bleiben, da sonst semantische Feinheiten verloren gehen und die Resultate der Algorithmen nur bedingt adäquat eingeordnet werden können.</p>
            <p>Auch 20 Jahre nach der Einführung der Methode in den Geisteswissenschaften ist es weiterhin notwendig, methodologisch über Topic Modeling nachzudenken und den Ansatz reflektiert einzusetzen. Auch im Zeitalter von LLMs ist es hilfreich, wenn reproduzierbare Resultate aus statistischen Methoden gewonnen werden, die jederzeit Imitation oder Reproduktion erlauben. Des Weiteren ergeben sich aus der Anwendung von LLMs zwei weitere Probleme: Zeitgeschichtliche Quellen, insbesondere hochsensible Interviews, können aus Datenschutzgründen nicht ohne Weiteres über Schnittstellen an High-Perfomance-Cluster oder Cloudanbieter gesendet werden. Die Möglichkeiten, LLMs lokal zu betreiben, nehmen zwar zu, weisen aber auf das zweite Problem hin: dass wir es mitunter mit enorm großen Dokumenten (z.&#160;B. Transkripte mehrstündiger Interviews) zu tun haben, für die entsprechende Rechenkapazität benötigt wird. Es gibt also noch immer genügend Gründe, in der Geschichtswissenschaft mit LDA zu arbeiten. Eine Symbiose mit aktuellen KI-Ansätzen wäre aber zum Beispiel, LLMs zur Evaluation von Topic-Modellen heranzuziehen.<note type="footnote">Vgl. <ref type="bibliography" target="#stammbach_et_al_2023">Stammbach et&#160;al. 2023</ref>.</note>
            </p>
            <p>Aus Gründen der Transparenz und Nachvollziehbarkeit votieren wir dafür, bei der Anwendung von Topic Modeling auf ein Korpus die genutzten Parameter der Algorithmen zu veröffentlichen. Die Prinzipien des FAIRen Publizierens<note type="footnote">Vgl. dazu <ref type="bibliography" target="#wilkinson_et_al_principles_2016">Wilkinson et&#160;al. 2016</ref>.</note> gelten unserer Meinung nach nicht nur für den Umgang mit Daten, sondern auch für die Verwendung von Algorithmen. Aber auch für die hier analysierte Form des Distant Readings und der Korpusanalyse mit Topic Modeling gilt, dass die Bearbeitenden über thematische Expertise verfügen müssen und gleichzeitig die gewonnenen Resultate durch ihre explizierende Interpretation nachvollziehbar machen sollten.</p>
         </div>
      </body>
      <back>
         <div type="bibliography">
            <head>Bibliografie</head>
            <listBibl>
               <bibl xml:id="aletras_stevenson_topic_2013">Nikolaos Aletras&#160;/ Mark Stevenson: Evaluating Topic Coherence Using Distributional Semantics. In: Alexander Koller&#160;/ Katrin Erk (Hg.): Proceedings of the 10<hi rend="super">th</hi> International Conference on Computational Semantics. Long Papers (IWCS 2013, Potsdam, 19.–22.03.2013). Kerrville, Texas 2013, S.&#160;13–22. PDF. [<ref target="https://www.aclweb.org/anthology/W13-0102">online</ref>]</bibl>
               <bibl xml:id="arun_et_al_finding_2010">R. Arun&#160;/ V. Suresh&#160;/ C. E. Veni Madhavan&#160;/ M. N. Narasimha Murthy: On Finding the Natural Number of Topics with Latent Dirichlet Allocation: Some Observations. In: Mohammed J. Zaki&#160;/ Jeffrey Xu Yu&#160;/ B. Ravindran&#160;/ Vikram Pudi (Hg.): Advances in Knowledge Discovery and Data Mining. Part I. 14<hi rend="super">th</hi> Pacific-Asia Conference. Conference Proceedings (PAKDD 2010, Hyderabad, 21.–24.06.2010). Berlin u.&#160;a. 2010, S.&#160;391–402. PDF. DOI: <ref target="https://doi.org/10.1007/978-3-642-13657-3_43">10.1007/978-3-642-13657-3_43</ref></bibl>
               <bibl xml:id="bayerschmidt_moebus_leben_2025">Philipp Bayerschmidt&#160;/ Dennis Möbus: Leben gelabelt. Computergestützte Inhaltverzeichnisse für Oral-History-Interviews. In: BIOS. Zeitschrift für Biographieforschung, Oral History und Lebensverlaufsanalysen 28 (2025), H.&#160;1/2, S.&#160;83–104. <ptr type="gbv" cRef="624822702"/>
               </bibl>
               <bibl xml:id="blei_topic_2012">David M. Blei: Probabilistic Topic Models. Surveying a Suite of Algorithms That Offer a Solution to Managing Large Document Archives. In: Communications of the ACM 55 (2012), H.&#160;4, S.&#160;77–84. DOI: 10.1145/2133806.2133826</bibl>
               <bibl xml:id="blei_et_al_lda_2003">David M. Blei&#160;/ Andrew Y. Ng&#160;/ Michael I. Jordan: Latent Dirichlet Allocation. In: The Journal of Machine Learning Research 3 (2003), S.&#160;993–1022. [<ref target="https://www.jmlr.org/papers/volume3/blei03a/blei03a.pdf">online</ref>]</bibl>
               <bibl xml:id="bollmann_comparison_2019">Marcel Bollmann: A Large-Scale Comparison of Historical Text Normalization Systems. In: Jill Burstein&#160;/ Christy Doran&#160;/ Thamar Solorio (Hg.): Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Minneapolis, 02.–07.06.2019). 2 Bände. Minneapolis 2019. Band 1 (2019): Long and Short Papers, S.&#160;3885–3898. PDF. DOI: <ref target="https://doi.org/10.18653/v1/N19-1389">10.18653/v1/N19-1389</ref></bibl>
               <bibl xml:id="bouma_information_2009">Gerlof Bouma: Normalized (Pointwise) Mutual Information in Collocation Extraction. 2009. PDF. [<ref target="https://svn.spraakdata.gu.se/repos/gerlof/pub/www/Docs/npmi-pfd.pdf">online</ref>] </bibl>
               <bibl xml:id="brett_topic_2012">Megan R. Brett: Topic Modeling: A Basic Introduction. In: Journal of Digital Humanities 2 (2012), H.&#160;1. HTML. [<ref target="http://journalofdigitalhumanities.org/2-1/topic-modeling-a-basic-introduction-by-megan-r-brett">online</ref>] </bibl>
               <bibl xml:id="bubenhofer_aequivalenz_2020">Noah Bubenhofer: Semantische Äquivalenz in Geburtserzählungen: Anwendung von Word Embeddings. In: Zeitschrift für germanistische Linguistik 48 (2020), H.&#160;3, S.&#160;562–589. PDF. DOI: 10.1515/zgl-2020-2014</bibl>
               <bibl xml:id="burns_constructing_2018">Patrick J. Burns: Constructing Stoplists for Historical Languages. In: Digital Classics Online 4 (2018), H. 2, S.&#160;4–20. PDF. DOI: <ref target="https://doi.org/10.11588/dco.2018.2.52124">10.11588/dco.2018.2.52124</ref></bibl>
               <bibl xml:id="cao_et_al_method_2009">Juan Cao&#160;/ Tian Xia&#160;/ Jintao Li&#160;/ Youngdong Zhang&#160;/ Sheng Tang: A Density-Based Method for Adaptive LDA Model Selection. In: Neurocomputing 72 (2009), H.&#160;7–9, S.&#160;1775–1781. HTML. DOI: 10.1016/j.neucom.2008.06.011</bibl>
               <bibl xml:id="chang_et_al_tea_2009">Jonathan Chang&#160;/ Jordan Boyd-Graber&#160;/ Sean Gerrish&#160;/ Chong Wang&#160;/ David M. Blei: Reading Tea Leaves: How Humans Interpret Topic Models. In: Yoshua Bengio&#160;/ Dale Schuurmanns&#160;/ John Lafferty&#160;/ Chris Williams&#160;/ Aron Culotta (Hg.): Advances in Neural Information Processing Systems. 22<hi rend="super">nd</hi> Conference Proceedings (NIPS 2009, Vancouver, 07.-10.12.2009). La Jolla, US-CA 2009. PDF. [<ref target="https://proceedings.neurips.cc/paper_files/paper/2009/file/f92586a25bb3145facd64ab20fd554ff-Paper.pdf">online</ref>] </bibl>
               <bibl xml:id="churchill_singh_evolution_2022">Rob Churchill&#160;/ Lisa Singh: The Evolution of Topic Modeling. In: ACM Computing Surveys 54 (2022), H.&#160;10, S.&#160;1–35. HTML. DOI: <ref target="https://doi.org/10.1145/3507900">10.1145/3507900</ref></bibl>
               <bibl xml:id="deveaud_et_al_concept_2014">Romain Deveaud&#160;/ Eric SanJuan&#160;/ Patrice Bellot: Accurate and Effective Latent Concept Modeling for Ad Hoc Information Retrieval. In: Document Numérique 17 (2014), H.&#160;1, S.&#160;61–84. PDF. [<ref target="https://www.researchgate.net/publication/262904368_Accurate_and_Effective_Latent_Concept_Modeling_for_Ad_Hoc_Information_Retrieval">online</ref>]<!--DOI: 10.3166/dn.17.1.61-84 (führt zu nicht mehr verfügbarer Seite)--></bibl>
               <bibl xml:id="devlin_et_al_2018">Jacob Devlin&#160;/ Ming-Wei Chang&#160;/ Kenton Lee&#160;/ Kristina Toutanova: BERT. Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv. 11.10.2018. Version 2.0 vom 24.05.2019. HTML. DOI: <ref target="https://doi.org/10.48550/ARXIV.1810.04805">10.48550/arXiv.1810.04805</ref></bibl>
               <bibl xml:id="dobson_outputs_2021">James Dobson: Interpretable Outputs. Criteria for Machine Learning in the Humanities. In: Digital Humanities Quarterly 15 (2021), H.&#160;2. HTML. [<ref target="https://dhq.digitalhumanities.org/vol/15/2/000555/000555.html">online</ref>]</bibl>
               <bibl xml:id="doogan_buntine_topic_2021">Caitlin Doogan&#160;/ Wray Buntine: Topic Model or Topic Twaddle? Re-Evaluating Semantic Interpretability Measures. In: Kristina Toutanova&#160;/ Anna Rumshisky&#160;/ Luke Zettlemoyer&#160;/ Dilek Hakkani-Tur&#160;/ Iz Beltagy&#160;/ Steven Bethard&#160;/ Ryan Cotterell&#160;/ Tanmoy Chakraborty&#160;/ Yichao Zhou (Hg.): Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Online, 06.–11.06.2021). 2021, S.&#160;3824–3848. PDF. [<ref target="https://aclanthology.org/2021.naacl-main.300.pdf">online</ref>]</bibl>
               <bibl xml:id="du_verstaendnis_2024">Keli Du: Zum Verständnis des LDA Topic Modeling: eine Evaluation aus Sicht der Digital Humanities. Dissertation, Universität Würzburg. 2024. PDF. DOI: <ref target="https://doi.org/10.25972/OPUS-34826">10.25972/OPUS-34826</ref></bibl>
               <bibl xml:id="dumais_analysis_2004">Susan T. Dumais: Latent Semantic Analysis. In: Annual Review of Information Science and Technology 38 (2004), H.&#160;1, S.&#160;188–230. HTML. DOI: 10.1002/aris.1440380105</bibl>
               <bibl xml:id="flachs_et_al_text_2019">Simon Flachs&#160;/ Marcel Bollmann&#160;/ Anders Søgaard: Historical Text Normalization with Delayed Rewards. In: Anna Korhonen&#160;/ David Traum&#160;/ Lluís Màrquez (Hg.): Proceedings of the 57<hi rend="super">th</hi> Annual Meeting of the Association for Computational Linguistics (ACL 2019, Florenz, 28.07.–02.08.2019). Florenz 2019, S.&#160;1614–1619. PDF. DOI: <ref target="https://doi.org/10.18653/v1/P19-1157">10.18653/v1/P19-1157</ref></bibl>
               <bibl xml:id="fuberlin_ub_hg_oralhistory_2025">Freie Universität Berlin. Universitätsbibliothek (Hg.): Oral-History.Digital. Letzter Zugriff: 07.01.2025. HTML. [<ref target="https://www.oral-history.digital/">online</ref>]</bibl>
               <bibl xml:id="graham_et_al_exploring_2022">Shawn Graham&#160;/ Scott B. Weingart&#160;/ Ian Milligan&#160;/ Kim Martin: Exploring Big Historical Data. The Historian’s Macroscope. 2. Auflage.  Hackensach, US-NJ 2022. <ptr type="gbv" cRef="1772351059"/>
               </bibl>
               <bibl xml:id="graham_et_al_topic_2012">Shawn Graham&#160;/ Scott B. Weingart&#160;/ Ian Milligan: Getting Started with Topic Modeling and MALLET. In: Programming Historian 1 (2012). HTML. DOI: <ref target="https://doi.org/10.46430/phen0017">10.46430/phen0017</ref></bibl>
               <bibl xml:id="grant_et_al_topic_2021">Philip Grant&#160;/ Ratan Sebastian&#160;/ Marc Allassonnière-Tang&#160;/ Sara Cosemans: Topic Modeling on Archive Documents from the 1970s: Global Policies on Refugees. In: Digital Scholarship in the Humanities 36 (2021), H.&#160;4, S.&#160;886–904. PDF. DOI: 10.1093/llc/fqab018</bibl>
               <bibl xml:id="griffiths_steyvers_topics_2004">Thomas L. Griffiths&#160;/ Mark Steyvers: Finding Scientific Topics. In: Proceedings of the National Academy of Sciences 101 (2004), Supplement 1, S.&#160;5228–5235. PDF. DOI: <ref target="https://doi.org/10.1073/pnas.0307752101">10.1073/pnas.0307752101</ref>
               </bibl>
               <bibl xml:id="grootendorst_bertopic_2022">Maarten Grootendorst: BERTopic: Neural Topic Modeling with a Class-Based TF-IDF Procedure. arXiv. 11.03.2022. PDF.  DOI: <ref target="https://doi.org/10.48550/arXiv.2203.05794">10.48550/arXiv.2203.05794</ref>
               </bibl>
               <bibl xml:id="grootendorst_bertopic_2024">Maarten Grootendorst: BERTopic. 2024. HTML. [<ref target="https://maartengr.github.io/BERTopic/index.html">online</ref>]</bibl>
               <bibl xml:id="handschriftencensus_hg_twinger_2025">Handschriftencensus (Hg.): Twinger, Jakob, von Königshofen: ›Chronik‹ (dt.). Letzter Zugriff: 07.01.2025. HTML. [<ref target="https://handschriftencensus.de/werke/1906">online</ref>]</bibl>
               <bibl xml:id="hodel_et_al_inferenzen_2022">Tobias Hodel&#160;/ Dennis Möbus&#160;/ Ina Serif: Von Inferenzen und Differenzen. Ein Vergleich von Topic-Modeling-Engines auf Grundlage historischer Korpora. In: Selin Gerlek&#160;/ Sarah Kissler&#160;/ Thorben Mämecke&#160;/ Dennis Möbus (Hg.): Von Menschen und Maschinen&#160;– Mensch-Maschine-Interaktion in digitalen Kulturen. Hagen 2022, S.&#160;181–205. PDF. DOI: <ref target="https://doi.org/10.57813/20220623-153139-0">10.57813/20220623-153139-0</ref></bibl>
               <bibl xml:id="hoyle_et_al_topic_2021">Alexander Hoyle&#160;/ Pranav Goel&#160;/ Denis Peskov&#160;/ Andrew Hian-Cheong&#160;/ Jordan Boyd-Graber&#160;/ Philip Resnik: Is Automated Topic Model Evaluation Broken? The Incoherence of Coherence. In: Marc’Aurelio Ranzato&#160;/ Alina Beygelzimer&#160;/ Yann N. Dauphin&#160;/ Percy S. Liang&#160;/ Jennifer Wortman Vaughan (Hg.): Advances in Neural Information Processing Systems 34. 35<hi rend="super">th</hi> Conference on Neural Information Processing Systems 2021. Conference Proceedings (NeurIPS 2021, Online, 06.–14.12.2021). 2021. PDF. <ref target="https://proceedings.neurips.cc/paper/2021/file/0f83556a305d789b1d71815e8ea4f4b0-Paper.pdf">[online]</ref>
               </bibl>
               <bibl xml:id="igubfuhagen_hg_archiv_2025a">Institut für Geschichte und Biographie der FernUniversität in Hagen (Hg.) (2025a): Archiv »Deutsches Gedächtnis«. Letzter Zugriff: 07.01.2025. HTML. [<ref target="https://www.fernuni-hagen.de/geschichteundbiographie/deutschesgedaechtnis/">online</ref>]</bibl>
               <bibl xml:id="igubfuhagen_hg_projekt_2025b">Institut für Geschichte und Biographie der FernUniversität in Hagen (Hg.) (2025b): Projekt: KA3&#160;– Kölner Zentrum Analyse und Archivierung von AV-Daten. Teilprojekt: Pilotprojekt Oral History. Letzter Zugriff: 07.01.2025. HTML. [<ref target="https://www.fernuni-hagen.de/geschichteundbiographie/forschung/projekte/KA3.shtml">online</ref>]</bibl>
               <bibl xml:id="jurafsky_martin_speech_2009">Daniel Jurafsky&#160;/ James H.&#160;Martin: Speech and Language Processing. An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition. 2. Auflage.  Upper Saddle River, US-NJ u.&#160;a. 2009. <ptr type="gbv" cRef="577240269"/>
               </bibl>
               <bibl xml:id="khodorchenko_et_al_evaluation_2022">Maria Khodorchenko&#160;/ Nikolay Butakov&#160;/ Denis Nasonov: Towards Better Evaluation of Topic Model Quality. In: Sergey Balandin&#160;/ Evgeny Kucheryay&#160;/ Tatiana Shatalova (Hg.): Proceedings of the 32<hi rend="super">nd</hi> Conference of Open Innovations Association FRUCT (FRUCT’32, Tampere, FI, 09.–11.11.2022). 2 Hefte. Helsinki 2022. Heft 2 (2022), S.&#160;128–134. PDF. [<ref target="https://www.fruct.org/files/publications/volume-32/fruct32/Kho.pdf">online</ref>] </bibl>
               <bibl xml:id="lau_et_al_machine_2009">Jey Han Lau&#160;/ David Newman&#160;/ Timothy Baldwin: Machine Reading Tea Leaves: Automatically Evaluating Topic Coherence and Topic Model Quality. In: Shuly Wintner&#160;/ Sharon Goldwater&#160;/ Stefan Riezler (Hg.): Proceedings of the 14<hi rend="super">th</hi> Conference of the European Chapter of the Association for Computational Linguistics (Göteborg, SE, 26.-30.04.2014). Göteborg 2014, S.&#160;530–539. PDF. DOI: <ref target="https://doi.org/10.3115/v1/E14-1056">10.3115/v1/E14-1056</ref></bibl>
               <bibl xml:id="li_et_al_improving_2024">Zongxia Li&#160;/ Andrew Mao&#160;/ Daniel Stephens&#160;/ Pranav Goel&#160;/ Emily Walpole&#160;/ Alden Dima&#160;/ Juan Fung&#160;/ Jordan Boyd-Graber: Improving the TENOR of Labeling: Re-Evaluating Topic Models for Content Analysis. arXiv. 29.01.2024. Version 2 vom 20.02.2024. PDF. DOI: <ref target="https://doi.org/10.48550/arXiv.2401.16348">10.48550/arXiv.2401.16348</ref>
               </bibl>
               <bibl xml:id="linseisen_data_2022">Elisa Linseisen: »Big Data of the Past«: Reflexionen über eine Episteme des Digitalen. In: Riley Linebaugh&#160;/ Philipp McLean&#160;/ Lisa Regazzoni&#160;/ Bettina Severin-Barboutie (Hg.): Geschichtstheorie am Werk. 08.03.2022. Version vom 18.01.2023. HTML. DOI: <ref target="https://doi.org/10.58079/pcx2">10.58079/pcx2</ref>
               </bibl>
               <bibl xml:id="mcinnes_et_al_library_2016">Leland McInnes&#160;/ John Healy&#160;/ Steve Astels: The hdbscan Clustering Library. 2016. HTML. [<ref target="https://hdbscan.readthedocs.io/en/latest/index.html">online</ref>]</bibl>
               <bibl xml:id="meaney_et_al_indices_2023">Christopher Meaney&#160;/ Therese A. Stukel&#160;/ Peter C. Austin&#160;/ Rahim Moineddin&#160;/ Michelle Greiver&#160;/ Michael Escobar: Quality Indices for Topic Model Selection and Evaluation. A Literature Review and Case Study. In: BMC Medical Informatics and Decision Making 23 (2023). PDF. DOI: <ref target="https://doi.org/10.1186/s12911-023-02216-1">10.1186/s12911-023-02216-1</ref>
               </bibl>
               <bibl xml:id="mimno_et_al_optimizing_2011">David Mimno&#160;/ Hanna Wallach&#160;/ Edmund Talley&#160;/ Miriam Leenders&#160;/ Andrew McCallum: Optimizing Semantic Coherence in Topic Models. In: Regina Barzilay&#160;/ Mark Johnson (Hg.): Proceedings of the 2011 Conference on Empirical Methods in Natural Language Processing (EMNLP 2011, Edinburgh, 27.–31.07.2011). Edinburgh 2011, S.&#160;262–272. PDF. [<ref target="https://aclanthology.org/D11-1024.pdf">online</ref>] </bibl>
               <bibl xml:id="miner_et_al_topic_2023">Adam S. Miner&#160;/ Sheridan A. Stewart&#160;/ Meghan C. Halley&#160;/ Laura K. Nelson&#160;/ Eleni Linos: Formally Comparing Topic Models and Human-Generated Qualitative Coding of Physician Mothers’ Experiences of Workplace Discrimination. In: Big Data &amp; Society 10 (2023). DOI: <ref target="https://doi.org/10.1177/20539517221149106">10.1177/20539517221149106</ref></bibl>
               <bibl xml:id="moebus_vermaechtnis_2020">Dennis Möbus: Holleriths Vermächtnis&#160;– ein Beitrag zur Geschichte von Frauen in der EDV. Topic Modeling als Methode digitaler Sekundäranalyse lebensgeschichtlicher Interviews. In: BIOS. Zeitschrift für Biographieforschung, Oral History und Lebensverlaufsanalysen 33 (2020), H.&#160;1, S.&#160;162–180. PDF. DOI: <ref target="https://doi.org/10.3224/bios.v33i2.01">10.3224/bios.v33i2.01</ref></bibl>
               <bibl xml:id="murzintcev_number_2016">Nikita Murzintcev: Select Number of Topics for LDA Model. RPubs. 24.10.2016. HTML. [<ref target="https://rpubs.com/siri/ldatuning">online</ref>] </bibl>
               <bibl xml:id="mutuvi_et_al_evaluating_2018">Stephen Mutuvi&#160;/ Antoine Deucet&#160;/ Moses Odeo&#160;/ Adam Jatowt: Evaluating the Impact of OCR Errors on Topic Modeling. In: Milena Dobreva&#160;/ Annika Hinze&#160;/ Maja Žumer (Hg.): Maturity and Innovation in Digital Libraries. Cham 2018, S.&#160;3–14. HTML. DOI: 10.1007/978-3-030- 04257-8_1</bibl>
               <bibl xml:id="newman_et_al_evaluation_2010">David Newman&#160;/ Jey Han Lau&#160;/ Karl Grieser&#160;/ Timothy Baldwin: Automatic Evaluation of Topic Coherence. In: Ron Kaplan&#160;/ Jill Burstein&#160;/ Mary Harper&#160;/ Gerald Penn (Hg.): Human Language Technologies: The 2010 Annual Conference of the North American Chapter of the Association for Computational Linguistics. Conference Proceedings (Los Angeles, 02.–04.07.2010). Los Angeles 2010, S.&#160;100–108. PDF. [<ref target="https://aclanthology.org/N10-1012.pdf">online</ref>]</bibl>
               <bibl xml:id="niethammer_hg_jahre_1983">Lutz Niethammer (Hg.): »Die Jahre weiß man nicht, wo man die heute hinsetzen soll.« Faschismuserfahrungen im Ruhrgebiet. Berlin u.&#160;a. 1983. <ptr type="gbv" cRef="030920663"/>
               </bibl>
               <bibl xml:id="rahimi_et_al_topic_2023">Hamed Rahimi&#160;/ Jacob Louis Hoover&#160;/ David Mimno&#160;/ Hubert Naacke&#160;/ Camelia Constantin&#160;/ Bernd Amann: Contextualized Topic Coherence Metrics. arXiv. 23.05.2023. PDF. DOI: <ref target="https://doi.org/10.48550/arXiv.2305.14587">10.48550/arXiv.2305.14587</ref>
               </bibl>
               <bibl xml:id="rawson_munoz_cleaning_2019">Katie Rawson&#160;/ Trevor Muñoz: Against Cleaning. In: Matthew K. Gold&#160;/ Lauren F. Klein (Hg.): Debates in the Digital Humanities. Minneapolis 2019. HTML. [<ref target="https://dhdebates.gc.cuny.edu/read/untitled-f2acf72c-a469-49d8-be35-67f9ac1e3a60/section/07154de9-4903-428e-9c61-7a92a6f22e51">online</ref>]  </bibl>
               <bibl xml:id="roeder_et_al_space_2015">Michael Röder&#160;/ Andreas Both&#160;/ Alexander Hinneburg: Exploring the Space of Topic Coherence Measures. In: Xueqi Cheng&#160;/ Hang Li (Hg.): WSDM ’15. Proceedings of the Eighth ACM International Conference on Web Search and Data Mining (Shanghai, 02.–06.02.2015). Shanghai 2015, S.&#160;399–408. PDF. DOI: <ref target="https://doi.org/10.1145/2684822.2685324">10.1145/2684822.2685324</ref>
               </bibl>
               <bibl xml:id="rosner_et_al_topic_2014">Frank Rosner&#160;/ Alexander Hinneburg&#160;/ Michael Röder/ Martin Nettling&#160;/ Andreas Both: Evaluating Topic Coherence Measures. arXiv. 25.03.2014. PDF. DOI: <ref target="https://doi.org/10.48550/arXiv.1403.6397">10.48550/arXiv.1403.6397</ref>
               </bibl>
               <bibl xml:id="schoech_topic_exploration_2021">Christof Schöch: Topic Modeling Genre. An Exploration of French Classical and Enlightenment Drama. arXiv. 24.03.2021 PDF. DOI: <ref target="https://doi.org/10.48550/arXiv.2103.13019">10.48550/arXiv.2103.13019</ref>
               </bibl>
               <bibl xml:id="schofield_et_al_stops_2017">Alexandra Schofield&#160;/ Måns Magnusson&#160;/ David Mimno: Pulling Out the Stops: Rethinking Stopword Removal for Topic Models. In: Mirella Lapata&#160;/ Phil Blunsom&#160;/ Alexander Koller (Hg.): Proceedings of the 15<hi rend="super">th</hi> Conference of the European Chapter of the Association for Computational Linguistics (Valencia, 03.–07.04.2017). 2 Bände. Valencia 2017. Band 2 (2017): Short Papers, S.&#160;432–436. PDF. [<ref target="https://aclanthology.org/E17-2069.pdf">online</ref>] </bibl>
               <bibl xml:id="shi_et_al_evaluation_2019">Hanyu Shi&#160;/ Martin Gerlach&#160;/ Isabel Diersen&#160;/ Doug Downey&#160;/ Luis Amaral: A New Evaluation Framework for Topic Modeling Algorithms Based on Synthetic Corpora. In: Kamalika Chaudhuri&#160;/ Masashi Sugiyama (Hg.): Proceedings of the 22<hi rend="super">nd</hi> International Conference on Artificial Intelligence and Statistics (Naha, JP, 16.–18.04.2019; =&#160;Proceedings of Machine Learning Research, 89). 2019, S.&#160;816–826. PDF. [<ref target="http://proceedings.mlr.press/v89/shi19a/shi19a.pdf">online</ref>]</bibl>
               <bibl xml:id="serif_geschichte_2020">Ina Serif: Geschichte aus der Stadt. Überlieferung und Aneignungsformen der deutschen Chronik Jakob Twingers von Königshofen (=&#160;Kulturtopographie des alemannischen Raums, 11). Berlin u.&#160;a. 2020. <ptr type="gbv" cRef="1696831512"/>
               </bibl>
               <bibl xml:id="serif_chronist_2015">Ina Serif: Der zerstreute Chronist. Zur Überlieferung der deutschsprachigen Chronik Jakob Twingers von Königshofen. In: Mittelalter. Interdisziplinäre Forschung und Rezeptionsgeschichte. 05.12.2015. Version vom 02.07.2025. HTML. DOI: <ref target="https://doi.org/10.58079/rgxp">10.58079/rgxp</ref>
               </bibl>
               <bibl xml:id="serif_tmdata_2024">Ina Serif: tm_data. GitHub. 19.09.2024. Datenset. [<ref target="https://github.com/wissen-ist-acht/tm_data">online</ref>]</bibl>
               <bibl xml:id="simmler_et_al_topic_2019">Severin Simmler&#160;/ Thorsten Vitt&#160;/ Steffen Pielström: Topic Modeling with Interactive Visualizations in a GUI Tool. In: DH 2019. Abstracts and Posters from the Digital Humanities 2019 Conference (Utrecht, 09.–12.07.2019). Utrecht 2019. PDF. DOI: <ref target="https://doi.org/10.34894/ENV3TX">10.34894/ENV3TX</ref></bibl>
               <bibl xml:id="stammbach_et_al_2023">Dominik Stammbach&#160;/ Vilém Zouhar&#160;/ Alexander Hoyle&#160;/ Mrinmaya Sachan&#160;/ Elliott Ash: Revisiting Automated Topic Model Evaluation with Large Language Models. In: Houda Bouamor&#160;/ Juan Pino&#160;/ Kalika Bali (Hg.): Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023, Singapur, 06.–10.12.2023). Singapur 2023, S.&#160;9348–9357. PDF. [<ref target="https://aclanthology.org/2023.emnlp-main.581.pdf">online</ref>]</bibl>
               <bibl xml:id="taddy_estimation_2012">Matthew A. Taddy: On Estimation and Selection for Topic Models. In: Neil D. Lawrence&#160;/ Mark Girolami (Hg.): Artificial Intelligence and Statistics (La Palma, IC, 21.–23.04.2012) (=&#160;Proceedings of Machine Learning Research, 22). 2012, S.&#160;1184–1193. PDF. [<ref target="https://proceedings.mlr.press/v22/taddy12/taddy12.pdf">online</ref>]
               </bibl>
               <bibl xml:id="wallach_et_al_evaluation_2009">Hanna M. Wallach&#160;/ Iain Murray&#160;/ Ruslan Salakhutdinov&#160;/ David Mimno: Evaluation Methods for Topic Models. In: Andrea Danyluk (Hg.): ICML ’09. Proceedings of the 26<hi rend="super">th</hi> International Conference on Machine Learning (Montreal, 14.–18.06.2009). New York 2009, S.&#160;1105–1112. PDF. DOI: <ref target="https://doi.org/10.1145/1553374.1553515">10.1145/1553374.1553515</ref>
               </bibl>
               <bibl xml:id="weston_et_al_selecting_2023">Sara J. Weston&#160;/ Ian Shryock&#160;/ Ryan Light&#160;/ Phillip A. Fisher: Selecting the Number and Labels of Topics in Topic Modeling: A Tutorial. In: Advances in Methods and Practices in Psychological Science 6 (2023), H.&#160;2. HTML. DOI: <ref target="https://doi.org/10.1177/25152459231160105">10.1177/25152459231160105</ref></bibl>
               <bibl xml:id="wilkinson_et_al_principles_2016">Mark D. Wilkinson&#160;/ Michel Dumontier&#160;/ IJsbrand Jan Aalbersberg&#160;/ Gabrielle Appleton&#160;/ Myles Axton&#160;/ Arie Baak&#160;/ Niklas Blomberg&#160;/ Jan-Willem Boiten&#160;/ Luiz Bonino da Silva Santos&#160;/ Philip Eric Bourne&#160;/ Jildau Bouwman&#160;/ Anthony J. Brookes&#160;/ Tim Clark&#160;/ Mercè Crosas&#160;/ Ingrid Dillo&#160;/ Olivier Dumon&#160;/ Scott Edmunds&#160;/ Chris T. Evelo&#160;/ Richard Finkers&#160;/ Alejandra Gonzalez-Beltran&#160;/ Alasdair J. G. Gray&#160;/ Paul Groth&#160;/ Carole Goble&#160;/ Jeffrey Sean Grethe&#160;/ Jaap Heringa&#160;/ Peter A. C. ’t Hoen&#160;/ Rob Hooft&#160;/ Tobias Kuhn&#160;/ Ruben Kok&#160;/ Joost Kok&#160;/ Scott J. Lusher&#160;/ Maryann Elizabeth Martone&#160;/ Albert Mons&#160;/ Abel Laerte Packer&#160;/ Bengt Persson&#160;/ Philippe Rocca-Serra&#160;/ Marco Roos&#160;/ Rene van Schaik&#160;/ Susanna-Assunta Sansone&#160;/ Erik Schultes&#160;/ Thierry Sengstag&#160;/ Ted Slater&#160;/ George Strawn&#160;/ Morris A. Swertz&#160;/ Mark Thompson&#160;/ Johan van der Lei&#160;/ Erik van Mulligen&#160;/ Jan Velterop&#160;/ Andra Waagmeester&#160;/ Peter Wittenburg&#160;/ Katherine Wolstencroft&#160;/ Jun Zhao&#160;/ Barend Mons: The FAIR Guiding Principles for Scientific Data Management and Stewardship. In: Scientific Data 3 (2016). HTML. DOI: <ref target="https://doi.org/10.1038/sdata.2016.18">10.1038/sdata.2016.18</ref>
               </bibl>
               <bibl xml:id="zaagsma_historiker_2023">Gerben Zaagsma: Der hybride Historiker. Geschichtsforschung im digitalen Zeitalter. Videoportal FernUniversität in Hagen. 11.08.2023. [<ref target="https://video.fernuni-hagen.de/Play/11257">online</ref>]</bibl>
         </listBibl>
         </div>
               <div type="bibliography">
                  <head>Weiterführende Literatur</head>  
                  <listBibl>
                  <bibl xml:id="althage_potenziale_2022">Melanie Althage: Potenziale und Grenzen der Topic-Modellierung mit Latent Dirichlet Allocation für die Digital History. In: Karoline Dominika Döring&#160;/ Stefan Haas&#160;/ Mareike König&#160;/ Jörg Wettlaufer (Hg.): Digital History. Konzepte, Methoden und Kritiken Digitaler Geschichtswissenschaft. Berlin u.&#160;a. 2022, S.&#160;255–277. PDF. DOI: <ref target="https://doi.org/10.1515/9783110757101-014">10.1515/9783110757101-014</ref>
               </bibl>
                     <bibl xml:id="andorfer_test_2017">Peter Andorfer: Turing Test für das Topic Modeling. Von Menschen und Maschinen erstellte inhaltliche Analysen der Korrespondenz von Leo von Thun-Hohenstein im Vergleich. In: Zeitschrift für digitale Geisteswissenschaften 2 (2017). 25.04.2017. HTML. DOI: <ref target="http://dx.doi.org/10.17175/2017_002">10.17175/2017_002</ref>
               </bibl>
               <bibl xml:id="cohen_questions_2013">Steve Cohen: Shifting Questions. New Paradigms for Oral History in a Digital World. In: The Oral History Review 40 (2013), H.&#160;1, S.&#160;154–167. PDF. DOI: 10.1093/ohr/oht036.</bibl>
                     <bibl xml:id="fechner_weiß_einsatz_2017">Martin Fechner&#160;/ Andreas Weiß: Einsatz von Topic Modeling in den Geschichtswissenschaften: Wissensbestände des 19. Jahrhunderts. In: Zeitschrift für digitale Geisteswissenschaften 2 (2017). 19.12.2017. HTML. DOI: <ref target="https://doi.org/10.17175/2017_005">10.17175/2017_005</ref>
               </bibl>
               <bibl xml:id="franken_et_al_nachnutzung_2023">Lina Franken&#160;/ Nils Egger&#160;/ Luis Fischer&#160;/ Katharina Lillich&#160;/ Florian Schmid: Nachnutzung von Forschungsdaten für qualitative Forschungen. Text Mining als Ansatz zur Exploration transkribierter Interviews. In: Dennis Eckhardt&#160;/ Martina Klausner (Hg.): Digital[ität] Ethnografieren. Forschungsmethoden für den digitalen Alltag (=&#160;Kulturanthropologie Notizen, 85). Frankfurt&#160;/ Main 2023, S.&#160;188–222. PDF. DOI: <ref target="https://doi.org/10.21248/ka-notizen.85.16">10.21248/ka-notizen.85.16</ref>
               </bibl>
               <bibl xml:id="lemke_wiedemann_hg_text_2016">Matthias Lemke&#160;/ Gregor Wiedemann (Hg.): Text Mining in den Sozialwissenschaften. Grundlagen und Anwendungen zwischen qualitativer und quantitativer Diskursanalyse. Wiesbaden 2016. PDF. DOI: 10.1007/978-3-658-07224-7</bibl>
               <bibl xml:id="papilloud_hinneburg_textanalyse_2018">Christian Papilloud&#160;/ Alexander Hinneburg: Qualitative Textanalyse mit Topic-Modellen. Eine Einführung für Sozialwissenschaftler. Wiesbaden u.&#160;a. 2018. <ptr type="gbv" cRef="1639574824"/>
               </bibl>
               <bibl xml:id="sloan_swimming_2014">Stephen M. Sloan: Swimming in the Exaflood. Oral History as Information in the Digital Age. In: Douglas Boyd&#160;/ Mary Larson (Hg.): Oral History and Digital Humanities. Voice, Access, and Engagement. New York 2014, S.&#160;175–186. <ptr type="gbv" cRef="803770006"/>
               </bibl>             
            </listBibl>
         </div>
      </back>
   </text>
</TEI>
