<?xml version="1.0" encoding="utf-8"?>
<?xml-model href="https://zfdg.de/sites/default/files/medien/zfdg.rng" type="application/xml" schematypens="http://relaxng.org/ns/structure/1.0"?>
<?xml-model href="https://zfdg.de/sites/default/files/medien/zfdg.rng" type="application/xml" schematypens="http://purl.oclc.org/dsdl/schematron"?>
<TEI xmlns="http://www.tei-c.org/ns/1.0" xmlns:tei="http://www.tei-c.org/ns/1.0">
   <teiHeader>
      <fileDesc>
         <titleStmt>
            <title level="a" type="full">R für Philolog*innen: Ein praktischer Einstieg mit politischen Reden</title>
            <title level="a" type="short">R für Philolog*innen</title>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/aut">Author</resp>
               <resp ref="https://credit.niso.org/contributor-roles/conceptualization/">Conceptualization</resp>
               <resp ref="https://credit.niso.org/contributor-roles/methodology/">Methodology</resp>
               <resp ref="https://credit.niso.org/contributor-roles/software/">Software</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-original-draft/">Writing&#160;– original draft</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-review-editing/">Writing&#160;– review &amp; editing</resp>
               <persName>
                  <forename>Ángeles</forename>
                  <surname>González-Miguel</surname>
                  <email>angeles.gonzalez.miguel@uva.es</email>
                  <idno type="gnd">1416980601</idno>
                  <idno type="orcid">0000-0002-5989-0680</idno>
                  <affiliation>Universität Valladolid</affiliation>
               </persName>
            </respStmt>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/aut">Author</resp>
               <resp ref="https://credit.niso.org/contributor-roles/conceptualization/">Conceptualization</resp>
               <resp ref="https://credit.niso.org/contributor-roles/methodology/">Methodology</resp>
               <resp ref="https://credit.niso.org/contributor-roles/software/">Software</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-original-draft/">Writing&#160;– original draft</resp>
               <resp ref="https://credit.niso.org/contributor-roles/writing-review-editing/">Writing&#160;– review &amp; editing</resp>
               <persName>
                  <forename>Francisco Javier</forename>
                  <surname>Muñoz-Acebes</surname>
                  <email>fjavier.munoz@uva.es</email>
                  <idno type="gnd">1067645519</idno>
                  <idno type="orcid">0000-0001-6527-203X</idno>
                  <affiliation>Universität Valladolid</affiliation>
               </persName>
            </respStmt>
         </titleStmt>
         <editionStmt>
            <edition n="1.0"/>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/dtm">Technische Redaktion</resp>
               <persName>
                  <forename>Martin</forename>
                  <surname>de la Iglesia</surname>
                  <idno type="gnd">1095143719</idno>
                  <idno type="orcid">0000-0002-9319-4793</idno>
               </persName>
            </respStmt>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/dtm">Technische Redaktion</resp>
               <persName>
                  <forename>Maximilian</forename>
                  <surname>Görmar</surname>
                  <idno type="gnd">1077317964</idno>
                  <idno type="orcid">0000-0003-3608-1140</idno>
               </persName>
            </respStmt>
            <respStmt>
               <resp ref="http://id.loc.gov/vocabulary/relators/pfr">Textredaktion</resp>
               <persName>
                  <forename>Maximilian</forename>
                  <surname>Görmar</surname>
                  <idno type="gnd">1077317964</idno>
                  <idno type="orcid">0000-0003-3608-1140</idno>
               </persName>
            </respStmt>
         </editionStmt>
         <publicationStmt>
            <publisher n="Redaktionssitz">
               <orgName>Herzog August Bibliothek</orgName>
               <address>
                  <addrLine>Lessingplatz 1</addrLine>
                  <addrLine>38304 Wolfenbüttel</addrLine>
               </address>
            </publisher>
            <publisher n="herausgebendes Organ">
               <orgName>Forschungsverbund Marbach Weimar Wolfenbüttel</orgName>
               <address>
                  <addrLine>Burgplatz 4</addrLine>
                  <addrLine>99423 Weimar</addrLine>
               </address>
            </publisher>
            <publisher n="herausgebendes Organ">
               <orgName>Digital Humanities im deutschsprachigen Raum e. V.</orgName>
               <address>
                  <addrLine>Hamburg</addrLine>
               </address>
            </publisher>
            <date n="1.0" when="2026-09-15">15.09.2026</date>
            <idno type="doi">10.17175/2026_012</idno>
            <idno type="ppn">1982617446</idno>
            <availability status="free">
               <licence target="https://creativecommons.org/licenses/by-sa/4.0/">CC BY-SA 4.0, sofern nicht anders angegeben.</licence>
            </availability>
         </publicationStmt>
         <seriesStmt>
            <title level="j">Zeitschrift für digitale Geisteswissenschaften</title>
            <idno type="issn">2510-1358</idno>
            <idno type="ppn">819494402</idno>
            <idno type="doi">10.17175/zfdg.01</idno>
            <biblScope unit="volume">11</biblScope>
            <biblScope unit="article">12</biblScope>
         </seriesStmt>
         <sourceDesc>
            <p>Born digital: no previous source exists.</p>
         </sourceDesc>
      </fileDesc>
      <encodingDesc>
         <editorialDecl>
            <p>Letzte Überprüfung aller Verweise: <date when="2026-08-28">28.08.2026</date>
            </p>
         </editorialDecl>
         <schemaRef url="https://zfdg.de/sites/default/files/medien/zfdg.odd"/>
      </encodingDesc>
      <profileDesc>
         <textClass>
            <keywords n="Beitragstyp">
               <term>Projektvorstellung</term>
            </keywords>
            <keywords n="GND">
               <term ref="https://d-nb.info/gnd/4035843-4">Computerlinguistik</term>
               <term ref="https://d-nb.info/gnd/4194196-2">Textanalyse</term>
               <term ref="https://d-nb.info/gnd/4705956-4">R</term>
               <term ref="https://d-nb.info/gnd/4253759-9">Bundespräsident (Deutschland)</term>
            </keywords>
         </textClass>
      </profileDesc>
   </teiHeader>
   <text xml:lang="de">
      <front>
         <div type="abstract" xml:lang="de">
            <p>
               Der vorliegende Beitrag stellt ein praxisorientiertes R-Skript für Philologiestudierende ohne Programmiervorkenntnisse vor. Anhand des <title>German Political Speeches Corpus</title>&#160;– einer XML-Sammlung der Reden deutscher Bundespräsidenten&#160;– werden grundlegende Methoden der korpusgestützten Analyse eingeführt: <term type="dh">Tokenisierung</term>, <term type="dh">Frequenzanalyse</term>, <term type="dh">Bigramme</term>, <term type="dh">lexikalische Vielfalt</term> und <term type="dh">diachrone Schlüsselwortanalyse</term>. Das Tutorial wurde im Rahmen eines Seminars zur digitalen Philologie an der Universidad de Valladolid erprobt und folgt den Prinzipien des projektbasierten Lernens.</p>
         </div>
         <div type="abstract" xml:lang="en">
            <p>
               This paper presents a practice-oriented R script for philology students without prior programming experience. Using the <title>German Political Speeches Corpus</title>&#160;– an XML collection of speeches by German Federal Presidents&#160;– it introduces fundamental corpus-based methods: <term type="dh">tokenisation</term>, <term type="dh">frequency analysis</term>, <term type="dh">bigrams</term>, <term type="dh">lexical diversity</term>, and <term type="dh">diachronic keyword analysis</term>. Tested in a digital philology seminar at the Universidad de Valladolid, it follows the principles of project-based learning.</p>
         </div>
      </front>
      <body>
         <div type="chapter">
            <head>1. Einführung</head>
            <p>Die vorliegende Publikation ist als praktisches Beispiel für den Einsatz von R in der text- und datenbasierten Analyse konzipiert.<note type="footnote">Generative KI-Werkzeuge kamen in diesem Beitrag in zweierlei Hinsicht zum Einsatz: Zum einen setzten die Studierenden im Rahmen des Seminars den KI-Assistenten Claude (Anthropic) unterstützend beim Erlernen von R ein; zum anderen griffen auch die Verfasser*innen bei der Erstellung des begleitenden R-Skripts auf Claude (Anthropic, Sonnet-Modellreihe) zur Fehlersuche und Kommentierung einzelner Codeabschnitte zurück. Die konzeptionelle und methodische Gestaltung der Analyse erfolgte eigenständig durch die Autor*innen.</note> Sie richtet sich an Studierende mit geringen oder keinen Vorkenntnissen in R: Alle Schritte werden im <ref target="https://github.com/javiermunoz-acebes/filologia_digital/blob/main/R%20f%C3%BCr%20Philolog_innen_%20Ein%20praktischer%20Einstieg%20mit%20politischen%20Reden/Script_Bundespraesidenten_Final_updated.Rmd">Skript</ref> kommentiert, so dass der Code Zeile für Zeile nachvollzogen werden kann. Das hier präsentierte Skript wurde im Rahmen von Seminaren zur digitalen Philologie mit Studierenden der Germanistik an der Universidad de Valladolid (Spanien) eingesetzt. Ziel ist es, an einem konkreten Beispiel&#160;– den Reden der deutschen Bundespräsidenten&#160;– grundlegende Arbeitsweisen der korpusgestützten Analyse (Datenaufbereitung, quantitative Untersuchungen, Visualisierungen, einfache lexikalische Auswertungen) kennenzulernen.</p>
            <p>Das Material versteht sich als Vorlage: Die verwendeten Dateien und Einstellungen können leicht angepasst werden (z. B. an andere Korpora, andere Schlüsselwörter, weitere Visualisierungen), so dass das Skript in unterschiedlichen Lehrkontexten wiederverwendet und erweitert werden kann.</p>
            <div type="subchapter">
               <head>1.1 Kontext: R in den Digital Humanities</head>
               <p>Der Einsatz von Programmiersprachen wie R in der philologischen Forschung stellt einen bedeutenden methodischen Wandel dar.<note type="footnote"> Vgl. <ref type="bibliography" target="#arnold_et_al_frequencies_2019">Arnold et al. 2019</ref>.</note> Traditionell wurde die Textanalyse durch genaues Lesen (<term type="dh">close reading</term>) durchgeführt; heute ermöglichen digitale Werkzeuge auch die Analyse aus der Distanz (<term type="dh">distant reading</term>, Konzept von Franco Moretti<note type="footnote"> Vgl. <ref type="bibliography" target="#moretti_reading_2013">Moretti 2013</ref>.</note>), d. h. die Untersuchung großer Textmengen durch quantitative Methoden und Datenvisualisierung.</p>
               <p>R ist für diese Art von Analyse besonders geeignet, weil es</p>
               <list type="unordered">
                  <item>kostenlos und Open Source ist,</item>
                  <item>eine sehr aktive wissenschaftliche Community hat,</item>
                  <item>spezialisierte Pakete für Textanalyse bietet (z.&#160;B. <ref target="https://doi.org/10.32614/CRAN.package.tidytext">tidytext</ref>, <ref target="https://doi.org/10.32614/CRAN.package.quanteda">quanteda</ref>, <ref target="https://doi.org/10.32614/CRAN.package.stylo">stylo</ref>),</item>
                  <item>Reproduzierbarkeit ermöglicht: andere Forscher*innen können unsere Analysen nachvollziehen;</item>
                  <item>in der Entwicklungsumgebung <ref target="https://posit.co/products/open-source/rstudio">RStudio</ref> eine vollständig integrierte Arbeitsumgebung bietet: Skript-Editor, Konsole, Datenobjekte und Visualisierungen sind in einem einzigen Fenster zugänglich, ohne dass externe Konfigurationen oder zusätzliche Werkzeuge erforderlich sind. Dies unterscheidet R von Arbeitsumgebungen wie Python, wo vergleichbare Workflows typischerweise mehrere Komponenten voraussetzen (Interpreter, Paketverwaltung, <ref target="https://jupyter.org/">Jupyter Notebook</ref> oder Ähnliches), deren Einrichtung für Studierende ohne Programmiererfahrung eine Einstiegshürde darstellt.</item>
               </list>
               <p>Das vorgestellte Skript steht in der Tradition der Korpuslinguistik, angewandt auf politische Texte, und kombiniert quantitative Methoden mit qualitativer Interpretation&#160;– ein Vorgehen, das als methodisch notwendig gilt, wenn computergestützte Verfahren hermeneutisch fundiert und für die Zieldisziplin transparent bleiben sollen.<note type="footnote"> Vgl. <ref type="bibliography" target="#blessing_et_al_werkzeuge_2015">Blessing et al. 2015</ref>.</note> Beispiele für eine solche Verbindung im Kontext deutschsprachiger politischer Korpora finden sich etwa in diachronen Frequenz- und Themenanalysen, die quantitative Befunde konsequent mit inhaltlicher Interpretation verknüpfen.<note type="footnote"> Vgl. <ref type="bibliography" target="#adam_et_al_klimaschutz_2023">Adam et al. 2023</ref>.</note>
               </p>
            </div>
            <div type="subchapter">
               <head>1.2 Stand der Forschung: R-Tutorials in den Digital Humanities</head>
               <p>Die verfügbaren Lehrressourcen für den Einsatz von R in geisteswissenschaftlichen Curricula lassen sich grob in zwei Kategorien einteilen: technisch orientierte Einführungswerke und anwendungsorientierte Tutorials.<note type="footnote"> Zu Letzteren zählen: <ref type="bibliography" target="#silge_robinson_mining_2017">Silge&#160;/ Robinson 2017</ref>; <ref type="bibliography" target="#jockers_thalken_analysis_2020">Jockers&#160;/ Thalken 2020</ref>; <ref type="bibliography" target="#fradejas_rueda_cuentapalabras_2025">Fradejas Rueda 2025</ref> (für den hispanophonen Raum besonders relevant).</note> Was diesen Ressourcen gemeinsam ist, ist ein gewisser Abstraktionsgrad: Die Beispielkorpora sind oft auf das Englische ausgerichtet, und der hochschuldidaktische Kontext mit Philologiestudierenden ohne Programmiervorkenntnisse tritt häufig in den Hintergrund.</p>
               <p>Eine wichtige Ausnahme bildet Kristine Hildebrandt,<note type="footnote"> Vgl. <ref type="bibliography" target="#hildebrandt_narrating_2024">Hildebrandt 2024</ref>.</note> die zeigt, wie digitale Werkzeuge im linguistischen Seminar mit fachlich heterogenen Studierenden ohne Programmierkenntnisse eingesetzt werden können; ein expliziter Fokus auf der Einführung in Programmiersprachen wie R fehlt bei ihr jedoch. Im deutschsprachigen Raum hat sich <ref target="https://journal.fortext.org/issues/">forTEXT</ref> (TU Darmstadt) als zentrale Plattform für DH-Lehrmaterialien etabliert: Lerneinheiten zur Textvisualisierung mit Voyant<note type="footnote"> Vgl. <ref type="bibliography" target="#flueh_textvisualisierung_2024">Flüh 2024</ref>.</note>  und zur Stilometrie mit Stylo<note type="footnote"> Vgl. <ref type="bibliography" target="#stilometrie_2026">Stilometrie 2026</ref>.</note> bieten niedrigschwellige Zugänge zur digitalen Textanalyse für Studierende in den Geisteswissenschaften ohne Programmiererfahrung; sie setzen dabei jedoch auf grafische Benutzeroberflächen statt auf direktes Programmieren und beziehen sich vorwiegend auf literarische Korpora. Für die digitale Philologie bleibt damit weiterhin offen, wie ein methodischer Einstieg aussehen kann, der digitale Verfahren nicht als Selbstzweck, sondern als Erweiterung philologischer Erkenntnisinteressen vermittelt und Studierenden zugleich die direkte Arbeit mit einer Programmiersprache erschließt.<note type="footnote"> Vgl. <ref type="bibliography" target="#horstmann_kleymann_fragen_2019">Horstmann&#160;/ Kleymann 2019</ref>; <ref type="bibliography" target="#bartsch_et_al_sinn_2023">Bartsch et al. 2023</ref>.</note>
               </p>
               <p>Das vorliegende Tutorial setzt an diesem Desiderat an und orientiert sich an den Grundsätzen des projektbasierten Lernens,<note type="footnote"> Vgl. <ref type="bibliography" target="#brown_learning_2019">Brown et al. 2019</ref>; <ref type="bibliography" target="#featherstone_teaching_2025">Featherstone 2025</ref>.</note> das für Studierende ohne Vorkenntnisse in formalen Methoden<note type="footnote"> Damit sind technische bzw. MINT-nahe Methoden wie Programmierung oder Statistik gemeint, die im Curriculum geisteswissenschaftlicher Studiengänge in der Regel nicht vermittelt werden.</note> als besonders lernwirksam beschrieben worden ist.<note type="footnote"> Vgl. <ref type="bibliography" target="#havenga_learning_2015">Havenga 2015</ref>; <ref type="bibliography" target="#novalia_et_al_learning_2025">Novalia et al. 2025</ref>.</note> Die Wahl des <title>German Political Speeches Corpus</title><note type="footnote">
                     <ref type="bibliography" target="#barbaresi_speeches_2011-2019">Barbaresi 2011–2019</ref>.</note> ist didaktisch motiviert: Politische Reden sind für Germanistikstudierende inhaltlich zugänglich und linguistisch reich genug, um Konzepte wie Tokenisierung, Frequenzanalyse oder lexikalische Vielfalt an authentischem Material zu illustrieren; zugleich eröffnet das XML-Format eine zweite Lernachse im Umgang mit strukturierten Textdaten. Das Skript ist zudem explizit als Vorlage konzipiert, sodass Korpus, Schlüsselwörter und Visualisierungsformen mit geringem Aufwand an andere Lehrkontexte angepasst werden können.</p>
            </div>
         </div>
         <div type="chapter">
            <head>2. Hintergrund: Das Projekt von Adrien Barbaresi</head>
            <p>Das in diesem Skript verwendete Korpus stammt aus dem <title>German Political Speeches Corpus</title>, das von Adrien Barbaresi aufgebaut wurde.<note type="footnote"> Vgl. <ref type="bibliography" target="#barbaresi_speeches_2011-2019">Barbaresi 2011–2019</ref>.</note> Es handelt sich um ein Korpus politischer Reden auf Deutsch, vor allem von hochrangigen Amtsträgern (z.&#160;B. Bundespräsident, Bundeskanzler*in), die nach ihrer politischen Relevanz ausgewählt wurden.</p>
            <p>Die Reden wurden aus offiziellen Quellen (u. a. Websites des Bundespräsidenten und der Bundesregierung) gesammelt und im XML‑Format<note type="footnote"> Dabei handelt es sich nicht um ein standardisiertes Schema wie <ref target="https://tei-c.org/">TEI</ref>, sondern um ein von Barbaresi eigens für dieses Korpus entwickeltes, einfaches XML-Schema mit interner DTD. Es definiert lediglich die Elemente „collection", „text" und „rohtext"; die Metadaten (person, titel, datum, ort, untertitel, url, anrede) sind als Attribute des &lt;text&gt;-Elements abgebildet, der Redetext selbst liegt als Fließtext im Element &lt;rohtext&gt; vor. Ein &lt;teiHeader&gt; oder andere TEI-spezifische Strukturen sind nicht vorhanden.</note> mit Metadaten aufbereitet (Titel, Sprecher*in, Datum, Ort, Quelle, Anrede usw.).</p>
            <p>Aktuelle Versionen des Korpus werden über <ref target="https://doi.org/10.5281/zenodo.3611246">Zenodo</ref> bereitgestellt, sodass das Material leicht nachnutzbar und zitierbar ist. In diesem R‑Skript verwenden wir den Teil des Korpus, der die Reden der Bundespräsidenten umfasst (<code>Bundespräsidenten.xml</code>). Die XML‑Struktur ermöglicht es uns, die Reden und ihre Metadaten systematisch zu analysieren.</p>
         </div>
         <div type="chapter">
            <head>3. Didaktisches Konzept und Seminarkontext</head>
            <p>Das vorliegende Tutorial entstand im Rahmen eines Seminars zur digitalen Philologie, das im vierten Studienjahr des Bachelorstudiengangs <hi rend="italic">Lenguas Modernas</hi> (Moderne Sprachen) an der Universidad de Valladolid durchgeführt wurde. Die Teilnehmenden hatten sich auf Deutsch als Hauptfachsprache spezialisiert und brachten solide philologische Kenntnisse mit&#160;– Erfahrungen mit Programmiersprachen oder statistischen Auswertungstools besaßen sie jedoch nicht. Das Seminar verfolgte damit ein klar definiertes Ziel: die Einführung in R und in die Arbeitsumgebung RStudio als philologisches Werkzeug, nicht die informatische Kompetenz um ihrer selbst willen.</p>
            <div type="subchapter">
               <head>3.1 Lernziele und Aufbau</head>
               <p>Die Lernziele des Seminars lassen sich in drei Dimensionen gliedern:</p>
               <list type="ordered">
                  <item>Technisch: Grundlegende Bedienung von RStudio (Skript-Editor, Konsole, Environment, Plot-Fenster); Installation und Laden von Paketen; Lesen und Verarbeiten von XML-Dateien; Erstellen einfacher Visualisierungen mit <ref target="https://doi.org/10.32614/CRAN.package.ggplot2">ggplot2</ref>. </item>
                  <item>Methodisch: Verständnis korpuslinguistischer Grundbegriffe (<term type="dh">Token</term>, <term type="dh">Type</term>, <term type="dh">Lemma</term>, <term type="dh">Stoppwörter</term>, <term type="dh">Type-Token-Ratio</term> (<term type="dh">TTR</term>), <term type="dh">Konkordanz</term>); kritische Einordnung quantitativer Befunde im Verhältnis zu qualitativer Textinterpretation. </item>
                  <item>Epistemisch: Reflexion über die Möglichkeiten und Grenzen des <hi rend="italic">distant reading</hi> als Ergänzung&#160;– nicht Ersatz&#160;– für das philologische <hi rend="italic">close reading</hi>.</item>
               </list>
               <p>Das Seminar folgte einem iterativen Aufbau: Jeder Block begann mit der Vorstellung eines Konzepts (z. B. <term type="dh">Tokenisierung</term>), gefolgt von einem gemeinsam im Plenum ausgeführten Code-Abschnitt, und endete mit einer freien Übungsphase, in der die Studierenden Parameter eigenständig variierten&#160;– andere Präsident*innen, andere Schlüsselwörter, andere Visualisierungsformen. Dieses Vorgehen entspricht dem Modell des <term type="dh">scaffolded learning</term>, bei dem die Lehrperson zunächst stark unterstützt und diese Unterstützung schrittweise zurückzieht, bis die Lernenden selbstständig arbeiten können. Anders als das oben genannte projektbasierte Lernen, das den übergeordneten didaktischen Rahmen des Seminars bildet, bezieht sich das <hi rend="italic">scaffolded learning</hi> auf die konkrete Unterstützungsstruktur innerhalb der einzelnen Lerneinheiten.<note type="footnote"> Vgl. <ref type="bibliography" target="#havenga_learning_2015">Havenga 2015</ref>; <ref type="bibliography" target="#novalia_et_al_learning_2025">Novalia et al. 2025</ref>.</note>
               </p>
            </div>
            <div type="subchapter">
               <head>3.2 KI-Unterstützung als didaktisches Element</head>
               <p>Eine der methodischen Neuerungen dieses Seminars war die explizite Integration eines KI-Assistenzsystems&#160;– konkret <ref target="https://claude.ai">Claude Sonnet</ref> von Anthropic&#160;– in den Lernprozess. Die Studierenden wurden ausdrücklich dazu ermutigt, beim Schreiben und Debuggen ihrer R-Skripte auf dieses Werkzeug zurückzugreifen, allerdings unter einer zentralen Bedingung: Der generierte Code musste verstanden und kommentiert werden, bevor er als Teil des eigenen Skripts akzeptiert wurde.</p>
               <p>Diese Entscheidung gründet auf einer wachsenden empirischen Evidenz zur Rolle von Large Language Models (LLMs) im Programmierunterricht. Neuere Studien zeigen, dass KI-Assistenz den Erwerb von Programmierkenntnissen nicht notwendigerweise untergräbt, sondern&#160;– wenn sie reflektiert eingesetzt wird&#160;– kognitive Zugangshürden abbaut und das Verstehen vertiefen kann: Studierende, die KI nicht nur zur Codeproduktion, sondern zur aktiven Erklärung und Fehlerdiagnose nutzen, zeigen bessere Lernergebnisse als solche, die Code lediglich übernehmen.<note type="footnote"> Vgl. <ref type="bibliography" target="#shen_tamkin_ai_2026">Shen&#160;/ Tamkin 2026</ref>. Die Studie zeigt, dass kognitiv aktive Interaktionsmuster mit KI (Erklärung, Fehlerdiagnose, hybrider Einsatz) den Lernerfolg erhalten, während passive Delegation ihn beeinträchtigt. Vgl. ferner <ref type="bibliography" target="#wills_et_al_learning_2024">Wills et al. 2024</ref>; <ref type="bibliography" target="#lepp_kaimre_ai_2025">Lepp&#160;/ Kaimre 2025</ref>.</note> Für Studierende der Geisteswissenschaften ohne Programmiervorkenntnisse ist dieser Befund besonders relevant: Die natürlichsprachliche Schnittstelle eines LLM erlaubt es, Fehlermeldungen in eigenen Worten zu beschreiben und konzeptuelle Fragen in fachlicher Sprache zu stellen&#160;– eine Form der Interaktion, die dem Lernstil von Philologiestudierenden strukturell entgegenkommt.</p>
               <p>Gleichwohl wurden im Seminar auch die Risiken dieses Ansatzes thematisiert: die Gefahr der unkritischen Übernahme von fehlerhaftem oder unverständlichem Code, die Tendenz zur Umgehung eigener Denkprozesse (<term type="dh">cognitive offloading</term>) sowie Fragen der akademischen Integrität. Diese Reflexion über die epistemischen Grenzen KI-generierter Analysen ist ihrerseits ein philologisch relevantes Thema und konnte so in den fachlichen Diskurs des Seminars integriert werden.</p>
            </div>
            <div type="subchapter">
               <head>3.3 Block 0&#160;– Vorbereitung und Laden der XML-Datei</head>
               <p>Zuerst brauchen wir das Korpus der Reden. Die Datei liegt im XML‑Format vor, also in einer strukturierten Textform mit Metadaten (Autor, Datum, Ort usw.).</p>
               <p>Damit die Arbeit so einfach wie möglich ist, wird die Datei beim ersten Ausführen automatisch von Zenodo heruntergeladen. Sie müssen nichts manuell herunterladen.</p>
               <p>Wir werden:</p>
               <list type="ordered">
                  <item>Die notwendigen Pakete laden.</item>
                  <item>Prüfen, ob die XML‑Datei im Arbeitsverzeichnis existiert.</item>
                  <item>Falls nicht, das ZIP‑Archiv von Zenodo herunterladen und entpacken.</item>
                  <item>Die Datei <code>Bundespräsidenten.xml</code> mit <code>xml2::read_xml()</code> in R einlesen.</item>
                  <item>Das vollständige R-Skript mit allen Codeblöcken, Kommentaren und Beispieldaten steht im <ref target="https://github.com/javiermunoz-acebes/filologia_digital/tree/main/R%20f%C3%BCr%20Philolog_innen_%20Ein%20praktischer%20Einstieg%20mit%20politischen%20Reden">GitHub-Repositorium der Autor*innen</ref> zur freien Nachnutzung zur Verfügung.</item>
               </list>
            </div>
         </div>
         <div type="chapter">
            <head>4. Block 1&#160;– Data Frame mit Reden erstellen</head>
            <p>Nun wollen wir das XML in eine besser handhabbare Form bringen: eine Tabelle (<term type="dh">tibble</term>), in der jede Zeile eine Rede ist und jede Spalte eine Information (Präsident, Datum, Ort, Text usw.).</p>
            <p>
               <code>df &lt;- tibble(</code>
               <lb/><code>    person    = xml_attr(nodos_text, "person"),</code>
               <lb/><code>    titel     = xml_attr(nodos_text, "titel"),</code>
               <lb/><code>    datum_raw = xml_attr(nodos_text, "datum"),</code>
               <lb/><code>    rohtext   = xml_text(xml_find_all(xml_data, ".//rohtext"))</code>
               <lb/><code>) |&gt;</code>
               <lb/><code>    mutate(datum = ymd(datum_raw), jahr = year(datum))</code>
               <lb/><code>head(df)</code>
               <lb/><code>person	datum	ort	jahr</code>
               <lb/><code>Joachim Gauck	2016-05-02	Saarbrücken	2016</code>
               <lb/><code>Joachim Gauck	2014-02-26	Schloss Bellevue	2014</code>
               <lb/><code>Horst Köhler	2009-03-13	Madrid	2009</code>
               <lb/><code>Joachim Gauck	2013-11-09	(leer)	2013</code>
               <lb/><code>Horst Köhler	2009-12-06	Berlin	2009</code>
               <lb/><code>Christian Wulff	2011-09-10	Schloss Bellevue	2011</code>
            </p>
            <p>Einige einfache Fragen, die wir jetzt sofort beantworten können: Wie viele Reden gibt es? (2045) Welche Bundespräsidenten kommen im Korpus vor? (sechs: Christian Wulff, Horst Köhler, Joachim Gauck, Johannes Rau, Richard von Weizsäcker, Roman Herzog) Welche Zeitspanne deckt das Korpus ab? (1984–2017)</p>
         </div>
         <div type="chapter">
            <head>5. Block 2&#160;– Einfache quantitative Auswertungen und erste Grafiken</head>
            <p>Wir beginnen mit sehr einfachen quantitativen Auswertungen: Wie viele Reden hat jeder Präsident, und wie viele gibt es pro Jahr? <ref type="graphic" target="#r-tutorial_001">Abbildung&#160;1</ref> zeigt die Gesamtzahl der Reden pro Bundespräsident als Balkendiagramm; <ref type="graphic" target="#r-tutorial_002">Abbildung&#160;2</ref> stellt die zeitliche Verteilung nach Jahren dar. Als Übungsvarianten stehen ein farbkodiertes Balkendiagramm zur Verfügung (vgl. <ref type="graphic" target="#r-tutorial_003">Abbildung&#160;3</ref>), das dieselben Daten nach Präsidenten farblich differenziert, sowie ein Liniendiagramm derselben Zeitreihe (vgl. <ref type="graphic" target="#r-tutorial_004">Abbildung&#160;4</ref>), das die Entwicklung über den gesamten Erfassungszeitraum besonders anschaulich macht und sich als Einstieg in die diachrone Analyse eignet.</p>
            <figure>
               <graphic xml:id="r-tutorial_001" url="Medien/r-tutorial_001.png">
                  <desc>
                     <ref type="intern" target="#abb1">Abb. 1</ref>: Anzahl der Reden pro Bundespräsident im <title>German Political Speeches Corpus</title>. [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <figure>
               <graphic xml:id="r-tutorial_002" url="Medien/r-tutorial_002.png">
                  <desc>
                     <ref type="intern" target="#abb2">Abb. 2</ref>: Reden pro Jahr im <title>German Political Speeches Corpus</title> (1984–2017). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <figure>
               <graphic xml:id="r-tutorial_003" url="Medien/r-tutorial_003.png">
                  <desc>
                     <ref type="intern" target="#abb3">Abb. 3</ref>: Reden pro Bundespräsident im <title>German Political Speeches Corpus</title> (farbkodiert nach Person). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <figure>
               <graphic xml:id="r-tutorial_004" url="Medien/r-tutorial_004.png">
                  <desc>
                     <ref type="intern" target="#abb4">Abb. 4</ref>: Entwicklung der Anzahl der Reden pro Jahr im <title>German Political Speeches Corpus</title> (1984–2017). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <div type="subchapter">
               <head>5.1 Interpretation: Was uns die quantitativen Befunde sagen</head>
               <p>Die Ergebnisse von Block 2 sind auf den ersten Blick eindeutig: Joachim Gauck (588 Reden), Johannes Rau (568) und Horst Köhler (528) führen das Ranking an, während Richard von Weizsäcker mit lediglich 23 Reden das Schlusslicht bildet. Diese Zahlen einfach als Maß präsidialer ›Aktivität‹ zu lesen, wäre jedoch ein methodischer Fehler&#160;– und genau an dieser Stelle beginnt die philologische Interpretation.</p>
               <p>Das Korpus ist nicht gleichmäßig verteilt. Das Balkendiagramm der Reden pro Jahr zeigt deutlich, dass das <title>German Political Speeches Corpus</title> erst ab Mitte der 1990er Jahre eine vollständige Abdeckung bietet. Die Amtszeit von Richard von Weizsäcker (1984–1994) ist im Korpus kaum vertreten&#160;– nicht, weil er weniger gesprochen hätte, sondern weil die systematische digitale Erfassung von Bundespräsidentenreden online erst später einsetzte. Die niedrige Zahl seiner Reden ist mithin ein Artefakt der Datenerhebung, kein Befund über seine Aktivität als Redner.</p>
               <p>Die Amtsdauer erklärt einen Teil der Varianz. Normiert man die absoluten Zahlen auf die Amtsdauer, ergibt sich ein anderes Bild: Christian Wulff etwa war nur gut zwei Jahre im Amt (2010–2012), bevor er infolge einer politischen Affäre zurücktrat&#160;– seine 204 Reden entsprechen damit einer bemerkenswert hohen Jahresrate. Joachim Gauck hingegen absolvierte eine volle fünfjährige Amtszeit (2012–2017), was die absolute Spitzenposition relativiert. Eine sinnvolle Ergänzung zu den absoluten Zählungen wäre daher die Berechnung der Reden pro Amtsjahr&#160;– eine Übung, die sich als Aufgabe für die Studierenden eignet.</p>
               <p>Der Jahresverlauf zeigt strukturelle Muster. Das Balkendiagramm nach Jahren lässt zwei ausgeprägte Aktivitätsphasen erkennen: eine erste um 2001–2003 (Amtszeit Johannes Raus) und eine zweite zwischen 2012 und 2016 (Amtszeit Joachim Gaucks), mit Spitzenwerten von über 140 Reden pro Jahr. Der starke Einbruch am Ende der Zeitreihe&#160;– der letzte Balken fällt auf rund 25 Reden&#160;– markiert höchstwahrscheinlich ein unvollständiges Jahr in der Datenerhebung und sollte bei Folgeanalysen herausgefiltert werden. Diese Überlegungen illustrieren ein zentrales Prinzip der korpusgestützten Analyse: Quantitative Befunde sind Ausgangspunkte, keine Schlussfolgerungen. Jede Zahl verlangt nach einem historischen und methodischen Kommentar&#160;– eine Anforderung, die dem philologischen Ethos des genauen Lesens strukturell verwandt ist.</p>
            </div>
         </div>
         <div type="chapter">
            <head>6. Block 3&#160;– Länge der Reden</head>
            <p>Jetzt wollen wir wissen, wie lang die Reden sind (in Zeichen, Wörtern, Sätzen). Wir können auch die mittlere Länge pro Präsident und pro Jahr berechnen (vgl. <ref type="graphic" target="#r-tutorial_007">Abbildung&#160;7</ref>).</p>
            <div type="subchapter">
               <head>6.1 Philologische Interpretation: Was uns die Redenlänge verrät</head>
               <p>Die quantitativen Grundmaße des Korpus sind aufschlussreich: Die durchschnittliche Rede umfasst 1.401 Wörter bei einem Mittelwert von 80 Sätzen – das entspricht einer vorgetragenen Dauer von etwa zehn bis fünfzehn Minuten und deutet auf ein Format mittlerer Länge hin, dass weder auf eine sehr kurze, noch auf eine außergewöhnlich lange Redeform hindeutet. Diese Zahlen sind jedoch Durchschnittswerte, die eine beträchtliche Varianz verbergen, wie <ref type="graphic" target="#r-tutorial_005">Abbildung&#160;5</ref> unmittelbar zeigt.</p>
               <figure>
                  <graphic xml:id="r-tutorial_005" url="Medien/r-tutorial_005.png">
                     <desc>
                        <ref type="intern" target="#abb5">Abb. 5</ref>: Verteilung der Redenlänge im <title>German Political Speeches Corpus</title> (in Wörtern; rechtsschiefe Verteilung mit Schwerpunkt unter 2.500 Wörtern). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
               <p>Die Verteilung ist rechtsschief (vgl. <ref type="graphic" target="#r-tutorial_005">Abbildung&#160;5</ref>). Der Großteil der Reden konzentriert sich im Bereich von 500 bis 2.000 Wörtern, mit einem deutlichen Häufigkeitsgipfel um 750–1.000 Wörter. Gleichzeitig existiert ein langer rechter Ausläufer mit einzelnen Reden von über 5.000 Wörtern. Diese Tendenz ist diskursanalytisch interpretierbar: Das Korpus enthält zwei strukturell unterschiedliche Redetypen&#160;– kurze, zeremonielle Ansprachen (Glückwünsche, Eröffnungsworte, Danksagungen) und längere politische Grundsatzreden, in denen der Bundespräsident programmatisch zu gesellschaftlichen Fragen Stellung nimmt. Die Länge ist in diesem Sinne kein triviales Maß, sondern ein Indikator für die diskursive Funktion der jeweiligen Rede.</p>
               <p>Der nach Präsidenten aufgeschlüsselte Boxplot (vgl. <ref type="graphic" target="#r-tutorial_006">Abbildung&#160;6</ref>) offenbart klare stilistische Differenzen. Roman Herzog und Richard von Weizsäcker weisen die höchsten Medianwerte und die breiteste Streuung auf – ihre Reden sind im Durchschnitt deutlich länger als die ihrer Nachfolger, was auf ein elaborierteres, argumentativ dichteres Redeformat hindeutet. Johannes Rau, Joachim Gauck und Horst Köhler zeigen niedrigere Mediane (unter 1.500 Wörter) mit zahlreichen Ausreißern nach oben: Sie hielten viele kurze Ansprachen, aber auch vereinzelte sehr lange Grundsatzreden. Christian Wulff hat den schmalsten Interquartilsbereich&#160;– ein Befund, der sich mit seiner kurzen, durch politische Krisen geprägten Amtszeit in Verbindung bringen lässt. Diese Unterschiede reflektieren zugleich Veränderungen im kommunikativen Format: Kürzere Reden können eine Anpassung an die Medienlogik moderner Öffentlichkeit signalisieren, in der prägnante Interventionen sichtbarer sind als ausführliche Argumentationen. <ref type="graphic" target="#r-tutorial_007">Abbildung&#160;7</ref> veranschaulicht die durchschnittliche Redenlänge pro Bundespräsident und bestätigt, dass Roman Herzog und Richard von Weizsäcker mit Mittelwerten von über 2.000 Wörtern pro Rede deutlich über dem Korpusdurchschnitt liegen.</p>
               <figure>
                  <graphic xml:id="r-tutorial_006" url="Medien/r-tutorial_006.png">
                     <desc>
                        <ref type="intern" target="#abb6">Abb. 6</ref>: Länge der Reden nach Bundespräsident im <title>German Political Speeches Corpus</title> (in Wörtern; Boxplot mit Ausreißern). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
               <figure>
                  <graphic xml:id="r-tutorial_007" url="Medien/r-tutorial_007.png">
                     <desc>
                        <ref type="intern" target="#abb7">Abb. 7</ref>: Durchschnittliche Redenlänge pro Bundespräsident im <title>German Political Speeches Corpus</title> (Mittelwert in Wörtern pro Rede). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
            </div>
         </div>
         <div type="chapter">
            <head>7. Block 4&#160;– Tokenisierung und Wortfrequenzen</head>
            <div type="subchapter">
               <head>7.1 Grundbegriffe: Tokens, Types und Lemmata</head>
               <p>In der Korpuslinguistik unterscheiden wir: Token (jedes einzelne Vorkommen eines Wortes im Text), Type (jede einzigartige Form) und Lemma (die Grundform eines Wortes: ›spricht‹, ›sprach‹, ›gesprochen‹ sind verschiedene Tokens, gehören aber zum selben Lemma ›sprechen‹). Die Tokenisierung ist der Prozess, einen Text in Einheiten (normalerweise Wörter) zu zerlegen. Im Deutschen stellt dies eine besondere Herausforderung dar: Komposita wie ›Bundespräsident‹ werden als ein einziger Token gezählt, obwohl sie semantisch zwei Konzepte enthalten.</p>
               <p>Stoppwörter  sind sehr häufige grammatische Funktionswörter (Artikel, Präpositionen, Pronomen), die wenig semantische Information für Inhaltsanalysen liefern. Ihre Entfernung aus dem Analysekorpus hilft dabei, das distinktive thematische Vokabular zu identifizieren. Wir zerlegen die Reden zunächst in einzelne Wörter (d. h., die Datenstruktur wechselt von ›eine Rede pro Zeile‹ zu ›ein Wort pro Zeile‹) und entfernen anschließend die Stoppwörter. Die Häufigkeitsverteilung der verbleibenden Wörter ist in <ref type="graphic" target="#r-tutorial_008">Abbildung&#160;8</ref> als Balkendiagramm dargestellt. </p>
               <figure>
                  <graphic xml:id="r-tutorial_008" url="Medien/r-tutorial_008.png">
                     <desc>
                        <ref type="intern" target="#abb8">Abb. 8</ref>: Die 30 häufigsten Wörter im <title>German Political Speeches Corpus</title> nach Entfernung der Stoppwörter (Gesamtkorpus, ohne Lemmatisierung). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
            </div>
            <div type="subchapter">
               <head>7.2 Philologische Interpretation: Was uns die Wortfrequenzen verraten</head>
               <p>Bereits die Rohfrequenzliste zeigt einen methodisch bedeutsamen Befund: Das häufigste Wort vor der Stoppwortbereinigung ist ›dass‹ mit über 20.000 Vorkommen&#160;– ein Konjunktionalwort, das für die syntaktische Komplexität der deutschen Präsidentenreden charakteristisch ist. Abhängige Sätze mit ›dass‹ markieren argumentative Strukturen, Behauptungen und normative Aussagen (›Es ist wichtig, dass…‹, ›Ich glaube, dass…‹), die für die politische Rede typisch sind. Der hohe Wert ist damit nicht lexikalisch, aber grammatisch interpretierbar und rechtfertigt die Aufnahme des Wortes in die manuelle Stoppliste.</p>
               <p>Das bereinigte Vokabular ist stark wertebezogen (vgl. <ref type="graphic" target="#r-tutorial_008">Abbildung&#160;8</ref>). Nach der Entfernung der Stoppwörter dominieren ›Menschen‹ (10.054), ›heute‹ (8.722), ›Deutschland‹ (8.034), ›mehr‹ (7.327) und ›immer‹ (6.717). Dieses Kernvokabular ist für präsidiale Reden hochgradig charakteristisch:<note type="footnote">Vgl. <ref type="bibliography" target="#burkhardt_parlament_2003">Burkhardt 2003</ref>, S. 353–357.</note> ›Menschen‹ als zentrales Subjekt des politischen Diskurses, ›heute‹ als deiktischer Zeitmarker, der die Gegenwartsorientierung der Reden betont, und ›Deutschland‹ als konstante nationale Referenz. Die häufige Verwendung des Modalverbs ›müssen‹ (5.197) ist rhetorisch bedeutsam: Es signalisiert normative Dringlichkeit und appellative Funktion&#160;– der Bundespräsident spricht nicht nur beschreibend, sondern auffordernd.</p>
               <p>Das Lexem ›Europa‹ erscheint bereits unter den 30 häufigsten Wörtern (ca. 3.800 Belege)&#160;– ein Befund, der die Zentralität des europäischen Themas in den Präsidentenreden bestätigt und in <ref type="intern" target="#hd26">Kapitel 12</ref> einer detaillierteren Analyse unterzogen wird. Gleiches gilt für ›Gesellschaft‹, ›Geschichte‹, ›Zukunft‹ und ›Welt‹: Diese Lexeme beschreiben das typische thematische Repertoire des Amtes – ein Präsident, der historisch einbettet, gesellschaftlich reflektiert und zukunftsorientiert appelliert.</p>
               <p>
                  Eine methodische Einschränkung bleibt festzuhalten: Da die Texte nicht lemmatisiert wurden, werden flektierte Formen getrennt gezählt. So erscheinen ›deutschen‹ und ›deutsche‹ als separate Einträge, obwohl sie zum selben Lemma gehören. Eine Lemmatisierung würde die tatsächliche Reichweite dieser Konzepte im Korpus noch deutlicher sichtbar machen&#160;– und stellt, wie in den Schlussbemerkungen (<ref type="intern" target="#hd31">Kapitel 14</ref>) skizziert, eine natürliche Erweiterung des hier vorgestellten Workflows dar. Hinzu kommt, dass bei der Tokenisierung sämtliche Wortformen klein geschrieben werden, wodurch auch Groß- / Kleinschreibungsunterschiede aufgehoben werden: So lassen sich etwa das Substantiv ›Deutsche‹ (im Sinne von ›Person deutscher Staatsangehörigkeit‹) und das Adjektiv ›deutsche‹ nach der Tokenisierung nicht mehr unterscheiden. Auch dieser Informationsverlust ließe sich durch ein vorgeschaltetes POS-Tagging vermeiden.
               </p>
            </div>
         </div>
         <div type="chapter">
            <head>8. Block 5&#160;– Wortwolke</head>
            <p>Eine Wortwolke ist eine sehr visuelle Art darzustellen, welche Wörter am häufigsten in einem Text oder Textkorpus vorkommen. <ref type="graphic" target="#r-tutorial_009">Abbildung&#160;9</ref> zeigt die 100 häufigsten Wörter in den Reden Roman Herzogs; <ref type="graphic" target="#r-tutorial_010">Abbildung&#160;10</ref> stellt dieselbe Visualisierung für die Reden Joachim Gaucks dar und eignet sich als Ausgangspunkt für den Vergleich zwischen einzelnen Präsidenten.</p>
            <figure>
               <graphic xml:id="r-tutorial_009" url="Medien/r-tutorial_009.png">
                  <desc>
                     <ref type="intern" target="#abb9">Abb. 9</ref>: Wortwolke der 100 häufigsten Wörter in den Reden Roman Herzogs im <title>German Political Speeches Corpus</title> nach Entfernung der Stoppwörter (ohne Lemmatisierung). [Grafik: Ángeles González-Miguel / Francisco Javier Muñoz-Acebes 2026] </desc>
               </graphic>
            </figure>
            <figure>
               <graphic xml:id="r-tutorial_010" url="Medien/r-tutorial_010.png">
                  <desc>
                     <ref type="intern" target="#abb10">Abb. 10</ref>: Wortwolke der 100 häufigsten Wörter in den Reden Joachim Gaucks nach Entfernung der Stoppwörter (ohne Lemmatisierung). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <div type="subchapter">
               <head>8.1 Methodische Anmerkung zur Wortwolke</head>
               <p>Die Wortwolke bestätigt visuell, was die Frequenztabelle aus Block 4 (<ref type="intern" target="#hd14">Kapitel 7</ref>) bereits gezeigt hat: ›Menschen‹, ›heute‹ und ›Deutschland‹ dominieren das Korpus, gefolgt von einem dichten Cluster aus Wörtern wie ›Gesellschaft‹, ›Europa‹, ›Zukunft‹, ›Demokratie‹ und ›Freiheit‹, die das thematische Repertoire der Präsidentenreden  sichtbar machen.</p>
               <p>Als Visualisierungswerkzeug hat die Wortwolke klare didaktische Vorzüge: Sie ist intuitiv lesbar, visuell ansprechend und vermittelt auf einen Blick ein erstes Bild des dominanten Vokabulars. Dies macht sie besonders geeignet, um Studierende ohne Vorkenntnisse für die Möglichkeiten der Textanalyse zu motivieren. Für analytische Zwecke ist sie jedoch mit Vorsicht zu verwenden: Die Schriftgröße kodiert Frequenz, aber ohne Achsenbeschriftung sind die genauen Werte nicht ablesbar, und die zufällige Anordnung der Wörter kann semantische Zusammenhänge suggerieren, die im Text nicht existieren. Das Balkendiagramm aus Block 4 (vgl. <ref type="graphic" target="#r-tutorial_008">Abbildung&#160;8</ref>) bleibt das präzisere und wissenschaftlich nachvollziehbarere Instrument.</p>
               <p>Ein besonders produktiver Einsatz der Wortwolke im Seminar war der Vergleich nach Präsidenten: Wenn Studierende die Wolke für Joachim Gauck (vgl. <ref type="graphic" target="#r-tutorial_010">Abbildung&#160;10</ref>) neben die von Roman Herzog (vgl. <ref type="graphic" target="#r-tutorial_009">Abbildung&#160;9</ref>) oder Johannes Rau stellen, werden stilistische und thematische Unterschiede unmittelbar sichtbar&#160;– auch ohne statistische Vorkenntnisse. Diese Art der explorativen Visualisierung dient als Einstieg in gezieltere Analysen, nicht als deren Ersatz.</p>
            </div>
         </div>
         <div type="chapter">
            <head>9. Block 6&#160;– Bigramme (Wortpaare)</head>
            <p><term type="dh">Bigramme</term> sind Paare von aufeinanderfolgenden Wörtern und helfen, einfache Kollokationen zu erkennen (z.&#160;B. ›soziale Marktwirtschaft‹). Die 20 häufigsten Bigramme nach Entfernung der Stoppwörter sind in <ref type="graphic" target="#r-tutorial_011">Abbildung&#160;11</ref> dargestellt.</p>
            <figure>
               <graphic xml:id="r-tutorial_011" url="Medien/r-tutorial_011.png">
                  <desc>
                     <ref type="intern" target="#abb11">Abb. 11</ref>: Die 20 häufigsten Bigramme im <title>German Political Speeches Corpus</title> nach Entfernung der Stoppwörter (Gesamtkorpus, ohne Lemmatisierung). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <div type="subchapter">
               <head>9.1 Interpretation: Was uns die Bigramme verraten</head>
               <p>Die Bigrammanalyse (vgl. <ref type="graphic" target="#r-tutorial_011">Abbildung&#160;11</ref>) liefert qualitativ andere Erkenntnisse als die Einzelwortfrequenzen: Während Tokens isolierte Lexeme zählen, zeigen Bigramme syntagmatische Muster&#160;– also Wörter, die der Präsident gemeinsam und wiederholt verwendet. Das Ergebnis ist diskursanalytisch aufschlussreich.</p>
               <p>Das häufigste Bigramm ist ›unserem Land‹ (ca. 850 Belege), gefolgt von ›Europäischen Union‹ (ca. 760) und ›viele Menschen‹ (ca. 660). Diese drei Kollokationen beschreiben treffend die Grundkoordinaten präsidialer Rhetorik: eine nationale Rahmung (›unserem Land‹), eine europäische Einbettung (›Europäischen Union‹) und ein volksbezogener Appell (›viele Menschen‹). Interessant ist, dass ›Europäischen Union‹ und ›europäische Union‹ als zwei separate Einträge erscheinen&#160;– ein erneutes Indiz für die Grenzen einer nicht-lemmatisierten Analyse, bei der unterschiedliche Flexionsformen separat gezählt werden.</p>
               <p>Einige Bigramme sind funktional-zeremonielle Formeln. ›Schloss Bellevue‹ (ca. 530), der offizielle Amtssitz des Bundespräsidenten, erscheint als häufiger Redeort und markiert Reden, die explizit dort gehalten wurden. ›Herr Präsident‹, ›Lieber Herr‹ und ›Herzlich willkommen‹ sind typische Anredeformeln, die auf die zeremonielle Dimension vieler Reden hinweisen. Ihr hohes Vorkommen erklärt teilweise den großen Anteil kurzer Reden im Korpus: Viele Texte sind Begrüßungsansprachen, keine politischen Grundsatzreden.</p>
               <p>Diskursiv besonders bedeutsam sind die Bigramme ›immer mehr‹, ›junge Menschen‹&#160;/ ›jungen Menschen‹ und ›unserer Gesellschaft‹: Sie verweisen auf typische Argumentationsmuster des Amtes: demographische Herausforderungen, gesellschaftlicher Zusammenhalt und eine Tendenz zum sprachlichen Ausdruck kontinuierlicher Zunahme (›immer mehr‹), die auf normative Dringlichkeit schließen lässt. Das Bigramm ›Vereinten Nationen‹ (ca. 540) belegt zudem die außenpolitische Dimension der Präsidentenreden, die in der Einzelwortanalyse weniger sichtbar war.</p>
               <p>Für Studierende ist der Vergleich zwischen Unigrammen (<ref type="intern" target="#hd17">Kapitel 8</ref>) und Bigrammen besonders lehrreich: Erst in der Kollokation zeigt sich, ob ›Menschen‹ in einem sozialen (›viele Menschen‹, ›junge Menschen‹), einem normativen (›für die Menschen‹, hier als Trigramm) oder einem abstrakten Kontext verwendet wird. Allgemein spricht man hierbei von n-Grammen&#160;– zusammenhängenden Sequenzen aus n Wörtern, wobei Bigramme (n = 2) und Trigramme (n = 3) die gebräuchlichsten Fälle sind. Dies illustriert den Mehrwert der n-Gramm-Analyse gegenüber der einfachen Frequenzauszählung.</p>
            </div>
         </div>
         <div type="chapter">
            <head>10. Block 7&#160;– Lexikalische Vielfalt und Komplexität</head>
            <p>Die lexikalische Vielfalt, gemessen anhand der TTR (Type-Token-Ratio), also dem Verhältnis von Tokens und Types (unterschiedliche Wortformen), gibt an, welcher Anteil der Wörter in einer Rede unterschiedlichen Wortformen zuzuordnen ist. <ref type="graphic" target="#r-tutorial_012">Abbildung&#160;12</ref> zeigt die Verteilung der TTR-Werte über das Gesamtkorpus. Außerdem lässt sich die sprachliche Komplexität eines Textes näherungsweise über die Anzahl der Wörter pro Satz bestimmen. In methodischer Hinsicht ist zu beachten, dass die TTR hier auf Basis der bereinigten Token-Liste (ohne Stoppwörter) berechnet wird, nicht auf dem Rohtext. Dies hebt die absoluten TTR-Werte gegenüber der klassischen Berechnung an und macht sie nicht direkt mit Studien vergleichbar, die die TTR auf den unbereinigten Text anwenden. Der intern konsistente Vergleich zwischen den Amtsinhabern bleibt jedoch valide.</p>
            <figure>
               <graphic xml:id="r-tutorial_012" url="Medien/r-tutorial_012.png">
                  <desc>
                     <ref type="intern" target="#abb12">Abb. 12</ref>: Verteilung der Type-Token-Ratio (TTR) im <title>German Political Speeches Corpus</title> (Gesamtkorpus; Schwerpunkt zwischen 0,65 und 0,80). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <div type="subchapter">
               <head>10.1 Interpretation: Lexikalische Vielfalt in den Präsidentenreden </head>
               <p>Die Verteilung der TTR-Werte (vgl. <ref type="graphic" target="#r-tutorial_012">Abbildung&#160;12</ref>) zeigt ein annähernd normalverteiltes Bild, konzentriert zwischen 0,65 und 0,85, mit einem Gipfel um 0,72–0,75. Das bedeutet, dass im Durchschnitt etwa 72–75 % der Wörter einer Rede unterschiedliche Formen haben&#160;– ein Wert, der für die hier vorliegenden Reden mittlerer Länge auf ein abwechslungsreiches, aber nicht übermäßig technisches Vokabular hinweist.</p>
               <p>Der Boxplot nach Präsidenten (vgl. <ref type="graphic" target="#r-tutorial_013">Abbildung&#160;13</ref>) zeigt, dass die Unterschiede zwischen den Amtsinhabern in absoluten TTR-Werten gering sind: Alle Mediane liegen zwischen 0,70 und 0,76. Roman Herzog und Richard von Weizsäcker weisen die höchsten Medianwerte auf, was konsistent mit ihren in <ref type="intern" target="#hd14">Kapitel 7</ref> beobachteten längeren Reden ist&#160;– ein scheinbarer Widerspruch, der sich auflöst, wenn man bedenkt, dass beide zahlreiche kurze Reden gehalten haben, die tendenziell höhere TTR-Werte aufweisen; da diese kurzen Reden den Großteil ihres Redekorpus ausmachen, liegt ihr Median entsprechend im oberen Bereich. Joachim Gauck, Horst Köhler und Christian Wulff clustern eng zusammen, was auf einen ähnlichen diskursiven Stil in Bezug auf lexikalische Variation hindeutet. Die größte Streuung zeigt Johannes Rau&#160;– er umfasst sowohl sehr knappe Begrüßungsansprachen als auch die längsten Grundsatzreden des gesamten Korpus.</p>
               <figure>
                  <graphic xml:id="r-tutorial_013" url="Medien/r-tutorial_013.png">
                     <desc>
                        <ref type="intern" target="#abb13">Abb. 13</ref>: Lexikalische Vielfalt (TTR) nach Bundespräsident im <title>German Political Speeches Corpus</title> (Boxplot mit Ausreißern). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
               <figure>
                  <graphic xml:id="r-tutorial_014" url="Medien/r-tutorial_014.png">
                     <desc>
                        <ref type="intern" target="#abb14">Abb. 14</ref>: Zusammenhang zwischen Redenlänge (in Wörtern) und lexikalischer Vielfalt (TTR) im <title>German Political Speeches Corpus</title>, farbkodiert nach Bundespräsident (negative Korrelation: längere Reden weisen tendenziell niedrigere TTR-Werte auf). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
               <p>
                  Das Streudiagramm (vgl. <ref type="graphic" target="#r-tutorial_014">Abbildung&#160;14</ref>) offenbart eine strukturelle Gesetzmäßigkeit, die für die methodische Reflexion zentral ist: Je länger eine Rede, desto niedriger die TTR. Dieser negative Zusammenhang ist kein inhaltlicher Befund, sondern ein mathematisches Artefakt: In längeren Texten werden Wörter zwangsläufig häufiger wiederholt, was den TTR-Wert senkt, unabhängig vom tatsächlichen Reichtum des Vokabulars. Die sehr langen Reden (über 7.500 Wörter, überwiegend von Johannes Rau und Horst Köhler) weisen TTR-Werte unter 0,55 auf, während kurze Ansprachen unter 500 Wörtern TTR-Werte von über 0,90 erreichen können. Dieses Phänomen ist in der Stilometrie gut bekannt und hat zur Entwicklung längennormierter Maße wie <term type="dh">MATTR</term> (<term type="dh">Moving Average Type-Token Ratio</term>)<note type="footnote">Vgl. <ref type="bibliography" target="#covington_mcfall_knot_2010">Covington / McFall 2010</ref> (MATTR).</note> oder <term type="dh">MTLD</term> (<term type="dh">Measure of Textual Lexical Diversity</term>)<note type="footnote">Vgl. <ref type="bibliography" target="#mccarthy_jarvis_mtld_2010">McCarthy / Jarvis 2010</ref> (MTLD).</note>  geführt, die als Erweiterung dieses Blocks eingeführt werden könnten.
               </p>
               <p>Für Studierende ist dieser Block besonders lehrreich, weil er die Grenzen quantitativer Maße direkt erfahrbar macht: Eine hohe TTR bedeutet nicht unbedingt einen reicheren Stil, sondern kann schlicht Kürze signalisieren. Die Interpretation verlangt, den Zahlenwert immer im Kontext von Textlänge und Gattung zu lesen&#160;– eine Übung im kritischen Umgang mit Daten, die über die Philologie hinaus Gültigkeit hat.</p>
            </div>
         </div>
         <div type="chapter">
            <head>11. Block 8&#160;– Schlüsselwörter und Konkordanzen (KWIC)</head>
            <div type="subchapter">
               <head>11.1 Relevanz der Schlüsselbegriffe im deutschen Präsidialdiskurs</head>
               <p>Die Begriffe, die wir im Folgenden analysieren, sind nicht willkürlich gewählt, sondern spiegeln zentrale Achsen der zeitgenössischen deutschen politischen Debatte wider: ›Europa‹ (die europäische Integration als konstitutives Thema der deutschen Nachkriegsidentität), ›Freiheit‹ (Grundbegriff der liberalen Demokratie und wiederkehrendes Thema nach der Wiedervereinigung), ›Krise‹ (Indikator für die Wahrnehmung politischer Dringlichkeit in verschiedenen Perioden) und ›Flüchtlinge‹ (Zentralität des Migrationsthemas insbesondere seit 2015). Die diachrone Analyse dieser Begriffe erlaubt es, die politische Agenda und die dominierenden Deutungsrahmen (<term type="dh">frames</term>) in verschiedenen Perioden nachzuzeichnen&#160;– ein Verfahren, das auch in vergleichbaren korpusgestützten Untersuchungen deutschsprachiger politischer und medialer Diskurse eingesetzt wurde.<note type="footnote"> Vgl. <ref type="bibliography" target="#adam_et_al_klimaschutz_2023">Adam et al. 2023</ref>.</note>
               </p>
               <figure>
                  <graphic xml:id="r-tutorial_015" url="Medien/r-tutorial_015.png">
                     <desc>
                        <ref type="intern" target="#abb15">Abb. 15</ref>: Durchschnittliche Erwähnungen des Begriffs ›Europa‹ pro Rede nach Bundespräsident im <title>German Political Speeches Corpus</title> (Roman Herzog mit dem höchsten Wert). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
               <p>
                  <ref type="graphic" target="#r-tutorial_015">Abbildung&#160;15</ref> zeigt, wie oft der Begriff ›Europa‹ durchschnittlich pro Rede bei den einzelnen Bundespräsidenten vorkommt. Darüber hinaus erlaubt die <term type="dh">KWIC</term>-Funktion (<term type="dh">Key Word In Context</term>) einen qualitativen Blick auf die Verwendungskontexte der Schlüsselbegriffe: Sie macht sichtbar, ob ein Begriff in einem affirmativen, kritischen oder appellativen Rahmen erscheint und illustriert damit exemplarisch das Zusammenspiel von quantitativer Frequenzanalyse und qualitativer Interpretation, das den methodischen Kern dieses Tutorials bildet.</p>
            </div>
            <div type="subchapter">
               <head>11.2 Interpretation: Schlüsselbegriffe in den Präsidentenreden</head>
               <p>Das Gesamtvorkommen der vier Schlüsselbegriffe spiegelt unmittelbar die thematischen Prioritäten der Präsidentenreden wider: ›Europa‹ (5.973) und ›Freiheit‹ (3.630) dominieren mit großem Abstand vor ›Krise‹ (1.229) und ›Flüchtlinge‹ (368). Diese Rangfolge ist sowohl inhaltlich als auch historisch interpretierbar.</p>
               <p>›Europa‹ ist das stabilste Grundthema des Amtes. Mit fast 6.000 Belegen über alle Amtsinhaber ist es das weitaus häufigste der analysierten Schlüsselwörter. <ref type="graphic" target="#r-tutorial_015">Abbildung&#160;15</ref> zeigt jedoch erhebliche Unterschiede in der Intensität: Roman Herzog nennt Europa im Durchschnitt über 6-mal pro Rede&#160;– der höchste Wert im gesamten Korpus&#160;–, was mit seiner Amtszeit (1994–1999) zusammenhängt, in der zentrale europäische Integrationsschritte stattfanden (Maastricht-Vertrag 1993, Vorbereitung des Euro). Richard von Weizsäcker (ca. 4,2 pro Rede) und Joachim Gauck (ca. 3,2) folgen, während Johannes Rau und Horst Köhler trotz vieler Reden die niedrigsten Durchschnittswerte aufweisen&#160;– ein Befund, der zur Hypothese einlädt, dass europäische Themen in ihrer Amtszeit stärker auf andere Institutionen (z.&#160;B. Bundesregierung, Bundestag) delegiert wurden.</p>
               <p>›Freiheit‹ ist ein Kernbegriff der deutschen politischen Identität, besonders nach der Wiedervereinigung 1990. Seine Häufigkeit (3.630) deutet auf eine kontinuierliche normative Rahmung hin, die sich durch alle Amtszeiten zieht. Die deutlich geringere Frequenz von ›Krise‹ (1.229) mag überraschen, ist aber funktional erklärbar: Bundespräsidenten meiden als staatstragende Institution tendenziell Krisenvokabular, das als alarmistisch wahrgenommen werden könnte. Diese These ist mit der KWIC-Funktion unmittelbar überprüfbar.</p>
               <p>›Flüchtlinge‹ (368) ist mit Abstand das seltenste Wort der Liste, was angesichts der Prominenz des Themas in der deutschen Politik seit 2015 zunächst überrascht. Hier sei jedoch auf den Zeitschnitt des Korpus hingewiesen: Der Großteil der Reden stammt aus den Jahren vor 2016. Eine diachrone Analyse (Block 9, <ref type="intern" target="#hd26">Kapitel 12</ref>) wird zeigen, ob die Frequenz dieses Begriffs in den letzten Jahren des Korpus deutlich ansteigt.</p>
               <p>Die KWIC-Funktion erlaubt es, über das reine Zählen hinauszugehen. Die Beispielkontexte aus den Reden Horst Köhlers vom März und November 2009, dem Jahr nach der globalen Finanzkrise, ermöglichen eine direkte Überprüfung, ob ›Europa‹ in jenem Jahr in einem Krisenrahmen verwendet wird oder eher als positive Referenz. Diese Art der qualitativen Validierung quantitativer Befunde ist methodisch zentral: Frequenzen zeigen, wo zu lesen ist, die KWIC-Konkordanz zeigt, was dort steht.</p>
            </div>
         </div>
         <div type="chapter">
            <head>12. Block 9&#160;– Zeitliche Dimension von Schlüsselbegriffen</head>
            <p>Zum Schluss betrachten wir die diachrone Entwicklung von Begriffen wie ›Europa‹ und ›Freiheit‹. <ref type="graphic" target="#r-tutorial_016">Abbildung&#160;16</ref> zeigt die relative Häufigkeit beider Begriffe pro Jahr über den gesamten Erfassungszeitraum des Korpus. Im Unterschied zu den bisherigen absoluten Zahlen gleicht die relative Häufigkeit die ungleichmäßige Verteilung der Reden über die Jahre aus (vgl. Block 2, <ref type="intern" target="#hd10">Kapitel 5</ref>): Sie ergibt sich aus der Anzahl der Vorkommen eines Begriffs in einem bestimmten Jahr, geteilt durch die Gesamtzahl aller Tokens in diesem Jahr. Ein Wert von 0,009 bedeutet, dass der Begriff in besagtem Jahr etwa 9-mal pro 1000 Tokens vorkommt (bzw. 0,9&#160;% aller Wörter ausmacht).</p>
            <figure>
               <graphic xml:id="r-tutorial_016" url="Medien/r-tutorial_016.png">
                  <desc>
                     <ref type="intern" target="#abb16">Abb. 16</ref>: Relative Häufigkeit der Begriffe ›europa‹ und ›freiheit‹ pro Jahr im <title>German Political Speeches Corpus</title> (1984–2017); markanter Doppelgipfel um 1990 im Kontext der deutschen Wiedervereinigung und des Mauerfalls von 1989. [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
               </graphic>
            </figure>
            <div type="subchapter">
               <head>12.1 Interpretation: Diachrone Muster in den Präsidentenreden</head>
               <p>Das Liniendiagramm (vgl. <ref type="graphic" target="#r-tutorial_016">Abbildung&#160;16</ref>) ist die philologisch ergiebigste Visualisierung des gesamten Tutorials: Es macht sichtbar, dass quantitative Muster in politischen Texten nicht zufällig verteilt sind, sondern mit historischen Ereignissen korrespondieren, und damit interpretierbar werden. Dass diachrone Frequenzverläufe gesellschaftlich relevante Diskursverschiebungen abbilden können, hat sich auch in vergleichbaren Korpusanalysen deutschsprachiger politischer und medialer Texte gezeigt.<note type="footnote"> Vgl. <ref type="bibliography" target="#adam_et_al_klimaschutz_2023">Adam et al. 2023</ref>.</note> Das vorliegende Tutorial macht dieses Prinzip für Studierende an konkretem historischen Material erfahrbar.</p>
               <p>Der markanteste Befund ist der Doppelgipfel um 1990. Sowohl ›Europa‹ als auch ›Freiheit‹ erreichen in diesem Jahr ihre absoluten Höchstwerte im gesamten Korpus, mit ›Freiheit‹ klar an der Spitze (relative Häufigkeit über 0,009). Das Jahr 1990 markiert im unmittelbaren Nachklang des Mauerfalls von 1989 die deutsche Wiedervereinigung und den Beginn einer neuen europäischen Ordnung. Dies findet in den Präsidentenreden unmittelbar und eindeutig Niederschlag. Der Begriff ›Freiheit‹ wird in diesem Kontext nicht abstrakt verwendet, sondern als direkte Referenz auf ein historisches Ereignis, das die politische Identität der Bundesrepublik nachhaltig geprägt hat. Dieser Peak illustriert für Studierende exemplarisch, wie eine diachrone Frequenzanalyse als Seismograph politischer Geschichte funktioniert.</p>
               <p>Nach 1990 folgt ein gemeinsamer Rückgang beider Begriffe, der bis etwa 2002 anhält. Die relative Häufigkeit stabilisiert sich danach auf einem niedrigeren Niveau (zwischen 0,002 und 0,004, d. h. etwa 2 bis 4 Vorkommen pro 1.000 Tokens), mit moderaten Schwankungen. Dies lässt sich als Normalisierung des Diskurses interpretieren: Die außerordentliche historische Situation der Wendezeit wich einem routinierteren Redeformat der konsolidierten Demokratie.</p>
               <p>Ab ca. 2014 zeigt ›Europa‹ einen deutlichen Wiederanstieg, der bis zum Ende des Korpus anhält und kurz vor 2016 seinen zweiten Gipfelwert (ca. 0,006) erreicht. Dieser Anstieg fällt zeitlich zusammen mit der Eurokrise (2010–2015), der Ukraine-Krise (2014) und dem Brexit-Referendum (2016), also mit Ereignissen, die den europäischen Zusammenhalt in Frage stellten und das Thema wieder auf die präsidiale Agenda brachten. ›Freiheit‹ hingegen zeigt in diesem Zeitraum keinen vergleichbaren Anstieg und bleibt auf niedrigem Niveau, was darauf hindeutet, dass die Bedrohungswahrnehmung der 2010er Jahre eher geopolitisch als freiheitsbezogen gerahmt wurde.</p>
            </div>
         </div>
         <div type="chapter">
            <head>13. Methodische Limitationen und kritische Überlegungen</head>
            <p>Die in den vorangehenden Kapiteln eingeführten Methoden sind mächtige Explorationswerkzeuge, aber keine neutralen Messinstrumente. An mehreren Stellen dieses Tutorials sind wir auf spezifische Grenzen gestoßen, die hier zusammenfassend reflektiert werden.</p>
            <div type="subchapter">
               <head>13.1 Technische Limitationen</head>
               <p>Die wichtigste technische Limitation ist das Fehlen einer Lemmatisierung. Wir haben in den Blöcken 4 und 6 (<ref type="intern" target="#hd17">Kapitel 8</ref> und <ref type="intern" target="#hd21">10</ref>) beobachtet, dass flektierte Formen desselben Lexems (z.&#160;B. ›deutschen‹, ›deutsche‹, ›deutschem‹) als separate Types gezählt werden und im Ranking separat erscheinen. Dadurch wird systematisch die tatsächliche diskursive Reichweite zentraler Konzepte unterschätzt. Ähnliches gilt für die Satzsegmentierung (Block 3, <ref type="intern" target="#hd12">Kapitel 6</ref>), die über einfache Zeichenregeln approximiert wurde, und für den TTR-Wert (Block 7, <ref type="intern" target="#hd21">Kapitel 10</ref>), dessen mathematische Abhängigkeit von der Textlänge eine direkte Vergleichbarkeit zwischen Reden unterschiedlicher Länge verhindert. Diese Einschränkungen sind durch den Einsatz von POS-Taggern wie udpipe, längennormierten Diversitätsmaßen wie MATTR oder syntaktischen Parsern lösbar. So zeigt <ref type="graphic" target="#r-tutorial_017">Abbildung&#160;17</ref> den Unterschied zwischen lemmatisierter und nicht-lemmatisierter Analyse. Eine nähere Diskussion dieser Analyse übersteigt jedoch den Rahmen einer Einführungsveranstaltung und wird als Erweiterungsoption in den Schlussbemerkungen aufgeführt.<note type="footnote"> Exkurs: Eine Lemmatisierung lässt sich in R mit dem Paket udpipe und einem vortrainierten deutschen Modell (german-gsd-ud-2.5) durchführen. Der direkte Vergleich von Frequenzlisten mit und ohne Lemmatisierung zeigt (vgl. <ref type="graphic" target="#r-tutorial_017">Abbildung&#160;17</ref>), dass flektierte Formen wie ›Kind‹ und ›Kindern‹ oder ›europäisch‹, ›europäischen‹ und ›Europäer‹ ohne Lemmatisierung als verschiedene Types gezählt werden, was die diskursive Reichweite zentraler Konzepte systematisch unterschätzt. Da die vollständige Lemmatisierung des Gesamtkorpus rechenintensiv ist, steht der vollständige Code (inkl. Vergleichsvisualisierung) im GitHub-Repositorium der Autor*innen zur Verfügung (vgl. <ref type="bibliography" target="#gonzalez-miguel_munoz-acebes_r_2026">González-Miguel&#160;/ Muñoz-Acebes 2026</ref>).</note>
               </p>
               <figure>
                  <graphic xml:id="r-tutorial_017" url="Medien/r-tutorial_017.png">
                     <desc>
                        <ref type="intern" target="#abb17">Abb. 17</ref>: Frequenzvergleich der Top-15-Nomen mit und ohne Lemmatisierung in den ersten zehn Reden Joachim Gaucks (udpipe, Modell german-gsd-ud-2.5; gruppiertes Balkendiagramm). [Grafik: Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes 2026]</desc>
                  </graphic>
               </figure>
            </div>
            <div type="subchapter">
               <head>13.2 Die Balance zwischen <hi rend="italic">distant</hi> und <hi rend="italic">close reading</hi>
               </head>
               <p>Quantitative Methoden sind ein Explorationswerkzeug, kein Ersatz für genaues Lesen. Numerische Muster müssen philologisch interpretiert werden: Ein Peak in der Frequenz von ›Krise‹ zeigt uns, wo wir hinschauen sollten, aber die präzise Bedeutung erfordert das Lesen der Reden in ihrem historischen und rhetorischen Kontext. Die in diesem Tutorial eingeübte Kombination aus quantitativer Exploration und qualitativer Validierung, die exemplarisch in der KWIC-Funktion realisiert wurde, ist methodisch der Kern der zeitgenössischen Digital Humanities: nicht <hi rend="italic">distant reading</hi> statt <hi rend="italic">close reading</hi>, sondern <hi rend="italic">distant</hi> als Orientierung für <hi rend="italic">close reading</hi>.</p>
            </div>
         </div>
         <div type="chapter">
            <head>14. Erfahrungsbericht: Erkenntnisse aus dem Seminar</head>
            <p>Die praktische Erprobung dieses Tutorials im Seminarkontext hat eine Reihe von Beobachtungen erbracht, die über die technische Dokumentation hinaus für Lehrende von Interesse sein dürften.</p>
            <div type="subchapter">
               <head>14.1 Was gut funktioniert hat</head>
               <p>Der projektbasierte Ansatz mit einem realen, inhaltlich relevanten Korpus erwies sich als entscheidender Motivationsfaktor. Studierende, die zu Beginn des Seminars skeptisch gegenüber Programmierung waren, zeigten hohes Engagement, sobald die ersten Visualisierungen eigene Hypothesen über das sprachliche Verhalten der Bundespräsidenten bestätigten oder widerlegten. Besonders wirksam war der Moment, in dem die Wortwolke (vgl. <ref type="graphic" target="#r-tutorial_009">Abbildung&#160;9</ref>) und das Frequenzdiagramm (vgl. <ref type="graphic" target="#r-tutorial_008">Abbildung&#160;8</ref>) zum ersten Mal erschienen: Das unmittelbare Erkennen bekannter Begriffe (›Menschen‹, ›Europa‹, ›Freiheit‹) schuf eine Brücke zwischen dem philologischen Vorwissen der Studierenden und der neuen Methode.</p>
               <p>Die Blöcke mit dem stärksten Lerneffekt waren Block 4 (<ref type="intern" target="#hd14">Kapitel 7</ref>: Tokenisierung und Stoppwörter) und Block 9 (<ref type="intern" target="#hd26">Kapitel 12</ref>: diachrone Entwicklung). Im ersten Fall löste die Frage, welche Wörter aus der Analyse ausgeschlossen werden sollen und warum, lebhafte Diskussionen über die Grenzen von Automatisierung aus: Ist ›müssen‹ ein Stoppwort? Sollte ›heute‹ herausgefiltert werden? Diese Debatten zeigten, dass die Studierenden begonnen hatten, methodisch zu denken. Im zweiten Fall produzierte die Visualisierung des Höhepunkts von ›Freiheit‹ im Jahr 1990 (vgl. <ref type="graphic" target="#r-tutorial_016">Abbildung&#160;16</ref>) spontane historische Kontextualisierungen, ohne dass die Lehrperson eingreifen musste.</p>
            </div>
            <div type="subchapter">
               <head>14.2 Wo Schwierigkeiten auftraten</head>
               <p>Die größten technischen Hürden lagen erwartungsgemäß in der Installation der Pakete und im Umgang mit Fehlermeldungen. Viele Studierende hatten R und RStudio noch nie gestartet und reagierten auf rote Ausgaben in der Konsole zunächst mit Verunsicherung. Hier bewährte sich der Einsatz des KI-Assistenten (Claude Sonnet 4.5): Studierende beschrieben ihre Fehlermeldungen in eigenen Worten und erhielten unmittelbare Erklärungen, was den Unterrichtsfluss erheblich verbesserte. Kritisch bleibt jedoch, dass einige Studierende dazu neigten, KI-generierten Code zu übernehmen, ohne ihn zu verstehen. Diese Tendenz konnte durch die Anforderung, jeden Code-Block zu kommentieren und im Plenum zu erklären, teilweise abgefedert werden.</p>
               <p>Ein konzeptuell schwieriger Moment war die Auseinandersetzung mit dem TTR-Artefakt in Block 7 (<ref type="intern" target="#hd21">Kapitel 10</ref>): Der Befund, dass kürzere Reden automatisch höhere TTR-Werte aufweisen, unabhängig von ihrem tatsächlichen Wortreichtum, erforderte eine explizite Thematisierung der Grenzen quantitativer Maße und war für viele Studierende die erste bewusste Erfahrung damit, dass Zahlen interpretierungsbedürftig sind.</p>
            </div>
            <div type="subchapter">
               <head>14.3 Studentische Eigenproduktionen</head>
               <p>Im Anschluss an das gemeinsame Tutorial erarbeiteten die Studierenden eigene kleine Analysen, in denen sie das Skript auf abgewandelte Fragestellungen anwendeten, z.&#160;B. den Vergleich zweier Präsidenten nach Lexik, die Analyse eines anderen Schlüsselbegriffs (›Demokratie‹, ›Familie‹, ›Wirtschaft‹) oder die Erstellung präsidentenspezifischer Wortwolken. Diese Arbeiten zeigten, dass das Skript als Vorlage funktioniert: Der Code war für alle Studierenden modifizierbar, ohne dass tiefgehende Programmierkenntnisse erforderlich waren. Die Qualität der Interpretationen variierte stark und reichte von rein beschreibenden Kommentaren bis hin zu kontextualisierenden Analysen mit historischen Referenzen. Das weist auf die Notwendigkeit hin, die philologische Interpretationskompetenz parallel zur technischen Einführung explizit zu fördern.</p>
            </div>
            <div type="subchapter">
               <head>14.4 Pädagogischer Wert und Übertragbarkeit</head>
               <p>Das Tutorial vermittelt nicht nur R-Kenntnisse, sondern eine Haltung gegenüber Texten: die Bereitschaft, sie als strukturierte, messbare Daten zu betrachten, ohne ihre hermeneutische Dimension preiszugeben. Die Vorlage ist auf andere Korpora, Sprachen und philologische Fragestellungen übertragbar; der Einsatz im Fremdsprachenkontext (Germanistik an einer spanischsprachigen Universität) hat gezeigt, dass quantitative Methoden den <hi rend="italic">close-reading</hi>-basierten Zugang produktiv ergänzen.</p>
            </div>
         </div>
      </body>
      <back>
         <div type="bibliography">
            <head>R-Pakete und Ressourcen</head>
            <listBibl>               
               <bibl xml:id="benoit_et_al_stopwords_2017">Kenneth Benoit&#160;/ David Muhr&#160;/ Kohei Watanabe: stopwords. Multilingual Stopword Lists. CRAN. 12.11.2017. Version 2.3 vom 28.10.2021. DOI: <ref target="https://doi.org/10.32614/CRAN.package.stopwords">10.32614/CRAN.package.stopwords</ref></bibl>
               <bibl xml:id="fellows_wordcloud_2011">Ian Fellows: wordcloud. Word Clouds. CRAN. 23.07.2011. Version 2.6 vom 24.08.2018. DOI: <ref target="https://doi.org/10.32614/CRAN.package.wordcloud">10.32614/CRAN.package.wordcloud</ref></bibl>
               <bibl xml:id="gonzalez-miguel_munoz-acebes_r_2026">Ángeles González-Miguel&#160;/ Francisco Javier Muñoz-Acebes: R für Philolog:innen&#160;– Begleitendes R-Skript [Code]. GitHub. 07.07.2026. [<ref target="https://github.com/javiermunoz-acebes/filologia_digital/blob/main/R%20f%C3%BCr%20Philolog_innen_%20Ein%20praktischer%20Einstieg%20mit%20politischen%20Reden/Script_Bundespraesidenten_Final_updated.Rmd">online</ref>] </bibl>
               <bibl xml:id="grolemund_wickham_dates_2011">Garrett Grolemund&#160;/ Hadley Wickham: Dates and Times Made Easy with lubridate. In: Journal of Statistical Software 40 (2011), H. 3, S. 1–25. DOI: <ref target="https://doi.org/10.18637/jss.v040.i03">10.18637/jss.v040.i03</ref></bibl>
               <bibl xml:id="mueller_wickham_tibble_2016">Kirill Müller&#160;/ Hadley Wickham: tibble. Simple Data Frames. CRAN. 23.03.2016. Version 3.3.1 vom 11.01.2026. DOI: <ref target="https://doi.org/10.32614/CRAN.package.tibble">10.32614/CRAN.package.tibble</ref></bibl>
               <bibl xml:id="neuwirth_rcolorbrewer_2002">Erich Neuwirth: RColorBrewer. ColorBrewer Palettes. CRAN. 31.10.2002. Version 1.1-3 vom 03.04.2022. DOI: <ref target="https://doi.org/10.32614/CRAN.package.RColorBrewer">10.32614/CRAN.package.RColorBrewer</ref></bibl>
               <bibl xml:id="r_core_team_r_1993-2026">R Core Team: R. A Language and Environment for Statistical Computing. Version 4.3.3. Wien 1993–2026. [<ref target="https://www.r-project.org">online</ref>] </bibl>
               <bibl xml:id="rstudio_team_rstudio_2023">RStudio Team: RStudio. Integrated Development Environment for R. Version 2023.12.1. Boston 2023. [<ref target="https://posit.co/products/open-source/rstudio">online</ref>] </bibl>
               <bibl xml:id="silge_robinson_tidytext_2016">Julia Silge&#160;/ David Robinson: tidytext. Text Mining and Analysis Using Tidy Data Principles in R. In: Journal of Open Source Software 1 (2016), H. 3, Art. 37. DOI: <ref target="https://doi.org/10.21105/joss.00037">10.21105/joss.00037</ref></bibl>
               <bibl xml:id="wickham_ggplot2_2016">Hadley Wickham: ggplot2. Elegant Graphics for Data Analysis. 2. Auflage. New York 2016. <ptr type="gbv" cRef="846024217"/>
               </bibl>
               <bibl xml:id="wickham_stringr_2009">Hadley Wickham: stringr. Simple, Consistent Wrappers for Common String Operations. CRAN. 09.11.2009. Version 1.6.0 vom 04.11.2025. DOI: <ref target="https://doi.org/10.32614/CRAN.package.stringr">10.32614/CRAN.package.stringr</ref></bibl>
               <bibl xml:id="wickham_et_al_tidyr_2014">Hadley Wickham&#160;/ Davis Vaughan&#160;/ Maximilian Girlich: tidyr. Tidy Messy Data. CRAN. 21.07.2014. Version 1.3.2 vom 19.12.2025. DOI: <ref target="https://doi.org/10.32614/CRAN.package.tidyr">10.32614/CRAN.package.tidyr</ref></bibl>
               <bibl xml:id="wickham_et_al_xml2_2015">Hadley Wickham&#160;/ Jim Hester&#160;/ Jeroen Ooms: xml2. Parse XML. CRAN. 20.04.2015. Version 1.5.2. vom 17.01.2026. DOI: <ref target="https://doi.org/10.32614/CRAN.package.xml2">10.32614/CRAN.package.xml2</ref></bibl>
               <bibl xml:id="wickham_et_al_dplyr_2014">Hadley Wickham&#160;/ Romain François&#160;/ Lionel Henry&#160;/ Kirill Müller&#160;/ Davis Vaughan: dplyr. A Grammar of Data Manipulation. CRAN. 29.01.2014. Version 1.2.1 vom 03.04.2026. DOI: <ref target="https://doi.org/10.32614/CRAN.package.dplyr">10.32614/CRAN.package.dplyr</ref></bibl>
               <bibl xml:id="xie_knitr">Yihui Xie: knitr. A General-Purpose Package for Dynamic Report Generation in R. CRAN. 17.01.2012. Version 1.51 vom 20.12.2025. DOI: <ref target="https://doi.org/10.32614/CRAN.package.knitr">10.32614/CRAN.package.knitr</ref></bibl>
            </listBibl>
         </div>
         <div type="bibliography">
            <head>Literatur</head>
            <listBibl>
               <bibl xml:id="adam_et_al_klimaschutz_2023">Raven Adam&#160;/ Marie Lisa Kogler&#160;/ Martina Scholger: Aufwind in der Berichterstattung zum Klimaschutz. Langfristige Entwicklung von Themen und Stimmungsbildern in österreichischen Zeitungen. In: Zeitschrift für digitale Geisteswissenschaften 8 (2023). Version 2 vom 27.06.2024. HTML. DOI: <ref target="https://doi.org/10.17175/2023_006_v2">10.17175/2023_006_v2</ref></bibl>
               <bibl xml:id="arnold_et_al_frequencies_2019">Taylor Arnold&#160;/ Nicolas Ballier&#160;/ Paula Lissón&#160;/ Lauren Tilton: Beyond Lexical Frequencies: Using R for Text Analysis in the Digital Humanities. In: Language Resources and Evaluation 53 (2019), H. 4, S. 707–733. PDF. DOI: 10.1007/s10579-019-09456-6</bibl>
               <bibl xml:id="barbaresi_speeches_2011-2019">Adrien Barbaresi: German Political Speeches Corpus. 2011–2019. Datenset. DOI: <ref target="https://doi.org/10.5281/zenodo.3611246">10.5281/zenodo.3611246</ref></bibl>
               <bibl xml:id="bartsch_et_al_sinn_2023">Sabine Bartsch&#160;/ Evelyn Gius&#160;/ Marcus Müller&#160;/ Andrea Rapp&#160;/ Thomas Weitin: Sinn und Segment. Wie die digitale Analysepraxis unsere Begriffe schärft. In: Zeitschrift für digitale Geisteswissenschaften 8 (2023). 01.06.2023. HTML. DOI: <ref target="https://doi.org/10.17175/2023_003">10.17175/2023_003</ref></bibl>
               <bibl xml:id="blessing_et_al_werkzeuge_2015">André Blessing&#160;/ Fritz Kliche&#160;/ Ulrich Heid&#160;/ Cathleen Kantner&#160;/ Jonas Kuhn: Computerlinguistische Werkzeuge zur Erschließung und Exploration großer Textsammlungen aus der Perspektive fachspezifischer Theorie. In: Constanze Baum&#160;/ Thomas Stäcker (Hg.): Grenzen und Möglichkeiten der Digital Humanities (= Zeitschrift für digitale Geisteswissenschaften&#160;/ Sonderbände, 1). Wolfenbüttel 2015. 19.02.2015. HTML. DOI: <ref target="https://doi.org/10.17175/sb001_013">10.17175/sb001_013</ref></bibl>
               <bibl xml:id="brown_learning_2019">Benjamin D. Brown: Evolving Project Based Learning Methodology at the University Level. A Need for More Guidance and Accountability. In: Alabama Journal of Educational Leadership 6 (2019), S. 10–19. PDF. [<ref target="https://files.eric.ed.gov/fulltext/EJ1326794.pdf">online</ref>] </bibl>
               <bibl xml:id="burkhardt_parlament_2003">Armin Burkhardt: Das Parlament und seine Sprache. Studien zu Theorie und Geschichte parlamentarischer Kommunikation. Tübingen 2003. <ptr type="gbv" cRef="362870020"/>
               </bibl>
               <bibl xml:id="covington_mcfall_knot_2010">Michael A. Covington&#160;/ Joe D. McFall: Cutting the Gordian Knot. The Moving-Average Type–Token Ratio (MATTR). In: Journal of Quantitative Linguistics 17 (2010), H. 2, S. 94–100. PDF. DOI: 10.1080/09296171003643098</bibl>
               <bibl xml:id="featherstone_teaching_2025">Michael Featherstone: Teaching Programming in Higher Education Using a Hybrid Project-Based Learning Approach. In: IEEE Transactions on Education 68 (2025), H. 4, S. 377–386. PDF. DOI: 10.1109/TE.2025.3577406</bibl>
               <bibl xml:id="flueh_textvisualisierung_2024">Marie Flüh: Lerneinheit: Textvisualisierung mit Voyant. In: forTEXT 1 (2024), H. 5. 07.08.2024. HTML. DOI: <ref target="https://doi.org/10.48694/fortext.3773">10.48694/fortext.3773</ref></bibl>
               <bibl xml:id="fradejas_rueda_cuentapalabras_2025">José Manuel Fradejas Rueda: Cuentapalabras. Estilometría y análisis de textos con R para filólogos. Valladolid 2025. HTML. [<ref target="https://aic.uva.es/cuentapalabras">online</ref>]</bibl>
               <bibl xml:id="havenga_learning_2015">Marietjie Havenga: Project-Based Learning in Higher Education. Exploring Programming Students’ Development towards Self-Directedness. In: South African Journal of Higher Education 29 (2015), H. 4, S. 135–157. 01.01.2015. PDF. [<ref target="https://hdl.handle.net/10520/EJC182452">online</ref>] </bibl>
               <bibl xml:id="hildebrandt_narrating_2024">Kristine Hildebrandt: Narrating a Path. Digital Humanities Tools in the Linguistics Classroom. In: Proceedings of the Linguistic Society of America 9 (2024), H. 3. 30.10.2024. PDF. DOI: <ref target="https://doi.org/10.3765/plsa.v9i3.5848">10.3765/plsa.v9i3.5848</ref></bibl>
               <bibl xml:id="horstmann_kleymann_fragen_2019">Jan Horstmann&#160;/ Rabea Kleymann: Alte Fragen, neue Methoden&#160;– Philologische und digitale Verfahren im Dialog. Ein Beitrag zum Forschungsdiskurs um Entsagung und Ironie bei Goethe. In: Zeitschrift für digitale Geisteswissenschaften 4 (2019). 12.12.2019. HTML. DOI: <ref target="https://doi.org/10.17175/2019_007">10.17175/2019_007</ref></bibl>
               <bibl xml:id="jockers_thalken_analysis_2020">Matthew L. Jockers&#160;/ Rosamond Thalken: Text Analysis with R. For Students of Literature. 2. Auflage. New York 2020. <ptr type="gbv" cRef="1698802285"/>
               </bibl>
               <bibl xml:id="lepp_kaimre_ai_2025">Marina Lepp&#160;/ Joosep Kaimre: Does Generative AI Help in Learning Programming: Students’ Perceptions, Reported Use and Relation to Performance. In: Computers in Human Behavior Reports 18 (2025). HTML. DOI: <ref target="https://doi.org/10.1016/j.chbr.2025.100642">10.1016/j.chbr.2025.100642</ref></bibl>
               <bibl xml:id="mccarthy_jarvis_mtld_2010">Philip M. McCarthy&#160;/ Scott Jarvis: MTLD, vocd-D, and HD-D. A Validation Study of Sophisticated Approaches to Lexical Diversity Assessment. In: Behavior Research Methods 42 (2010), H. 2, S. 381–392. DOI: 10.3758/BRM.42.2.381</bibl><!-- wird nicht zitiert-->
               <bibl xml:id="moretti_reading_2013">Franco Moretti: Distant Reading. London 2013. <ptr type="gbv" cRef="1605398268"/>
               </bibl>
               <bibl xml:id="novalia_et_al_learning_2025">Riska Novalia&#160;/ Arita Marini&#160;/ Totok Bintoro&#160;/ Uyu Muawanah: Project-Based Learning. For Higher Education Students’ Learning Independence. In: Social Sciences &amp; Humanities Open 11 (2025). HTML. DOI: <ref target="https://doi.org/10.1016/j.ssaho.2025.101530">10.1016/j.ssaho.2025.101530</ref></bibl>
               <bibl xml:id="shen_tamkin_ai_2026">Judy Hanwen Shen&#160;/ Alex Tamkin: How AI Impacts Skill Formation. arXiv. 28.01.2026. Version 2 vom 01.02.2026. DOI: <ref target="https://doi.org/10.48550/arXiv.2601.20245">10.48550/arXiv.2601.20245</ref></bibl>
               <bibl xml:id="silge_robinson_mining_2017">Julia Silge&#160;/ David Robinson: Text Mining with R. A Tidy Approach. Sebastopol, US-CA 2017. <ptr type="gbv" cRef="885349660"/>
               </bibl>
               <bibl xml:id="stilometrie_2026">Stilometrie und Literaturanalyse. Drei Schritt-für-Schritt-Tutorials In: forTEXT. Literatur digital erforschen. Letzter Zugriff: 29.06.2026. HTML. [<ref target="https://fortext.net/ressourcen/videos/tutorials/stilometrie-und-literaturanalyse">online</ref>]</bibl>
               <bibl xml:id="wills_et_al_learning_2024">Simon Wills&#160;/ Sanson T. S. Poon&#160;/ Arianna Salili-James&#160;/ Ben Scott: The Use of Generative AI for Coding in Academia. In: Methods in Ecology and Evolution 15 (2024), H. 12, S. 2189–2191. 12.11.2024. PDF. DOI: <ref target="https://doi.org/10.1111/2041-210X.14454">10.1111/2041-210X.14454</ref></bibl>
            </listBibl>
         </div>
      </back>
   </text>
</TEI>
