Ling. Kolloquium: PhD candidate Dimitar Poposki (Faculty of Philology "Blaze Koneski"):
This lecture outlines the complete lifecycle of creating digital linguistic resources for low-resource South Slavic languages, mapping the journey from physical archives to advanced semantic networks. The presentation will walk through the "full circle" of corpus building: beginning with primary, from-scratch digitization and the crucial foundational step of securing institutional Creative Commons agreements between the Drama Theater in Skopje and the Faculty of Philology "Blaze Koneski".
Following primary preservation via Archive.org, the workflow focuses on transforming raw documents into a robust, 4.75-million-word linguistic corpus (Teatarski Glasnik https://zenodo.org/records/22917991). A key focus will be digital data sovereignty—specifically, enforcing open-access licenses while protecting the dataset from unauthorized commercial AI scraping using novel forensic watermarking techniques.
Crucially, the lecture will demonstrate how his previous and ongoing digitization projects are actively gathering the missing corpus data for the Macedonian language. To illustrate this scale, he will present newly developed corpora of 81 million tokens, built by scraping baseline literary journals i.e. Macedonian language periodicals like Stremez, Sovremenost, Razgledi (partially digitized so far), contemporary postmodern magazines like Margina, and the Macedonian Anarchist Library among others. However, the presentation will argue that while large-scale scraping proves data availability, the future of Macedonian digital humanities requires a shift from raw extraction to legal and structural curation. The focus must now be on building corpora grounded in explicit Creative Commons agreements and ethical data sovereignty. Ultimately, this workflow serves as the rationale for future doctoral research: taking these massive, legally cleared Macedonian datasets and executing rigorous TEI P5 XML integration to seamlessly embed them into Austrian digital infrastructures like ARCHE and CLARIAH-AT.
______________________________________________________________________
Dieser Vortrag gibt einen Überblick über den gesamten Lebenszyklus der Erstellung digitaler linguistischer Ressourcen für südslawische Sprachen mit geringen Ressourcen und zeichnet den Weg von physischen Archiven bis hin zu fortschrittlichen semantischen Netzwerken nach. Die Präsentation führt durch den „vollständigen Kreislauf“ der Korpusbildung: beginnend mit der primären Digitalisierung von Grund auf und dem entscheidenden ersten Schritt, nämlich dem Abschluss institutioneller Creative-Commons-Vereinbarungen zwischen dem Drama-Theater in Skopje und der Philologischen Fakultät „Blaze Koneski“.
Nach der primären Sicherung über Archive.org konzentriert sich der Arbeitsablauf auf die Umwandlung der Rohdokumente in ein robustes, 4,75 Millionen Wörter umfassendes linguistisches Korpus (Teatarski Glasnik https://zenodo.org/records/22917991). Ein Schwerpunkt liegt auf der digitalen Datenhoheit – insbesondere auf der Durchsetzung von Open-Access-Lizenzen bei gleichzeitigem Schutz des Datensatzes vor unbefugtem kommerziellem AI-Scraping mithilfe neuartiger forensischer Wasserzeichen-Techniken.
Entscheidend ist, dass der Vortrag aufzeigen wird, wie seine früheren und laufenden Digitalisierungsprojekte aktiv die fehlenden Korpusdaten für die mazedonische Sprache sammeln. Um diese Größenordnung zu veranschaulichen, wird er neu entwickelte Korpora mit 81 Millionen Tokens vorstellen, die durch das Scraping grundlegender Literaturzeitschriften, d. h. mazedonischer Periodika wie „Stremez“, „Sovremenost“, „Razgledi“ (bisher teilweise digitalisiert), zeitgenössische postmoderne Zeitschriften wie „Margina“ sowie die Mazedonische Anarchistische Bibliothek und andere. In dem Vortrag wird jedoch argumentiert, dass das groß angelegte Scraping zwar die Verfügbarkeit von Daten belegt, die Zukunft der mazedonischen Digital Humanities jedoch einen Wandel von der rohen Datenextraktion hin zu einer rechtlichen und strukturellen Kuratierung erfordert. Der Fokus muss nun auf dem Aufbau von Korpora liegen, die auf expliziten Creative-Commons-Vereinbarungen und ethischer Datensouveränität basieren. Letztendlich dient dieser Arbeitsablauf als Grundlage für zukünftige Promotionsforschungen: Die Nutzung dieser umfangreichen, rechtlich geklärten mazedonischen Datensätze und die Durchführung einer rigorosen TEI-P5-XML-Integration, um sie nahtlos in österreichische digitale Infrastrukturen wie ARCHE und CLARIAH-AT einzubetten.