Das Projekt Lexicography meets AI ist Teil des Langzeitprojekts Sprachdynamik in Österreich (DynAT) und hat zum Ziel, die Potenziale von Large Language Models (LLMs) für die Erstellung von Wörterbuchartikeln im Rahmen des historischen Wörterbuchs der bairischen Mundarten in Österreich (WBÖ) zu evaluieren. Die Arbeiten finden in Kooperation der Forschungsabteilungen Sprachwissenschaft (Wolfgang Koppensteiner, Katharina Korecky-Kröll und Philipp Stöckle) und DHRI (Elisabeth Eder und Daniel Elsner) statt und nutzen die am ACDH und der ÖAW bereitgestellten Ressourcen.

Seit dem Release von ChatGPT im November 2022 spielen LLMs in der Lexikographie eine zunehmend große Rolle, wurden bislang jedoch vor allem für standardsprachliche Wörterbücher eingesetzt. Die Anwendung auf nicht-standardsprachliche Varietäten stellt besondere Herausforderungen dar, da Dialekte in den Trainingsdaten von LLMs unterrepräsentiert sind. Hinzu kommt der streng empirische Anspruch des WBÖ, Bedeutungsdefinitionen ausschließlich aus den projekteigenen Daten zu generieren.

Als Datengrundlage dienen Belegsammlungen zu ausgewählten Lemmata aus der WBÖ-Datenbank. Die Testphase konzentriert sich auf Lemmata, zu denen bereits manuell erstellte Artikel vorliegen, die als Referenz für die Evaluation des KI-generierten Outputs dienen. Methodisch umfasst die Arbeit die Erstellung eines Glossars zur Erschließung der WBÖ-Datenstruktur, das systematische Testen verschiedener Prompts, die Entwicklung einer Chain-of-Thought-Prompting-Strategie sowie die Evaluation des LLM-generierten Outputs. Der Fokus liegt auf der lexikographischen Kernarbeit: der semantischen Kategorisierung von Belegen und der Generierung von Wörterbuchartikeln nach vorgegebenem Schema.

Ziel ist es, einen Workflow zu entwickeln, der die Artikelerstellung künftig durch LLMs unterstützt. Zugleich soll evaluiert werden, welche neuen Perspektiven sich daraus für die Dialektlexikographie ergeben – sowohl methodisch als auch hinsichtlich der Anforderungen an Lexikograph*innen.

_________________________________________________________________________________________________________________________

Stöckle, Philipp, Daniel Elsner, Wolfgang Koppensteiner & Katharina Korecky-Kröll (2025): LLM-Assisted Dialect Lexicography: Challenges and Opportunities in Processing Historical Bavarian Dialects. In: Iztok Kosem et al. (eds.): Electronic Lexicography in the 21st Century (eLex 2025). Intelligent Lexicography. Proceedings of the eLex 2025 Conference. Bled, 18-20 November 2025. Bled: Lexical Computing, 457–479. |Link|

Projektleitung

Philipp Stöckle

Kontakt

Daniel Elsner & Wolfgang Koppensteiner

Finanzierung

ÖAW

Projektlaufzeit

01/2025–12/2028