Fiktionale Texte sind aufgrund hoher Lizenz- und Aufbereitungskosten in den gängigen deutschen Referenzkorpora stark unterrepräsentiert. Text+ schafft mit DeLiKo-XL@DNB einen möglichen Ausweg aus diesem Dilemma. Darin erschließt die Deutsche Nationalbibliothek (DNB) zusammen mit dem Leibniz-Institut für Deutsche Sprache (IDS) erstmals einen umfangreichen Bestand für die Forschung.
Mit 287 585 fiktionalen Publikationen umfasst das Korpus alle deutschen im EPUB-Format veröffentlichten belletristischen E-Books zwischen 2012 und 2024 sowie alle 362 digital verfügbaren Titel, die jemals für den Deutschen Buchpreis nominiert waren – insgesamt sind das 20,9 Milliarden Token (Wörter und Satzzeichen).
Mit der Korpus-Analyseplattform KorAP kann das Korpus auf vielfältige Weise genutzt werden. Möglich sind zum Beispiel die flexible, metadatenbasierte Erstellung virtueller Unterkorpora, mehrschichtige Annotationen, komplexe Suchanfragen in sechs Sprachen (u. a. CQP). Dabei unterstützt ein Anfrage Assistent das Formulieren von Suchanfragen und eine Query by Example-Funktion das Auffinden komplexer Konstruktionen anhand von Beispielen. Für die praktische Anwendung bieten R- und Python-Bibliotheken sowie Video-Tutorials der Universität Mannheim einen niederschwelligen Einstieg.
Möglich wurde diese Nutzbarmachung durch die Einführung der Urheberrechtsschranke §60d UrhG, die Text-und-Data-Mining zu wissenschaftlichen Zwecken erlaubt. Auf dieser rechtlichen Grundlage und unter der Voraussetzung, dass die Volltexte, deren Annotation und die KorAP-Instanz stets in der Infrastruktur der DNB verbleiben, können Forschende ohne Anmeldung das Korpus frei und online durchsuchen und analysieren. Die einzige Einschränkung ist ein Kontext von 50 Wörtern pro Suchtreffer.
Zum DeLiKo-Korpus:
KorAP-Quellcode:
Andere Beiträge
FAIRagro und das bayrische StMELF – eine Geschichte über Kulturwandel im FDM
Mit Unterstützung von FAIRagro führt das StMELF ein koordiniertes Forschungsdatenmanagement ein – von Sensibilisierung über verpflichtende Datenmanagementpläne bis hin zu klaren Leitlinien. Erste Ergebnisse zeigen: mehr Bewusstsein, bessere Zusammenarbeit und langfristig effizientere Prozesse.
FAIR4Chem Award: Gute Beispiele aus der Community für die Community (NFDI4Chem)
FAIR-Daten als gelebte Praxis in der Chemie
Mit dem FAIR4Chem Award zeichnet NFDI4Chem seit 2021 herausragende Datensätze aus und fördert so FAIR-Praktiken in der Chemie. Die ausgezeichneten Forschenden wirken als Botschafter:innen und treiben den Kulturwandel hin zu nachhaltigem Forschungsdatenmanagement voran.
Der Health Study Hub: Von Datensilos zur Wissensinfrastrucktur (NFDI4Health)
Der Health Study Hub von NFDI4Health bündelt Studien, Instrumente und Dokumente an einem zentralen Ort und macht Gesundheitsforschungsdaten systematisch auffindbar und nutzbar. Durch standardisierte und FAIR aufbereitete Daten wird die Vernetzung verbessert, Doppelarbeit reduziert und Forschung beschleunigt.
Recent Comments