Wir erforschen, wie sich historisch gewachsenes entomologisches Wissen maschinell erschließen, semantisch verknüpfen und unter Wahrung von Provenienz und Kontext nachnutzbar machen lässt.
Entomologische Literatur, Archivquellen und Sammlungsdokumentationen überliefern Informationen zu Arten, Fundorten und Merkmalen, aber auch zu Personen und wissenschaftlichen Netzwerken. Vieles davon liegt nur in unstrukturierten Texten, historischen Bezeichnungen oder Bildern vor.
Ausgehend von entomologischen Quellen entwickeln und prüfen wir Verfahren zur Erschließung und Verknüpfung historisch gewachsener Wissensbestände. Zentrale Forschungsfragen sind: Wie können taxonomische Angaben trotz historischer Schriften, OCR-Fehlern, Mehrsprachigkeit und wechselnder Nomenklatur zuverlässig extrahiert werden? Wie lassen sich Personen, Arten, Orte, Publikationen und Sammlungsobjekte eindeutig identifizieren und unter Wahrung von Provenienz und historischem Kontext miteinander verknüpfen? Und wie müssen digitale Wissensinfrastrukturen gestaltet sein, damit die gewonnenen Daten langfristig nachnutzbar sind?
Dazu verbinden wir Text Mining, Natural Language Processing, KI-gestützte Texterkennung und Bildanalyse mit Knowledge Graphs, persistenten Identifikatoren und Standards wie RDF und Darwin Core. Die Verfahren werden an entomologischen Quellen erprobt und mit taxonomischer Fachkenntnis bewertet. Menschliche Kontrolle bleibt bei unsicheren Ergebnissen ebenso zentral wie der verantwortungsvolle Umgang mit sensiblen und kolonial geprägten Wissensbeständen.
Als Arbeitsgruppe des Senckenberg Data and Modelling Center entwickeln wir übertragbare Verfahren für entomologische Sammlungen und Wissensinfrastrukturen.
Historische Quellen erweitern den zeitlichen und kontextuellen Horizont digitaler Sammlungen und eröffnen neue Zugänge zur Erforschung langfristiger Veränderungen der Insektenvielfalt.


