FAIRagro Talk: AI-based data extraction from literature for agroecosystem modelling

Aug.32026
15:00 – 16:30
Ort: online

Simulationsmodelle, Metaanalysen und maschinelles Lernen erfordern standardisierte Daten, doch in der Agrarforschung liegen viele wertvolle Informationen aus der veröffentlichten Literatur nur in unstrukturierten, nicht maschinenlesbaren Formaten vor. Die Umwandlung dieser Informationen in analysefähige Datensätze kann die Wiederverwendung von Daten fördern, ist jedoch arbeitsintensiv und stellt somit ein anhaltendes Hindernis für den Forschungsfortschritt dar.

In Use Case 2 wird ein neuartiger automatisierten Arbeitsablauf entwickelt, um Datenengpässe zu beheben, indem Daten aus begutachteten Fachzeitschriften systematisch extrahiert und harmonisiert werden. Basierend auf dem Modell „Chat Generative Pre-Trained Transformer (GPT)-4.1-mini“ (OpenAI) wurde das Modell anhand manuell kuratierter Datensätze, die Genotypen, Kontext-Metadaten und Bewirtschaftungspraktiken (z. B. Bewässerung, Düngung) abdecken, feinabgestimmt, um strukturierte und konsistente Metadaten aus wissenschaftlichen Publikationen zu extrahieren.

Diese Arbeit dient als beispielhafter Ansatz und als Ressource für den Zugriff auf, die Extraktion und die Nutzung wissenschaftlicher Informationen für Agrarökosystemmodelle und andere Analysewerkzeuge, die explizite, quantitative Daten erfordern.

Achtung:
Ab sofort finden die FAIRagro Talks in einem neuen Raum statt – bitte vormerken: