Dr.in Yagmur Kati
Computer- und Medienservice, Digitale Infrastruktur und Betrieb
Workflows als verknüpftes Wissen
Moderne Forschung stützt sich zunehmend auf Workflows: eine definierte Abfolge aus Skripten, Softwarewerkzeugen und Ausführungseinstellungen, die auf Computer-Systemen ausgeführt wird, Daten verarbeitet und somit wissenschaftliche Ergebnisse hervorbringt. Sobald die Abarbeitung eines Workflows beendet ist, verschwindet jedoch meist ein großer Teil dieses Kontexts (Logdateien, Monitoringdaten, lokale Ordner etc.). Die Publikation bleibt sichtbar, die einzelnen Schritte lassen sich jedoch oft nur schwer rekonstruieren – ein praktisches Problem für die Reproduzierbarkeit.
Den Code zu teilen ist wichtig, reicht aber selten aus. Um eine Berechnung zu verstehen und zu wiederholen, müssen Forschende auch wissen, welche Daten verwendet wurden, welche Softwareumgebung aktiv war, wie der Workflow ausgeführt wurde, welche Ressourcen genutzt wurden und unter welchen technischen Bedingungen das Ergebnis entstanden ist. Die National Academies beschreiben computergestützte Reproduzierbarkeit als das Erzielen konsistenter Ergebnisse mit denselben Eingabedaten, Rechenschritten, Methoden, demselben Code und denselben Analysebedingungen1.
Die Arbeit im Rahmen des Sonderforschungsbereichs FONDA (SFB 1404) setzt genau hier an: Die FONDA-VIVO-Plattform wird als vernetztes Informationssystem für wissenschaftliche Workflows entwickelt. Die Plattform verbindet Forschende, Publikationen, Workflows, Code-Versionen, Trace-Archive, Ausführungsmetadaten und Nachhaltigkeits-metriken2. Dadurch werden Workflows nicht mehr nur als isolierte technische Ereignisse betrachtet. Sie werden zu strukturierten Forschungsobjekten, die durchsucht, verglichen und wiederverwendet werden können.
Automatische Erfassung von Metadaten
Bei der Ausführung eines Workflows auf dem FONDA-Cluster (Abb. 1) erfasst ein Python-basierter Collector Metadaten über den Durchlauf und überträgt diese an die FONDA-VIVO-Plattform. Der Ansatz soll künftig auch die Integration mit HPC@HU und weiteren Clustern unterstützen, die von FONDA-Forschenden genutzt werden.

Je nach Systemkonfiguration können energiebezogene Informationen wie ein Running Average Power Limit (RAPL) erfasst werden. Auf dem FONDA Kubernetes Cluster geschieht dies mit Kepler. Zur Abschätzung der CO2-Emissionen eines Workflow-Durchlaufs werden außerdem Echtzeitdaten zur CO2-Intensität des deutschen Strommixes einbezogen.
Zu den erfassten Daten gehören der Gesamtenergieverbrauch des Workflows, der Energieverbrauch pro Aufgabe oder Prozess, CPU- und GPU-Nutzung, Leistungsaufnahme pro Knoten, Speicherverbrauch, Laufzeit, Workflow-Etappe, Trace-Daten sowie Details zur Hardware- und Softwareumgebung. Anstatt in Monitoring-Tools, Clustersystemen und separaten Dateien verstreut zu bleiben, werden diese Daten als Teil eines verknüpften VIVO-Datensatzes organisiert und bereitgestellt.
So lässt sich ein Workflow auch nach Abschluss der Arbeiten besser nachvollziehen. Forschende können nicht nur sehen, dass ein Workflow ein Ergebnis geliefert hat, sondern auch, wie er ausgeführt wurde, welche Ressourcen er genutzt hat und an welchen Komponenten die größten Energiekosten und CO2-Emissionen entstanden sind.
Von Metadaten zu Vergleich und Optimierung
In VIVO kann eine Workflow-Seite direkt mit der zugehörigen Publikation, dem Workflow-Code, dem Trace-Archiv und den Ausführungsmetadaten verknüpft werden. Dadurch entsteht eine Verbindung zwischen dem wissenschaftlichen Ergebnis und dem rechnerischen Prozess dahinter.

Eine solche verknüpfte Ansicht ist besonders nützlich, wenn sich Workflows im Laufe der Zeit weiterentwickeln. Ein Workflow kann umgeschrieben, auf ein anderes System portiert, in verschiedene Schritte aufgeteilt oder für eine neue Ausführungsumgebung optimiert werden. Mit strukturierten Metadaten lassen sich verschiedene Versionen desselben Workflows leichter vergleichen. Forschende können erkennen, welche Implementierung schneller ist, welcher Schritt besonders viele Ressourcen benötigt und wo Energieverbrauch oder CO2-Emissionen reduziert werden können.
Aktueller Stand und nächste Schritte
Ein funktionsfähiger Prototyp ist bereits verfügbar; die FONDA-VIVO-Website enthält Einträge für Forschende, Publikationen und Beispiel-Workflows, während ein Prototyp-Collector Workflow-Metadaten automatisch extrahieren und an VIVO übertragen kann.
Ein Beispiel ist ein Workflow zur langfristigen Vegetationsdynamik im Mittelmeerraum, der auf der Verarbeitung von Satellitenbildern basiert. Für diesen Workflow können Metadaten sowohl für den gesamten Lauf als auch für einzelne Stufen wie Vorverarbeitung, Mosaikgenerierung, Pyramidenerstellung und Zeitreihenanalyse gespeichert werden. Dadurch lässt sich die Ausführung insgesamt betrachten, aber auch gezielt analysieren, welche Schritte besonders stark zu Laufzeit, Ressourcenverbrauch oder Emissionen beitragen.
Der nächste Schritt besteht darin, das Hochladen und Verwalten von Workflow-Daten für Forschende zu vereinfachen. Langfristig soll die Plattform einen praktischen Einstiegspunkt bieten, mit dem Workflow-Versionen, Code, Trace-Daten, Reproduzierbarkeitsinformationen und Nachhaltigkeitsmetriken gemeinsam dokumentiert werden.
Studien zum wissenschaftlichen Rechnen zeigen, dass Reproduzierbarkeit mehr erfordert als Quellcode: Auch Softwareumgebungen, Abhängigkeiten, Eingabedaten und Ausführungsbedingungen müssen erfasst werden3. Durch die Verknüpfung dieser Elemente mit Energie- und CO2-Informationen unterstützt die FONDA-VIVO-Plattform eine transparentere, vergleichbarere und ressourcenbewusstere Form der computergestützten Forschung an der HU Berlin.
- National Academies of Sciences, Engineering, and Medicine: Reproducibility and Replicability in Science. Washington, DC: The National Academies Press, 2019. https://doi.org/10.17226/25303 ↩︎
- FONDA VIVO Platform: Discover FONDA’s research on sustainable scientific data analysis. https://vivo-fonda.hu-berlin.de/vivo/ ↩︎
- Ivie, P., Thain, D.: Reproducibility in Scientific Computing. ACM Computing Surveys 51(3), Article 63, 2018. https://doi.org/10.1145/3186266 ↩︎
