· 3 Min. Lesezeit · Gaia Lab
GNNs für das Chlorophyll einer Lagune: Bringt der Graph etwas?
Das Chlorophyll einer Küstenlagune aus Sentinel-2-Bildern mit raumzeitlichen Graph-Neural-Networks vorhersagen und die Frage beantworten, die ein Gutachter stellt: ob der Graph Information beiträgt oder nur glättet. Mit einem AutoML-Pilot für Intrusion Detection am Ende des Zeitraums.

Achte Folge von Cluster-Röntgenbild. Im Überblicksbeitrag erschien diese Linie als Intrusion Detection. Die Skripte erzählen etwas anderes: Die Graph-Netze sind umweltbezogen, und die Intrusion Detection kommt im September als Pilot dazu.
Die Frage #
Die Chlorophyllkonzentration ist der direkteste Indikator für den Zustand einer Küstenlagune: Sie kündigt Eutrophierungsepisoden und Algenblüten an. Man kann sie vom Satelliten aus schätzen, aber die Beziehung zwischen Reflektanz und Chlorophyll hängt vom Ort, vom Zeitpunkt und vom Geschehen in der Umgebung ab. Die Linie fragt, ob ein Graph-Neural-Network, das Punkte der Lagune in Raum und Zeit verbindet, besser vorhersagt als tabellarische Modelle, und vor allem, ob der Graph echte Information beiträgt oder nur als Glättung wirkt.
Wie man vorgeht #
Die Daten sind Reflektanzen von Sentinel-2 (Prozessor C2X-Complex), in Fenstern von 5×5 und 9×9 Pixeln und in mehreren Tiefen, zwischen 2016 und 2023. Der Graph ist raumzeitlich: Die Knoten sind Punkte der Lagune zu jedem Datum, und die Kanten verbinden sie mit ihren räumlichen Nachbarn und mit ihren eigenen früheren Beobachtungen. Verglichen werden GCN, GAT und GraphSAGE und ihr Ensemble, mit Optuna für die Hyperparameter und zwanzig Seeds.
Die Experimente im August sind die Antwort auf ein Artikel-Review und in den Skripten mit chirurgischer Präzision beschrieben:
- A. Raumzeitliche Baselines ohne Graph (XGBoost, Gauß-Prozesse) mit zufälliger Aufteilung.
- A2 und A2i. Die GNN mit gleichem Budget, im transduktiven und im strikt induktiven Modus: „A2 − A2i quantifiziert, was der Graph dadurch gewinnt, die Merkmale der zurückgehaltenen Knoten zu sehen“.
- B und C. Ehrliche zeitliche Validierung: mit 2016–2021 trainieren und mit 2022–2023 testen, und jeweils ein Jahr von 2018 bis 2023 auslassen.
- D. Kanten-Ablation: nur räumlich, nur zeitlich, zufällig unter Erhalt des Grades, zufällig gleichverteilt. „random_degree ist der entscheidende Arm: Wenn er ‚full‘ gleichkommt, wirkt das Message Passing als generische Glättung, und die konkrete Struktur trägt nichts bei“.
- E. Lernen der Graphstruktur mit Gates, „damit der Mechanismus als Beitrag evaluiert und nicht einmalig demonstriert wird“.
Was man lernt #
Das Design ist bereits eine Lektion: Die Frage, ob der Graph etwas beiträgt, beantwortet man nicht mit einer Fehlertabelle, sondern mit einer Kontrolle, die die Statistik des Graphen (den Grad jedes Knotens) erhält und seine Struktur zerstört. Leistet diese Kontrolle dasselbe, ist die GNN ein teurer Glätter. Und die blockweise zeitliche Validierung schützt vor der üblichen Falle von Umwelt-Zeitreihen: Eine zufällige Aufteilung lässt das Modell die Zukunft sehen.
Nebenbei erforschte dieselbe Person Bodenfeuchte mit LSTM und CNN je Parzelle und eröffnete im September den Pilot zu AutoML für Intrusion Detection auf dem öffentlichen Datensatz CICIDS2017 mit Ray: vierunddreißig Jobs, die meisten kurze Tests, und ein vollständiger Lauf von zehn Stunden.
Auf dem Cluster #
Die vier Tasks des Review-Arrays, einer pro Tiefe, dauerten jeweils zwischen 30 und 38 Stunden auf einer L40S: 135 der 162 GPU-Stunden der Linie.
Die neunte und letzte Folge schließt die Serie mit der Infrastruktur, die die anderen trägt.
Zahlen aus dem Slurm-Accounting (reservierte Kapazität, nicht gemessene Nutzung) und den archivierten sbatch-Dateien. Anonymisierter Beitrag: ohne identifizierbare Nutzer, Pfade, E-Mails oder Projektnamen. Die Zitate stammen aus den Kommentaren der Skripte.