· 3 Min. Lesezeit · Gaia Lab

Bäume einzeln aus LiDAR-Punktwolken: den Wald in Individuen zerlegen

Um die Biomasse eines Waldes zu schätzen, muss man wissen, wo jeder Baum beginnt und endet. Die Linie vergleicht drei Deep-Learning-Architekturen auf Punktwolken, mit zehn Seeds, und misst, was Farbe, Intensität und Punktdichte zur Segmentierung beitragen.

Drei Bäume, gezeichnet als Punktwolken in Teal mit einigen roten Punkten und grauen Stämmen
Für die Serie generierte Illustration: drei Bäume als Punktwolken.

Fünfte Folge von Cluster-Röntgenbild. Nach den Proteinen eine weitere Linie fern der Sprache: Wälder.

Die Frage #

Ein LiDAR-Scan einer Waldparzelle liefert Millionen unbeschrifteter Punkte. Um die oberirdische Biomasse und damit den gespeicherten Kohlenstoff zu schätzen, muss man wissen, welche Punkte zu welchem Baum gehören: den Wald in Individuen zerlegen. Das ist ein Problem der Instanzsegmentierung in 3D, schwierig dort, wo sich die Kronen berühren. Die Linie fragt, welche Architektur das am besten kann, wie sehr das Ergebnis vom Glück der Initialisierung abhängt und welche Information der Punktwolke wirklich zählt.

Wie man vorgeht #

Auf dem Framework Pointcept werden drei Referenzarchitekturen für Punktwolken verglichen: PTv3 (Point Transformer v3), OA-CNN und SpUNet (U-Net mit Sparse Convolution). Der Hauptdatensatz ist ein eigener, Parzellen mit beschrifteten Bäumen; ein Inferenzskript zielt auch auf den öffentlichen Benchmark FOR-instance.

Das Versuchsdesign ist das einer rigorosen Studie:

  • Zehn Seeds pro Architektur, damit der Vergleich nicht von einem glücklichen Durchlauf abhängt.
  • Ablation der Eingabeattribute: nur Koordinaten, plus Farbe, plus Rückkehrintensität, plus Anzahl der Rückkehrer. Sie sagt, welche Kanäle des Sensors es sich lohnt zu behalten.
  • Ablation der Dichte: Die Wolke wird auf Raster von 0,05, 0,10, 0,20 und 0,40 Metern neu abgetastet. Sie sagt, wie stark die Segmentierung mit billigeren Sensoren oder höheren Flügen nachlässt.
  • Ensemble in der Inferenz: gewichtete Fusion der Masken zweier Architekturen, ohne Neutraining, um zu sehen, ob ihre Fehler komplementär sind.

Was man lernt #

Die Skripte enthalten nicht die finalen Metriken, wohl aber die Form des Ergebnisses: eine Tabelle je Architektur, Seed und Bedingung, aggregiert zu Kurven mit ihrer Varianz. Die Entscheidungen, die man in den Diffs liest, sind beredt. PTv3, der Transformer, verlangt am meisten Speicher und schöpfte beim feinsten Raster die 141 GB einer H200 aus; er wurde in eigene Jobs isoliert und erneut versucht. Die Ablationen wurden mit einem einzigen Seed und bei fester Dichte durchgeführt, „fixiert auf einer Label-Qualitätsstufe“, um jede Variable zu isolieren. Und die Dichte-Baseline wurde aus dem Ensemble-Experiment wiederverwendet statt neu trainiert: dasselbe Protokoll, dieselben Seeds, gepaarter Vergleich.

Auf dem Cluster #

176Jobs320 hreservierte GPU-Stunden7.867 hreservierte CPU-Stunden19 Mai – 28 JulZeitraum (2026)
Kennzahlen der Linie, zwischen Mai und Juli. Zwei Personen teilen sich die Pipeline.

Der große Sweep (drei Architekturen mal zehn Seeds mal Bedingung) wurde auf zwei 41-Stunden-Jobs auf der H200 verteilt, jeder mit fünf Seeds und nach Fortschritt wiederaufnehmbar. Die Ablationen im Juli sind Jobs von einer bis zehn Stunden auf der generischen Partition, mit von Hand im Kommentar geschätzter und nach dem ersten Lauf angepasster Zeit.

Jobs nach TypMulti-Seed-TrainingMulti-Seed-Training: 116 · 66 %116 · 66 %Ablation der EingabeattributeAblation der Eingabeattribute: 19 · 11 %19 · 11 %Tests und DebuggingTests und Debugging: 13 · 7 %13 · 7 %InferenzInferenz: 13 · 7 %13 · 7 %Ensemble bei der InferenzEnsemble bei der Inferenz: 11 · 6 %11 · 6 %Basismodelle (Mai)Basismodelle (Mai): 3 · 2 %3 · 2 %Dichte-AblationDichte-Ablation: 1 · 1 %1 · 1 %
Jobs nach Typ: Das Multi-Seed-Training dominiert zahlenmäßig; die Ablationen sind wenige und gezielt.

In der sechsten Folge : medizinische Bildgebung und ein Array aus hundert Seeds.


Zahlen aus dem Slurm-Accounting (reservierte Kapazität, nicht gemessene Nutzung) und den archivierten sbatch-Dateien. Anonymisierter Beitrag: ohne identifizierbare Nutzer, Pfade, E-Mails oder Projektnamen. Die Zitate stammen aus den Kommentaren der Skripte.