· 3 Min. Lesezeit · Gaia Lab

Dentale Segmentierung und 100 Seeds: Wie sehr sich ein Modell durch reinen Zufall ändert

Strukturen in Dentalbildern mit Convolutional Networks und Transformern segmentieren, sechs Modellfamilien gegen eine klassische Baseline vergleichen und, bevor ein Gewinner erklärt wird, die beiden Finalisten hundertmal trainieren, um die Varianz zwischen Durchläufen zu messen.

Drei Zahnsilhouetten in grauem Strich mit einer farbigen Innenregion, zwei in Teal und eine in Rot, wie Segmentierungsmasken
Für die Serie generierte Illustration: Masken auf drei Zähnen.

Sechste Folge von Cluster-Röntgenbild. Nach den Wäldern die sparsamste Linie des Archivs: zwanzig GPU-Stunden in vier Monaten und eine methodische Frage, die viele Arbeiten veröffentlichen, ohne sie zu beantworten.

Die Frage #

Strukturen in Dentalbildern automatisch zu segmentieren, also Pixel für Pixel die interessierende Region vom Hintergrund zu trennen, ist die Grundlage jeder nachfolgenden Messung oder assistierten Diagnose. Die Literatur vergleicht Architekturen mit einem einzigen Durchlauf pro Modell, und die Unterschiede zwischen ihnen liegen oft in der Größenordnung eines Punktes. Die Linie stellt zwei Fragen: Welche Architektur segmentiert diese Art von Bild am besten, und wie viel des Unterschieds zwischen zwei Modellen ist real und wie viel ist die Lotterie der Initialisierung?

Wie man vorgeht #

Der Datensatz ist ein eigener: Bilder und binäre Masken für Training und Test. Die Methode entwickelt sich in vier Schritten, die man in den Skripten liest:

  1. Eine UNet mit vortrainiertem Encoder und Focal-Tversky-Verlust, einer Funktion, die für Probleme entworfen ist, bei denen die zu segmentierende Region klein ist und falsch Negative schwerer wiegen als falsch Positive. Explizite Datenaugmentierung: Spiegelungen, Rotationen, Helligkeit, Rauschen und Unschärfe.
  2. Ein manueller Sweep des Verlusts. Zwölf Trainings, bei denen die Tversky-Parameter verschoben werden, um die Strafe immer stärker auf die falsch Negativen zu legen, bis der Gleichgewichtspunkt gefunden ist.
  3. Ein Vergleich von sechs Familien: einfache UNet, UNet++ mit ResNet50, DeepLabV3+ mit ResNet34 und ResNet50, SegFormer (ein Transformer) und als klassische Baseline ein pixelweiser Random Forest. Jedes Modell mit eigener Hyperparametersuche über acht Konfigurationen.
  4. Die Varianzstudie. Die beiden Finalisten, UNet++ und DeepLabV3+, werden je hundertmal mit kontrollierten Seeds (1.000 plus Index), zweihundert Epochen und Early Stopping trainiert, und alles wird in eine einzige Tabelle geschrieben.

Was man lernt #

Schritt vier ist das, was diese Linie auszeichnet. Hundert Durchläufe pro Modell ergeben eine Verteilung, keine Zahl: Sie erlauben zu sagen, ob der Unterschied zwischen UNet++ und DeepLabV3+ die Streuung übersteigt, die allein der Wechsel des Seeds erzeugt. Jedes Training dauert etwa sechs Minuten auf einer H100, also kostete die vollständige Frage zehn GPU-Stunden. Ein geringer Preis für eine Antwort, die „Modell A ist besser“ in „Modell A ist mit dieser Wahrscheinlichkeit besser“ verwandelt.

Beim Tversky-Sweep, ohne Kommentare in den Skripten, liest man das Warum in den Diffs: Jede Version erhöht das Gewicht der falsch Negativen – ein Zeichen, dass der Fehler, der am meisten Sorgen macht, darin besteht, einen Teil der Struktur unsegmentiert zu lassen, nicht darin, zu viel zu markieren.

Auf dem Cluster #

221Jobs21 hreservierte GPU-Stunden259 hreservierte CPU-Stunden20 Mai – 14 SepZeitraum (2026)
Kennzahlen der Linie. Jeder Job dauert Minuten.
Jobs nach TypModellvergleichModellvergleich: 104 · 47 %104 · 47 %Array mit 100 SeedsArray mit 100 Seeds: 100 · 45 %100 · 45 %ResNet und Tversky-SweepResNet und Tversky-Sweep: 12 · 5 %12 · 5 %Anfängliches UNetAnfängliches UNet: 5 · 2 %5 · 2 %
Jobs nach Typ: Das Array aus hundert Seeds ist fast die Hälfte der Linie.

In der siebten Folge : ein Sprachmodell, das in ein 4-GB-Telefon passen muss.


Zahlen aus dem Slurm-Accounting (reservierte Kapazität, nicht gemessene Nutzung) und den archivierten sbatch-Dateien. Anonymisierter Beitrag: ohne identifizierbare Nutzer, Pfade, E-Mails oder Projektnamen. Die Zitate stammen aus den Kommentaren der Skripte.