· 3 Min. Lesezeit · Gaia Lab

Modelle bereitstellen und den Cluster pflegen: die Infrastruktur hinter den anderen Linien

Abschluss der Serie mit dem, was keine Forschungslinie ist, sie aber erst möglich macht: offene Modelle, die als Slurm-Jobs bereitgestellt werden, damit andere sie nutzen, die Validierung der Hardware, die Tests vor der Freigabe von Containern und die persönlichen Experimente, die an den Rändern hervorschauen.

Vier Racks in grauem Strich mit Reihen von Indikatoren in Teal und vereinzelt Rot, und darunter eine rote Pulslinie
Für die Serie generierte Illustration: die Racks und der Puls.

Neunte und letzte Folge von Cluster-Röntgenbild. Hier fassen wir zusammen, was in keine Forschungslinie passt, aber in den Skripten fast aller auftaucht.

Modelle bereitstellen, damit andere arbeiten können #

Mehrere Linien der Serie brauchen ein laufendes großes Modell: einen Richter, der Antworten bewertet, einen Generator synthetischer Daten, einen Programmierassistenten. Auf einem Cluster mit einer GPU pro Knoten ist die natürliche Art, es bereitzustellen, ein Slurm-Job, der vLLM hochfährt, wartet, bis es antwortet, sich bei einem gemeinsamen Proxy registriert und dort bleibt, bis die Zeit abläuft. Am Ende meldet er sich ab: Das Modell erscheint und verschwindet mit dem Job aus dem Katalog.

Was bereitgestellt wurde, sagt viel darüber, was erforscht wird: gpt-oss 120B und Qwen3.6 27B als allgemeine Modelle und Qwen3 Coder 30B für Code. Alle offen, fast alle in einer für die verfügbare Karte gewählten Größe: „das Modell belegt ~66 GiB von 94 GB; die konservativen Einstellungen ließen viel Spielraum, also geben wir Gas“.

Die Hardware validieren #

Nach einer Erweiterung im Juni durchliefen alle GPUs zweimal einen gleichzeitigen Stresstest: zehn Minuten Matrixmultiplikationen mit 32.768×32.768 bei 75 % belegtem Speicher, wobei Auslastung, Leistungsaufnahme und Temperatur jede Sekunde protokolliert wurden, mit einer Variante, die zusätzlich alle CPU-Kerne belastet. So erfährt man, dass ein neuer Knoten aushält, was die Jobs der anderen Linien ihm abverlangen werden.

Bevor Container freigegeben werden #

Die 52 Jobs eines einzigen Septembertags sind Sonden von Sekunden, Knoten für Knoten gerichtet: dass die Umgebung auf den vierzehn GPU-Knoten und dem CPU-Knoten antwortet, dass die Identitätsauflösung funktioniert, dass ein Netzwerkdiagnose-Image aus einem Job heraus startet. Sie fallen zusammen mit einem Docker-Pilot auf den ARM-Knoten und mit Versuchen, ein Hardware-Synthesewerkzeug zu starten. Es ist die methodische Überprüfung, die dem Angebot von Containern für die Nutzer vorausgeht.

An den Rändern #

Das Archiv verzeichnet auch, was die Leute mit dem Cluster außerhalb ihrer Linie machen: eine Analyse von 6.613 Audiotracks mit CLAP, Demucs und MERT, um Tempo, Tonart, Stimmung und Embeddings zu extrahieren; Photogrammetrie mit Meshroom und Bild-zu-3D mit Hunyuan3D für einen smarten Spiegel; eine vertrauliche virtuelle Maschine mit SEV-SNP, deren Lebensdauer die des Jobs ist; und Ende September die ersten Schritte einer Linie zur Einzelzell-Genomik mit Geneformer.

Auf dem Cluster #

310Jobs41 hreservierte GPU-Stunden1.053 hreservierte CPU-Stunden19 Mai – 21 SepZeitraum (2026)
Aggregierte Kennzahlen von Inferenzservern, Betrieb, Sonden und losen Experimenten.
Jobs nach TypPiloten (Docker auf ARM, Vivado)Piloten (Docker auf ARM, Vivado): 64 · 21 %64 · 21 %SonstigeSonstige: 57 · 18 %57 · 18 %Burn-in und KnotenprüfungBurn-in und Knotenprüfung: 47 · 15 %47 · 15 %AudioanalyseAudioanalyse: 38 · 12 %38 · 12 %Netz- und IdentitätssondenNetz- und Identitätssonden: 29 · 9 %29 · 9 %InferenzserverInferenzserver: 28 · 9 %28 · 9 %Einzelzell-GenomikEinzelzell-Genomik: 23 · 7 %23 · 7 %Vertrauliche VMVertrauliche VM: 17 · 5 %17 · 5 %Photogrammetrie und 3DPhotogrammetrie und 3D: 6 · 2 %6 · 2 %Modell-DownloadsModell-Downloads: 1 · 0 %1 · 0 %
Jobs nach Typ. Die Server sind wenige, aber lang; die Sonden sind viele und dauern Sekunden.

Abschluss der Serie #

Neun Beiträge später ist das Bild des Clusters das, was der Überblicksbeitrag vorwegnahm, mit den Nuancen, die nur die Skripte liefern: Die Linie, die die meisten GPU-Stunden reserviert, trainiert nicht, sondern misst; die Modelle, die andere Linien brauchen, werden als ganz normale Jobs bereitgestellt; und die Forschungsfragen reichen von der Sicherheit eines Sprachmodells bis zum Chlorophyll einer Lagune, über Proteine, Wälder und Zähne.

Bewahrt die Skripte auf.


Zahlen aus dem Slurm-Accounting (reservierte Kapazität, nicht gemessene Nutzung) und den archivierten sbatch-Dateien. Anonymisierter Beitrag: ohne identifizierbare Nutzer, Pfade, E-Mails oder Projektnamen. Die Zitate stammen aus den Kommentaren der Skripte.