<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>llm on Gaia Lab · Blog</title><link>https://blog.defectiv.es/de/tags/llm/</link><description>Recent content in llm on Gaia Lab · Blog</description><generator>Hugo</generator><language>de-DE</language><lastBuildDate>Wed, 23 Sep 2026 09:00:00 +0200</lastBuildDate><atom:link href="https://blog.defectiv.es/de/tags/llm/index.xml" rel="self" type="application/rss+xml"/><item><title>Modelle bereitstellen und den Cluster pflegen: die Infrastruktur hinter den anderen Linien</title><link>https://blog.defectiv.es/de/posts/servir-modelos-y-cuidar-el-cluster-inferencia-burn-in-y-sondas/</link><pubDate>Tue, 22 Sep 2026 14:15:00 +0200</pubDate><guid>https://blog.defectiv.es/de/posts/servir-modelos-y-cuidar-el-cluster-inferencia-burn-in-y-sondas/</guid><description>&lt;p&gt;Neunte und letzte Folge von &lt;strong&gt;Cluster-Röntgenbild&lt;/strong&gt;. Hier fassen wir zusammen, was in keine Forschungslinie passt, aber in den Skripten fast aller auftaucht.&lt;/p&gt;&#10;&lt;h2 id="modelle-bereitstellen-damit-andere-arbeiten-können"&gt;Modelle bereitstellen, damit andere arbeiten können &lt;a class="hanchor" href="#modelle-bereitstellen-damit-andere-arbeiten-k%c3%b6nnen" aria-label="Enlace a esta sección"&gt;#&lt;/a&gt;&lt;/h2&gt;&#10;&lt;p&gt;Mehrere Linien der Serie brauchen ein laufendes großes Modell: einen Richter, der Antworten bewertet, einen Generator synthetischer Daten, einen Programmierassistenten. Auf einem Cluster mit einer GPU pro Knoten ist die natürliche Art, es bereitzustellen, ein Slurm-Job, der &lt;strong&gt;vLLM&lt;/strong&gt; hochfährt, wartet, bis es antwortet, sich bei einem gemeinsamen Proxy registriert und dort bleibt, bis die Zeit abläuft. Am Ende meldet er sich ab: Das Modell erscheint und verschwindet mit dem Job aus dem Katalog.&lt;/p&gt;</description></item><item><title>Ein Risikoklassifikator für Minderjährige, der in ein Smartphone passt</title><link>https://blog.defectiv.es/de/posts/un-clasificador-de-riesgo-para-menores-que-cabe-en-un-movil/</link><pubDate>Tue, 22 Sep 2026 13:45:00 +0200</pubDate><guid>https://blog.defectiv.es/de/posts/un-clasificador-de-riesgo-para-menores-que-cabe-en-un-movil/</guid><description>&lt;p&gt;Siebte Folge von &lt;strong&gt;Cluster-Röntgenbild&lt;/strong&gt;. Eine Sicherheitslinie anderer Art: die der Minderjährigen, die ein Telefon benutzen.&lt;/p&gt;&#10;&lt;h2 id="die-frage"&gt;Die Frage &lt;a class="hanchor" href="#die-frage" aria-label="Enlace a esta sección"&gt;#&lt;/a&gt;&lt;/h2&gt;&#10;&lt;p&gt;Risikosituationen in den Gesprächen eines Minderjährigen zu erkennen (Mobbing, &lt;em&gt;Grooming&lt;/em&gt;, sexuelle Inhalte, Isolation, Drohungen), ist mit einem Sprachmodell möglich. Es auf einem Server zu tun, bedeutet, das Gespräch aus dem Telefon hinauszuschicken, und genau das will man mit dem Privatleben eines Minderjährigen nicht tun. Die Linie fragt, &lt;strong&gt;ob ein Modell, das klein genug ist, um auf dem Telefon selbst zu laufen, das Risiko mit der nötigen Zuverlässigkeit klassifizieren kann, und wie viel verloren geht, wenn man es so weit komprimiert, dass es hineinpasst.&lt;/strong&gt;&lt;/p&gt;</description></item><item><title>Quantisierte LLMs messen: Was beim Komprimieren eines offenen Modells verloren geht</title><link>https://blog.defectiv.es/de/posts/medir-llm-cuantizados-gguf-bfcl-bigcodebench-ruler/</link><pubDate>Tue, 22 Sep 2026 12:45:00 +0200</pubDate><guid>https://blog.defectiv.es/de/posts/medir-llm-cuantizados-gguf-bfcl-bigcodebench-ruler/</guid><description>&lt;p&gt;Dritte Folge von &lt;strong&gt;Cluster-Röntgenbild&lt;/strong&gt;. Sie ist das beste Beispiel für das, was der &lt;a href="https://blog.defectiv.es/de/posts/que-corre-de-verdad-en-nuestro-cluster/"&gt;Überblicksbeitrag&lt;/a&gt;&#10; sagte: Der Cluster ist heute vor allem ein &lt;strong&gt;Messlabor&lt;/strong&gt;. Hier wird kein einziger Parameter trainiert.&lt;/p&gt;&#10;&lt;h2 id="die-frage"&gt;Die Frage &lt;a class="hanchor" href="#die-frage" aria-label="Enlace a esta sección"&gt;#&lt;/a&gt;&lt;/h2&gt;&#10;&lt;p&gt;Offene Modelle werden quantisiert verteilt: dieselben Gewichte, komprimiert auf 8, 6, 5, 4, 3 oder 2 Bit, damit sie auf eine kleine Karte oder ein Notebook passen. Die Community veröffentlicht Hunderte Varianten, aber selten mit einer vergleichbaren Messung dessen, was verloren geht. Die Linie fragt, &lt;strong&gt;wie viel jede Quantisierungsstufe jeder Familie in Aufgaben wirklich leistet, die für den Einsatz des Modells als Werkzeug zählen&lt;/strong&gt;, und mit welcher Geschwindigkeit und welchen Energiekosten sie das auf jeder Karte tut.&lt;/p&gt;</description></item><item><title>Ein Rat kleiner Modelle gegen ein 120B-Modell: automatisches Jailbreaking und wer darüber urteilt</title><link>https://blog.defectiv.es/de/posts/un-consejo-de-modelos-pequenos-contra-uno-de-120b/</link><pubDate>Tue, 22 Sep 2026 12:30:00 +0200</pubDate><guid>https://blog.defectiv.es/de/posts/un-consejo-de-modelos-pequenos-contra-uno-de-120b/</guid><description>&lt;p&gt;Zweite Folge von &lt;strong&gt;Cluster-Röntgenbild&lt;/strong&gt;. Die &lt;a href="https://blog.defectiv.es/de/posts/auto-alineamiento-de-un-llm-de-3b-con-lora-y-harmbench/"&gt;vorige Folge&lt;/a&gt;&#10; justierte ein Modell, damit es Schädliches ablehnt. Diese Linie macht das Gegenteil: Sie greift automatisiert ein großes Modell an und zählt, wie oft es nachgibt.&lt;/p&gt;&#10;&lt;h2 id="die-frage"&gt;Die Frage &lt;a class="hanchor" href="#die-frage" aria-label="Enlace a esta sección"&gt;#&lt;/a&gt;&lt;/h2&gt;&#10;&lt;p&gt;Automatische &lt;em&gt;Jailbreak&lt;/em&gt;-Angriffe nutzen meist ein Angreifermodell, das einen &lt;em&gt;Prompt&lt;/em&gt; Runde um Runde verfeinert. Die Linie fragt, ob &lt;strong&gt;eine Gruppe kleiner Modelle, die sich beraten,&lt;/strong&gt; besser angreift als jedes von ihnen einzeln, und mit gleichem Gewicht, &lt;strong&gt;wie man den Erfolg misst, ohne sich selbst zu täuschen&lt;/strong&gt;, denn derselbe Angriff kann je nach Beurteiler als erfolgreich gelten oder nicht.&lt;/p&gt;</description></item><item><title>Self-Alignment: Wie viel Sicherheit man einem Sprachmodell beibringen kann, ohne dass es nutzlos wird</title><link>https://blog.defectiv.es/de/posts/auto-alineamiento-de-un-llm-de-3b-con-lora-y-harmbench/</link><pubDate>Tue, 22 Sep 2026 12:15:00 +0200</pubDate><guid>https://blog.defectiv.es/de/posts/auto-alineamiento-de-un-llm-de-3b-con-lora-y-harmbench/</guid><description>&lt;p&gt;Erste Folge von &lt;strong&gt;Cluster-Röntgenbild&lt;/strong&gt;, der Serie, die Linie für Linie aufschlüsselt, &lt;a href="https://blog.defectiv.es/de/posts/que-corre-de-verdad-en-nuestro-cluster/"&gt;was auf dem Cluster der ANTS-Gruppe wirklich läuft&lt;/a&gt;&#10;. Wir beginnen mit der ersten von drei Linien zur Sicherheit von Sprachmodellen.&lt;/p&gt;&#10;&lt;h2 id="die-frage"&gt;Die Frage &lt;a class="hanchor" href="#die-frage" aria-label="Enlace a esta sección"&gt;#&lt;/a&gt;&lt;/h2&gt;&#10;&lt;p&gt;Ein Sprachmodell so zu justieren, dass es schädliche Anfragen ablehnt, hat einen Preis: Bringt man ihm zu sehr bei, Nein zu sagen, beginnt es, auch Harmloses abzulehnen, und verliert an Nützlichkeit. Die Linie untersucht dieses Gleichgewicht: &lt;strong&gt;Welcher Anteil an Sicherheitsdaten muss den Nützlichkeitsdaten beigemischt werden, und kann das Modell selbst seine Ablehnungsbeispiele erzeugen und die Dosis eigenständig regeln?&lt;/strong&gt;&lt;/p&gt;</description></item><item><title>Was auf unserem Cluster wirklich läuft, gelesen aus den Skripten selbst</title><link>https://blog.defectiv.es/de/posts/que-corre-de-verdad-en-nuestro-cluster/</link><pubDate>Tue, 22 Sep 2026 10:00:00 +0200</pubDate><guid>https://blog.defectiv.es/de/posts/que-corre-de-verdad-en-nuestro-cluster/</guid><description>&lt;p&gt;Die Job-Historie eines Clusters ist meist eine Wand aus sechsstelligen Kennungen und kryptischen Namen – &lt;code&gt;mcpfw_cc&lt;/code&gt;, &lt;code&gt;eval_dynamic_pid&lt;/code&gt;, &lt;code&gt;boltz2&lt;/code&gt; –, die demjenigen alles sagen, der sie gestartet hat, und allen anderen nichts. Bewahrt man aber die &lt;em&gt;Skripte&lt;/em&gt; auf, wird aus der Wand ein Dokument: Die Leute schreiben auf, &lt;strong&gt;warum&lt;/strong&gt; sie etwas tun, vor allem dann, wenn ein Durchlauf Geld und eine Nacht Wartezeit kostet.&lt;/p&gt;</description></item></channel></rss>