· 3 Min. Lesezeit · Gaia Lab

Ein Rat kleiner Modelle gegen ein 120B-Modell: automatisches Jailbreaking und wer darüber urteilt

Mehrere kleine offene Modelle beraten sich, um Prompts zu konstruieren, die gpt-oss-120b zum Nachgeben bringen. Die Linie misst, wie viel das Beraten gegenüber dem Angriff im Alleingang bringt, und widmet der unbequemen Frage, wer den Erfolg beurteilt, ebenso viel Aufwand wie dem Angriff selbst.

Zielscheibe aus konzentrischen Ringen mit rotem Zentrum, umgeben von sechs Kreisen, die durch gepunktete Linien mit dem Zentrum verbunden sind
Für die Serie generierte Illustration: der Rat der Modelle rund um das Ziel.

Zweite Folge von Cluster-Röntgenbild. Die vorige Folge justierte ein Modell, damit es Schädliches ablehnt. Diese Linie macht das Gegenteil: Sie greift automatisiert ein großes Modell an und zählt, wie oft es nachgibt.

Die Frage #

Automatische Jailbreak-Angriffe nutzen meist ein Angreifermodell, das einen Prompt Runde um Runde verfeinert. Die Linie fragt, ob eine Gruppe kleiner Modelle, die sich beraten, besser angreift als jedes von ihnen einzeln, und mit gleichem Gewicht, wie man den Erfolg misst, ohne sich selbst zu täuschen, denn derselbe Angriff kann je nach Beurteiler als erfolgreich gelten oder nicht.

Wie man vorgeht #

Auf dem öffentlichen Framework ARES wird ein Rat aufgebaut: Qwen3 14B, Gemma 3 12B und DeepSeek-R1 32B schlagen Prompts vor und kritisieren sie, ein Vorsitzender (Qwen2.5 32B) aggregiert die Vorschläge per Borda-Zählung, und ein Richter in der Schleife bewertet die Schädlichkeit der Antwort von 0 bis 5. Das Hauptziel ist gpt-oss 120B; außerdem werden gpt-oss 20B, Qwen3 8B und Llama 3.1 70B evaluiert. Jedes Ziel erhält bis zu zwanzig Runden.

Die Studie ist in Ablationen und Kontrollen organisiert:

  • Was jedes Teil beiträgt. Vollständiger Rat gegen Rat ohne Vorsitzenden, ohne Borda oder mit reinem Borda, auf fünfzig repräsentativen HarmBench-Verhaltensweisen und danach auf dem vollständigen Pool von 271 Verhaltensweisen ohne Copyright.
  • Beraten gegen allein angreifen. Jedes Mitglied und der Vorsitzende greifen im Alleingang mit derselben Angriffsfläche an, ohne Aggregation. Das ist die Kontrolle, die sagt, ob der Rat wert ist, was er kostet.
  • Baselines aus der Literatur: Crescendo, Kodierungen, direkte Anfrage, menschliche Jailbreaks, FITD und PAPILLON.

Und der Messteil. Der Richter, der den Angriff steuert, ist gpt-oss selbst, was eine Zirkularität birgt: Ziel und Richter sind dasselbe Modell. Um sie aufzubrechen, werden alle gespeicherten Antworten mit dem offiziellen HarmBench-Klassifikator (einem dafür trainierten Llama 2 mit 13B) als unabhängigem Testrichter neu bewertet, und danach mit einem dritten Richter aus einer anderen Familie (Mistral). Der Kommentar, der es zusammenfasst: „J_search = Richter 0-5 (steuert den Angriff), J_test = unabhängiger HarmBench-Klassifikator“. Eine Baseline, die wegen eines Infrastrukturfehlers fehlgeschlagen war, wurde vor dem Vergleich komplett wiederholt.

Was man lernt #

Die Skripte halten die Zahl fest, die die Studie organisiert: Der Rat erreicht eine Erfolgsrate um die 73 % über die 271 Verhaltensweisen mit vier Versuchen, und die Kontrollen im Alleingang existieren genau dafür, zu wissen, welcher Teil davon Beratung ist und welcher einfach das Beharren über zwanzig Runden. Die andere Lektion ist methodisch und steht als Antwort an einen Gutachter geschrieben: Die Wahl des Richters verschiebt die Erfolgsrate, also bedeutet eine Rate ohne Angabe, wer urteilt, gar nichts. Daher die drei Richter.

Auf dem Cluster #

53Jobs299 hreservierte GPU-Stunden3.409 hreservierte CPU-Stunden14 Aug – 30 AugZeitraum (2026)
Kennzahlen der Linie: zwei Augustwochen.

Ziel, Rat, Vorsitzender und Richter werden gleichzeitig mit Ollama auf derselben Karte bereitgestellt, rund 102 GB an Modellen, und deshalb lebt die Linie auf der H200 NVL mit 141 GB: Auf die H100 mit 94 GB passt das 120B zusammen mit dem Rat nicht. Die anschließenden Urteile mit dem 13B-Klassifikator passen auf jede freie GPU.

Jobs nach TypAngriff: Rat und EinzelmodelleAngriff: Rat und Einzelmodelle: 25 · 47 %25 · 47 %Bewertung mit HarmBench-KlassifikatorBewertung mit HarmBench-Klassifikator: 16 · 30 %16 · 30 %NeubewertungNeubewertung: 6 · 11 %6 · 11 %Erneuter AngriffErneuter Angriff: 4 · 8 %4 · 8 %SonstigeSonstige: 2 · 4 %2 · 4 %
Jobs nach Typ: Angriffe, Urteile mit dem unabhängigen Klassifikator, Neubewertungen und ein erneuter Angriff.

In der dritten Folge : die Linie, die die meisten GPU-Stunden reserviert – quantisierte Modelle messen.


Zahlen aus dem Slurm-Accounting (reservierte Kapazität, nicht gemessene Nutzung) und den archivierten sbatch-Dateien. Anonymisierter Beitrag: ohne identifizierbare Nutzer, Pfade, E-Mails oder Projektnamen. Die Zitate stammen aus den Kommentaren der Skripte.