· 4 min de lectura · Gaia Lab

Un consejo de modelos pequeños contra uno de 120B: jailbreak automático y quién lo juzga

Varios modelos abiertos pequeños deliberan para construir prompts que hagan ceder a gpt-oss-120b. La línea mide cuánto aporta deliberar frente a atacar en solitario, y dedica tanto esfuerzo a la pregunta incómoda de quién juzga el éxito como al ataque mismo.

Diana de anillos concéntricos con un centro rojo, rodeada de seis círculos conectados al centro por líneas de puntos
Ilustración generada para la serie: el consejo de modelos alrededor del objetivo.

Tercera entrega de Radiografía del clúster. La entrega anterior afinaba un modelo para que rechazara lo dañino. Esta línea hace lo contrario: ataca automáticamente un modelo grande y cuenta cuántas veces cede.

La pregunta #

Los ataques de jailbreak automáticos suelen usar un modelo atacante que refina un prompt turno a turno. La línea pregunta si un grupo de modelos pequeños que deliberan ataca mejor que cualquiera de ellos por separado, y, con el mismo peso, cómo medir el éxito sin engañarse, porque el mismo ataque puede parecer exitoso o no según quién lo juzgue.

Cómo se aborda #

Sobre el framework público ARES se construye un consejo: Qwen3 14B, Gemma 3 12B y DeepSeek-R1 32B proponen y critican prompts, un presidente (Qwen2.5 32B) agrega las propuestas por recuento Borda, y un juez dentro del bucle puntúa el daño de la respuesta de 0 a 5. El objetivo principal es gpt-oss 120B; también se evalúan gpt-oss 20B, Qwen3 8B y Llama 3.1 70B. Cada objetivo recibe hasta veinte turnos.

El estudio se organiza en ablaciones y controles:

  • Qué aporta cada pieza. Consejo completo frente a consejo sin presidente, sin Borda o con Borda puro, sobre cincuenta comportamientos representativos de HarmBench, y después sobre el pool completo de 271 comportamientos sin copyright.
  • Deliberar frente a atacar solo. Cada miembro y el presidente atacan en solitario con la misma superficie, sin agregación. Es el control que dice si el consejo vale lo que cuesta.
  • Líneas base de la literatura: Crescendo, codificaciones, petición directa, jailbreaks humanos, FITD y PAPILLON.

Y la parte de medida. El juez que guía el ataque es el propio gpt-oss, lo que encierra una circularidad: objetivo y juez son el mismo modelo. Para romperla, todas las respuestas guardadas se re-puntúan con el clasificador oficial de HarmBench (un Llama 2 de 13B entrenado para ello) como juez de prueba independiente, y después con un tercer juez de otra familia (Mistral). El comentario que lo resume: «J_search = juez 0-5 (guía el ataque), J_test = clasificador HarmBench independiente». Una línea base que había fallado por un error de infraestructura se repitió entera antes de comparar.

Qué se aprende #

Los scripts recogen la cifra que organiza el estudio: el consejo alcanza una tasa de éxito en torno al 73 % sobre los 271 comportamientos con cuatro intentos, y los controles en solitario existen precisamente para saber qué parte de eso es deliberación y qué parte es simplemente insistir veinte turnos. La otra lección es metodológica y aparece escrita como respuesta a un revisor: la elección del juez mueve la tasa de éxito, así que una tasa sin decir quién juzga no significa nada. De ahí los tres jueces.

En el clúster #

53trabajos299 hhoras de GPU reservadas3.409 hhoras de CPU reservadas14 ago – 30 agoperiodo (2026)
Cifras de la línea: dos semanas de agosto.

Objetivo, consejo, presidente y juez se sirven a la vez con Ollama en la misma tarjeta, unos 102 GB de modelos, y por eso la línea vive en la H200 NVL de 141 GB: la H100 de 94 GB no cabe con el 120B y el consejo. Los juicios posteriores, con el clasificador de 13B, entran en cualquier GPU libre.

Trabajos por tipoAtaque: consejo y modelos en solitarioAtaque: consejo y modelos en solitario: 25 · 47 %25 · 47 %Juicio con clasificador HarmBenchJuicio con clasificador HarmBench: 16 · 30 %16 · 30 %Re-juicioRe-juicio: 6 · 11 %6 · 11 %Re-ataqueRe-ataque: 4 · 8 %4 · 8 %OtrosOtros: 2 · 4 %2 · 4 %
Trabajos por tipo: ataques, juicios con el clasificador independiente, re-juicios y un re-ataque.

En la cuarta entrega , la línea que más horas de GPU reserva: medir modelos cuantizados.


Cifras de la contabilidad de Slurm (capacidad reservada, no uso medido) y de los sbatch archivados. Entrada anonimizada: sin usuarios, rutas, correos ni nombres de proyecto identificables. Las citas son de los comentarios de los scripts.