· 4 min de lectura · Gaia Lab

4.400 complejos de proteínas con Boltz-2: predecir cómo se unen dos proteínas

Un modelo abierto de difusión, de la familia de AlphaFold 3, aplicado a miles de pares de proteínas para predecir la estructura del complejo y la confianza de la unión. Quince trabajos, dos campañas y una lección sobre cuánto cuesta cada par cuando los complejos crecen.

Dos cadenas de círculos, una teal y otra roja, entrelazadas como dos hélices
Ilustración generada para la serie: dos cadenas que se pliegan juntas.

Quinta entrega de Radiografía del clúster y la línea con menos trabajos: quince. También una de las que más GPU reserva, porque cada trabajo dura días.

La pregunta #

Saber si dos proteínas interaccionan, y cómo, es una de las preguntas centrales de la biología estructural: explica rutas de señalización, dianas de fármacos y el efecto de mutaciones. Determinarlo experimentalmente cuesta meses por par. La línea usa predicción estructural para estimar, a escala de miles de pares, la estructura del complejo que forman dos proteínas y la confianza de que la unión sea real.

Cómo se aborda #

El modelo es Boltz-2, un modelo abierto de difusión para estructura biomolecular, sucesor de Boltz-1 y comparable a AlphaFold 3. El flujo es el mismo en las dos campañas:

  1. Resolver las secuencias de cada par (desde una caché local, un FASTA compartido o UniProt en vivo) y escribir una descripción por par físico único.
  2. Predecir cada complejo con Boltz-2, usando el servidor de alineamientos múltiples remoto del proyecto y generando tres muestras de difusión por par para estimar la variabilidad.
  3. Construir la tabla de resultados por fila del diseño experimental, con las puntuaciones de confianza del modelo para cada par.

La primera campaña cubrió 2.534 pares; la segunda, 1.907, de los que unos 1.650 eran nuevos. Unas 4.400 predicciones en total. El diseño experimental se genera aparte y no cambia dentro de los trabajos: los pares ya predichos se saltan, así que una campaña se puede reanudar tantas veces como haga falta sin perder nada.

Qué se aprende #

Además de la tabla de complejos y confianzas, la línea dejó una medida útil para cualquiera que planifique una campaña así: cuánto cuesta un par. La primera estimación, escrita antes de medir, suponía dos minutos por par en una tarjeta de 48 GB. La tasa observada sobre los 2.533 primeros pares fue de 4 a 5 minutos (mediana 240 s, media 304 s). Y en la cola de la segunda campaña, al entrar en los complejos más grandes, la media subió a 21 minutos por par. Un factor diez entre la hipótesis inicial y la realidad de los complejos grandes, que el diseño reanudable absorbió sin perder trabajo.

Con una sola secuencia de predicciones por tarjeta y los alineamientos calculados fuera, la GPU pasa buena parte del tiempo esperando. Calcular los alineamientos localmente o predecir varios pares en paralelo por tarjeta son las dos palancas evidentes si la línea crece.

En el clúster #

15trabajos442 hhoras de GPU reservadas442 hhoras de CPU reservadas13 jul – 16 sepperiodo (2026)
Quince trabajos entre julio y septiembre. Once por ciento de las horas de GPU del clúster.
Horas que corrió cada lanzamiento (color = estado final)#01 · L40S · pedido 120 h · fallido#01 · L40S · pedido 120 h · fallido: 0 h0 h#02 · L40S · pedido 120 h · completado#02 · L40S · pedido 120 h · completado: 63.1 h63.1 h#03 · L40S · pedido 120 h · tiempo agotado#03 · L40S · pedido 120 h · tiempo agotado: 120 h120 h#04 · L40S · pedido 120 h · completado#04 · L40S · pedido 120 h · completado: 60.8 h60.8 h#05 · H100 NVL · pedido 120 h · completado#05 · H100 NVL · pedido 120 h · completado: 6.9 h6.9 h#06 · H100 NVL · pedido 168 h · cancelado#06 · H100 NVL · pedido 168 h · cancelado: 0.1 h0.1 h#07 · H100 NVL · pedido 168 h · tiempo agotado#07 · H100 NVL · pedido 168 h · tiempo agotado: 168 h168 h#08 · H100 NVL · pedido 72 h · completado#08 · H100 NVL · pedido 72 h · completado: 19.7 h19.7 h#09 · H100 NVL · pedido 24 h · completado#09 · H100 NVL · pedido 24 h · completado: 2.8 h2.8 h
Horas que corrió cada lanzamiento, con la tarjeta y el tiempo pedido. Los dos que agotaron el tiempo se relanzaron y continuaron donde estaban.

En la sexta entrega , nubes de puntos LiDAR y árboles individuales.


Cifras de la contabilidad de Slurm (capacidad reservada, no uso medido) y de los sbatch archivados. Entrada anonimizada: sin usuarios, rutas, correos ni nombres de proyecto identificables. Las citas son de los comentarios de los scripts.