· 4 min de lectura · Gaia Lab

Servir modelos y cuidar el clúster: la infraestructura que sostiene a las demás líneas

Cierre de la serie con lo que no es una línea de investigación pero las hace posibles: modelos abiertos servidos como trabajos de Slurm para que otros los usen, la validación del hardware, las pruebas previas a habilitar contenedores y los experimentos personales que asoman por los bordes. Casi una cuarta parte de las horas de GPU.

Cuatro bastidores dibujados en trazo gris con filas de indicadores teal y alguno rojo, y una línea de pulso roja debajo
Ilustración generada para la serie: los bastidores y el pulso.

Décima y última entrega de Radiografía del clúster. Aquí agrupamos lo que no encaja en una línea de investigación pero aparece en los scripts de casi todo el mundo, y que sumado es la segunda partida de horas de GPU del clúster.

Servir modelos para que otros trabajen #

Varias líneas de la serie necesitan un modelo grande en marcha: un juez que puntúe respuestas, un generador de datos sintéticos, un asistente de programación. En un clúster con una GPU por nodo, la forma natural de servirlo es un trabajo de Slurm que levanta vLLM, espera a que responda, se registra en un proxy compartido y se queda ahí hasta que se acaba el tiempo. Al terminar, se da de baja: el modelo aparece y desaparece del catálogo con el trabajo.

Lo que se sirvió dice mucho de lo que se investiga: gpt-oss 120B y Qwen3.6 27B como modelos generales, Qwen3 Coder 30B para código, un Gemma 4 configurado como juez para evaluar salidas de otros modelos, y una pila completa de voz a texto (Whisper), OCR, embeddings, reranking y síntesis de voz en una sola L40S, montada para medir servicios bajo demanda. Casi todos abiertos, casi todos con su tamaño elegido para la tarjeta disponible: «el modelo ocupa ~66 GiB de los 94 GB; los ajustes conservadores dejaban mucho margen, así que abrimos el acelerador».

Validar el hardware #

Tras una ampliación en junio, todas las GPU pasaron dos veces una prueba de estrés simultánea: diez minutos de multiplicaciones de matrices de 32.768×32.768 con el 75 % de la memoria ocupada, registrando uso, potencia y temperatura cada segundo, con una variante que carga también todos los núcleos de CPU. Es la forma de saber que un nodo nuevo aguanta lo que los trabajos de las demás líneas le van a pedir.

Antes de habilitar contenedores #

Los 52 trabajos de un mismo día de septiembre son sondas de segundos, dirigidas nodo a nodo: que el entorno responde en los catorce nodos GPU y el de CPU, que la resolución de identidad funciona, que una imagen de diagnóstico de red arranca desde un trabajo. Coinciden con un piloto de Docker en los nodos ARM y con intentos de lanzar una herramienta de síntesis de hardware. Es la verificación metódica que precede a ofrecer contenedores a los usuarios.

Por los bordes #

El archivo recoge también lo que la gente hace con el clúster fuera de su línea: un análisis de 6.613 pistas de audio con CLAP, Demucs y MERT para extraer tempo, tonalidad, ánimo y embeddings; fotogrametría con Meshroom e imagen a 3D con Hunyuan3D para un espejo inteligente; una máquina virtual confidencial SEV-SNP cuyo tiempo de vida es el del trabajo; y, al final de septiembre, los primeros pasos de una línea de genómica de célula única con Geneformer.

En el clúster #

580trabajos978 hhoras de GPU reservadas16.101 hhoras de CPU reservadas19 may – 21 sepperiodo (2026)
Cifras agregadas de servidores de inferencia, operación, sondas y experimentos sueltos.
Trabajos por tipoServidores de inferenciaServidores de inferencia: 213 · 37 %213 · 37 %OtrosOtros: 139 · 24 %139 · 24 %Pilotos (Docker ARM, Vivado)Pilotos (Docker ARM, Vivado): 64 · 11 %64 · 11 %Burn-in y chequeo de nodosBurn-in y chequeo de nodos: 51 · 9 %51 · 9 %Análisis de audioAnálisis de audio: 38 · 7 %38 · 7 %Sondas de red e identidadSondas de red e identidad: 29 · 5 %29 · 5 %Genómica de célula únicaGenómica de célula única: 23 · 4 %23 · 4 %VM confidencialVM confidencial: 17 · 3 %17 · 3 %Fotogrametría y 3DFotogrametría y 3D: 6 · 1 %6 · 1 %
Trabajos por tipo. Los servidores son pocos pero largos; las sondas son muchas y duran segundos.

Cierre de la serie #

Diez entradas después, la imagen del clúster es la que adelantaba la entrada de resumen , con los matices que solo dan los scripts: la línea que más horas de GPU reserva no entrena, sino que mide; la que más trabajos envía busca fallos en un módem sin usar GPU; una cuarta parte de la GPU se dedica a servir modelos para que otros trabajen; y las preguntas de investigación van desde la seguridad de un modelo de lenguaje hasta la clorofila de una laguna, pasando por proteínas, bosques y dientes.

Guardad los scripts.


Cifras de la contabilidad de Slurm (capacidad reservada, no uso medido) y de los sbatch archivados. Entrada anonimizada: sin usuarios, rutas, correos ni nombres de proyecto identificables. Las citas son de los comentarios de los scripts.