· 4 min de lectura · Gaia Lab
GNN para la clorofila de una laguna: ¿aporta algo el grafo?
Predecir la clorofila de una laguna costera a partir de imágenes Sentinel-2 con redes neuronales de grafos espaciotemporales, y responder a la pregunta que hace un revisor: si el grafo aporta información o solo suaviza. Con un piloto de AutoML para detección de intrusiones al final del periodo.

Novena entrega de Radiografía del clúster. En la entrada de resumen esta línea aparecía como detección de intrusiones. Los scripts cuentan otra cosa: las redes de grafos son ambientales, y la detección de intrusiones llega en septiembre como piloto.
La pregunta #
La concentración de clorofila es el indicador más directo del estado de una laguna costera: anticipa episodios de eutrofización y floraciones. Se puede estimar desde satélite, pero la relación entre reflectancia y clorofila depende del lugar, del momento y de lo que pasa alrededor. La línea pregunta si una red neuronal de grafos que conecta puntos de la laguna en el espacio y en el tiempo predice mejor que los modelos tabulares, y, sobre todo, si el grafo aporta información real o solo actúa como un suavizado.
Cómo se aborda #
Los datos son reflectancias de Sentinel-2 (procesador C2X-Complex), en ventanas de 5×5 y 9×9 píxeles y a varias profundidades, entre 2016 y 2023. El grafo es espaciotemporal: los nodos son puntos de la laguna en cada fecha, y las aristas los unen con sus vecinos espaciales y con sus propias observaciones anteriores. Se comparan GCN, GAT y GraphSAGE y su ensemble, con Optuna para los hiperparámetros y veinte semillas.
Los experimentos de agosto son la respuesta a una revisión de artículo, y están descritos con precisión quirúrgica en los scripts:
- A. Baselines espaciotemporales sin grafo (XGBoost, procesos gaussianos) con partición aleatoria.
- A2 y A2i. La GNN con presupuesto igualado, en modo transductivo e inductivo estricto: «A2 − A2i cuantifica lo que el grafo gana por ver las características de los nodos apartados».
- B y C. Validación temporal honesta: entrenar con 2016-2021 y probar con 2022-2023, y dejar un año fuera de 2018 a 2023.
- D. Ablación de aristas: solo espaciales, solo temporales, aleatorias conservando el grado, aleatorias uniformes. «random_degree es el brazo decisivo: si iguala a “full”, el paso de mensajes actúa como suavizado genérico y la estructura concreta no aporta nada».
- E. Aprendizaje de la estructura del grafo con puertas, «para que el mecanismo se evalúe como contribución y no se demuestre una vez».
Qué se aprende #
El diseño ya es una lección: la pregunta de si el grafo aporta algo no se responde con una tabla de errores, sino con un control que conserva la estadística del grafo (el grado de cada nodo) y destruye su estructura. Si ese control rinde igual, la GNN es un suavizador caro. Y la validación temporal por bloques protege de la trampa habitual de las series ambientales: una partición aleatoria deja que el modelo vea el futuro.
Al lado, la misma persona exploró humedad del suelo con LSTM y CNN por parcela, y en septiembre abrió el piloto de AutoML para detección de intrusiones sobre el conjunto público CICIDS2017 con Ray: treinta y cuatro trabajos, la mayoría pruebas cortas, y una ejecución completa de diez horas.
En el clúster #
Las cuatro tareas del array de revisión, una por profundidad, duraron entre 30 y 38 horas cada una en una L40S: 135 de las 162 horas de GPU de la línea.
La décima y última entrega cierra la serie con la infraestructura que sostiene a las demás.
Cifras de la contabilidad de Slurm (capacidad reservada, no uso medido) y de los sbatch archivados. Entrada anonimizada: sin usuarios, rutas, correos ni nombres de proyecto identificables. Las citas son de los comentarios de los scripts.