· 3 min de lectura · Gaia Lab

Árboles uno a uno desde nubes de puntos LiDAR: separar el bosque en individuos

Para estimar la biomasa de un bosque hay que saber dónde empieza y acaba cada árbol. La línea compara tres arquitecturas de aprendizaje profundo sobre nubes de puntos, con diez semillas, y mide qué aportan el color, la intensidad y la densidad de puntos a la segmentación.

Tres árboles dibujados como nubes de puntos teal con algunos puntos rojos y troncos grises
Ilustración generada para la serie: tres árboles como nubes de puntos.

Sexta entrega de Radiografía del clúster. Después de las proteínas , otra línea ajena al lenguaje: bosques.

La pregunta #

Un escaneo LiDAR de una parcela forestal devuelve millones de puntos sin etiqueta. Para estimar la biomasa aérea, y con ella el carbono almacenado, hace falta saber qué puntos pertenecen a qué árbol: separar el bosque en individuos. Es un problema de segmentación de instancias en 3D, difícil donde las copas se tocan. La línea pregunta qué arquitectura lo hace mejor, cuánto depende el resultado de la suerte de la inicialización y qué información de la nube importa de verdad.

Cómo se aborda #

Sobre el framework Pointcept se comparan tres arquitecturas de referencia para nubes de puntos: PTv3 (Point Transformer v3), OA-CNN y SpUNet (U-Net de convolución dispersa). El conjunto principal es propio, parcelas con árboles etiquetados; un script de inferencia apunta también al benchmark público FOR-instance.

El diseño experimental es el de un estudio riguroso:

  • Diez semillas por arquitectura, para que la comparación no dependa de una ejecución afortunada.
  • Ablación de atributos de entrada: solo coordenadas, más color, más intensidad de retorno, más número de retornos. Dice qué canales del sensor merece la pena conservar.
  • Ablación de densidad: la nube se remuestrea a rejillas de 0,05, 0,10, 0,20 y 0,40 metros. Dice cuánto se degrada la segmentación con sensores más baratos o vuelos más altos.
  • Ensemble en inferencia: fusión ponderada de las máscaras de dos arquitecturas, sin reentrenar, para ver si sus errores son complementarios.

Qué se aprende #

Los scripts no contienen las métricas finales, pero sí la forma del resultado: una tabla por arquitectura, semilla y condición, agregada en curvas con su varianza. Las decisiones que se leen en los diffs son elocuentes. PTv3, el transformador, es el que más memoria exige y el que agotó los 141 GB de una H200 con la rejilla más fina; se aisló en sus propios trabajos y se reintentó. Las ablaciones se hicieron con una sola semilla y a una densidad fija, «fijado en un tier de calidad de etiqueta», para aislar cada variable. Y el baseline de densidad se reutilizó del experimento del ensemble en vez de reentrenarlo: el mismo protocolo, las mismas semillas, comparación emparejada.

En el clúster #

176trabajos320 hhoras de GPU reservadas7.867 hhoras de CPU reservadas19 may – 28 julperiodo (2026)
Cifras de la línea, entre mayo y julio. Dos personas comparten el pipeline.

El barrido grande (tres arquitecturas por diez semillas por condición) se repartió en dos trabajos de 41 horas en la H200, cada uno con cinco semillas y reanudable por progreso. Las ablaciones de julio son trabajos de una hora a diez en la partición genérica, con el tiempo estimado a mano en el comentario y ajustado tras la primera ejecución.

Trabajos por tipoEntrenamiento multi-semillaEntrenamiento multi-semilla: 116 · 66 %116 · 66 %Ablación de atributosAblación de atributos: 19 · 11 %19 · 11 %Pruebas y depuraciónPruebas y depuración: 13 · 7 %13 · 7 %InferenciaInferencia: 13 · 7 %13 · 7 %Ensemble en inferenciaEnsemble en inferencia: 11 · 6 %11 · 6 %Modelos base (mayo)Modelos base (mayo): 3 · 2 %3 · 2 %Ablación de densidadAblación de densidad: 1 · 1 %1 · 1 %
Trabajos por tipo: el entrenamiento multi-semilla domina en número; las ablaciones son pocas y deliberadas.

En la séptima entrega , imagen médica y un array de cien semillas.


Cifras de la contabilidad de Slurm (capacidad reservada, no uso medido) y de los sbatch archivados. Entrada anonimizada: sin usuarios, rutas, correos ni nombres de proyecto identificables. Las citas son de los comentarios de los scripts.