html27 de julio de 2026 a las 9:00 p. m.Lectura 3 min

Tu scraper de tablas está mintiendo y no lo sabes 🤯

La mayoría de los desarrolladores cometen el mismo error: tratar las tablas HTML como una simple lista de filas y celdas. El problema real aparece con los atributos 'rowspan' y 'colspan'. Cuando un elemento ocupa vari

Artículo

Una lectura sobre tecnología y sistemas digitales, escrita para ir al punto y dejar claras las ideas principales.

Tema principal

desarrollo de software

Fuente

dev.to

Puntos clave

  • La mayoría de los desarrolladores cometen el mismo error: tratar las tablas HTML como una simple lista de filas y celdas.
  • El problema real aparece con los atributos 'rowspan' y 'colspan'.
  • Cuando un elemento ocupa varias filas o columnas, el DOM no refleja la realidad visual. Si iteras linealmente, las columnas se desplazan, los datos desaparecen y tu exportación termina siendo un caos.
  • El insight clave: Deja de iterar elementos y empieza a construir una matriz virtual.
01

Bloque 1

La mayoría de los desarrolladores cometen el mismo error: tratar las tablas HTML como una simple lista de filas y celdas.

El problema real aparece con los atributos 'rowspan' y 'colspan'.

02

Bloque 2

Cuando un elemento ocupa varias filas o columnas, el DOM no refleja la realidad visual. Si iteras linealmente, las columnas se desplazan, los datos desaparecen y tu exportación termina siendo un caos.

El insight clave: Deja de iterar elementos y empieza a construir una matriz virtual.

03

Bloque 3

Para resolver esto en producción, el enfoque debe ser:

• Pre-asignar una cuadrícula 2D (matrix) en lugar de usar arrays simples. • Implementar un puntero de columna que salte las celdas ya ocupadas por 'rowspans' previos. • Expandir el contenido de la celda actual en un bloque exacto según el valor de rowSpan x colSpan. • Normalizar la matriz final para garantizar que todas las filas tengan la misma longitud.

04

Bloque 4

Tratar la tabla como un grid y no como un árbol de nodos es la única forma de garantizar la integridad de los datos, especialmente en sitios complejos como Wikipedia o reportes financieros.

¿Cómo están manejando ustedes la normalización de datos cuando la estructura del HTML es inconsistente?