🖥️ Diapositivas — Sesión 04 (mié 7 oct)
Las geociencias funcionan con datos: con ellos observamos, modelamos y predecimos los procesos naturales. Para usar bien un conjunto de datos hay que saber qué clase de datos es, en qué formato llega y cómo está estructurado. Esta lección cubre las modalidades de datos que se encuentran en las geociencias, los formatos típicos, los arreglos y los data frames (marcos de datos). Los datos geocientíficos son particularmente diversos: mediciones puntuales de humedad del suelo, sismogramas en series de tiempo de alta tasa (1000 muestras por segundo), imágenes rasterizadas de LandSAT, campos geofísicos simulados en el espacio y en el tiempo.

Figure 1:Arte generado con IA (DALL·E): datos geocientíficos con marcos de datos, datos geoespaciales y temporales.
Modalidades de datos en las geociencias¶
En las geociencias, los datos llegan en varias modalidades según la fuente, la naturaleza de las mediciones y las aplicaciones previstas:
- Datos in situ: mediciones tomadas directamente en el sitio de interés. Los datos in situ suelen llegar como series de tiempo. Ejemplos:
- Datos de temperatura de estaciones meteorológicas, como las del Servicio Meteorológico Nacional de México o de sus pares en la región.
- Datos de movimiento del suelo de sismómetros, como los de la red del Servicio Sismológico Nacional (SSN).
- Datos de humedad del suelo de sondas in situ.
- Datos de percepción remota: recolectados con instrumentos que no están en contacto directo con el objeto de estudio, a menudo desde satélites, drones o aeronaves. Los datos geoespaciales están ligados a ubicaciones específicas de la superficie terrestre y suelen representarse como mapas o mallas (por ejemplo, datos SIG). Ejemplos:
- Imágenes en múltiples longitudes de onda (por ejemplo, imágenes multiespectrales o hiperespectrales) desde satélites.
- Datos de topografía obtenidos con sistemas LiDAR o de radar.
- Temperatura superficial del mar desde satélites.
- Datos de modelos: datos simulados generados por modelos computacionales. Por ejemplo:
- Modelos climáticos que predicen temperaturas, precipitación y química futuras.
- Modelos hidrológicos que simulan el flujo de agua en cuencas, como las que monitorea la CONAGUA.
- Simulaciones de campos de onda que resuelven la ecuación de onda en medios complejos.
- Datos geofísicos: mediciones del subsuelo derivadas por métodos indirectos como levantamientos sísmicos, estudios de gravedad o de magnetismo.
Formatos de datos en las geociencias¶
Los datos geocientíficos suelen almacenarse en formatos que optimizan el almacenamiento, el acceso y el intercambio. Los formatos comunes incluyen:
NetCDF (Network Common Data Form): de uso común para datos científicos multidimensionales, como salidas de modelos atmosféricos, oceánicos o climáticos. Almacena con eficiencia datos en arreglos junto con sus metadatos.
HDF (Hierarchical Data Format): similar a NetCDF pero más general; se usa para conjuntos de datos grandes, incluidas imágenes satelitales.
CSV (Comma-Separated Values, valores separados por comas): un formato simple para datos tabulares. Es legible por humanos y compatible con casi cualquier software, pero poco eficiente para conjuntos de datos grandes o multidimensionales.
GeoTIFF: un formato popular para datos geoespaciales ráster, usado con frecuencia en percepción remota y en aplicaciones SIG.
Shapefiles: un formato de datos vectoriales para software de sistemas de información geográfica (SIG), que contiene las ubicaciones geométricas y la información de atributos de los elementos espaciales.
Parquet / Arrow: formatos columnares para datos tabulares. Los archivos Parquet están comprimidos, tipados y se leen mucho más rápido que un CSV; Arrow es la contraparte en memoria que pandas y otras herramientas usan para intercambiar tablas sin copiarlas.
Formatos optimizados para la nube: a medida que los grandes archivos de datos migran al almacenamiento de objetos en la nube, importan los formatos diseñados para lecturas parciales y paralelas sobre HTTP:
- COG (Cloud Optimized GeoTIFF): un GeoTIFF con teselado interno y vistas generales, de modo que los clientes puedan solicitar solo las teselas que necesitan.
- GeoParquet: Parquet con una codificación estandarizada para geometrías vectoriales, que reemplaza a los shapefiles en conjuntos vectoriales grandes.
- Zarr (v3): arreglos n-dimensionales comprimidos y divididos en fragmentos (chunks), almacenados como muchos objetos pequeños; está construido para lecturas paralelas en la nube y es el pariente natural de netCDF en ese entorno.
- kerchunk / VirtualiZarr: indexan archivos netCDF/HDF5 existentes para que puedan leerse como si fueran Zarr, sin reescribir los datos.
- STAC (SpatioTemporal Asset Catalogs): un catálogo JSON estándar para describir y buscar recursos geoespaciales, de modo que un script pueda encontrar exactamente las escenas o los gránulos que necesita.
- TileDB y otros siguen desarrollándose en este espacio.
Arreglos¶
Un arreglo (array) es una estructura de datos fundamental para almacenar colecciones de valores, a menudo datos multidimensionales (por ejemplo, datos espaciales en malla). En las geociencias, los arreglos suelen representar variables como temperatura, presión o precipitación sobre una malla.
Dimensiones típicas de los arreglos:
- Arreglos 1D: una sola secuencia de datos, como mediciones de temperatura a lo largo del tiempo en una ubicación.
- Arreglos 2D: suelen representar datos espaciales en malla (por ejemplo, un mapa de precipitación sobre una región).
- Arreglos 3D: pueden incluir dimensiones adicionales, como el tiempo o la profundidad. Por ejemplo, un arreglo 3D puede representar la temperatura a varias profundidades y a lo largo del tiempo para una región dada, un modelo 3D de la Tierra con propiedades geofísicas como la velocidad de las ondas sísmicas, instantáneas de campos de onda sísmicos que varían en el tiempo, ...
- Arreglos 4D: agregan aún más complejidad, como una malla 3D que varía en el tiempo (por ejemplo, datos atmosféricos que cambian en el espacio y en el tiempo) o imágenes time-lapse de las propiedades del subsuelo.
Data frames¶
Un data frame (marco de datos) es una estructura de datos tabular de dos dimensiones, de uso común en el análisis de datos. Puede pensarse como el equivalente de una hoja de cálculo o de una tabla de base de datos, donde:
- Cada columna representa una variable o característica (por ejemplo, fecha, ubicación, temperatura).
- Cada fila corresponde a una observación o punto de datos. Los data frames son populares en entornos de programación como R y Python (mediante la biblioteca Pandas) porque ofrecen flexibilidad para manejar tipos de datos mixtos (numéricos, categóricos, etc.) y son ideales para el análisis estadístico y la manipulación de datos.