🖥️ Diapositivas — Sesión 04 (mié 7 oct)
Este curso ofrece varias pistas para estudiantes de geociencias. Los conjuntos de datos pueden descargarse y usarse a lo largo de los distintos ejercicios (por ejemplo, clasificación, regresión, agrupamiento...).
Las pistas son: ciencias geofísicas (sismología y geodesia), geología, ciencias de la criósfera, ciencias de la atmósfera, ciencias del océano, hidrología y ciencias forestales.
Proporcionamos una serie de conjuntos de datos pequeños y curados para el curso. Son datos de acceso abierto, cada uno con su propia licencia.
La colección vive en el repositorio UW
Cómo descargar un archivo del repositorio MLGeo-dataset¶
Para descargar un archivo de un repositorio de GitHub, siga estos pasos:
Identifique la URL del archivo:
- Navegue hasta el archivo CSV en el repositorio de GitHub.
- Haga clic en el archivo para ver su contenido.
- Haga clic en el botón «Raw» para obtener la URL directa al archivo.
Construya la URL de descarga:
El formato de la URL es:
https://raw.githubusercontent.com/UW-MLGEO/MLGeo-dataset/main/data/file.csvDescargue el archivo con pooch:
pooch es una pequeña biblioteca de Python hecha exactamente para esto: traer un archivo desde una URL, guardarlo en una caché local y comprobar su integridad.
import pooch fname = pooch.retrieve( url="https://raw.githubusercontent.com/UW-MLGEO/MLGeo-dataset/main/data/EarthRocGranites.csv", known_hash=None, )pooch.retrievedescarga el archivo una vez, lo almacena en una caché local y devuelve la ruta; las llamadas posteriores reutilizan la copia en caché. Conknown_hash=None, pooch imprime la suma de verificación SHA256 de lo que descargó. Pegue esa suma de vuelta enknown_hash="sha256:..."en su código: desde entonces, pooch verifica cada descarga contra ella y lanza un error si el archivo en el servidor cambió. Esa es una pieza pequeña y barata de reproducibilidad — usted sabe que su análisis corrió sobre el archivo que cree que corrió.Como nota aparte, los equivalentes de shell también funcionan, sin caché ni sumas de verificación:
wget https://raw.githubusercontent.com/UW-MLGEO/MLGeo-dataset/main/data/EarthRocGranites.csv # or: curl -O <url>
Descripción de los datos¶
La colección de datos busca representar la diversidad de conjuntos de datos que se encuentran en las geociencias.
Los datos incluyen series de tiempo a través de escalas temporales (del segundo a los 100 ka). Los datos se almacenan en archivos CSV para la clase, pero típicamente se almacenan en CSV, Arrow, H5, NetCDF, TileDB, mseed y otros formatos propios de cada disciplina. Los servicios sismológicos de la región — el SSN mexicano, el CSN chileno, el IGP peruano — y agencias como el IDEAM colombiano o el SMN argentino publican catálogos y series análogos, que usted puede sustituir en muchos ejercicios.
Licencias y citación¶
Cada página de conjunto de datos en el repositorio MLGeo-dataset debe llevar dos cosas: la licencia bajo la cual se distribuyen los datos y la citación de quien los produjo. Cuando reutilice un conjunto de datos, lleve ambas a su propio repositorio. Para los conjuntos de datos principales, donde se conoce:
- Registro de CO2 de Mauna Loa (
data_co2.csv): producido por el NOAA Global Monitoring Laboratory; como obra del gobierno de Estados Unidos, está en el dominio público. Cite a NOAA GML. - Pila bentónica LR04 (
lr04.csv): datos de investigación publicados; cite a Lisiecki & Raymo (2005), doi:10.1029/2004PA001071. - Catálogo global de sismos (
Global_Quakes_IRIS.csv): de los servicios de EarthScope (antes IRIS), de distribución abierta; cite EarthScope/USGS. - Catálogos sísmicos de la PNSN (
pnsn_catalog.csvy relacionados): distribuidos abiertamente por la Pacific Northwest Seismic Network; cite la PNSN. - Concentración de hielo marino del Ártico (
noaav4_nh_monthly_sic_1978_2024.nc): Climate Data Record de NOAA/NSIDC, de distribución abierta; cite el conjunto de datos del NSIDC. - Datos de hielo de Jakobshavn (
data_ice_jakobshavn.csv): cite al productor original de los datos listado en la página del conjunto. - Para los archivos restantes (por ejemplo,
water_potability.csv, extractos del SDSS Skyserver), la licencia se declara en la página del conjunto de datos; si a una página le falta, eso es un error — abra un issue.

Datos temporales de geociencias. Cada curva es un conjunto de datos, normalizado en amplitud y desplazado verticalmente según su índice en la colección; el eje x es tiempo normalizado. La colección incluye eventos extremos, ondas sísmicas dinámicas, el registro creciente de CO2 y más de 15 años de señales estacionales hidrológicas y meteorológicas.