Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

2.7 Consideraciones estadísticas para los datos geocientíficos y el ruido

Distribuciones canónicas en los datos geocientíficos

  1. Distribución normal: se usa para variables como la temperatura, las variaciones del nivel del mar o la velocidad del viento, cuyos valores se distribuyen simétricamente alrededor de una media.
  2. Distribución log-normal: se observa en fenómenos cuyos valores no pueden ser negativos y muestran colas largas, como la intensidad de la lluvia, el caudal de los ríos, el tamaño de grano y la permeabilidad.
  3. Distribución exponencial: se aplica al modelar los intervalos de tiempo entre eventos, como el tiempo entre sismos. Las magnitudes sísmicas siguen una forma exponencial relacionada, la ley de Gutenberg-Richter, que trabajamos más abajo.
  4. Distribución de ley de potencias: aparece en eventos raros y de gran escala, como deslizamientos de tierra e incendios forestales, donde los eventos pequeños son comunes y los grandes son raros.

🖥️ Diapositivas — Sesión 07 (mié 14 oct)

1. Características estadísticas

Sea P(z)P(z) la distribución de los datos zz.

La media

mean

Imagen tomada de este blog.

La media es la suma de los valores dividida por el número de puntos de datos. Es el primer momento crudo de una distribución. μ=∫−∞∞zP(z)dz\mu = \int_{-\infty}^\infty zP(z)dz, donde zz es el valor de los datos (el intervalo o bin) y P(z)P(z) es la distribución de los datos.

La varianza

variance

La varianza es el segundo momento centralizado. Centralizado significa que la distribución se desplaza alrededor de la media. Calcula qué tan dispersa es una distribución.

σ2=∫−∞∞(z−μ)2P(z)dz\sigma^2 = \int_{-\infty}^\infty (z-\mu)^2P(z)dz

La desviación estándar es la raíz cuadrada de la varianza, σ. Una varianza alta indica una distribución ancha.

La asimetría

La asimetría (skewness) es el tercer momento estandarizado. El momento estandarizado se escala por la desviación estándar. Mide el tamaño relativo de las dos colas de la distribución.

m3=∫−∞∞(z−μ)3σ3P(z)dzm_3= \int_{-\infty}^\infty \frac{(z - \mu)^3}{\sigma^3}P(z)dz

Con el exponente cúbico, es posible que la asimetría sea negativa.

skewness

Imagen tomada de este blog.

Una distribución con asimetría positiva es aquella donde la mayor parte del peso está al final de la distribución. Una distribución con asimetría negativa es aquella donde la mayor parte del peso está al principio de la distribución.

Curtosis

La curtosis mide el tamaño combinado de las dos colas en relación con la distribución completa. Es el cuarto momento centralizado y estandarizado.

m4=∫−∞∞(z−μσ)4P(z)dzm_4= \int_{-\infty}^\infty (\frac{z-\mu}{\sigma})^4P(z)dz

kurtosis Las distribuciones de Laplace, normal y uniforme mostradas tienen todas media 0 y varianza 1, pero su exceso de curtosis es 3, 0 y -1.2.

Las funciones de Python para calcular los momentos podrían ser:

2. Conjuntos de datos geológicos [Nivel 1]

Exploramos la composición del granito en términos de su contenido de sílice y de magnesio. Los datos fueron recolectados de la base de datos EarthChem.

Loading...

El preprocesamiento de los datos suele ser necesario y, sobre todo, es crítico registrar cada paso de procesamiento aplicado a los datos crudos. No cambie el archivo de datos original; en su lugar, registre los pasos de procesamiento. Abajo eliminamos las filas con NaN (not a number, no es un número).

Loading...

Pandas incluye métodos para reportar estadísticas básicas de los datos. Use el método describe del DataFrame.

Loading...
<Figure size 1000x400 with 2 Axes>
<Figure size 640x480 with 1 Axes>

Ahora calculemos los momentos del SiO2 con las funciones que definimos arriba.

The mean is: 72.11
The variance is: 16.84
The skewness is: -1.75
The kurtosis is: 13.67
The mean is: 72.11, the variance is: 16.84, the skewness is: -1.75, and the kurtosis is: 10.67

Observe que pandas reporta el exceso de curtosis (distribución normal = 0), mientras que nuestra versión central_moment reporta la curtosis simple (distribución normal = 3). Lleve el registro de qué convención usa cada biblioteca.

3. Distribuciones geocientíficas

Ejemplo 1: muestreo de la distribución normal

Aplicación: simular las variaciones diarias de temperatura en una ubicación específica a lo largo del tiempo. Este es un sustituto sintético, no observaciones: extraemos de una distribución normal con parámetros plausibles para Seattle (media anual cercana a 11.5 C, desviación estándar cercana a 6 C). Los datos reales de temperatura tienen una estructura estacional que una sola distribución normal no captura.

<Figure size 640x480 with 1 Axes>

Ejemplo 2: magnitudes sísmicas y la ley de Gutenberg-Richter

Las magnitudes de los sismos no siguen una distribución log-normal. Siguen la ley de Gutenberg-Richter: el número de sismos NN con magnitud al menos MM satisface

log⁡10N=a−bM\log_{10} N = a - bM,

donde aa fija la tasa general de sismicidad y bb (el «valor b») fija la tasa relativa de eventos pequeños frente a grandes. Globalmente, b≈1b \approx 1: por cada unidad que baja la magnitud hay unas diez veces más sismos — es lo que se observa, por ejemplo, en los catálogos del Servicio Sismológico Nacional (SSN) de México. Como la magnitud ya es una medida logarítmica del tamaño, esta ley significa que las magnitudes sísmicas siguen una distribución exponencial por encima de la magnitud mínima del catálogo.

Generamos un catálogo sintético con mlgeo_synth.gutenberg_richter_magnitudes, que extrae magnitudes con un valor b conocido.

20000 magnitudes between 1.00 and 5.64

Grafique la distribución frecuencia-magnitud. Con el eje de conteos en escala logarítmica, la ley de Gutenberg-Richter aparece como una línea recta de pendiente −b-b: tanto los conteos por intervalo de magnitud como los conteos acumulados N(≥M)N(\geq M) decaen de forma log-lineal.

<Figure size 700x500 with 1 Axes>

La línea recta sobre el eje de conteos en escala logarítmica es la firma de la ley de Gutenberg-Richter.

Podemos estimar el valor b a partir de los datos con el estimador de máxima verosimilitud (Aki 1965):

b^=log⁡10(e)Mˉ−Mmin\hat{b} = \dfrac{\log_{10}(e)}{\bar{M} - M_{min}},

donde Mˉ\bar{M} es la magnitud media del catálogo y MminM_{min} es la magnitud mínima de completitud.

Maximum-likelihood b-value estimate: 0.998 (true value: 1.0)

La estimación recupera el valor b que pusimos. En catálogos reales, el mismo estimador funciona una vez que usted identificó la magnitud de completitud (la magnitud por encima de la cual la red detecta todos los eventos); por debajo de ella, el catálogo pierde los sismos pequeños y la línea se dobla.

Ejemplo 3: distribuciones de ley de potencias

Aplicación en las geociencias: las distribuciones de ley de potencias se observan en la ocurrencia de amenazas naturales como deslizamientos de tierra e incendios forestales, donde los eventos pequeños son comunes pero los grandes son raros.

<Figure size 640x480 with 1 Axes>

La distribución de ley de potencias captura el comportamiento de colas pesadas típico de procesos geofísicos como los deslizamientos de tierra.

4. Ejercicio en clase

Elija una de las distribuciones de esta lección, extraiga muestras de ella, calcule los primeros cuatro momentos y compárelos con los valores teóricos. Siga los pasos de la celda de abajo.