Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

🖥️ Diapositivas — Sesión 01 (mié 30 sep)

La ciencia abierta y reproducible es el estándar de trabajo de este curso. Cada tarea y el proyecto final se califican, en parte, según si otra persona podría reejecutar su análisis y obtener su resultado. Esta página explica qué significa eso en la práctica: ciencia abierta, los principios FAIR, licencias, citación de datos, preprints, y por qué la reproducibilidad importa más ahora que la IA escribe buena parte del código.

Dos complementos de esta lección (no sustitutos, y por ahora en inglés):

DiapositivasGrabación de la presentación

¿Qué es la ciencia abierta?

La ciencia abierta es la práctica de poner los productos de la investigación — datos, código, métodos y artículos — a disposición de otros para inspeccionarlos, reutilizarlos y construir sobre ellos. En las geociencias esto no es un ideal abstracto. La mayor parte de los datos que usamos en este libro (formas de onda sísmicas, posiciones GNSS, imágenes satelitales, reanálisis climáticos) existe porque agencias e investigadores los publicaron abiertamente: el Servicio Sismológico Nacional de México, el Centro Sismológico Nacional de Chile o el IDEAM colombiano publican sus catálogos y series igual que las agencias estadounidenses que verá en este libro. Cuando usted publica su propio trabajo de la misma manera, cierra el círculo.

La ciencia abierta tiene varios componentes:

La reproducibilidad (reproducibility) es el hilo que une los cuatro. Un resultado es reproducible si alguien con su código y sus datos puede regenerar sus figuras y sus números. Es replicable si alguien con datos nuevos y código propio llega a la misma conclusión. Este curso califica lo primero y aspira a lo segundo.

Principios FAIR

Los principios FAIR (Wilkinson et al., 2016) describen qué hace útiles los datos para otros:

Cuando arme un conjunto de datos listo para IA en el capítulo 2, aplicará estos principios a sus propios productos: archivar los datos, documentar la procedencia, adjuntar una licencia, obtener un DOI.

Los datos geocientíficos suelen ser datos sobre un lugar, y los datos sobre un lugar pueden acarrear obligaciones que un archivo de licencia no captura: regulaciones locales, acuerdos con comunidades o políticas nacionales de datos. Antes de asumir que publicar en abierto es apropiado, revise los términos bajo los cuales se recolectaron los datos.

Licencias

Sin una licencia, otros no pueden legalmente reutilizar ni modificar su trabajo, aunque esté en un repositorio público. «Público» no significa «licenciado». Por eso, cada repositorio que usted cree en este curso lleva un archivo de licencia.

Licencias de software. Las opciones comunes de código abierto:

choosealicense.com lo guía en la elección. Para el trabajo del curso, MIT es un valor por defecto sensato. El capítulo de licencias de The Turing Way ofrece una discusión más larga.

Licencias de datos y texto. Las licencias de software están escritas para código y se ajustan mal a los datos. Para conjuntos de datos, documentación y figuras, use Creative Commons:

Un repositorio que contiene código y datos puede llevar dos licencias — por ejemplo, MIT para el código y CC-BY para los datos — con la separación declarada en el README.

Qué contiene un repositorio reutilizable

Además de la licencia, un repositorio que otros (incluida su versión futura) puedan usar tiene:

Las lecciones Intermediate Research Software Development de los Software Carpentries cubren esto en profundidad software_carpentries_intermediate.

Citación de datos y DOI

Un DOI (identificador de objeto digital, Digital Object Identifier) es un identificador persistente que resuelve a un conjunto de datos, un artículo o una versión de software para siempre, aunque cambie la URL que lo aloja. Los datos con DOI pueden citarse como un artículo — así reciben crédito quienes los producen, y por eso los repositorios de datos exigen citar los datos que usted usa. Cuando este libro descarga datos GNSS del Nevada Geodetic Laboratory en 1.7, citamos a Blewitt et al. (2018). Haga lo mismo con cada conjunto de datos de su proyecto.

Zenodo, operado por el CERN, acuña DOI gratis y se integra con GitHub: enlace su repositorio una vez, y cada release de GitHub queda archivada en Zenodo con su propio DOI automáticamente. Así vuelve citable su proyecto final. GitHub documenta el flujo aquí. Los archivos disciplinarios (PANGAEA, EarthScope, los centros nacionales de datos) cumplen el mismo papel para datos observacionales.

Preprints

Un preprint es el manuscrito publicado abiertamente antes de (o durante) la revisión por pares. En las ciencias de la Tierra, los servidores principales son EarthArXiv y ESS Open Archive (ESSOAr). Los preprints hacen disponibles los resultados meses o años antes que las revistas, llevan DOI y son citables. La mayoría de las revistas de geociencias permite publicarlos; revise la política de cada revista. Leer preprints también es parte del trabajo semanal de literatura en este curso, con la advertencia de siempre: un preprint aún no pasó por revisión por pares, así que léalo con el mismo ojo crítico que aprenderá a aplicar a la salida de la IA.

Reproducibilidad en la era de la IA

Podría esperarse que los asistentes de IA vuelvan obsoleta la preocupación por la reproducibilidad: si el código puede regenerarse a demanda, ¿para qué archivarlo? Lo cierto es lo contrario.

El capítulo 5 desarrolla esto en un flujo de trabajo completo: entornos como archivos de bloqueo, versionado de datos y seguimiento de experimentos. Por ahora, la regla es simple: todo lo que produjo una figura o un número en su proyecto está confirmado, licenciado y es reejecutable.

Lecturas adicionales

References
  1. Wilkinson, M. D., Dumontier, M., Aalbersberg, Ij. J., Appleton, G., Axton, M., Baak, A., Blomberg, N., Boiten, J.-W., da Silva Santos, L. B., Bourne, P. E., Bouwman, J., Brookes, A. J., Clark, T., Crosas, M., Dillo, I., Dumon, O., Edmunds, S., Evelo, C. T., Finkers, R., … Mons, B. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data, 3(1). 10.1038/sdata.2016.18