Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

Tarea: Preparar datos listos para la IA para el proyecto final

Tarea: Preparar datos listos para la IA para el proyecto final

Objetivo

Esta tarea se centra en organizar, limpiar y preparar los datos en una forma adecuada para el aprendizaje automático. Al terminar, usted debería tener un repositorio organizado que contenga los datos crudos, los datos limpios, los atributos anotados y el análisis exploratorio que prepara los datos para su uso en modelos de aprendizaje automático.

Estructura de la tarea

  1. Configuración y documentación del repositorio del proyecto

    • Tarea: cree un repositorio público de GitHub para el proyecto grupal.
    • Requisitos:
      • Un archivo README.md claro y conciso que explique:
        • La(s) fuente(s) de los datos.
        • Los objetivos del proyecto. Allí debe describirse la justificación del proyecto.
        • Las instrucciones para configurar el entorno (dependencias, paquetes).
        • Una descripción de alto nivel de cada script/cuaderno.
      • Estructure su repositorio siguiendo las pautas de MLGEO.
  2. Descarga de datos y organización de los datos crudos

    • Tarea: descargue el conjunto de datos geocientíficos crudos relevante para su proyecto y discuta sus modalidades básicas.
    • Requisitos:
      • Incluya un script o cuaderno (scripts/download_data.py o notebooks/Download_Data.ipynb) que descargue y verifique el conjunto de datos.
      • Asegúrese de que los datos crudos se almacenen en una carpeta dedicada (data/raw/).
      • Si aplica, documente en el README.md cualquier clave de API o credencial de acceso requerida para obtener los datos.
      • Describa las modalidades y los formatos de los datos.
      • Si aplica, describa los grandes archivos de datos que pueden usarse para la inferencia del modelo, y su tamaño.
  3. Limpieza y manipulación básicas de los datos

    • Tarea: limpie los datos crudos para manejar los valores faltantes, los valores atípicos o las inconsistencias.
    • Requisitos:
      • Escriba un script/cuaderno (scripts/clean_data.py o notebooks/Data_Cleaning.ipynb) que:
        • Maneje los valores faltantes (por ejemplo, imputación, eliminación).
        • Corrija o remueva los valores atípicos.
        • Garantice la consistencia de los datos (por ejemplo, formato de fechas uniforme, conversiones de unidades).
        • Guarde los datos limpios en una carpeta nueva (data/clean/).
  4. Organización de los datos en un formato listo para la IA

    • Tarea: prepare los datos limpios para el aprendizaje automático, garantizando que estén correctamente anotados y estructurados. Este hito se califica contra la lista de verificación de la lección 2.13.
    • Requisitos:
      • Convierta sus datos a un formato adecuado para ML (por ejemplo, DataFrame de pandas, arreglos de NumPy, Xarray).
      • Sea muy específico y declare 1) qué es una muestra/instancia de datos, 2) cuáles son los datos de entrada (los datos crudos o sus características) y 3) cuáles son los datos objetivo. Identificar esto temprano fija metas claras para el análisis. Note que elegir unos «datos objetivo» probablemente significa que el problema (por ejemplo, regresión, clasificación, etc.) ya está planteado.
      • Escriba una ficha de datos (data/ai_ready/data_card.yml), siguiendo la plantilla de la lección 2.13: nombre, versión, descripción, procedencia (incluidos los datos sintéticos o aumentados, declarados), licencia, cita, muestreo, variables con unidades y dtypes, política de datos faltantes, inventario de clases/eventos y definición de las particiones.
      • Incluya las particiones de referencia con los datos: almacene la pertenencia a entrenamiento/validación/prueba como una columna o un archivo índice en data/ai_ready/, y justifique el diseño de las particiones contra la estructura de correlación de sus datos (agrupamiento por tiempo, espacio o evento — las particiones aleatorias de datos autocorrelacionados perderán puntos; vea la lección 2.13, sección 7).
      • Asegúrese de que los datos estén bien documentados con atributos, etiquetas y metadatos.
      • Incluya un cuaderno (notebooks/Prepare_AI_Ready_Data.ipynb) que describa con claridad:
        • La forma final de los datos (número de muestras, características y etiquetas objetivo).
        • Una descripción de cada característica/atributo por muestra de datos, cuál es su significado físico, y escriba la dimensionalidad original de los datos con base en el número de características.
        • Una demostración de que los estadísticos de preprocesamiento (escaladores, imputadores, bases de PCA) se ajustan solo con la partición de entrenamiento.
        • Guarde los datos finales listos para la IA en una carpeta dedicada (data/ai_ready/).
  5. Análisis exploratorio de datos (EDA)

    • Tarea: realice una exploración básica de los datos limpios para entender su estructura y sus características principales.
    • Requisitos:
      • Cree un cuaderno (notebooks/EDA.ipynb) que incluya:
        • Estadísticos de resumen básicos del conjunto de datos (media, varianza, mínimo, máximo, etc.).
        • Visualización de las distribuciones de las características (histogramas, diagramas de caja, etc.).
        • Análisis de correlación entre las distintas características y las variables objetivo (matriz de correlación, mapas de calor).
        • Una discusión breve sobre los patrones o hallazgos observados durante el análisis.
  6. Discusión y reducción de la dimensionalidad

    • Tarea: analice la dimensionalidad de su conjunto de datos y proponga métodos para reducirla.
    • Requisitos:
      • En un cuaderno (notebooks/Dimensionality_Reduction.ipynb):
        • Discuta las dimensiones actuales del conjunto de datos y los desafíos que presentan (por ejemplo, alta dimensionalidad, datos dispersos).
        • Proponga e implemente al menos dos técnicas de reducción de dimensionalidad:
          • Técnicas de extracción de características como el PCA (análisis de componentes principales).
          • Un método no lineal: t-SNE (t-Distributed Stochastic Neighbor Embedding), como se enseñó en la lección 2.12. UMAP es opcional — no está instalado en el entorno del curso, así que si lo usa, agréguelo al entorno propio de su proyecto y documéntelo.
        • Visualice los resultados de la reducción de dimensionalidad (gráficos de dispersión, gráficos de varianza explicada).
        • Discuta las implicaciones de la reducción de dimensionalidad para su conjunto de datos.

Entregables

Criterios de calificación

Autoevaluación obligatoria: revisión con IA agéntica, más su crítica de ella

No pegue la URL de su repositorio en un chatbot y lo llame una revisión. En su lugar:

  1. Ejecute una revisión agéntica con IA del repositorio. Use un agente que realmente pueda leer los archivos (por ejemplo, Claude Code, GitHub Copilot Workspace o una herramienta similar ejecutada dentro de un clon de su repositorio). Instrúyalo para que califique el repositorio contra la rúbrica de calificación completa de arriba, sección por sección, citando archivos y líneas específicos como evidencia, y para que verifique explícitamente los puntos de la lista de verificación de la lección 2.13 (campos de la ficha de datos, particiones almacenadas, controles contra fugas). Guarde el informe completo del agente.

  2. Escriba una crítica de media página de la evaluación de la IA. Identifique al menos un error concreto, una omisión o una afirmación injustificada en el informe de la IA — un archivo que leyó mal, un punto de la lista de verificación que marcó como satisfecho y no lo está, un problema de diseño de las particiones que pasó por alto, o crédito que otorgó por algo que no existe. Si cree que el informe es enteramente correcto, no lo ha leído con suficiente cuidado; las revisiones agénticas de repositorios reales contienen, de manera confiable, al menos un error.

  3. Entregue ambos en Canvas: el informe de la IA y su crítica. La crítica es la parte calificada — demuestra que usted puede supervisar a un revisor de IA en lugar de deferir a él.