Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

Objetivo

Esta tarea le guía por las tareas de aprendizaje automático clásico para su conjunto de datos listo para IA. Comparará familias de modelos, evaluará el desempeño con honestidad y estimará el costo computacional. La meta es practicar la selección y la optimización de un modelo para su proyecto, y así prepararlo para un desarrollo de modelos más profundo.

Estructura de la tarea

  1. Relevancia para el proyecto de investigación

    • Tarea: escriba un ensayo breve que discuta la relevancia del aprendizaje automático para su proyecto y esboce su enfoque.
    • Requisitos:
      • Un ensayo conciso, de media página (en Research_Relevance.md), que incluya:
        • La conexión del problema con la clasificación o la regresión.
        • La justificación de si el trabajo usará un enfoque supervisado, no supervisado, autosupervisado o semisupervisado.
        • Los resultados esperados y el impacto potencial de aplicar ML a su conjunto de datos.
        • Una declaración de uso de IA: indique qué partes del código y del texto se produjeron con asistencia de IA, y cómo las verificó.
  2. Análisis de agrupamiento (clustering) para proyectos de clasificación

    • Tarea: si su proyecto involucra clasificación, realice un análisis de agrupamiento sobre las características de sus datos, en especial después de la reducción de dimensionalidad.
    • Requisitos:
      • Aplique algoritmos de agrupamiento (p. ej., K-means) para entender los conglomerados o patrones de las características.
      • Aplique las buenas prácticas del análisis de agrupamiento en un cuaderno (notebooks/Clustering_Analysis.ipynb):
        • Use el análisis de silueta y la curva del codo para identificar el K óptimo.
        • Evalúe los conglomerados con la homogeneidad o el índice de Fowlkes-Mallows.
        • Ponga a prueba la robustez con corridas repetidas de K-means con semillas aleatorias.
      • Visualice los conglomerados y discuta cómo este análisis informa su enfoque de clasificación.
  3. Comparación de modelos y ajuste de hiperparámetros

    • Tarea: compare familias de modelos de manera sistemática y ajuste las prometedoras. (Ediciones anteriores exigían pycaret; esa herramienta está retirada.)
    • Requisitos:
      • En un cuaderno (notebooks/AutoML_Hyperparameter_Tuning.ipynb):
        • Establezca primero un modelo de referencia (baseline) trivial (clase mayoritaria o predicción de la media/climatología). Todo modelo se juzga contra él.
        • Compare al menos cuatro familias de clasificadores o regresores, incluido un modelo de gradient boosting (potenciación de gradiente; HistGradientBoosting* de scikit-learn o LightGBM).
        • Ajuste los mejores candidatos con un estudio de Optuna o una búsqueda en malla envueltos en validación cruzada.
        • Describa los algoritmos evaluados y los hiperparámetros optimizados.
        • Identifique los modelos más prometedores según el desempeño, la interpretabilidad y el costo computacional.
  4. Ingeniería del entrenamiento y evaluación del modelo

    • Tarea: realice un análisis exhaustivo de las estrategias de entrenamiento y de la evaluación del modelo.
    • Requisitos:
      • En un cuaderno (notebooks/Model_Training_Assessment.ipynb), demuestre:
        • Un protocolo limpio de entrenamiento-validación-prueba: toda la selección de modelos ocurre sobre los datos de entrenamiento/validación; el conjunto de prueba se usa una sola vez.
        • Un esquema de validación cruzada elegido según la estructura de correlación de sus datos, con justificación: si sus muestras están correlacionadas en el tiempo o en el espacio (la mayoría de los datos geocientíficos lo están), use divisiones TimeSeriesSplit, por bloques o GroupKFold y explique su elección; si usa K pliegues aleatorios, justifique por qué la fuga de datos no es una preocupación.
        • La generalidad del desempeño, probando sobre subconjuntos diversos de los datos.
        • Técnicas de bootstrapping y de agregación bootstrap (bagging) a través de distintas arquitecturas de modelo y variaciones de los datos.
        • Visualice el desempeño del modelo (p. ej., curvas de aprendizaje, métricas de error) a lo largo de las rondas de entrenamiento.
        • Una discusión de los resultados, incluida la manera en que estos métodos afectan la generalidad y el desempeño del modelo.
      • Todas las métricas reportadas deben provenir de sus propios conjuntos apartados de validación y de prueba, nunca de los datos de entrenamiento. El instructor guarda datos de prueba ocultos para los conjuntos de datos del curso y verificará por muestreo el desempeño declarado; una brecha grande entre los scores declarados y los verificados costará puntos.
  5. Análisis del tiempo de cómputo

    • Tarea: analice el tiempo de cómputo necesario para el entrenamiento y el despliegue del modelo.
    • Requisitos:
      • En un cuaderno (notebooks/Computational_Time_Analysis.ipynb), incluya:
        • Métricas del tiempo de entrenamiento de cada arquitectura de modelo, detallando cómo los distintos parámetros afectan la velocidad.
        • Una exploración de los compromisos entre tiempo y exactitud para distintas configuraciones.
        • Una estimación de los requisitos de tiempo esperados para el despliegue del modelo en escenarios del mundo real.
      • Resuma los hallazgos en una conclusión breve, con foco en los desafíos u optimizaciones computacionales relevantes para su modelo.

Entregables

Criterios de calificación

Esta tarea aplica los métodos del aprendizaje automático clásico a datos geocientíficos reales, y profundiza su comprensión práctica de la selección, el ajuste y la evaluación honesta de modelos.