Objetivo¶
Esta tarea le guía por las tareas de aprendizaje automático clásico para su conjunto de datos listo para IA. Comparará familias de modelos, evaluará el desempeño con honestidad y estimará el costo computacional. La meta es practicar la selección y la optimización de un modelo para su proyecto, y así prepararlo para un desarrollo de modelos más profundo.
Estructura de la tarea¶
Relevancia para el proyecto de investigación
- Tarea: escriba un ensayo breve que discuta la relevancia del aprendizaje automático para su proyecto y esboce su enfoque.
- Requisitos:
- Un ensayo conciso, de media página (en
Research_Relevance.md), que incluya:- La conexión del problema con la clasificación o la regresión.
- La justificación de si el trabajo usará un enfoque supervisado, no supervisado, autosupervisado o semisupervisado.
- Los resultados esperados y el impacto potencial de aplicar ML a su conjunto de datos.
- Una declaración de uso de IA: indique qué partes del código y del texto se produjeron con asistencia de IA, y cómo las verificó.
- Un ensayo conciso, de media página (en
Análisis de agrupamiento (clustering) para proyectos de clasificación
- Tarea: si su proyecto involucra clasificación, realice un análisis de agrupamiento sobre las características de sus datos, en especial después de la reducción de dimensionalidad.
- Requisitos:
- Aplique algoritmos de agrupamiento (p. ej., K-means) para entender los conglomerados o patrones de las características.
- Aplique las buenas prácticas del análisis de agrupamiento en un cuaderno (
notebooks/Clustering_Analysis.ipynb):- Use el análisis de silueta y la curva del codo para identificar el K óptimo.
- Evalúe los conglomerados con la homogeneidad o el índice de Fowlkes-Mallows.
- Ponga a prueba la robustez con corridas repetidas de K-means con semillas aleatorias.
- Visualice los conglomerados y discuta cómo este análisis informa su enfoque de clasificación.
Comparación de modelos y ajuste de hiperparámetros
- Tarea: compare familias de modelos de manera sistemática y ajuste las prometedoras. (Ediciones anteriores exigían pycaret; esa herramienta está retirada.)
- Requisitos:
- En un cuaderno (
notebooks/AutoML_Hyperparameter_Tuning.ipynb):- Establezca primero un modelo de referencia (baseline) trivial (clase mayoritaria o predicción de la media/climatología). Todo modelo se juzga contra él.
- Compare al menos cuatro familias de clasificadores o regresores, incluido un modelo de gradient boosting (potenciación de gradiente;
HistGradientBoosting*de scikit-learn o LightGBM). - Ajuste los mejores candidatos con un estudio de Optuna o una búsqueda en malla envueltos en validación cruzada.
- Describa los algoritmos evaluados y los hiperparámetros optimizados.
- Identifique los modelos más prometedores según el desempeño, la interpretabilidad y el costo computacional.
- En un cuaderno (
Ingeniería del entrenamiento y evaluación del modelo
- Tarea: realice un análisis exhaustivo de las estrategias de entrenamiento y de la evaluación del modelo.
- Requisitos:
- En un cuaderno (
notebooks/Model_Training_Assessment.ipynb), demuestre:- Un protocolo limpio de entrenamiento-validación-prueba: toda la selección de modelos ocurre sobre los datos de entrenamiento/validación; el conjunto de prueba se usa una sola vez.
- Un esquema de validación cruzada elegido según la estructura de correlación de sus datos, con justificación: si sus muestras están correlacionadas en el tiempo o en el espacio (la mayoría de los datos geocientíficos lo están), use divisiones
TimeSeriesSplit, por bloques oGroupKFoldy explique su elección; si usa K pliegues aleatorios, justifique por qué la fuga de datos no es una preocupación. - La generalidad del desempeño, probando sobre subconjuntos diversos de los datos.
- Técnicas de bootstrapping y de agregación bootstrap (bagging) a través de distintas arquitecturas de modelo y variaciones de los datos.
- Visualice el desempeño del modelo (p. ej., curvas de aprendizaje, métricas de error) a lo largo de las rondas de entrenamiento.
- Una discusión de los resultados, incluida la manera en que estos métodos afectan la generalidad y el desempeño del modelo.
- Todas las métricas reportadas deben provenir de sus propios conjuntos apartados de validación y de prueba, nunca de los datos de entrenamiento. El instructor guarda datos de prueba ocultos para los conjuntos de datos del curso y verificará por muestreo el desempeño declarado; una brecha grande entre los scores declarados y los verificados costará puntos.
- En un cuaderno (
Análisis del tiempo de cómputo
- Tarea: analice el tiempo de cómputo necesario para el entrenamiento y el despliegue del modelo.
- Requisitos:
- En un cuaderno (
notebooks/Computational_Time_Analysis.ipynb), incluya:- Métricas del tiempo de entrenamiento de cada arquitectura de modelo, detallando cómo los distintos parámetros afectan la velocidad.
- Una exploración de los compromisos entre tiempo y exactitud para distintas configuraciones.
- Una estimación de los requisitos de tiempo esperados para el despliegue del modelo en escenarios del mundo real.
- Resuma los hallazgos en una conclusión breve, con foco en los desafíos u optimizaciones computacionales relevantes para su modelo.
- En un cuaderno (
Entregables¶
- Un repositorio de GitHub con la estructura siguiente:
- data/ - ai_ready/ - notebooks/ - Clustering_Analysis.ipynb - AutoML_Hyperparameter_Tuning.ipynb - Model_Training_Assessment.ipynb - Computational_Time_Analysis.ipynb - Research_Relevance.md - README.md - Actualice el archivo
README.mdde la tarea anterior con una sección adicional sobre el ML clásico, los hallazgos clave e instrucciones claras para reproducir los análisis, nombrando qué cuaderno correr. Añada la versión del repositorio en un archivo de texto como parte de la entrega.
Criterios de calificación¶
- Ensayo de relevancia (10 %): claridad del planteamiento del problema, enfoque de ML apropiado, explicación del impacto y declaración de uso de IA.
- Análisis de agrupamiento (20 %) (solo si el proyecto es de clasificación): profundidad del análisis de agrupamiento, buenas prácticas de evaluación y claridad de las conclusiones.
- Comparación de modelos y ajuste de hiperparámetros (20 %): modelo de referencia establecido, variedad de familias de modelos probadas (incluido el gradient boosting), calidad de la búsqueda con Optuna o en malla, y claridad del reporte.
- Ingeniería del entrenamiento y evaluación del modelo (30 %): robustez de la estrategia de entrenamiento, una elección de validación cruzada consciente de la correlación y justificada, uso de bootstrapping y una discusión clara de los resultados.
- Análisis del tiempo de cómputo (10 %): análisis exhaustivo de los tiempos de entrenamiento y despliegue, y conclusiones sobre la eficiencia computacional.
- Documentación y claridad del código (10 %): explicaciones claras, legibilidad del código y apego a las buenas prácticas.
Esta tarea aplica los métodos del aprendizaje automático clásico a datos geocientíficos reales, y profundiza su comprensión práctica de la selección, el ajuste y la evaluación honesta de modelos.