Del ranking a la decisión: incertidumbre, comparación y selección de modelos en ciencia de datos

Ponente(s): Sergio Martín Nava Muñoz
En ciencia de datos es común comparar varios modelos mediante métricas de desempeño calculadas sobre un conjunto de prueba. Sin embargo, la selección del “mejor” modelo suele hacerse a partir de estimaciones puntuales, sin considerar explícitamente la incertidumbre asociada a la muestra de evaluación, la dependencia entre predicciones ni la multiplicidad de comparaciones. Esta práctica puede conducir a decisiones poco robustas, especialmente cuando las diferencias entre modelos son pequeñas. En esta plática se discuten herramientas estadísticas para complementar la comparación tradicional de modelos: intervalos de confianza para métricas de desempeño, análisis de diferencias pareadas, pruebas de hipótesis y ajustes por comparaciones múltiples. Se enfatiza que el objetivo no es reemplazar las métricas habituales, sino interpretarlas con mayor rigor, distinguiendo entre diferencias observadas y diferencias estadísticamente respaldadas. La presentación se ilustra con ejemplos de clasificación supervisada y métricas como exactitud, precisión, recall y F1-score. Se mostrará que distintos criterios pueden conducir a diferentes modelos líderes y que, en algunos casos, varios modelos pueden ser estadísticamente indistinguibles.