-
Notifications
You must be signed in to change notification settings - Fork 1
6. Conclusiones
-
Hemos aprendido a manejar un clúster y saber aprovechar los recursos disponibles del mismo para el procesamiento de los datos.
-
Hemos conseguido mejorar las predicciones realizadas por las heurísticas en aproximadamente 15 segundos. Por lo tanto, aplicar aprendizaje automático para predecir los tiempos de espera de las aeronaves puede ser una buena aproximación al problema. No obstante, el margen de mejora sigue siendo bastante amplio. En la siguiente sección explicamos cómo podrían mejorarse los resultados obtenidos.
-
Los modelos probabilísticos no han resultado eficientes para resolver los problemas propuestos, puesto que han presentado sesgos significativos. Puede deberse, por un lado, a que los modelos elegidos y/o la implementación utilizada resultan insuficientes para la complejidad de los datos. Por otro lado, también creemos que la razón puede deberse a que nuestras variables no sean suficientemente explicativas, sobre todo para los problemas de clasificación por día de la semana y categoría de turbulencia.
-
En cuanto a los modelos, nos centraremos en seguir desarrollando el Transformer, ya que es un modelo con muy buena generalización y que aprovecha la naturaleza de serie temporal de los datos. Un paso muy importante está en una búsqueda profunda de hiperparámetros adecuados, y una reorganización de las capas de la parte neuronal, fijándonos en qué funcionó. Asimismo, el Transformer por partes, todavía en desarrollo, consideramos que también tiene mucho potencial.
-
Nuestro conjunto de datos abarca menos de tres meses. Aunque contamos con aproximadamente 150.000 filas, estas se reducen únicamente a unos 5.500 vuelos distintos. Este volumen de datos no es excesivamente grande y ya hemos comentado que muchos de los puntos de espera están infrarrepresentados. Esto afecta directamente a las métricas. Consideramos que para que un modelo capte la dinámica de un aeropuerto necesita muchos más ejemplos. Esto es especialmente importante para que los modelos puedan predecir mejor los valores atípicos: los tiempos de espera grandes, que son los que principalmente empeoran nuestras métricas.
-
Por otro lado también podría considerarse la opción de ampliar la región de los puntos de espera a las vías enteras en las que se sitúan estos puntos. Esto es debido a que las aeronaves no siempre se sitúan próximas a los puntos: hay algunos de ellos cuyas vías sobre las que se sitúan son significativamente más largas. Esto hace que en ocasiones suceda que los aviones se salgan de la región establecida por nosotros y esperen en puntos incluso más cercanos a la pista. De ahí que ciertos tiempos de espera sean largos después del último mensaje detectado.