Tabla de contenido
El presente proyecto tiene que ver con la puesta en práctica de todo lo aprendido en la carrera de Data de Henry. Busco personalmente la apropiación de los conocimientos de ETL, EDA y Machine Learning. Es un desafío para mi enfrentarme a este Dataset y lograr realizar un modelo de Machine Learning funcional.
Poner en práctica los conceptos aprendidos durante la carrera de Data Scienst y sobreponerme a los errores de código y dificutades propias del desarrollo del proyecto. Adquirir las habilidades necesarias que me permitan desempeñarme satisfactoriamente en el mundo laboral.
-
Transformación y Limpieza de Datos: Optimizar el proceso de ETL con el fin de entender mejor los datos y tomar decisiones acertadas que me permitan conservar los datos de la mejor manera posible, en pro de cumplir con la creación de las funciones solicitadas y el modelo requerido.
-
Modelo ML: Desarrollar un modelo que recomiende videojuegos con base en la similitud del coseno.
Para ETL consideré cada conjunto de datos por aparte. Aplicando transformaciones donde el tipo de cada columna fuera el mismo. Estudié cada columna y sus relaciones para entender que tipo de información me iba a encontrar y fui de a poco diseñando en mi mente una posible solución con el propósito de crear las funciones que el proyecto propone. En cada uno de los tres conjuntos de datos use la función .json_normalize y procedí a eliminar nulos en el caso donde se aplicaba, a conservar los años en aquellas columnas donde la información era fechas y a desanidar columnas con datos anidados. De esa misma manera los registros duplicados fueron eliminados. Invito a revisar, para conocer los detalles, los tres archivos notebook creados para tal proceso.
Durante el desarrollo del proceso de EDA mis esfuerzos se orientaron hacia la consecución de la información justa y necesaria para la realización de las funciones y el modelo de recomendación. Por favor revisar el archivo Notebook donde se adelantó este proceso.
El modelo de ML recibe como parámetro un valor de item_id y entrega una recomendación de 5 video juegos. Se utilizó la similitud del coseno para llevar a feliz término el modelo. Se usan los tres conjuntos de datos y se crea un dataframe nuevo con las columnas title y genres para proceder a la creación de los vectores y aplicar la similitud del coseno, al final se lleva a cabo la función de recomendacion. Para el despliegue en Render se crea un dataframe con item_id y recommended para poder adelantar el despliegue.
Git: Link del repositorio de GitHub (https://github.com/willflorez/machine-learning1.0) .
Despliegue en Render: Con Render se despliega la API. API en ejecución. En la web se puede hacer el uso de las funciones y del modelo de recomendación.
link al video explicativo [https://www.loom.com/share/44560780b5a94f229ede5b18300114c3?sid=1441e474-2bbf-412b-953e-29e8e20d6608]
