Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

17 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

PrimerProyectoIndividualHenry

Índice

Tabla de contenido
  1. Introducción
  2. Objetivo
  3. Pila de Tecnologías
  4. ETL
  5. EDA
  6. Modelo ML
  7. Video

Introducción

El presente proyecto tiene que ver con la puesta en práctica de todo lo aprendido en la carrera de Data de Henry. Busco personalmente la apropiación de los conocimientos de ETL, EDA y Machine Learning. Es un desafío para mi enfrentarme a este Dataset y lograr realizar un modelo de Machine Learning funcional.

Objetivo

Poner en práctica los conceptos aprendidos durante la carrera de Data Scienst y sobreponerme a los errores de código y dificutades propias del desarrollo del proyecto. Adquirir las habilidades necesarias que me permitan desempeñarme satisfactoriamente en el mundo laboral.

  • Transformación y Limpieza de Datos: Optimizar el proceso de ETL con el fin de entender mejor los datos y tomar decisiones acertadas que me permitan conservar los datos de la mejor manera posible, en pro de cumplir con la creación de las funciones solicitadas y el modelo requerido.

  • Modelo ML: Desarrollar un modelo que recomiende videojuegos con base en la similitud del coseno.

Pila de Tecnologías

Visual Studio Code Jupyter Notebook Python NumPy Pandas Matplotlib scikit-learn FastAPI Git GitHub Markdown

Proceso de ETL

Para ETL consideré cada conjunto de datos por aparte. Aplicando transformaciones donde el tipo de cada columna fuera el mismo. Estudié cada columna y sus relaciones para entender que tipo de información me iba a encontrar y fui de a poco diseñando en mi mente una posible solución con el propósito de crear las funciones que el proyecto propone. En cada uno de los tres conjuntos de datos use la función .json_normalize y procedí a eliminar nulos en el caso donde se aplicaba, a conservar los años en aquellas columnas donde la información era fechas y a desanidar columnas con datos anidados. De esa misma manera los registros duplicados fueron eliminados. Invito a revisar, para conocer los detalles, los tres archivos notebook creados para tal proceso.

EDA

Durante el desarrollo del proceso de EDA mis esfuerzos se orientaron hacia la consecución de la información justa y necesaria para la realización de las funciones y el modelo de recomendación. Por favor revisar el archivo Notebook donde se adelantó este proceso.

Modelo ML

El modelo de ML recibe como parámetro un valor de item_id y entrega una recomendación de 5 video juegos. Se utilizó la similitud del coseno para llevar a feliz término el modelo. Se usan los tres conjuntos de datos y se crea un dataframe nuevo con las columnas title y genres para proceder a la creación de los vectores y aplicar la similitud del coseno, al final se lleva a cabo la función de recomendacion. Para el despliegue en Render se crea un dataframe con item_id y recommended para poder adelantar el despliegue.

Git: Link del repositorio de GitHub (https://github.com/willflorez/machine-learning1.0) .

Despliegue en Render: Con Render se despliega la API. API en ejecución. En la web se puede hacer el uso de las funciones y del modelo de recomendación.

Video

About

ETL, EDA, API, Machine Learnig1.0

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Used by

Contributors

Languages