-
Notifications
You must be signed in to change notification settings - Fork 1
Notebooks y datos
Adrian Marino edited this page Aug 27, 2023
·
7 revisions
Dataset de libros extraído de Amazon US.
- Raw pre-processing
-
build-datasets
- Pre-procesamiento.
- Selección de features.
- Construcción de un datasets de items e interacciones de usuarios.
-
data-loading
- Preprosesamiento final.
- Filtro de item e interaciones según un mínimo de popularidad.
- Carga de datos via SQL en la base de datos de RecSys.
-
similarity-matrix-jobs
- Testing de jobs:
- svd_distance_matrix_job
- nmf_distance_matrix_job
- Ambos jobs son instancias de SurpriseSimilarityMatrixJob.
- SurpriseSimilarityMatrixJob consulta las interacciones via REST a RecSys.
- Predice los ratings de las interacciones faltantes.
- Cosntruye una matrix de ratings completa. Es decir, esta contien las interacciones actuales y las predichas.
- Calcula las similitudes user-user/item-item, solo para un numero N de usuarios e items vecinos. Esto disminuir los tiempo de ejecución y evita tener en tienta usuario e item muy lejanos.
- Finalmente, crear o actualiza via REST (En RecSys) las entidades Recommender para cada modelos SVD y NMF, junto con sus propias matrices de similitud (SimilarityMatrix, entidades asociada a Recommender).
- Las entidades SimilarityMatrix son versionadas cada vez que correr cada job. Al correr un job, se crea una nueva versión de las matrices. Al finalizar el proceso, se borra la versión anterior quendado disponibilizada la nueva versión. Es posible mantener una ventana de versiones, pero por el momento no es necesario.
- Los jobs solo se ejecutan cuando se encuentran nuevas interacciones, para evitar re-procesamiento innecesario.
- Testing de jobs:
Datasets de zapatillas extraído de Amazon US.
- build-datasets: Construcción de un datasets de items e interacciones de usuarios en base a files generados en la etapa de scrapping de datos.
-
data-loader: Carga de datos en la base de datos de RecSys Abstracción
Repository.
Datasets de películas con scoring personalizado.
- preprocessing
- data-loader: Carga de datos en la base de datos de RecSys.
RecSys REST client testing Administrar users, items, interacciones y matrices de distancia via RecSys REST API.