Bienvenidos a mi portfolio de la materia Natural Language Processing.
Aquí encontrarán todos los desafíos realizados durante el curso, con una breve descripción de cada uno y acceso directo a los notebooks correspondientes.
Título: Vectorización de texto y modelo de clasificación Naïve Bayes
Descripción:
Se realizó la vectorización de textos utilizando representaciones clásicas como TF-IDF. Posteriormente, se entrenó un modelo de clasificación Naïve Bayes para categorizar textos en base a sus representaciones vectoriales.
Título: Entrenamiento y análisis de Word Embeddings
Descripción: Se entrenaron embeddings de palabras personalizados utilizando la librería Gensim sobre un nuevo dataset. Además, se exploraron términos de interés mediante pruebas de similitud, se plantearon tests de analogías y se graficaron los embeddings resultantes para analizar su distribución en el espacio vectorial.
Título: Modelado de Lenguaje
Descripción:
Se construyeron modelos de lenguaje basados en redes neuronales recurrentes, utilizando tanto LSTM como GRU, trabajando con tokenización a nivel de palabras. Se entrenaron los modelos para predecir secuencias de texto en corpus de tamaño reducido.
Título: Chatbot basado en Encoder-Decoder
Descripción:
Se trabajó con datos del challenge ConvAI2 para construir un bot conversacional en inglés. Se entrenó un modelo Encoder-Decoder capaz de generar respuestas a preguntas del usuario (QA), utilizando una arquitectura secuencia a secuencia.
- Cada desafío incluye el código desarrollado en formato Jupyter Notebook (.ipynb).
