Una colección de cuadernos y scripts explorando diversos modelos y técnicas de NLP.
Este repositorio contiene una serie de experimentos y desarrollos en el campo del Procesamiento del Lenguaje Natural (NLP). Incluye implementaciones de modelos de lenguaje a nivel de carácter y palabra, embeddings personalizados, y un bot de preguntas y respuestas, utilizando principalmente PyTorch y Gensim. Los datos de entrenamiento provienen de textos de H.P. Lovecraft.
Aquí hay un resumen de los principales cuadernos y scripts incluidos:
- ⌨️ Modelo de Lenguaje (Carácter): Implementación de un modelo de lenguaje basado en caracteres, inspirado en Neuromancer.
- Archivo:
3_Neuromancer_modelo_lenguaje_char.ipynb
- Archivo:
- 📖 Modelo de Lenguaje (Palabra): Desarrollo de un modelo de lenguaje a nivel de palabra, también basado en Neuromancer.
- Archivo:
4_modelo_lenguaje_Neuromancer.ipynb
- Archivo:
- 🤖 Bot de Preguntas y Respuestas: Un bot simple capaz de responder preguntas basado en un contexto dado.
- Archivo:
6_bot_qa_Dimas_Torres (1).ipynb
- Archivo:
- 🔗 Embeddings Personalizados con Gensim: Creación y exploración de embeddings de palabras personalizados utilizando la biblioteca Gensim.
- Archivo:
NLP-Ej2- Custom embedding con Gensim.ipynb
- Archivo:
- 🏆 Desafío 1: Cuaderno relacionado con el primer desafío del curso o proyecto.
- Archivo:
Desafio_1_DimasTorres (1).ipynb
- Archivo:
- 🔧 Utilidades de PyTorch: Script con funciones auxiliares para trabajar con PyTorch en los diferentes cuadernos.
- Archivo:
torch_helpers.py
- Archivo:
Los modelos de lenguaje y otros experimentos en este repositorio fueron entrenados o utilizan textos del autor H.P. Lovecraft. Estos archivos se encuentran en la carpeta HPL-ext/.