Skip to content

Latest commit

 

History

14 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

LABORATORIO LLM

En este laboratorio vamos a explorar los LLM(Large Language Model), el cual es un tipo de modelo de inteligencia artificial diseñado para procesar y generar texto en varios idiomas. Estos modelos están entrenados en grandes cantidades de datos textuales para aprender la estructura, el significado y las reglas gramaticales del lenguaje. Pueden realizar una variedad de tareas relacionadas con el procesamiento del lenguaje natural, como traducción automática, generación de texto, respuesta a preguntas, resumen de texto y más.

PRIMER PROGRAMA

Este código muestra un ejemplo de cómo usar la biblioteca langchain para crear un "chain" (cadena) que utiliza un "Large Language Model" (LLM) de OpenAI para responder preguntas basadas en una plantilla de pregunta y respuesta. Las bibliotecas instaladas fueron:

  1. openai: proporciona acceso a estos modelos a través de una API que permite a los desarrolladores utilizar la capacidad de generación de texto de estos modelos en sus propias aplicaciones.
  2. langchain: Langchain es una biblioteca que proporciona herramientas y utilidades para trabajar con modelos de lenguaje y cadenas de texto en Python codigo: promt.py image

image

SEGUNDO PROGRAMA

Este código muestra cómo utilizar la biblioteca langchain para construir un pipeline de procesamiento de lenguaje natural (NLP) que extrae información de un sitio web y luego utiliza un modelo de lenguaje de OpenAI para responder preguntas sobre el contenido extraído. La bibliotecas instladas fueron

  1. Beautiful Soup: Es una biblioteca de Python que se utiliza para extraer datos de archivos HTML y XML.
  2. chromadb: Base de datos de vectores de embedding diseñada para almacenar y recuperar vectores de representación semántica de texto.
  3. tiktoken: Rápido algoritmo BPE desarrollado por OpenAI
  4. langchainhub: Módulo que proporciona acceso a diferentes modelos y recursos para el procesamiento de lenguaje natural (NLP). codigo: rag.py

image

image

TERCER PROGRAMA

Este código carga documentos de texto, divide el texto en fragmentos, genera embeddings para estos fragmentos, indexa los embeddings en Pinecone y luego realiza búsquedas de similitud de documentos en el índice creado. Para el archivo conocimientos.txt que usa el codigo la información esta relacionada a ataques DDoS. La biblioteca instalada fue:

  1. langchain-pinecone: extensión específica entre la biblioteca langchain y el servicio Pinecone para la indexación y búsqueda eficiente de vectores de embedding generados a partir de texto codigo pineconRag.py

image

image

image

image

image

image

image

CUARTO PROGRAMA

el código implementa un sistema de pregunta-respuesta para el código fuente utilizando la técnica de Retriever-Augmented Generation (RAG), que combina recuperación de información y generación de texto para proporcionar respuestas más precisas y relevantes. Este script muestra cómo utilizar las bibliotecas de procesamiento de texto y aprendizaje automático para realizar la carga de documentos, la generación de embeddings, la indexación y búsqueda de información, así como la participación en conversaciones basadas en texto. codigo: codeRag.py

image

image

AUTOR

Nicolás Castro Jaramillo

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Used by

Contributors

Languages