# Ejercicio 01: Recuperación de Información Basado en el Modelo de Matriz Término-Documento

En este ejercicio, trabajaremos con un corpus de documentos en formato JSON para implementar un sistema de Recuperación de Información basado en el modelo de espacio vectorial. Seguirás los siguientes pasos:

## Paso 1: Determinar un vocabulario
El primer paso es cargar el corpus en formato JSON, extraer los textos de los documentos y crear el vocabulario.

In [36]:
import json

datos = []
with open(file='../data/01tdmatrix_corpus.json', mode='r', encoding='utf-8') as file:
    datos = json.load(file)

In [37]:
print(datos[0]['text'].lower())

la inteligencia artificial continúa avanzando rápidamente, transformando sectores como la salud y las finanzas. las empresas están adoptando algoritmos de aprendizaje automático para mejorar la eficiencia. sin embargo, el desafío principal sigue siendo garantizar que las decisiones basadas en datos sean justas y no perpetúen sesgos. la ética es fundamental en este contexto.


In [38]:
print(datos[0]['text'].lower().split())

['la', 'inteligencia', 'artificial', 'continúa', 'avanzando', 'rápidamente,', 'transformando', 'sectores', 'como', 'la', 'salud', 'y', 'las', 'finanzas.', 'las', 'empresas', 'están', 'adoptando', 'algoritmos', 'de', 'aprendizaje', 'automático', 'para', 'mejorar', 'la', 'eficiencia.', 'sin', 'embargo,', 'el', 'desafío', 'principal', 'sigue', 'siendo', 'garantizar', 'que', 'las', 'decisiones', 'basadas', 'en', 'datos', 'sean', 'justas', 'y', 'no', 'perpetúen', 'sesgos.', 'la', 'ética', 'es', 'fundamental', 'en', 'este', 'contexto.']


In [39]:
vocab = set(datos[0]['text'].lower().split())
print(vocab)
print(len(vocab))

{'datos', 'continúa', 'avanzando', 'sean', 'sectores', 'principal', 'de', 'y', 'no', 'salud', 'siendo', 'decisiones', 'en', 'contexto.', 'embargo,', 'finanzas.', 'algoritmos', 'perpetúen', 'que', 'sin', 'garantizar', 'este', 'mejorar', 'la', 'adoptando', 'automático', 'sigue', 'es', 'desafío', 'rápidamente,', 'aprendizaje', 'ética', 'justas', 'inteligencia', 'sesgos.', 'eficiencia.', 'empresas', 'transformando', 'están', 'para', 'como', 'el', 'basadas', 'fundamental', 'las', 'artificial'}
46


In [40]:
vocab = []
for i in range(0,len(datos)):
    vocab.extend(datos[i]['text'].lower().replace(',','').replace('.','').split())

vocab = set(vocab)
print(len(vocab))
print(vocab)

230
{'continúa', 'otros', 'uno', 'donde', 'personas', 'profesionales', 'decisiones', 'sino', 'acceder', 'se', 'personalizadas', 'tecnología', 'promueven', 'creciente', 'realistas', 'libros', 'perpetúen', 'experiencia', 'este', 'herramientas', 'consume', 'transacciones', 'contenido', 'enfermedades', 'crear', 'ubicación', 'es', 'telemedicina', 'mundos', 'ética', 'aumento', 'empresas', 'médicos', 'están', 'nuevas', 'para', 'entretiene', 'saludables', 'mercado', 'accesibles', 'enfoque', 'personal', 'plataformas', 'fundamental', 'literarios', 'impulsa', 'artificial', 'portátiles', 'avanzando', 'desarrollo', 'principal', 'tecnologías', 'digitales', 'virtuales', 'está', 'vida', 'integral', 'streaming', 'educativa', 'no', 'bienestar', 'transformado', 'prometedor', 'en', 'ha', 'medicina', 'utilizan', 'avanzadas', 'ficción', 'solo', 'cursos', 'distancia', 'mejores', 'rápidos', 'facilitando', 'series', 'populares', 'escenas', 'su', 'humanidad', 'mejorar', 'permitiendo', 'compramos', 'desafío', 'i

## Paso 2: Calcular una matriz término-documento
Una vez que tenemos el vocabulario, el siguiente paso es construir una **matriz término-documento**, que nos permitirá representar cada documento como un vector en el espacio de términos.

In [41]:
def tdtransform(text):
    doc = []
    for word in vocab:
        if word in text.lower().replace(',','').replace('.','').split():
           doc.append(1)
        else:
            doc.append(0)
    return doc

In [42]:
tdmatrix = []

for i in range(0,len(datos)):
    doc = tdtransform(text=datos[i]['text'])
    tdmatrix.append(doc)

print(tdmatrix[0])

[1, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 1, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 1, 0, 1, 0, 1, 0, 1, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 1, 0, 1, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 1, 1, 0, 0, 1, 0, 0, 1, 0, 0, 1, 0, 1, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 1, 0, 0, 0, 1, 0, 0, 0, 0, 0, 1, 1, 1, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 1, 0, 0, 1, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 1, 0, 0, 1, 0, 1, 0, 0, 1, 1, 0, 0, 0, 0, 0, 0, 0, 1, 1, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0]


## Paso 3: Obtener una representación de una _query_ en el espacio término-documento
Ahora vamos a representar una _query_ como un vector en el mismo espacio de términos que hicimos para el corpus.

In [72]:
queries = ["inteligencia artificial en medicina",
           "beneficios de la educacion a distancia",
           "realidad aumentada en videojuegos",
           "desarrollo personal y habitos saludables",
           "futuro del comercio electronico",
           "tecnologias en cine moderno",
           "competencias de e-sports",
           "diagnostico con dispositivos portatiles",
           "literatura de ciencia ficcion",
           "plataformas de streaming"
           ]

tdqueries = []

for i in range(0,len(queries)):
    
    query = tdtransform(text=queries[i])
    tdqueries.append(query)
print(tdqueries[0])
print(tdmatrix[1].count(1))
print(tdqueries[1].count(1))

[0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0]
44
5


## Paso 4: Calcular la distancia entre la _query_ y todos los documentos del corpus
Al obtener la distancia Jaccard entre la _query_ y cada documento del corpus, calculamos la relevancia que tiene cada documento para la _query_ 

La formula para calcular la distancia Jaccard es la: |A ∩ B| / |A ∪ B| que tambien se puede rerpesentar como  |A ∩ B| / |A| +|B|-|A ∩ B|, trabajaremos con las segunda representación.


In [158]:
def distanceJaccard(docs, queries):
    jaccardMatrix = []
    for i in range(len(docs)):
        distanceMatrix = []
        for j in range(len(queries)):
            intersection = 0
            for k in range(len(docs[0])):   
                # Con el condicional se realiza la interseccion entre los elementos de la matriz termino-documento
                # y la matriz queries que contiene las consultas en el espacio de la matriz termino-documento 
                # y utilizamos el contador intersection para saber cual es el numero total de intersecciones.   
                if docs[i][k] == 1 and queries[j][k] == 1:
                    intersection += 1
            # Para la union necesitamos la cantidad de terminos que contiene el documento segun la matriz termino-documento
            # y de igual forma la cantidad de terminos que se encuentran en la consulta en el espacio de la matriz termino-documento
            # y se le resta la interseccion que fue previamente calculada.
            union = docs[i].count(1) + queries[j].count(1) - intersection
            # Se calcula la distancia segun la formula
            distance = intersection / union
            #Se agrega en otra matriz para un mejor orden
            distanceMatrix.append(round(distance, 3))
        jaccardMatrix.append(distanceMatrix)
        
    return jaccardMatrix

searchMatrix = distanceJaccard (tdmatrix,tdqueries)
distanceJaccard (tdmatrix,tdqueries)




[[0.064, 0.041, 0.02, 0.02, 0.0, 0.021, 0.021, 0.0, 0.021, 0.021],
 [0.067, 0.065, 0.091, 0.043, 0.0, 0.022, 0.068, 0.022, 0.022, 0.022],
 [0.022, 0.044, 0.022, 0.0, 0.023, 0.023, 0.023, 0.023, 0.023, 0.047],
 [0.0, 0.119, 0.0, 0.0, 0.0, 0.0, 0.023, 0.023, 0.023, 0.023],
 [0.0, 0.067, 0.022, 0.022, 0.0, 0.023, 0.022, 0.023, 0.023, 0.07],
 [0.07, 0.068, 0.022, 0.022, 0.023, 0.023, 0.023, 0.0, 0.048, 0.023],
 [0.022, 0.067, 0.022, 0.093, 0.0, 0.023, 0.022, 0.0, 0.023, 0.022],
 [0.045, 0.068, 0.022, 0.022, 0.023, 0.023, 0.023, 0.048, 0.023, 0.023]]

## Paso 5: Entregar los resultados de la búsqueda al usuario
A partir de la _query_, debemos indicar al usuario cuáles documentos son los más relevantes. Se debe presentar la información en orden de relevancia.

In [159]:
rows = len(searchMatrix)
cols = len(searchMatrix[0])
rankingMatrix= []
dicRanking = {}
#Creamos un diccionario para saber el numero de documento en el cual existe mayor relevancia segun la consulta
for j in range(0,cols):
    print(f"Query {j+1}")
    for i in range(0,rows):
        dicRanking.update({f"Doc {i+1}": searchMatrix[i][j]})
    #Ordenamos segun el orden de relevancia
    dicRanking = dict(sorted(dicRanking.items(), key=lambda item: item[1], reverse=True))

    print(f"{dicRanking}\n")


Query 1
{'Doc 6': 0.07, 'Doc 2': 0.067, 'Doc 1': 0.064, 'Doc 8': 0.045, 'Doc 3': 0.022, 'Doc 7': 0.022, 'Doc 4': 0.0, 'Doc 5': 0.0}

Query 2
{'Doc 4': 0.119, 'Doc 6': 0.068, 'Doc 8': 0.068, 'Doc 7': 0.067, 'Doc 5': 0.067, 'Doc 2': 0.065, 'Doc 3': 0.044, 'Doc 1': 0.041}

Query 3
{'Doc 2': 0.091, 'Doc 6': 0.022, 'Doc 8': 0.022, 'Doc 7': 0.022, 'Doc 5': 0.022, 'Doc 3': 0.022, 'Doc 1': 0.02, 'Doc 4': 0.0}

Query 4
{'Doc 7': 0.093, 'Doc 2': 0.043, 'Doc 6': 0.022, 'Doc 8': 0.022, 'Doc 5': 0.022, 'Doc 1': 0.02, 'Doc 3': 0.0, 'Doc 4': 0.0}

Query 5
{'Doc 6': 0.023, 'Doc 8': 0.023, 'Doc 3': 0.023, 'Doc 7': 0.0, 'Doc 2': 0.0, 'Doc 5': 0.0, 'Doc 1': 0.0, 'Doc 4': 0.0}

Query 6
{'Doc 6': 0.023, 'Doc 8': 0.023, 'Doc 3': 0.023, 'Doc 7': 0.023, 'Doc 5': 0.023, 'Doc 2': 0.022, 'Doc 1': 0.021, 'Doc 4': 0.0}

Query 7
{'Doc 2': 0.068, 'Doc 6': 0.023, 'Doc 8': 0.023, 'Doc 3': 0.023, 'Doc 4': 0.023, 'Doc 7': 0.022, 'Doc 5': 0.022, 'Doc 1': 0.021}

Query 8
{'Doc 8': 0.048, 'Doc 3': 0.023, 'Doc 4': 0.023, 'D