Benchmark LLMs Evaluation Pipeline
Este repositorio implementa un flujo automatizado para evaluar múltiples modelos de lenguaje (LLMs) y clasificarlos según la calidad de sus respuestas.
- Generación de respuestas: Cada modelo de la familia LLM genera respuestas a un conjunto de preguntas de prueba contenidas en
finetuning_dataset_test.json. - Ranking de respuestas: Un modelo evaluador clasifica las respuestas generadas para determinar su calidad.
- Almacenamiento de resultados:
model_answers_ranking.json: Contiene las preguntas y el ranking de modelos según su desempeño. Ejemplo:[ { "question": "¿Qué tipo de confusión se intenta evitar al utilizar 'HRV' para referirse a la HRV de 24 horas y no a la HRV a corto plazo?", "ranking": [ "JulianVelandia/Llama-3.2-1B-unal-instruct-ft-gguf/model-f16.gguf", "JulianVelandia/Llama-3.2-1B-unal-instruct-q-ft-gguf/model-f16.gguf+RAG", "JulianVelandia/Llama-3.2-1B-unal-instruct-ft-gguf/model-f16.gguf+RAG" ] } ]models_answers.json: Contiene las respuestas generadas por cada modelo. Ejemplo:{ "lmstudio-community/Llama-3.2-1B-Instruct-GGUF/Llama-3.2-1B-Instruct-Q8_0.gguf": [ { "question": "¿Qué tipo de confusión se intenta evitar al utilizar 'HRV' para referirse a la HRV de 24 horas y no a la HRV a corto plazo?", "answer": "La confusión se intenta evitar al considerar que la HRV de 24 horas puede ser utilizada como sinónimo de la HRV a corto plazo, lo que podría llevar a errores en la interpretación de los resultados.", "llm_answer": "" } ] }
Los resultados almacenados en model_answers_ranking.json y models_answers.json permiten analizar el desempeño de cada modelo en la tarea evaluada y comparar su calidad en la generación de respuestas.

