Para utilizar desse código, será necessário fazer a instalação do Ollama, instalar o modelo desejado e realizar as mudanças personalizáveis no código, como o modelo utilizado, template, documento pesquisado, etc. Todos esses pontos estarão destacados no código por comentários.
Para Linux, deve-se executar a seguinte linha de comando:
curl -fsSL https://ollama.com/install.sh | shPara instalação no Windows, baixe no site https://ollama.com/download/windows e execute o executável.
Após isso, o Ollama já é configurado para utilizar a GPU para rodar os modelos, baseado nessa lista de GPUs, que contém mais informações de compatibilidade: https://github.com/ollama/ollama/blob/main/docs/gpu.md
Para baixar um modelo do Ollama e executá-lo, segue-se o seguinte tutorial:
- Baixe o modelo:
ollama pull llama3
- Execute o modelo para teste:
ollama run llama3
Para utilizá-lo no código do notebook, é necessário apenas instalá-lo, sendo a execução realizada através do código.
- Criar ambiente para execução do código
$ python3 -m venv .venv
$ source .venv/bin/activate
$ pip install -r requirements.txt