v0.0.1-gptq-llama-cuda
·
20 commits
to main
since this release
Support Llama based models inference on GPU using GPTQ-for-llama
Support Llama based models inference on GPU using GPTQ-for-llama