Ce qu'il serait bien, si tu as la possibilité d'accéder à l'information depuis le modèle choisi, c'est de connaitre le nombre de couches GPU maximum du modèle. Pour pouvoir ajuster à la baisse, quand on a un modèle plus grand que notre VRAM et qu'on l'offload sur le CPU via la RAM.
Ainsi, au lieu de saturer notre VRAM (999 couches), avec un modèle qui de toute façon débordera sur la RAM, on pourrait faire l'inverse et récupérer de la VRAM en baissant le nombre de couches GPU. Afin que l'espace ainsi récupéré de VRAM, serve pour y mettre le contexte de 32K (~2Go) et le cache KV en q4_0 (aussi 1 à 2go), plutôt qu'ils aillent se charger en RAM.
Or, comment savoir de combien baisser le nombre de couches, si on ne connait pas le nombre de couches maximum du modèle choisi ?
Cela permettrait de faire moins d'essais pour trouver le 'sweet spot' de compromis.
Ce qu'il serait bien, si tu as la possibilité d'accéder à l'information depuis le modèle choisi, c'est de connaitre le nombre de couches GPU maximum du modèle. Pour pouvoir ajuster à la baisse, quand on a un modèle plus grand que notre VRAM et qu'on l'offload sur le CPU via la RAM.
Ainsi, au lieu de saturer notre VRAM (999 couches), avec un modèle qui de toute façon débordera sur la RAM, on pourrait faire l'inverse et récupérer de la VRAM en baissant le nombre de couches GPU. Afin que l'espace ainsi récupéré de VRAM, serve pour y mettre le contexte de 32K (~2Go) et le cache KV en q4_0 (aussi 1 à 2go), plutôt qu'ils aillent se charger en RAM.
Or, comment savoir de combien baisser le nombre de couches, si on ne connait pas le nombre de couches maximum du modèle choisi ?
Cela permettrait de faire moins d'essais pour trouver le 'sweet spot' de compromis.