-
Notifications
You must be signed in to change notification settings - Fork 0
1.7 Embedded LLM Guide
Version: 1.0.0-beta.2 Dernière mise à jour: 2026-01-27
ClioDeck peut fonctionner avec des modèles de langage (LLM) embarqués, permettant une utilisation hors-ligne complète pour la génération de texte. Cette fonctionnalité utilise node-llama-cpp pour exécuter des modèles au format GGUF directement dans l'application.
┌─────────────────────────────────────────────────────────────┐
│ Mode de fonctionnement │
├─────────────────────────────────────────────────────────────┤
│ │
│ Provider: AUTO (par défaut) │
│ │
│ 1. Ollama disponible ? │
│ └── OUI → Utiliser Ollama │
│ └── NON → 2. Modèle embarqué disponible ? │
│ └── OUI → Utiliser modèle embarqué │
│ └── NON → Erreur "Aucun LLM disponible" │
│ │
└─────────────────────────────────────────────────────────────┘
| Fonctionnalité | Ollama | Modèle embarqué |
|---|---|---|
| Génération de texte | Oui | Oui |
| Embeddings (RAG) | Oui | Non |
| Streaming | Oui | Oui |
| Performance | Meilleure | Correcte |
Important : Les modèles embarqués ne supportent pas la génération d'embeddings. Ollama reste nécessaire pour :
- L'indexation des PDFs
- L'indexation des sources primaires (Tropy)
- La recherche sémantique (RAG)
Le modèle embarqué ne sert qu'à la génération de réponses lorsque Ollama n'est pas disponible.
| Caractéristique | Valeur |
|---|---|
| Taille | ~469 Mo |
| Contexte | 32 768 tokens |
| Langues | 29+ (dont FR, EN, DE) |
| Performance | Rapide sur CPU |
| Cas d'usage | Usage général, machines modestes |
| Caractéristique | Valeur |
|---|---|
| Taille | ~1.04 Go (1066 Mo) |
| Contexte | 32 768 tokens |
| Langues | 29+ (dont FR, EN, DE) |
| Performance | Correcte sur CPU |
| Cas d'usage | Meilleure qualité, machines plus puissantes |
- Ouvrez ClioDeck
- Cliquez sur Paramètres (icône engrenage)
- Accédez à la section LLM embarqué
- Sélectionnez le modèle souhaité dans la liste
- Cliquez sur Télécharger
- Attendez la fin du téléchargement (barre de progression)
Le modèle est téléchargé depuis Hugging Face et stocké dans :
-
macOS :
~/Library/Application Support/cliodeck/models/ -
Linux :
~/.config/cliodeck/models/
Dans les paramètres LLM, choisissez la stratégie :
| Option | Comportement |
|---|---|
| Auto (défaut) | Ollama si disponible, sinon embarqué |
| Ollama | Force l'utilisation d'Ollama uniquement |
| Embarqué | Force l'utilisation du modèle embarqué |
En mode Auto, ClioDeck choisit automatiquement :
- Ollama démarré → Chat utilise Ollama
- Ollama arrêté, modèle téléchargé → Chat utilise le modèle embarqué
- Rien de disponible → Message d'erreur explicatif
L'interface affiche le provider actif :
-
Ollama (gemma2:2b)- Ollama avec le modèle gemma2:2b -
qwen2.5-0.5b (embarqué)- Modèle embarqué actif -
Aucun LLM disponible- Ni Ollama ni modèle embarqué
Quand vous posez une question avec RAG activé :
| Étape | Provider |
|---|---|
| Génération de l'embedding de la question | Ollama (requis) |
| Recherche dans le vector store | - |
| Génération de la réponse | Ollama ou Embarqué |
Si Ollama n'est pas disponible pour les embeddings, le RAG ne peut pas fonctionner. Le chat bascule alors en mode "conversation simple" sans contexte documentaire.
Le modèle embarqué utilise des paramètres optimisés pour les réponses académiques :
{
maxTokens: 2048, // Longueur max de la réponse
temperature: 0.1, // Faible pour des réponses précises
topP: 0.85, // Nucleus sampling
contextSize: 4096 // Fenêtre de contexte effective (modèle supporte 32768 max)
}Note : Le modèle Qwen2.5 supporte jusqu'à 32 768 tokens, mais ClioDeck utilise une fenêtre de 4096 tokens pour optimiser la mémoire et la vitesse.
Le modèle Qwen utilise le format ChatML :
<|im_start|>system
Tu es un assistant académique spécialisé...
<|im_end|>
<|im_start|>user
Ma question...
<|im_end|>
<|im_start|>assistant
| Modèle | Premier chargement | Chargement suivant |
|---|---|---|
| Qwen2.5-0.5B | 5-10 secondes | 2-3 secondes |
| Qwen2.5-1.5B | 10-20 secondes | 5-8 secondes |
Sur un CPU moderne (Apple M1/M2, Intel i5+) :
| Modèle | Tokens/seconde |
|---|---|
| Qwen2.5-0.5B | 15-25 t/s |
| Qwen2.5-1.5B | 8-15 t/s |
| Modèle | RAM approximative |
|---|---|
| Qwen2.5-0.5B | 1-1.5 Go |
| Qwen2.5-1.5B | 2-3 Go |
Symptôme : Message "Embedded LLM not initialized"
Causes possibles :
- Modèle non téléchargé
- Fichier GGUF corrompu
-
node-llama-cppnon installé
Solutions :
- Re-téléchargez le modèle depuis les paramètres
- Vérifiez que le fichier existe dans le dossier
models/ - Consultez les logs de l'application
Causes possibles :
- Modèle trop gros pour la machine
- Autre application utilisant le CPU intensivement
Solutions :
- Passez au modèle Qwen2.5-0.5B (plus léger)
- Fermez les applications gourmandes en ressources
Ce message apparaît quand :
- Ollama n'est pas démarré
- ET aucun modèle embarqué n'est téléchargé
Solutions :
- Démarrez Ollama :
ollama serve - OU téléchargez un modèle embarqué dans les paramètres
Rappel : Le modèle embarqué ne génère PAS d'embeddings.
Pour les embeddings (indexation, RAG), vous devez :
- Installer Ollama
- Télécharger un modèle d'embeddings :
ollama pull nomic-embed-text - Démarrer Ollama :
ollama serve
| Critère | Ollama | Embarqué |
|---|---|---|
| Installation | Séparée | Intégrée |
| Modèles disponibles | Nombreux | 2 (Qwen) |
| Embeddings | Oui | Non |
| Qualité génération | Excellente | Bonne |
| Mode hors-ligne | Non (service) | Oui |
| Mémoire | Séparée | Partagée avec l'app |
| Configuration | Flexible | Simple |
Utilisez Ollama quand :
- Vous avez besoin du RAG complet
- Vous voulez choisir parmi de nombreux modèles
- Vous avez suffisamment de RAM (16+ Go)
Utilisez le modèle embarqué quand :
- Ollama n'est pas installé/disponible
- Vous êtes hors-ligne
- Vous n'avez pas besoin du RAG (questions simples)
- node-llama-cpp - Bibliothèque d'exécution
- Qwen2.5 - Famille de modèles
- GGUF Format - Format de modèle
- Hugging Face - Source des modèles