-
Notifications
You must be signed in to change notification settings - Fork 0
Multimodal
KarenOS permet d'envoyer autre chose que du texte : pièces jointes (images, vidéos, audio, fichiers) et saisie vocale directe.
Dans la barre de saisie du chat, le bouton trombone donne accès à quatre choix :
- Image… — fichiers photos et images.
- Vidéo… — fichiers vidéo.
- Audio… — fichiers audio.
- Fichier… — tout autre type de fichier.
Les fichiers sélectionnés apparaissent comme vignettes au-dessus de la zone de saisie (pastilles supprimables) avant l'envoi. Une fois le message envoyé, ils sont affichés dans la bulle du message ; un clic droit permet de révéler le fichier dans le Finder.
Le bouton micro démarre la dictée :
- macOS demande les autorisations Microphone et Reconnaissance vocale (décrites dans
Info.plist). - L'app écoute et affiche la transcription en direct (une rondelle rouge + le texte reconnu).
- Au clic sur stop (ou à la fin de la phrase), le texte est inséré dans le champ de saisie : il peut être modifié avant l'envoi.
Techniquement, la dictée utilise le framework Speech de macOS (SFSpeechRecognizer) en mode local (requiresOnDeviceRecognition = true) quand le modèle vocal est installé sur la machine.
Un modèle de langage ne comprend une image que s'il s'agit d'un modèle vision (famille Llava / Qwen-VL…), accompagné d'un fichier *.mmproj posé à côté du fichier *.gguf.
- Au chargement d'un modèle, l'app détecte automatiquement la présence d'un
.mmprojdans le dossier du modèle. - Si présent, les images jointes sont transmises dans le format OpenAI vision :
{"type":"image_url","image_url":{"url":"data:image/png;base64,…"}} - Sans
.mmproj, l'image reste une pièce jointe affichée dans la conversation ; seule la partie texte part vers le modèle.
Les modèles fournis par défaut dans la Boutique (Qwen, SmolLM, Phi) sont textuels : la vision n'est donc pas active tant qu'un modèle vision n'est pas installé avec son
.mmproj.
| Entrée | Outil | Où |
|---|---|---|
| Texte | champ de saisie | barre du chat |
| Image | trombone → Image… | barre du chat |
| Vidéo | trombone → Vidéo… | barre du chat |
| Audio | trombone → Audio… | barre du chat |
| Fichier | trombone → Fichier… | barre du chat |
| Voix (dictée) | bouton micro | barre du chat |
Voir aussi : Inférence d'un message, Agents autonomes, Limites & évolutions.
- Accueil
- Architecture
- Inférence d'un message
- Modèles et Boutique
- Agents autonomes
- Multimodal
- Compétences
- Persistance
- Code source
- Construction & lancement
- Dépannage
- Limites & évolutions
- Home
- Architecture
- Inference of a message
- Models and Store
- Autonomous agents
- Multimodal
- Skills
- Persistence
- Source code
- Build & launch
- Troubleshooting
- Limits & roadmap
Main repository — created by Martial Zinsou