Skip to content

Multimodal

martialzinsou edited this page Sep 21, 2026 · 4 revisions

Multimodal (images, vidéos, audio, voix)

KarenOS permet d'envoyer autre chose que du texte : pièces jointes (images, vidéos, audio, fichiers) et saisie vocale directe.

Pièces jointes

Dans la barre de saisie du chat, le bouton trombone donne accès à quatre choix :

  • Image… — fichiers photos et images.
  • Vidéo… — fichiers vidéo.
  • Audio… — fichiers audio.
  • Fichier… — tout autre type de fichier.

Les fichiers sélectionnés apparaissent comme vignettes au-dessus de la zone de saisie (pastilles supprimables) avant l'envoi. Une fois le message envoyé, ils sont affichés dans la bulle du message ; un clic droit permet de révéler le fichier dans le Finder.

Saisie vocale (parler à l'application)

Le bouton micro démarre la dictée :

  1. macOS demande les autorisations Microphone et Reconnaissance vocale (décrites dans Info.plist).
  2. L'app écoute et affiche la transcription en direct (une rondelle rouge + le texte reconnu).
  3. Au clic sur stop (ou à la fin de la phrase), le texte est inséré dans le champ de saisie : il peut être modifié avant l'envoi.

Techniquement, la dictée utilise le framework Speech de macOS (SFSpeechRecognizer) en mode local (requiresOnDeviceRecognition = true) quand le modèle vocal est installé sur la machine.

Quand le modèle « voit » vraiment une image

Un modèle de langage ne comprend une image que s'il s'agit d'un modèle vision (famille Llava / Qwen-VL…), accompagné d'un fichier *.mmproj posé à côté du fichier *.gguf.

  • Au chargement d'un modèle, l'app détecte automatiquement la présence d'un .mmproj dans le dossier du modèle.
  • Si présent, les images jointes sont transmises dans le format OpenAI vision :
    {"type":"image_url","image_url":{"url":"data:image/png;base64,…"}}
    
  • Sans .mmproj, l'image reste une pièce jointe affichée dans la conversation ; seule la partie texte part vers le modèle.

Les modèles fournis par défaut dans la Boutique (Qwen, SmolLM, Phi) sont textuels : la vision n'est donc pas active tant qu'un modèle vision n'est pas installé avec son .mmproj.

Récapitulatif

Entrée Outil Où
Texte champ de saisie barre du chat
Image trombone → Image… barre du chat
Vidéo trombone → Vidéo… barre du chat
Audio trombone → Audio… barre du chat
Fichier trombone → Fichier… barre du chat
Voix (dictée) bouton micro barre du chat

Voir aussi : Inférence d'un message, Agents autonomes, Limites & évolutions.

Clone this wiki locally