Modèle multimodal
Réponse directe
Un modèle capable de traiter plusieurs types de contenu.
Explication détaillée
Un modèle multimodal peut combiner du texte, des images, de l’audio ou de la vidéo. Il peut, par exemple, lire une photo, écouter une question et produire une réponse écrite.
Exemple
Photographier un tableau et demander à l’IA d’en expliquer les données.
Analogie
Un assistant qui peut lire, regarder et écouter au lieu de travailler uniquement avec du texte.
Erreurs fréquentes
Supposer que toutes les modalités ont le même niveau de précision.
Termes liés
Dernière mise à jour : 22/07/2026 · Rédaction : Alban Speckaert
