Texte
Les mots sont découpés en unités puis représentés par des nombres.
Plusieurs formes d’information
Une IA multimodale peut traiter plusieurs types d’entrée — texte, image, son ou vidéo — et parfois produire plusieurs types de sortie. Elle cherche des relations entre ces informations, mais ne perçoit pas le monde avec des yeux, des oreilles ou une expérience humaine.
Quatre situations
Choisissez un exemple. Le panneau sépare les informations utilisées, la tâche possible et le principal piège.
Une modalité, c’est quoi ?
Les mots sont découpés en unités puis représentés par des nombres.
Les pixels deviennent des motifs, contours, zones et relations spatiales.
L’onde est analysée selon son évolution, ses fréquences et son rythme.
Le système traite des images successives, parfois avec leur piste sonore.
Relier des informations différentes
Une image et sa légende ne se ressemblent pas physiquement. Pour les relier, le modèle transforme chacune en représentations numériques comparables.
Pendant l’entraînement, il apprend par exemple quelles légendes correspondent à quelles images. Des mécanismes d’attention peuvent ensuite mettre en relation certaines zones visuelles, certains instants sonores et certains mots.
Une proximité statistique n’est pas une compréhension complète. Le modèle peut associer correctement « chien » à une forme visuelle tout en se trompant sur la situation, la race ou l’intention de l’animal.
Entrée et sortie sont deux choses différentes
Expliquer une photo, lire un graphique ou répondre à une question visuelle.
Transformer une parole en texte puis organiser les informations.
Créer une image à partir d’une description.
Combiner ce qui est vu, entendu et l’ordre des événements.
Le système ne regarde pas toujours tout
Traiter chaque image d’une vidéo ou chaque milliseconde d’un son peut demander beaucoup de calcul et dépasser la fenêtre de contexte. L’outil peut donc sélectionner des images, compresser l’audio ou découper le document.
Un événement très bref, une note en petits caractères ou une phrase prononcée entre deux extraits peut alors être manqué.
Plusieurs entrées, plusieurs fragilités
Un mot est mal transcrit ou un objet mal identifié.
Le système relie l’information au mauvais passage ou au mauvais objet.
Le texte final masque l’erreur initiale par une formulation fluide.
Pour une demande plus fiable
Indiquez précisément quel fichier ou quelle zone doit être examinée.
Demandez de distinguer ce qui est visible, audible et déduit.
Pour un document, exigez les pages ou passages utilisés.
Pour une vidéo, précisez le moment ou la séquence importante.
Contrôlez les données personnelles présentes dans tous les fichiers.
Vérifiez le résultat dans la source originale avant toute décision.
Les limites à garder en tête
Une image ou une voix peut révéler un visage, une adresse, un état de santé ou une conversation privée.
Les erreurs du texte, de l’image ou du son peuvent se renforcer mutuellement.
La combinaison de plusieurs signaux peut donner une réponse très détaillée mais toujours incorrecte.
Un document ou une image peut contenir du texte que l’outil interprète comme une consigne inattendue.
Trois idées à corriger
Elle traite des représentations numériques et peut manquer le contexte évident pour une personne.
Les informations peuvent être incomplètes, contradictoires ou mal reliées.
Chaque modèle accepte des formats et produit des sorties précises, avec ses propres limites.
Sources techniques
Ces références expliquent les modèles multimodaux, leurs processeurs et l’alignement entre texte et image.
La suite logique
Comprendre une notion
Une étape courte et clairement reliée à ce que vous venez de lire.