Concept LLM & agents
Multimodal
Que veut dire « Multimodal » dans le jargon de l’IA ?
Capacité d’un modèle à traiter plusieurs modalités, par exemple texte et image, dans une même interaction.
Autres formes : multimodal.
Un modèle multimodal traite plusieurs types de contenus dans une même interaction — texte et image le plus souvent — sans passer par un pipeline séparé pour chaque modalité.
Exemple d’usage : Pour générer des descriptions de photos, deux pistes ont été comparées : un modèle de vision local dédié au captioning, ou l'appel à une API multimodale externe si un résultat plus robuste était nécessaire.
Laisser un commentaire