C'est quoi en fait la multimodalité pour les LLM ?
Texte, images, son : ce que la multimodalité change concrètement dans les use cases.
Alors, pour faire simple, la multimodalité, c’est quand un LLM (ou tout autre modèle d’IA) arrive à comprendre autre chose que du pur texte. Il peut analyser et traiter différentes modalités d’information, comme du texte et des images ou encore du son. Bref, il devient un vrai couteau suisse.
Un exemple : quand tu dictes un message à ton téléphone, le modèle se contente de retranscrire ce que tu dis. Mais, si quelqu’un d’autre parle en même temps que toi, il va retranscrire aussi ce que l’autre personne dit…
Avec un modèle multimodal, ça change tout : il peut théoriquement comprendre que quelqu’un d’autre est en train de parler, et ignorer ce qu’il “entend”. On passe d’une simple transcription aveugle à une compréhension plus fine du contexte sonore.
Autre exemple : avant, pour analyser une image ou un graphique avec du texte, on pouvait extraire le texte facilement, mais pour comprendre la structure d’un graphique ? Good luck. Maintenant, avec la capacité “vision” (comme celles qu’on trouve dans certains modèles récents), un modèle peut carrément comprendre les images. Par exemple, on pourrait détecter toutes les images comportant de la violence ou des tentatives d’effraction et déclencher une alerte quand c’est le cas.
Et au-delà du texte et des images : ces nouvelles possibilités vont bien plus loin. Les LLM multimodaux peuvent désormais extraire des données structurées à partir de sources non structurées : des PDFs, des présentations PowerPoint, voire de la vidéo. C’est un potentiel énorme pour tout ce qui touche aux bases de connaissances avec des docs aux données non structurées (hello les PPTX pleins de graphiques). 💼
Le dernier en date : Mistral et son modèle Pixtral le 11 septembre dernier. La startup française Mistral a sorti Pixtral en mode open source multimodal (texte + vision). Ce n’est pas le premier du genre, mais à l’échelle des modèles open source, il est clairement dans le top du classement aujourd’hui. Et ça fait plaisir de voir des modèles performants disponibles pour tous, plutôt que de laisser les gros modèles propriétaires fermés exploser les prix par token.
Alors voilà, la multimodalité, ce n’est pas juste un buzzword. C’est littéralement ce qui étend les capacités des LLM à beaucoup d’autres use cases.