Le domaine de la vidéo et de l’image n’a pas encore connu un véritable « moment GPT », même si les capacités des modèles multimodaux progressent régulièrement.

Lors d’une récente émission sur la chaîne Redpoint AI, Oriol Vinyals, vice-président de la recherche chez Google DeepMind et codirigeant de Google Gemini, a indiqué que, même si les modèles actuels peuvent traiter plusieurs modalités de manière combinée et permettre des interactions naturelles, la compréhension purement visuelle n’atteint pas encore la profondeur des modèles de langage.

▷ Les méthodes d’entraînement existantes ont déjà intégré des données vidéo et d’image : le modèle fait preuve d’une bonne compréhension de longs contextes et de capacités d’édition intermodale, mais les progrès relèvent davantage d’une fusion progressive que d’une percée explosive.

▷ Le véritable « moment GPT » devrait désigner la capacité à extraire, à partir de seules données visuelles, un sens complet et une logique causale : or, la compréhension actuelle du contenu visuel par ces modèles reste encore assez superficielle et manque de la chaîne de raisonnement en profondeur propre aux modèles de langage.🪁