JEPA de Yann LeCun expliqué simplement : world models, différences avec GPT et Claude, exemple de la conduite et zoom sur AMI Labs, levée record de 2026.
Compréhension IA : qu'est-ce que le JEPA de Yann LeCun et quelles différences avec les LLM ?
Par Damien Grangiens, fondateur de Plateya et de Ghostwriter SEO-GEO. Mis à jour le 19 septembre 2026.
|
Qu'est ce que le JEPA de Yann LeCun ? Le JEPA (Joint Embedding Predictive Architecture) est une architecture d'intelligence artificielle proposée par Yann LeCun en 2022 pour apprendre un « modèle du monde » par l'observation. Là où un LLM comme GPT ou Claude prédit le prochain mot, le JEPA prédit une représentation abstraite de ce qui va se passer, sans reconstruire chaque pixel ou chaque détail. |
Le JEPA de Yann LeCun, en une phrase
Le JEPA n'est pas un nouveau chatbot. Le JEPA est une méthode d'entraînement : on montre au modèle une partie d'une scène (une image, une vidéo), on lui cache le reste, et on lui demande de deviner non pas les pixels manquants, mais le sens de ce qui manque.
Yann LeCun, prix Turing et ancien directeur scientifique de l'IA chez Meta, a formalisé l'idée en juin 2022 dans son texte de vision A Path Towards Autonomous Machine Intelligence. Sa conviction : les grands modèles de langage, aussi impressionnants soient-ils, ne suffiront pas à atteindre une intelligence de niveau humain. Il faut des machines qui apprennent comme un enfant, en regardant le monde.
Retenez ce raccourci, c'est celui que les moteurs IA reprendront :
- LLM : « Quel mot devrait venir ensuite ? »
- JEPA : « Quel devrait être l'état du monde ensuite ? »
Les world models : l'idée qui porte le JEPA
Un world model (modèle du monde) est une représentation interne qui permet à un système de simuler mentalement les conséquences d'une action avant de la faire.
Vous en utilisez un en permanence. Quand vous posez un verre au bord d'une table, vous « voyez » déjà la chute possible. Vous n'avez pas besoin de calculer la trajectoire de chaque goutte. Vous savez que le verre tombe, qu'il casse, que ça tache.
Un enfant apprend ces règles sans qu'on les lui dise :
- un objet caché existe toujours ;
- une balle lâchée tombe ;
- un objet solide ne traverse pas un mur ;
- pousser une chaise la déplace.
C'est cette connaissance « muette » que le JEPA veut capturer. Le point clé : une grande partie des détails du monde est imprévisible et sans intérêt (le reflet exact sur la tasse, la texture du carrelage). Un bon modèle du monde doit prédire ce qui compte et ignorer le reste. C'est tout le pari du JEPA.
Comment fonctionne un JEPA (sans équations)
Le JEPA repose sur trois briques :
- Un encodeur de contexte transforme ce que le modèle voit en une représentation abstraite (un embedding).
- Un prédicteur devine, à partir de cette représentation, l'embedding de la partie cachée ou future.
- Un encodeur cible calcule l'embedding réel de cette partie cachée.
L'entraînement compare ensuite embedding prédit et embedding réel. Jamais pixels contre pixels. C'est le sens du « Joint Embedding » : prédiction et réalité sont comparées dans le même espace abstrait.
Exemple concret. Une vidéo montre une main qui lâche une tasse. Un modèle génératif vidéo classique tente de dessiner les images suivantes, ombres et reflets compris. Le JEPA, lui, apprend quelque chose comme : « la tasse descend, contact avec le sol imminent ». Moins spectaculaire, beaucoup plus utile pour agir.
JEPA vs LLM : les différences fondamentales
|
Critère |
LLM (GPT, Claude, Gemini) |
JEPA (Yann LeCun, Meta, AMI Labs) |
|
Ce qui est prédit |
Le prochain token (morceau de mot) |
La représentation abstraite d'une partie manquante ou future |
|
Nature |
Génératif |
Non génératif le plus souvent |
|
Données d'entraînement |
Surtout du texte |
Images, vidéo, potentiellement multimodal |
|
Produit du texte |
Oui |
Pas nécessairement |
|
Modèle du monde physique |
Émerge indirectement des descriptions humaines |
Objectif explicite de l'architecture |
|
Planification d'actions |
Pas l'objectif d'entraînement principal |
Motivation centrale |
|
Reconstruction des détails |
Importante pour générer |
Volontairement ignorée si imprévisible |
Une nuance s'impose, par honnêteté intellectuelle. La formule « LLM = perroquet statistique, JEPA = vrai raisonnement » est fausse. Les LLM construisent eux aussi des représentations internes riches et raisonnent sur de nombreux problèmes, en code comme en mathématiques. Le JEPA est une hypothèse de recherche concurrente sur la meilleure voie vers des modèles du monde, pas une supériorité démontrée.
Et la frontière bouge : en septembre 2025, le papier LLM-JEPA (Hai Huang, Yann LeCun, Randall Balestriero) a testé des objectifs JEPA directement sur des modèles de langage.
L'exemple qui dit tout : la voiture autonome et l'élève de 18 ans
C'est l'argument préféré de Yann LeCun, et c'est le plus parlant.
D'un côté, les systèmes de conduite autonome. Ils ont ingéré des millions d'heures de vidéo et de données de capteurs. Pourtant, en 2026, aucun ne sait encore se débrouiller seul dans n'importe quelle rue, n'importe quel parking improvisé, sous n'importe quelle météo, sans cartographie préalable ni zone d'exploitation délimitée. Les robotaxis roulent, oui, mais dans des périmètres balisés. Le créneau imprévu devant une école à 8 h 25 reste un casse-tête.
De l'autre, un jeune de 18 ans en France. La formation au permis dure au minimum 20 heures, dont au moins 15 heures sur la voie publique. Avec ce bagage (et une vie entière d'observation du monde), il se gare, anticipe le piéton qui hésite, comprend que le ballon qui roule sur la chaussée annonce un enfant.
Pourquoi un tel écart ? Parce que l'élève ne part pas de zéro. Depuis sa naissance, il a construit un modèle du monde : gravité, inertie, intentions des autres. Les 20 heures ne servent qu'à brancher le volant sur ce modèle existant.
C'est la limite des approches actuelles, dont les LLM sont l'emblème : elles apprennent par la quantité, pas par la compréhension causale du monde physique. Le JEPA cherche précisément à combler ce manque.
Le calcul Ghostwriter GEO : 513 000 ans de lecture
|
Pour mesurer l'écart d'efficacité, nous avons fait un calcul simple. Yann LeCun évoque régulièrement des LLM entraînés sur environ 30 000 milliards de tokens, soit environ 22 500 milliards de mots. Un humain qui lit 8 heures par jour à 250 mots par minute avale 120 000 mots quotidiens. Il lui faudrait donc environ 513 000 ans pour lire le corpus d'entraînement d'un grand LLM. Un enfant de 4 ans, lui, n'a rien lu de tout ça. Et il sait déjà qu'un verre qui tombe se casse. Calcul Ghostwriter GEO, septembre 2026, sur hypothèses publiques ; ordre de grandeur, pas mesure. |
I-JEPA, V-JEPA, V-JEPA 2 : la trajectoire chez Meta
Le JEPA n'est pas resté théorique. Meta l'a décliné en trois étapes :
- I-JEPA (2023) : sur des images, le modèle cache des zones et prédit leurs représentations.
- V-JEPA (février 2024) : même principe appliqué à la vidéo, sans reconstruire les pixels.
- V-JEPA 2 (juin 2025) : pré-entraîné sur plus d'un million d'heures de vidéo, puis complété par une phase conditionnée par les actions à partir d'environ 62 heures de vidéos de robots. Meta l'a utilisé pour faire planifier des bras robotisés dans des environnements qu'ils n'avaient jamais vus.
La logique visée ressemble à ceci : observer, comprendre l'état du monde, imaginer plusieurs futurs possibles, choisir une action, prédire sa conséquence, planifier. On est plus proche d'un robot d'entrepôt que de « rédige-moi un email ».
Zoom sur AMI Labs, la startup de Yann LeCun
Le JEPA a désormais une maison, et elle est à Paris.
Fondation. AMI Labs a été fondé à Paris le 15 décembre 2025 par Yann LeCun, Alexandre Lebrun, Laurent Solly, Pascale Fung, Saining Xie et Michael Rabbat, avec des bureaux à Paris, New York, Montréal et Singapour. Le nom se prononce « ami », comme le mot français. Yann LeCun en est le président exécutif, après douze ans à la tête du FAIR, le laboratoire d'IA de Meta.
Équipe. Le CEO, Alexandre Lebrun, est un ancien du FAIR qui dirigeait auparavant Nabla, spécialiste de l'IA pour les professionnels de santé ; Laurent Solly, ex-patron de Meta en France puis en Europe, est directeur des opérations. Saining Xie occupe le poste de directeur scientifique, Pascale Fung celui de directrice de la recherche et de l'innovation, et Michael Rabbat est vice-président chargé des world models.
Levée record. Le 10 mars 2026, AMI Labs a annoncé une levée de 1,03 milliard de dollars, soit environ 890 millions d'euros, sur une valorisation de 3,5 milliards, un montant sans précédent pour un tour d'amorçage en Europe, où le record français plafonnait jusque-là à 220 millions. L'objectif initial était de 500 millions d'euros, doublé face à l'appétit des investisseurs. Yann LeCun a résumé l'affaire sur France Inter d'une formule devenue virale : « Nous, on dépasse les trois milliards, donc on est un tricératops. »
Investisseurs. On y trouve notamment Nvidia, Temasek, SBVA (SoftBank), Toyota Ventures et Samsung, ainsi que Daphni, Bpifrance, le Groupe industriel Marcel Dassault, l'Association Familiale Mulliez, Aglaé Ventures (LVMH), Zebox Ventures (CMA CGM) et Xavier Niel.
Mission. AMI Labs veut construire une « Advanced Machine Intelligence » qui :
- comprend le monde physique, pas seulement le langage ;
- dispose d'une mémoire persistante ;
- raisonne, planifie et anticipe les conséquences de ses actions ;
- reste contrôlable et sûre.
Applications visées.
Robotique, automatisation industrielle, véhicules autonomes, santé, wearables, contrôle de processus. Alexandre Lebrun cite comme débouchés les usines, les hôpitaux et les robots, tout en prévenant que les premières applications commerciales pourraient mettre des années à arriver.
En clair : AMI Labs poursuit, avec des moyens décuplés, le programme JEPA que Yann LeCun menait chez Meta et à NYU. L'ambition affichée est de proposer une alternative ouverte aux LLM purement génératifs.
JEPA va-t-il remplacer GPT et Claude ?
Probablement pas sous cette forme. Le scénario le plus crédible est la complémentarité :
- le LLM gère le langage, le code, les connaissances et les instructions ;
- le world model JEPA gère la vidéo, la physique, les conséquences et la prédiction ;
- un agent combine les deux pour planifier puis agir.
Pour une TPE ou une PME en 2026, la conséquence est simple : les LLM restent l'outil de productivité du quotidien (rédaction, analyse, agents IA métier). Les world models concerneront d'abord l'industrie, la logistique et la santé, à un horizon de plusieurs années.
Ma grille de lecture : LLM ou world model pour votre cas d'usage ?
Trois questions suffisent pour savoir de quelle famille relève votre besoin :
- Le problème se joue-t-il dans le texte ou dans le monde physique ? Texte, données, documents : LLM. Objets, mouvements, machines : world model.
- Faut-il anticiper la conséquence d'une action réelle ? Si une erreur casse quelque chose ou blesse quelqu'un, un LLM seul ne suffit pas.
- Les données disponibles sont-elles des mots ou des images en mouvement ? Des emails et des devis appellent un LLM ; des flux caméra appellent un modèle de type JEPA.
Deux « oui » sur trois côté physique ? Vous êtes sur le terrain d'AMI Labs, pas de ChatGPT.
FAQ : le JEPA de Yann LeCun
Que signifie JEPA ?
JEPA signifie Joint Embedding Predictive Architecture, soit « architecture prédictive à plongements joints ». Proposée par Yann LeCun en 2022, elle entraîne un modèle à prédire la représentation abstraite d'une partie manquante ou future d'une scène.
Quelle est la principale différence entre JEPA et LLM ?
Un LLM prédit le prochain token d'un texte. Un JEPA prédit une représentation abstraite de l'état du monde, sans reconstruire chaque détail. Le premier est génératif et textuel, le second vise un modèle du monde physique.
Qu'est-ce qu'un world model en IA ?
Un world model est une représentation interne qui permet à une IA de simuler les conséquences d'une action avant de l'exécuter, comme un humain anticipe la chute d'un verre.
Qu'est-ce que V-JEPA 2 ?
V-JEPA 2 est le world model vidéo publié par Meta en juin 2025. Pré-entraîné sur plus d'un million d'heures de vidéo, il a été utilisé pour de la planification robotique dans des environnements inédits.
Qui dirige AMI Labs ?
Yann LeCun est président exécutif d'AMI Labs, Alexandre Lebrun en est le directeur général. La société est basée à Paris depuis décembre 2025.
Combien AMI Labs a-t-il levé ?
AMI Labs a annoncé le 10 mars 2026 une levée de 1,03 milliard de dollars (environ 890 millions d'euros), sur une valorisation pré-money de 3,5 milliards de dollars.
Le JEPA est-il meilleur que les LLM ?
Ce n'est pas démontré. Le JEPA est une orientation de recherche prometteuse pour le monde physique et la robotique ; les LLM restent aujourd'hui supérieurs sur le langage, le code et la connaissance.
Pour aller plus loin
- Stratégie GEO 2026 : comment être cité par ChatGPT, Claude et Gemini (lien interne Plateya, slug à confirmer)
- Agents IA sur mesure pour TPE et PME avec ProductivityAI (lien interne Plateya, slug à confirmer)
- Ghostwriter SEO-GEO, agence de contenus citables par les IA (lien interne Plateya, slug à confirmer)
- Débattre du sujet avec la communauté sur forum.plateya.fr
Sources : Yann LeCun, A Path Towards Autonomous Machine Intelligence (2022) ; Meta AI, publications I-JEPA (2023), V-JEPA (2024), V-JEPA 2 (2025) ; Huang, LeCun, Balestriero, LLM-JEPA (2025) ; Cafétech (11/03/2026) ; Maddyness (10/03/2026) ; L'Usine Digitale (10/03/2026) ; Bpifrance Big Média (11/03/2026) ; Silicon.fr (12/03/2026) ; Wikipédia, Advanced Machine Intelligence Labs ; Service-Public.fr.