Le Big Bang
de l’IA Physique
9 annonces majeures en quelques jours. L’IA ne répond plus sur un chat — elle comprend, reconstruit et agit dans le monde réel.
Annonce 01 · Harvard
🔬 AutoScientist — Le labo qui ne dort jamais
La recherche scientifique souffre d’un problème fondamental : le chaos. Certaines pistes démarrent fort puis s’effondrent ; d’autres paraissent ennuyeuses pendant des semaines avant de déboucher sur un résultat majeur. AutoScientist, issu de Harvard, répond à ce défi avec une approche radicalement différente.
Au lieu d’un seul agent IA menant des expériences l’une après l’autre, AutoScientist organise une équipe décentralisée d’agents IA qui travaillent en parallèle — comme un labo miniature qui tourne 24h/24, sans pause café, sans réunion inutile.
Chaque agent peut lire l’état actuel du projet, voir ce qui a marché, ce qui a échoué, et proposer de nouvelles hypothèses. Un registre partagé des impasses évite de retester des pistes déjà explorées.
« Dans ce domaine, une amélioration de 2 à 3 % c’est déjà un bon papier scientifique. Alors 12,5 % sur la protéine Spike — c’est un saut. »— Analyse de la vidéo
Le code est disponible en open source dès maintenant — une excellente nouvelle pour les petits laboratoires aux budgets limités qui pourront désormais rivaliser avec les grands centres de recherche.
Annonce 02 · Nvidia
👁️ Locate Anything — Voir et trouver, tout, toujours
Vous lui donnez une image ou une vidéo, vous décrivez ce que vous cherchez en langage naturel — et il localise précisément chaque instance de cet objet, même dans des scènes encombrées, même quand il y en a dix dans le même cadre.
Image d’entrepôt + « colis endommagé » → tous les colis abîmés sont automatiquement encadrés.
Flux vidéo en temps réel + « personne avec sac rouge » → détection instantanée.
« Attrape la tasse bleue sur l’étagère du haut » — le robot sait exactement où regarder.
Capture d’écran + « bouton de validation » → localisation immédiate pour automatisation.
Au lieu de prédire les coordonnées d’une boîte chiffre après chiffre, Locate Anything utilise le Parallel Box Decoding : la boîte englobante entière est prédite en une seule étape — bien plus rapide et géométriquement cohérent.
Présenté à CVPR 2026 — en tendance #1 sur Hugging Face au moment de la publication.
Annonce 03 · Nvidia
🖼️ PiD — Du brouillon au 4K en une passe
Quand un modèle génère une image, il ne travaille pas directement sur les pixels : il produit d’abord un brouillon mathématique compressé. L’étape de décodage — transformer ce brouillon en vraie image haute résolution — était jusqu’ici lente et en deux temps.
512px → 2K en moins d’une seconde — soit 6× plus rapide que les meilleurs outils d’upscaling actuels, avec une qualité supérieure dans la majorité des comparaisons. Open source, compatible ComfyUI, Flux 2, Stable Diffusion 3.
- Restauration de vieilles photos en haute résolution
- Zoom sur images médicales ou satellites
- Pipeline de génération d’images professionnelles accéléré
- Nouveaux checkpoints SDXL et Qwen Image déjà disponibles
Annonce 04 · Nvidia + CVPR 2026
🏠 JenRecon — Votre smartphone comme scanner 3D professionnel
Vous filmez une pièce avec votre téléphone. JenRecon en reconstruit une scène 3D complète — pas un nuage de points approximatif, mais un mesh 3D complet avec des matériaux physiquement réalistes. Changez la lumière, modifiez la couleur d’un mur, déplacez un meuble.
Le code n’est pas encore disponible, mais le papier technique est en ligne — et quand un sujet obtient son propre workshop à la plus grande conférence de vision par ordinateur au monde, c’est que le domaine est en train d’exploser.
Annonce 05
🎮 Scope — Des jeux FPS générés par l’IA en temps réel
Vous lui donnez une image de départ et des actions de manette. Scope génère une vidéo qui répond à ces actions en temps réel : déplacement, visée, tir, rechargement, interaction avec l’environnement. C’est un world model conçu spécifiquement pour les jeux de tir à la première personne.
70 000 clips extraits de 7 jeux FPS différents, avec 10 types de signaux de contrôle. Le modèle apprend des patterns d’action entre les jeux — pas les mécaniques d’un seul titre. Code et dataset disponibles dès maintenant.
- Surpasse Matrix Game 3 et Human World 5 sur les benchmarks
- 70 000 clips en accès libre pour entraîner votre propre modèle
- Premier pas concret vers les moteurs de jeu génératifs
Annonce 06 · Nvidia — GTC Taipei, 1er juin 2026
🌌 Cosmos 3 — La brique fondatrice de l’IA Physique
« Le big bang de l’IA physique approche vite. »— Jensen Huang, PDG Nvidia — GTC Taipei, 1er juin 2026
Cosmos 3 est le modèle IA fondation open source qui réunit toutes les briques précédentes dans un seul système. L’IA ne doit plus seulement comprendre du texte ou des images — elle doit comprendre comment le monde réel fonctionne, le simuler, prédire ce qui se passe quand un objet bouge, quand un robot agit, quand une voiture tourne.
Poids du modèle, scripts d’entraînement, dataset synthétique — tout est en accès libre. Pour les start-ups en robotique, c’est une opportunité historique. Programmer des robots devient de moins en moins une affaire de spécialistes.
- Texte, images, vidéos, son ambiant : un seul système pour tout
- Mouvement de robots et données d’action humaine inclus
- Développement de robots facilité pour start-ups et labos
- Compatible avec les workflows de simulation industrielle
Annonce 07
🔺 TriSplat — La 3D directement exploitable pour la physique
Les Gaussian Splats sont très populaires pour reconstruire des scènes 3D à partir d’images (visites virtuelles, immobilier…). Problème : ces nuages de points ne sont pas directement exploitables pour la physique — collisions, navigation robotique, moteur de jeu. Il fallait d’abord convertir, et cette conversion prenait parfois des centaines de secondes.
Reconstruction → conversion en mesh → parfois 100s+ de traitement. Deux étapes, deux outils.
Utilise directement des primitives triangulaires. La scène reconstruite est immédiatement un objet 3D, prêt pour Blender, Unreal Engine ou Isaac Sim.
Code disponible dès aujourd’hui. Intégration directe dans tous les moteurs physiques majeurs.
Annonce 08 · Nvidia × Tsinghua × Toronto
🌍 Gamma World — Le monde virtuel multi-joueurs généré par l’IA
Les world models existants ne géraient qu’un seul joueur — un seul point de vue, un seul flux de contrôle. Gamma World brise cette limite : il génère un monde partagé dans lequel plusieurs entités agissent simultanément et indépendamment.
Deux joueurs se déplacent librement dans le même environnement. Quand le joueur 1 bouge, ça change ce que le joueur 2 voit — parce qu’ils partagent le même monde synthétique. L’IA génère les deux points de vue simultanément, en restant cohérente.
Le plus impressionnant : le modèle a été entraîné avec seulement deux joueurs mais généralise à quatre sans entraînement supplémentaire. Il n’a pas appris comment deux joueurs interagissent — il a appris un concept plus général : comment plusieurs agents partagent un monde cohérent.
Synthèse
🚀 Ce que tout cela signifie vraiment
En une semaine, ces neuf annonces ne sont pas des nouveautés isolées : ce sont des briques qui s’assemblent. Recherche autonome, vision précise, génération haute résolution, reconstruction 3D, world models multi-agents — chaque pièce complète les autres.
Depuis trois semaines, on observe un glissement profond : on ne parle plus de génération de contenu (texte, images, vidéo). On parle de génération de monde — des mondes qui commencent à obéir aux mêmes règles physiques que le nôtre. C’est le prérequis incontournable de la robotique humanoïde.
- L’IA de recherche découvre des résultats réels publiés dans Nature
- L’IA de vision localise n’importe quel objet dans n’importe quelle scène
- L’IA générative produit des images 4K en moins d’une seconde
- L’IA 3D reconstruit des pièces entières depuis un smartphone
- Les world models simulent des environnements multi-agents en temps réel
- Nvidia unifie tout cela dans Cosmos 3 — open source, accessible à tous
🎬 Regarder la vidéo complète

- 00:00 Introduction — 9 annonces, un fil rouge
- 01:00 AutoScientist (Harvard) — Recherche autonome par équipe d’agents IA
- 05:00 Locate Anything (Nvidia) — Vision et localisation en langage naturel
- 09:00 PiD (Nvidia) — Décodage pixel haute résolution en une passe
- 12:00 JenRecon (Nvidia) — Reconstruction 3D depuis smartphone
- 16:00 Scope — World model FPS jouable par l’IA
- 19:00 Cosmos 3 (Nvidia) — Modèle fondation pour l’IA physique
- 23:00 TriSplat — 3D physiquement exploitable en moins d’une seconde
- 26:00 Gamma World (Nvidia × Tsinghua × Toronto) — World model multi-agents
- 30:00 Synthèse — Ce que le big bang de l’IA physique signifie vraiment
🎓 Vous sentez que le fossé se creuse chaque semaine ?
Un programme complet pour comprendre et utiliser l’IA concrètement — dans votre travail, vos projets, votre vie. Chat GPT, Gemini, Claude, Grok, agents n8n… sans avoir besoin d’être développeur.
▶ Voir la vidéo complète