Le problème avec ce type de présentation n’est pas que Physical Intelligence mente sur ses résultats.
Les démonstrations existent : leurs robots peuvent réellement plier du linge, préparer des expressos, nettoyer une cuisine, assembler des objets et, dans certains cas, exécuter ces tâches de manière autonome pendant plusieurs heures.
Ce qui est survendu, c’est la portée de ces résultats.
Ces capacités sont obtenues au terme d’un processus d’entraînement lourd et coûteux :
collecte massive de données robotiques, téléopération et démonstrations humaines, pré-entraînement, fine-tuning, reinforcement learning, corrections et répétitions.
Le reinforcement learning peut ensuite améliorer fortement la robustesse et le débit d’une politique déjà entraînée.
Mais exécuter avec fiabilité une tâche réelle dans un contexte pour lequel le système a été entraîné n’est pas disposer d’une compétence générale transposable dans le monde réel.
Le problème apparaît lorsqu’on change véritablement le contexte :
autre environnement, disposition différente, objets inconnus, morphologie ou dynamique du robot différente, nouvelles contraintes physiques, événements imprévus ou tâche absente de l’entraînement.
Les capacités acquises ne se transposent pas automatiquement. Il faut généralement de nouvelles données, de l’adaptation, du fine-tuning ou un nouvel entraînement.
Et encore une fois, c'est très coûteux.
C’est une distinction essentielle lorsqu’on parle de « monde réel ».
Un vrai robot manipulant de vrais objets n’est pas, à lui seul, une démonstration de généralisation au monde réel.
Le monde réel signifie précisément l’ouverture du contexte :
variations non prévues, événements rares, changements de friction ou de charge, objets inconnus, erreurs qui s’accumulent, interruptions, interactions humaines et situations qui ne figuraient pas dans les données d’entraînement.
Il faut donc distinguer :
Exécuter une tâche physique réelle après un entraînement massif
et
transposer spontanément cette compétence dans un contexte réellement différent
faire face à une situation imprévue et y acquérir une nouvelle compétence
intégrer durablement cette nouvelle expérience sans perdre les compétences précédemment acquises
continuer ainsi pendant des jours, des mois ou des années en accumulant une histoire propre.
C’est ici qu’apparaît une autre limite fondamentale : l’apprentissage continu.
Les architectures neuronales actuelles restent confrontées à l’oubli catastrophique.
Lorsqu’on modifie leurs paramètres pour apprendre successivement de nouvelles tâches ou distributions, les nouvelles acquisitions peuvent dégrader les anciennes.
Replay, régularisation, architectures modulaires ou mémoires externes permettent de réduire le problème, mais il n’existe pas aujourd’hui de solution générale permettant à un robot d’apprendre continuellement tout au long de son existence, sans réentraînement lourd et sans dégradation de ses acquis.
Enfin, eux n'ont pas la solution.
Même l’affirmation selon laquelle ces robots peuvent fonctionner « autonomously for hours » doit donc être correctement interprétée.
Faire fonctionner pendant dix heures une politique devenue robuste dans son domaine appris est une remarquable démonstration de robustesse d’exécution. Ce n’est pas démontrer qu’un robot peut s’adapter et apprendre pendant dix heures dans un monde ouvert qui change.
Le passage vers des systèmes plus généralistes est réel.
Les modèles peuvent couvrir davantage de tâches, de robots et de situations qu’auparavant.
Mais plus généraliste ne signifie pas général.