Robots can already fold laundry, make espresso, clean kitchens, and assemble things. The harder problem is getting them to do those tasks reliably, for long periods of time, without a human babysitting them. At Startup School 2026, @physical_int cofounder @chelseabfinn explains what it takes to build general-purpose robots that work in the real world. She shares how reinforcement learning pushed robot throughput up 2x, how their systems can run autonomously for hours, and why she believes robotics is entering its GPT era: moving from specialized models toward general-purpose systems that can work across tasks, robots, and environments. 00:00 — The State of Physical Intelligence 01:23 — What It Takes to Make Robots Useful 05:11 — The Reliability Problem 07:43 — Reinforcement Learning for Robotics 09:35 — Learning From Failures 12:43 — Training Robots to Improve Themselves 14:21 — Can a Robot Work for 13 Hours Straight? 17:36 — Why Robots Need Memory 21:22 — Building a General-Purpose Robot 25:02 — From Fine-Tuning to Out-of-the-Box Models 27:35 — Training on All the Data 30:20 — One Model That Beats the Specialists 31:21 — Compositional Generalization 37:49 — The GPT Era of Robotics 39:49 — Q&A

Aug 12, 2026 · 3:43 PM UTC

37
45
320
113,101
Sort replies: Relevant Recent Liked
Love seeing thoughtful work like this.
1
158
most people don't realize the real challenge isn't programming robots to perform tasks, but making them do so in complex environments withou
211
the reliability problem is the real robotics problem
36
Le problème avec ce type de présentation n’est pas que Physical Intelligence mente sur ses résultats. Les démonstrations existent : leurs robots peuvent réellement plier du linge, préparer des expressos, nettoyer une cuisine, assembler des objets et, dans certains cas, exécuter ces tâches de manière autonome pendant plusieurs heures. Ce qui est survendu, c’est la portée de ces résultats. Ces capacités sont obtenues au terme d’un processus d’entraînement lourd et coûteux : collecte massive de données robotiques, téléopération et démonstrations humaines, pré-entraînement, fine-tuning, reinforcement learning, corrections et répétitions. Le reinforcement learning peut ensuite améliorer fortement la robustesse et le débit d’une politique déjà entraînée. Mais exécuter avec fiabilité une tâche réelle dans un contexte pour lequel le système a été entraîné n’est pas disposer d’une compétence générale transposable dans le monde réel. Le problème apparaît lorsqu’on change véritablement le contexte : autre environnement, disposition différente, objets inconnus, morphologie ou dynamique du robot différente, nouvelles contraintes physiques, événements imprévus ou tâche absente de l’entraînement. Les capacités acquises ne se transposent pas automatiquement. Il faut généralement de nouvelles données, de l’adaptation, du fine-tuning ou un nouvel entraînement. Et encore une fois, c'est très coûteux. C’est une distinction essentielle lorsqu’on parle de « monde réel ». Un vrai robot manipulant de vrais objets n’est pas, à lui seul, une démonstration de généralisation au monde réel. Le monde réel signifie précisément l’ouverture du contexte : variations non prévues, événements rares, changements de friction ou de charge, objets inconnus, erreurs qui s’accumulent, interruptions, interactions humaines et situations qui ne figuraient pas dans les données d’entraînement. Il faut donc distinguer : Exécuter une tâche physique réelle après un entraînement massif et transposer spontanément cette compétence dans un contexte réellement différent faire face à une situation imprévue et y acquérir une nouvelle compétence intégrer durablement cette nouvelle expérience sans perdre les compétences précédemment acquises continuer ainsi pendant des jours, des mois ou des années en accumulant une histoire propre. C’est ici qu’apparaît une autre limite fondamentale : l’apprentissage continu. Les architectures neuronales actuelles restent confrontées à l’oubli catastrophique. Lorsqu’on modifie leurs paramètres pour apprendre successivement de nouvelles tâches ou distributions, les nouvelles acquisitions peuvent dégrader les anciennes. Replay, régularisation, architectures modulaires ou mémoires externes permettent de réduire le problème, mais il n’existe pas aujourd’hui de solution générale permettant à un robot d’apprendre continuellement tout au long de son existence, sans réentraînement lourd et sans dégradation de ses acquis. Enfin, eux n'ont pas la solution. Même l’affirmation selon laquelle ces robots peuvent fonctionner « autonomously for hours » doit donc être correctement interprétée. Faire fonctionner pendant dix heures une politique devenue robuste dans son domaine appris est une remarquable démonstration de robustesse d’exécution. Ce n’est pas démontrer qu’un robot peut s’adapter et apprendre pendant dix heures dans un monde ouvert qui change. Le passage vers des systèmes plus généralistes est réel. Les modèles peuvent couvrir davantage de tâches, de robots et de situations qu’auparavant. Mais plus généraliste ne signifie pas général.
1
66
Love that they used laundry as the test. Growing up in dry cleaning, the hard part was doing it right every day. Reliability is the product.
2
229
exactly. a 30 second demo proves basically nothing
1
93
Organizations adopting reinforcement learning typically succeed when they integrate it into broader strategic goals in real-world applications.
1
89
"Without a human babysitting them" changes the problem from capability to failure recovery. A demo needs one successful run. Eight hours unattended means handling every abnormal state the robot itself creates — a sleeve caught on a drawer handle, a portafilter seated wrong, a counter that no longer resembles anything in training because a previous grasp slipped. The scarce data isn't successful trajectories, it's recovery-from-arbitrary-failure trajectories, and that's the hardest kind to collect: you have to make it fail first, and fail in enough different ways to matter.
211
YC, you’ll have to watch this speech. YC and Steve Hilton @SteveHiltonx should have a talk about the future of California. He’s got all the right ideas and he’s calling for a decade of building for California in this great speech.
🚨LIVE NOW: My first major address of the general election. c-span.org/event/campaign-20…
10
"Without a human babysitting them" is the whole problem, and it shows up in software agents too. I gave mine 53 tools instead of 3. It called zero of them, answered from memory, wrong, on 4 runs out of 4. Not one error raised. Reliability isn't the capability. It's whether the failure is visible.
385
After artificial intelligence, it is an era of physical intelligence it seems
88
imo you guys should invite @Lindon_Gao and @YorkYang5050 to give a talk - YC 16 alumni and knowing what I know I think they’re gonna do well long term
92
one bad grasp near a hot stove and 13 unsupervised hours is the headline. software agents fail for free. robots don't get that deal.
99