🤖 На AI Startup School от Y Combinator самым сильным докладом оказалась лекция про то, как устроены роботы.
YC впервые собрала своих 2500 студентов топовых CS-программ на разговор про AI - обычно на таких мероприятиях говорят про стартапы и питчи, но один из докладов сделала Chelsea Finn, профессор Stanford и сооснователь Physical Intelligence. Она объяснила, как в компании тренируют модель pi-zero: сначала на смеси данных с разных роботов, потом дообучают на аккуратно отобранных демонстрациях. В докладе был пример - робот учится складывать мятую одежду и повторяет это в незнакомых квартирах, с вещами, которые никогда раньше не видел.
Второй момент интереснее первого - роботов учат менять план прямо во время выполнения задачи по голосовой команде, а не только следовать инструкции со старта. "Сделай веганский сэндвич, без огурцов" - и робот на лету перестраивает движения, потому что языковые аннотации к каждому действию генерируют сами модели.
Jensen Huang еще на CES 2025 говорил, что "ChatGPT-момент для роботов уже здесь" - но это скорее маркетинг, чем факт. Модель pi-0.7 в апреле подняла успешность незнакомых задач с 5% до 95% при голосовых подсказках, и это впечатляет, но все еще далеко от общего прорыва уровня ChatGPT. Большинство в индустрии оценивает реальный момент в 3-5 лет вперед - и если прогноз верный, физический мир будет меняться так же быстро, как чат-боты в 2023, просто чуть позже, чем говорят на сцене.
И даже тогда дистрибуция будет медленнее. ChatGPT разошелся по миру за считанные месяцы, потому что это просто код на серверах. Робота нужно физически произвести и физически доставить - это совсем другая скорость масштабирования.
#robotics@rvnikita_blog #ai@rvnikita_blog #ycombinator@rvnikita_blog #chelsea_finn@rvnikita_blog