
如果语言模型让 AI 学会了"说",那么大模型与机器人的结合,正试图让它学会"做"。具身智能的核心命题是:让一个物理实体在开放、动态的真实环境里感知、决策并执行。
移动已相对成熟,灵巧操作才是深水区:抓取柔性物体、装配精密零件、处理未见过的场景,都要求模型具备物理常识与强泛化。数据稀缺是最大瓶颈——互联网上没有足够的"动作数据"可供学习。
务实路径是先攻结构化场景(工厂搬运、仓储分拣、巡检),环境可控、任务明确、ROI 可算;再逐步走向商业服务与家庭。人形并非唯一形态,"合适的身体做合适的事"比追求双足更像人更重要。
大模型为机器人装上了会思考的大脑,但具身智能的圣杯,是让这具身体在混乱的真实世界里,稳定地把事情做成。
