草根影响力新视野 夜未央编译

当你要求机器人把马克杯放进橱柜时,看似简单的生活日常,对机器人而言却是一场极为复杂的考验。人类能轻松绕过座椅、避开台面杂物并打开正确的柜门,但机器人却必须仔细运算每一个动作细节与物理路径。这也解释了为什么现在的机器人在实验室示范中看起来灵巧无比,但一进到真实的家庭或工厂环境时,却常常连最基础的家务事都做不好。机器人需要累积大量的空间与场景经验才能稳定运作,然而在现实世界中训练机器人不仅耗时费力,还需要人类随时维护与监督。

为了打破这个瓶颈,美国麻省理工学院电脑科学与人工智能实验室(MIT CSAIL)与丰田研究院(Toyota Research Institute)联手推出了全新的AI训练系统“SceneSmith”。这个系统能透过简单的文字指令,自动建构出细节极为丰富的3D室内虚拟环境。机器人可以在这些由AI生成的虚拟空间中进行千百次的练习与试错,并在进入真实家庭或工作场所前,提前发现并修正行动计划中的缺失。

传统的实体测试存在许多痛点。机器人每尝试一次,研究人员就必须重新摆设现场物件。摆歪的椅子或放错位置的瓶罐都会影响下一次的测试结果,更糟糕的是,失败的动作可能会撞碎碗盘或损坏机器人本身。虽然过去也有团队使用仿真器进行测试,但旧款仿真器产生的房间通常过于空旷且缺乏细节,无法呈现真实生活中随处可见的杂物、随意摆放的家具与复杂的物理环境。SceneSmith的出现则大幅填补了这个虚拟与现实之间的落差。

adey4327
图片取自:( 示意图123RF )

SceneSmith的运作方式极具创新性。使用者只需输入简单的文字描述,例如“打造一个带有汽车与工作台的车库,角落堆放轮胎,墙边靠著梯子”,系统就能顺畅生成场景。SceneSmith内部集成了三个由GPT-5.2驱动的AI代理(Agent)相互协作:首先由“设计师”负责规划并建构房间结构;接著由“批评者”检查整体摆设是否符合现实逻辑与合理性;最后由“协调者”掌控沟通流程并决定设计何时大功告成。

在建造过程中,SceneSmith采用分层建构策略。系统会先创建基本户型与大型家具,再于墙面和天花板加上饰品与设备,最后才放入机器人可以抓取或移动的日常小物件。“批评者”AI还能敏锐地捕捉到不合常理的细节,例如确保重物不会悬空摆放、物品风格相互协调等,让整个虚拟场景高度逼真。

透过这样强大的生成能力,机器人得以在完全安全且无风险的环境中训练。即使在虚拟空间中打破几百个碗盘、撞倒数十张桌子,也不会造成任何财产损失或安全隐患。更重要的是,这种训练模式能揭示机器人在面对复杂环境时的思维误區,大幅提升机器人未来投入实体应用时的安全性与稳定度。随著AI生成技术的持续突破,未来的具身智慧(Embodied AI)将能以更快的速度走出实验室,真正成为人类生活中不可或缺的好帮手。

资料来源:https://www.foxnews.com