这两天, WAIC(世界人工智能大会)展馆里, “铁皮生物”展示新学技能, 有: 分拣, 去组装, 做倒茶、调酒的动作, 打乒乓球以及拿药等技能,忙着给碳基生物展示。与两年前呆站或被绳索吊起的前辈不同, 这一届具身智能机器人做出有模有样的动作, 动起来了。
然而, 在逛过展馆之后, 身为腾讯首席科学家, 同时也是腾讯Robotics X实验室的张正友, 向第一财经等媒体表明, 他察觉出机器人, 无论是本体形态方面, 还是落地场景方面, 同质化的状况都还是较为严重的。
他宣称, 具身智能实际上尚未真正大面积地实现大规模落地, 众人都在寻觅能够应用其发挥作用的地方, 不同的机器人制造厂家所找到的应用场景大概都相差无几。并且, 他还指出, 当前业界对于工业层面的场景应用予以了诸多关注, 除此以外的其他方面, 他亦是冀望经由推动, 而吸引更多的企业投身参与到养老行业之中。
关于养老等存在与人交互需求的场景, 存在一些难题有待去解决。张正友告知记者 , 机器人最难处理的问题是操作物体或者与人物理接触。当前所见到的大部分落地场景是在工业领域 , 除非遇到像是玻璃这类脆弱物品 , 许多物体不管重一点还是轻一点 , 都无需那么精细细致地去抓取。然而 , 人与机器人的物理接触绝不能出现丝毫差错 , 特别是在养老场景当中 , 类似“搀扶老人却不小心把老人骨头捏碎”这种情况必然是无法被接受的 , 机器人进入家庭必须要百分百保障安全。
张正友讲, 需将触觉大模型做好, 要把力觉大模型做好, 还得把视觉大模型做好, 触觉、力觉以及视觉感知应紧密相联。触觉反馈大概是1毫秒时间, 视觉反馈或许为30毫秒时长, 把不同频率的感知信息与大模型相结合极具重要性。在腾讯期望挖掘的各类具身智能应用场景当中, 养老场景属于难度极大的场景之一, 腾讯的示范性机器人“小六计划”进入像养老院这样的真实场景, 以此实现进一步迭代。
去年的时候, 腾讯发布了Tairos具身智能开放平台, 这个平台的定位等同于具身大脑, 在本届WAIC期间, 推出了Hy-Embodied-VLM-1.0等多款具身智能系列新模型, 以及多个智能体框架, 其目的在于完善具身智能机器人的大小脑, 并且连通机器人身体感知。而这些更新的产生, 是因为机器人依旧存在一些需要被治愈的智能“硬伤”。
张正友称, 如今最为聪明的人工智能, 于本质层面而言, 依旧是“缸中之脑”, 其擅长逻辑推理, 能够进行文本生成, 也具备知识问答能力, 然而却欠缺与物理世界直接互动的闭环环境, 不一定真的理解物体所处位置, 不明白空间关系和可操作性, 并且也很难在持续发生变化的环境里, 一边展开行动, 一边接收反馈信息, 一边及时做出调整。而实际上真正的智能, 是需要将语言、视觉、空间认知、身体控制以及环境反馈进行连通的。
此外, 张正友讲, 机器人展开训练所需要的数据涵盖网络视频, 第一人称视角操作视频, 带传感器手套收集到的数据, 遥操作数据, 若想要机器人透过训练进而变得更加智能, 这四类数据得打通。
关于模型, 其仍有待持续地去演进。张正友向记者表明, 大语言模型的技术栈已然趋于收敛, 然而具身智能技术栈却并非如此。去年, 业界兴起了VLA(视觉语言动作模型)范式, 今年又在探讨世界模型, 可是当前世界模型的实现途径还不存在具有共识性的技术路径, 依旧需要持续地进行探索。


Copyright C 2025 All Rights Reserved 皖ICP备2024052706号-7
地址: EMAIL:1210524564@qq.com
Powered by PHPYun.