近日,具身智能赛道再现大额早期融资。8月11日,盖世具身智能获悉,具身基座模型公司LatentVerse宣布完成数亿元种子轮融资,投资方包括高瓴创投、清流资本、英诺基金,以及智元、星动纪元等产业资本。对于一家今年5月才成立的公司而言,这一融资规模也反映出资本对具身智能基础模型的押注仍在升温。
LatentVerse由清华大学交叉信息研究院具身智能研究团队创立,创始人兼CEO胡钰承为清华大学交叉信息研究院博士生,师从星动纪元创始人陈建宇,曾在字节跳动Seed参与具身智能基座模型研究。团队成员还来自北京大学、南洋理工大学,以及阿里Qwen、小米等团队。
与部分从机器人本体切入的创业公司不同,LatentVerse首先押注的是模型。其团队此前研究覆盖DP3、HiRT、VPP、BagelVLA、UAM等项目,技术路线大致经历视觉-动作、视觉-语言-动作(VLA)、世界动作模型(WAM)到统一模型。公开论文显示,DP3较早将紧凑3D视觉表征引入扩散策略,在机器人操作的泛化学习上取得较好效果。
这一方向也正在成为机器人基础模型竞争的新战场。今年以来,世界动作模型热度明显提升。英伟达DreamZero通过联合预测未来视频与机器人动作,让模型同时学习环境变化和控制策略,并在真实机器人实验中展示出较强的未见任务泛化能力。英伟达近期也将DreamZero、VPP、LingBot-VA等纳入WAM技术演进脉络。
LatentVerse进一步提出UTAM具身全模态世界模型,试图将视觉语言、世界模型、动作和触觉纳入统一基座。其中,视觉语言模块负责理解任务,世界模型预测动作可能产生的结果,动作模块生成控制信号,触觉模块则根据接触力、滑移和物体形变进行高频修正。
将触觉摆到更核心的位置,是LatentVerse与不少VLA路线的差异所在。当前机器人完成抓取、放置等单项任务已经不算新鲜,真正困难的是面对陌生物体、连续任务以及复杂物理接触时仍保持稳定。仅凭摄像头判断一个杯子“在哪里”,和准确判断杯子是否正在从机械手中滑落,显然不是同一个问题。
不过,从模型架构创新走到规模化商业落地,中间仍隔着数据、算力、机器人硬件适配和真实场景可靠性等多重关卡。英伟达也指出,WAM虽然有望提升机器人对新任务的泛化,但空间物理理解以及跨不同机器人本体迁移仍是待解决问题。Figure的Helix则采用“慢速理解+快速控制”的双系统架构,说明行业对于机器人如何兼顾高层推理与实时控制仍在探索不同解法。
目前,LatentVerse已完成UTAM多模态数据基础设施和训练管线建设,并开始推进各专家模块联合训练。本轮资金将主要投入模型研发、多模态具身数据体系、训练基础设施和真实机器人验证。对这家成立仅数月的年轻公司而言,拿到数亿元融资只是拿到了入场券。UTAM能否从论文和Demo进一步证明跨场景泛化、长程任务和灵巧操作能力,才是其接下来需要面对的真正考验。
关于《Seeds 发现》:
盖世汽车《Seeds 发现》栏目,旨在打造一个链接初创企业、产业链生态合作伙伴以及投资机构、地方政府的服务平台,为产业链上下游深度赋能。该栏目自启动以来,一直致力于发掘智能化变革大潮中对行业具有重要启发和引领作用的好公司、好技术、好的商业模式,推动产业创新力量的成长。据盖世汽车统计,经《Seeds 发现》栏目报道过的初创公司,几乎所有都已经成功对接了产业链生态资源。
郑重声明:此文内容为本网站转载企业宣传资讯,目的在于传播更多信息,与本站立场无关。仅供读者参考,并请自行核实相关内容。
