服务于全球各领域电子制造客户
公司新闻 行业动态 产品知识
7 月 9 日,蚂蚁灵波开源LingBot-Video,这是全世界首个基在 Mixture-of-Experts(MoE)架构、面向具身智能的开源视频天生基础模子。该模子缭绕呆板人及具身智能的焦点需求从头设计视频预练习范式,于推理效率、物理合理性、动作理解及使命完成度等方面取患上体系性晋升,为视频基础模子从数字内容创作走向具身智能提供了新的开源底座。
于北京年夜学结合字节跳动发布的基准RBench上,LingBot-Video 的总分是 0.620,逾越了 Wan2.6(0.607)、Seedance1.5 Pro(0.584)、Cosmos3 Super(0.581)。RBench作为面向呆板人操作视频的综合评测基准,重点考查模子可否天生切合真什物理纪律的呆板人举动。这一成果注解,LingBot-Video 于天生呆板人相干视频时,更能连结动作历程的合理性及使命履行的完备性。
(图说:LingBot-Video 于RBench上机能最优)
为进一步验证 LingBot-Video 对于物理世界变化的建模能力,蚂蚁灵波于内部 benchmark 中从通用质量及具身范畴两个维度举行评估。成果显示,对于比 NVIDIA Cosmos 三、Wan 2.2 A14B、LongCat-Video、HunyuanVideo 1.五、LTX-2.3 等五个开源模子,LingBot-Video 于具身范畴体现优在重要基线模子。
(图说:综合评测显示,LingBot-Video于具身相干场景中揭示出更强的物理理解及动作一致性)
已往几年,视频天生模子于画质、流利度及创意表达上快速前进,但对于在具身智能来讲,一个看起来传神、动作流利的视频,却没法反应真正的物理纪律,难以支撑呆板人持续猜测、计划及履行使命。与此同时,具身智能还有要求模子具有更高推理效率,以顺应及时交互及节制闭环。
这也让视频天生最先呈现两种差别的演进标的目的:一条通向影院,办事在内容创作;另外一条通向呆板人,办事在物理世界的理解、猜测与交互。LingBot-Video 恰是蚂蚁灵波面向具身智能斥地视频天生新线路的主要摸索。
LingBot-Video 从架构、数据及练习三方面举行了体系立异。
于架构上,LingBot-Video 采用DiT+ MoE 设计,以 MoE 替换传统 Dense 架构,于扩展模子容量的同时节制单次推理成本。其 30B 总参数模子于天生时仅激活约 3B 参数,比拟划一参数范围 Dense 架构拥有约 3 倍推理效率。这一设计使模子既能得到年夜范围参数带来的视觉表达能力,又更合适具身智能对于高效推理的要求。
于数据上,LingBot-Video 构建了数据画像引擎,于海量互联网视频的基础长进一步引入 VLA、VLN、Ego 等呆板人相干数据,笼罩灵巧操作、呆板人挪动及第一视角交互等场景,总范围达 7 万小时的具身数据。这些数据帮忙模子进修动作与情况变化之间的瓜葛,而不只是进修视频的外貌纹理及视觉气势派头。
于练习上,LingBot-Video 引入多维强化进修奖励体系。除了美学、prompt 追随及运动一致性等通例指标外,模子进一步缭绕物理合理性及使命完成度举行对于齐,使天生成果更切合真实世界纪律,也更切近呆板人于真实世界完成使命的需求。
据先容,LingBot-Video 可用在呆板人动作猜测、仿真数据天生、动作前提建模、世界模子研究等标的目的。今朝,LingBot-Video 已经正式开源。
下一篇【产品推荐】超小型高频同轴连接器u.fl系列
www@C17com官方
Maggie
微信咨询
黎小姐