0
联系电话:4001-158-698EN

公司新闻 行业动态 产品知识

C17官方网站-C17(中国)-从生成到行动,生数科技用通用世界模型连接「两个世界」

于世界人工智能年夜会(WAIC)的展馆里,呆板人凡是是最抢镜的一类展品。

机械臂抓取物体、人形呆板人服从指令完立室务,“世界模子”也经常陪同这些演示呈现,用来注释呆板人怎样理解情况、猜测变化并完成步履。长此以往,世界模子好像逐渐成为呆板人及主动驾驶范畴的专属观点。

但于生数科技开创人、清华年夜学人工智能研究院副院长朱军看来,通用世界模子其实不只办事在某个单一场景,其焦点是经由过程同一的基座与架构,实现对于世界的理解、猜测与步履。

7 月 20 日,于生数科技与万兴科技结合承办的“世界模子驱动下的 AI 影视出产力新范式”专题论坛上,朱军提出生避世界模子不是视频模子的进级,也不是语言模子的延长,而是 AI 从“天生内容”迈向“理解世界、推演世界、及时交互世界”的新范式。

从生成到行动,生数科技用通用世界模型连接「两个世界」

基在统一底层基座,模子既可以于像素空间天生视频内容,也能够于动作空间输出呆板人可履行的动作。AI 视频与具身智能是以并不是两条割裂的技能线路,而是世界建模能力于数字世界及物理世界中的差别延长。

这也是理解生数科技通用世界模子战略的要害。

公家最早经由过程视频年夜模子 Vidu 熟悉这家公司。如今,其产物系统已经经从数字内容天生拓展至及时交互及物理步履:世界天生模子 Vidu 理解并天生动态数字内容;及时交互模子 Vidu S1 将用户指令纳入天生历程;世界动作模子 Motubrain 则将对于情况的理解及猜测转化为呆板人动作。

看似分属 AI 视频与具身智能两条赛道,现实上,三款产物沿着统一条路径睁开:天生世界、于世界中交互,并终极步履在世界。

01世界模子的焦点,不只是“猜测下一帧”

世界模子毕竟需要具有甚么能力?

朱军将其归纳综合为三个部门:理解、想象及步履。

起首,模子要感知并理解当前情况;其次,要猜测差别输入或者动作可能带来的变化;末了,还有要把理解及猜测转化为可履行的决议计划。

这与人类进修骑车、开车等技术的历程相似。人于采纳动作前,会预判差别操作的成果,再选择更安全、不变的方案。

是以,世界模子不只是天生一个看起来真正的将来,也不只是猜测下一帧画面,而是要形成从理解当前状况、推演将来变化到引导步履的闭环。呆板人是这套能力最直不雅、要求也最高的运用之一,但不是独一运用。

数字内容一样需要世界建模。

图片记载的是一个刹时,视频则包罗时间、空间及状况的持续变化。人物运动时,身体、衣服及配景要连结合理变化;镜头切换后,脚色表面、服装及空间位置不克不及无端转变;跟着内容延伸,模子还有要处置惩罚物体瓜葛、事务挨次及情况状况。

视频模子不仅要知道物体“长甚么样”,还有要进修它怎样运动、怎样与情况发生瓜葛,以和一个状况怎样蜕变为下一个状况。

固然,天生联贯视频其实不等同在拥有完备的通用世界模子能力,但视频天生所要求的时空建模、动态猜测及状况一致性,为进一步走向及时交互及物理步履提供了基础。

02视频数据,是构建通用世界模子的主要底座

从第一性道理出发,构建通用世界模子需要解决两个问题:数据及架构。

已往,年夜模子经由过程通用架构、范围化数据及算力形成 Scaling Law。要让世界模子从特定场景的小模子走向通用基座,一样需要年夜范围、多样化的数据。

生数科技将相干数据归纳为一个从互联网视频到呆板人实采轨迹的“数据金字塔”,此中包括通用视频、第一视角人类动作视频、合成数据及呆板人轨迹数据。

这些数据的差异,重要表现于范围及精度上。

互联网视频范围重大,记载了人物、物体、情况、动作和当时空瓜葛。影视剧、纪录片、监控视频及第一视角影像,都生存了真实世界运行的一部门信息。

呆板人轨迹数据则可以或许提供枢纽关头角度、节制旌旗灯号、力反馈及动作成果,但收罗成本高,范围远小在互联网视频。

已往,因为缺乏动作标注及呆板人节制旌旗灯号,通用视频很难直接用在从状况到动作的进修。但跟着视频天生模子成长,模子可以经由过程猜测及重修视频,进修空间、时间、动作及成果之间的瓜葛,视频数据也由此成为世界模子年夜范围预练习的主要基础。

不外,视频数据不克不及替换呆板人数据。

视频可以告诉模子动作于视觉上怎样发生、情况怎样变化,却没法完备提供呆板人履行所需的枢纽关头角度、力反馈、本体状况及节制旌旗灯号。

更合理的路径,是先经由过程海量视频进修通用的世界纪律,再经由过程呆板人数据增补切确的动作常识及物理反馈:前者拓展世界模子的认知广度,后者晋升步履精度。

03从 Vidu 到 Motubrain,是统一套能力的慢慢延长

假如只看产物形态,生数科技从视频天生走向具身智能,像是一次横跨两条赛道的营业扩张。但从其模子成长路径来看,这更像是视频建模能力向及时交互及物理步履的天然延长。

生数科技从建立之初便定位在基础模子,并将视频建模作为技能出发点。于模子练习历程中,团队逐渐发明,视频模子的能力上限其实不只表现于画质、时长及天生效果上。跟着数据及模子范围扩展,模子对于人物、物体、空间瓜葛与动态变化的理解也于连续加强。

这象征着,视频模子进修的不只是怎样天生画面,还有包括世界怎样随时间变化。模子对于时空布局、运动纪律及状况演化理解患上越深切,就越有可能从内容天生进一步走向及时交互,以致物理步履。

已往两年,视频基模也履历了从展示技能可能性,到进入真实出产环节的快速演进。

初期的视频天生更多用在展示模子可以或许“天生甚么”,如今,模子最先被用在告白、短剧、影视等现实出产场景,并慢慢负担提高内容可用率、缩短建造周期及降低出产成本的使命。

以 Vidu Q1 为例,其推出的参考生视频能力,答应用户经由过程主体参考图天生脚色及视觉元素相对于一致的视频。今后,参考生视频逐渐成为行业中的主要产物范式,也让视频模子从随机天生东西,进一步走向可节制、可复用的出产东西。

从生成到行动,生数科技用通用世界模型连接「两个世界」

对于在生数科技而言,这一历程也强化了一个判定:高质量视频基模不仅可以或许办事内容出产,其于年夜范围练习中形成的时空理解、动态猜测及状况一致机能力,也能够继承迁徙至更广泛的智能使命。

解决数据以后,还有需要一套可以或许同一构造这些能力的模子架构。今朝,一些具身智能方案仍旧采用分散式布局:感知模子卖力辨认情况,世界模子卖力猜测将来,计谋模子卖力输出动作。差别模块别离优化,轻易带来信息割裂及偏差累积。

生数科技的思绪,是经由过程 Mixture-of-Transformer(MoT)架构,将情况理解、世界状况猜测及动作轨迹天生整合至同一框架。模子既可以于像素空间天生视频,也能够于动作空间输出呆板人动作,还有可以按照使命需要举行结合猜测。

基在这一架构,生数科技的三项产物别离负担差别层级的使命。

世界天生模子 Vidu 撑持文生视频、图生视频、参考生视频等创作方式,连续晋升主体与场景一致性、运动体现、物理合理性、镜头节制和内容交互性,帮忙创作者越发高效地完成高保真内容创作。

及时交互模子 Vidu S1 进一步将外部输入纳入天生轮回。用户可以于互动历程中连续发出语音指令,让脚色及时转变心情、动作及举动。每一一次输入均可能影响下一时刻的画面,模子不仅要天生内容,还有要按照反馈连续更新状况。

Vidu S1 撑持无穷时长持续天生,可实现 540P、25FPS 输出,最高撑持 42FPS,并答应用户基在真人、动漫或者萌宠形象和个性化音色创立交互脚色。

从生成到行动,生数科技用通用世界模型连接「两个世界」

到了世界动作模子 Motubrain,模子的输出则从数字内容变为呆板人可以履行的动作。Motubrain 定位在具身智能呆板人的通用年夜脑,将情况理解、世界状况猜测与动作轨迹天生同一建模。面临插花、浇水等使命,模子需要理解当前情况及使命方针,猜测差别步履可能带来的成果,并天生呆板人可以履行的动作轨迹。

从生成到行动,生数科技用通用世界模型连接「两个世界」

三款产物别离回覆了三个递进的问题:可否天生一个连续变化的数字世界?可否让这个世界按照外部输入及时更新?可否将对于世界的理解及猜测转化为物理步履?

它们不是三款产物的简朴并列,也不是生数科技从视频天生忽然转向呆板人,而是统一套世界建模能力从天生、交互到步履的慢慢延长。

从 Vidu Q1 成立参考生视频的出产范式,到 Vidu Q3 晋升繁杂音视频内容天生能力,再到 Vidu S1 及 Motubrain 别离走向及时交互与物理步履,生数科技试图成立的是一套可以或许同时办事高质量内容出产及具身智能落地的通用基础模子。

04呆板人以外,世界模子还有有更年夜界限

行业习气将世界模子与呆板人绑定,一个主要缘故原由是呆板人可以或许把猜测转化为可见的物理成果。

杯子是被乐成拿起,还有是被机械臂碰倒,成果一目明了。真实情况也会严酷查验模子是否理解空间瓜葛、接触瓜葛及动作后果。

但近似问题一样存于在数字内容中。

脚色上一镜拿起的杯子,下一镜是否还有于;人物回身后,服装及配景是否合理变化;导演修改动作后,脚色身份、空间瓜葛及镜头节拍可否连结不变。这里虽然没有机械臂,模子仍旧需要维护一个连续变化的情况。

两类使命的差异重要于在输出情势及危害等级。数字内容堕落可以从头天生,呆板人步履掉误则可能造成实际丧失。是以,物理世界对于及时感知、节制精度、不变性及安全性提出了更高要求。

但世界模子所进修的内容,不该只由终极毗连的是屏幕还有是机电来界说。只要模子需要暗示当前状况、猜测将来变化,并按照外部输入更新情况或者作出步履,世界建模能力就已经经介入此中。

呆板人不是世界模子的独一归宿,而是此中对于感知、猜测、决议计划及履行闭环要求更高的一种运用。

05数字世界与物理世界怎样形成互补

生数科技同时结构数字世界及物理世界,不只是由于两者可以同享底层技能,还有由于两条线路有可能于数据、反馈及能力验证上形成互补。

数字世界的上风于在数据范围年夜、利用频率高、试错成本低。

海量视频可以帮忙模子进修物体运动、人物举动及情况变化;告白、短剧、影视及互动内容的出产,又能连续孕育发生真实反馈,例如哪些成果被采用、哪些镜头频仍返工、脚色一致性及动作体现于哪些场景下轻易堕落。

物理世界则提供更切确的动作数据及更严酷的因果查验。

呆板人必需遵守真实空间中的尺寸、接触、受力及运动约束。使命是否完成、物体是否被碰倒、动作是否安全不变,没法依赖视觉效果袒护。这些反馈可以查验模子学到的纪律可否转化为靠得住步履。

反过来,呆板人于真实使命中进修到的动作常识、物体交互纪律及空间约束,也可能帮忙视频模子晋升运动体现及物理合理性。

归纳综合来讲,数字世界帮忙模子扩展对于世界的认知规模,并提供更快的产物反馈;物理世界则查验这些认知可否转化为正确、不变的步履。

生数科技这条线路真正值患上不雅察的,是两者可否形成正向轮回:视频预练习为呆板人提供通用世界常识,呆板人步履为视频模子增补物理约束,数字内容的范围化利用及贸易回报,则为持久的基座模子练习提供支撑。

这也是通用世界模子战略最具想象力、同时最需要验证的部门。

06终极仍要接管出产力的查验

已往一轮年夜模子成长,AI 重要从语言及静态常识中进修纪律。世界模子则进一步将进修对于象扩大至空间、时间、状况变化及步履后果。

这让视频天生、及时数字脚色及呆板人节制进入统一个技能命题。

天生视频,需要维持人物、场景及动作的持续性;驱动及时数字脚色,需要按照用户输入连续更新状况;节制呆板人,则要进一步猜测步履后果,并天生可履行的动作轨迹。

对于生数科技而言,Vidu 不是通用世界模子战略以前的旧营业,Motubrain 也不是与视频割裂的新标的目的。前者天生数字世界,Vidu S1 让数字世界接管及时反馈,后者则测验考试将理解及猜测转化为物理步履。

于数字世界,要看模子可否提高内容可用率、削减返工并降低出产成本;于物理世界,则要看呆板人可否走出仿真及演示,于差别本体、使命及动态情况中持久不变运行。

当内容天生、及时交互与物理步履慢慢成立于统一套世界建模能力之上,AI 也将从理解及天生信息,进一步走向理解世界、猜测世界,并步履在世界。对于生数科技而言,这既是从 Vidu 走向 Motubrain 的技能路径,也是其押注通用世界模子的持久逻辑。

-C17官方网站-C17(中国)
1210
在线客服
在线客服

Maggie

微信咨询

黎小姐