}

  2026年的AI赛道,有个领域卷得特别厉害。

  这就是视频生成AI。

  根据行业数据:2026年上半年,在AI短剧、漫剧这个赛道:抖音端上新22.19万部,只有1055部播放破亿,破亿率仅0.48%;意味着绝大多数内容一上线就被淹没。

  但是,最近这个影视、娱乐赛道的工具,却实打实地在物理世界的生产力中,发挥了真实的作用。

  7月31日,字节跳动发布新一代视频生成模型Seedance 2.5。与年初的2.0版本相比,单段视频直出时长拉到30秒,新增了局部编辑能力,单次可输入的参考素材扩充到50个。

  发布当日,徐工集团、小鹏汽车、灵初智能、微分智飞、穹彻智能等企业宣布与Seedance 2.5达成合作。

  原因就在于其强大的视频生成能力。

  在已经出现的案例中,Seedance不仅用来生成智能驾驶的各种训练数据,像是把同一段真实路况扩写成暴雨、逆光、强反射、还能将生成行人突然横穿、车辆加塞等长尾场景。

  而穹彻智能,更计划将Seedance接入通用机器人训练平台,围绕同一段真实操作,批量变化桌面布局、物体组合、观察视角、光照条件,甚至机器人本体形态,让一条示范长出多组可训练样本。

  但问题是:这些由AI生成的视频,在物理规则、物体运动轨迹方面,真的准确吗?

  毕竟,视频AI不理解现实物理这件事,已经成了一个行业诟病的老问题了,像是图灵奖得主杨立昆,就狠狠地批判过:当前的视频模型,不可能真正理解物理规律。

  原因在于,未来画面本身具有多种可能,逐像素预测会把大量算力耗在纹理、光照和随机噪声上,却未必学到与行动真正相关的物体状态、因果关系和动力学约束。

  画面看起来合理,不等于模型理解了世界。

  既然视频AI,现在在物理规律方面这么“不严谨”,小鹏、徐工、穹彻智能、微分智飞还会选择合作?他们不怕翻车吗?

  说到这,就必须提一个现在物理AI领域,特别焦虑的痛点:数据短缺问题。

  数据之痛

  所谓物理AI,指的是具身智能、自动驾驶,也可以指:工业视觉智能体、无人机、以及其他能在现实环境中完成‘感知—推理—行动’闭环的自主机器。

  在这些领域,业界的数据饥渴到了什么地步?

  一个更直观的尺度是:RAND曾估算,若要用实车统计证明自动驾驶的致死率比人类低20%,需要约177亿公里测试;100辆车全天不停地跑,也要500年。

  机器人也一样:Open X-Embodiment为了凑出100万条真实操作轨迹,动员了20多家机构、22种机器人,仍只覆盖500多项技能。连全球协作都如此吃力,国内企业想靠真机独自“穷举现实”,几乎不可能。

  虽然像百度Apollo、小马智行等企业,也试图通过仿真技术,模仿大量驾驶场景,以弥补和特斯拉这类巨头的差距,但即使有了仿真技术,国内车企、机器人企业短期内,还是很难填补这样的缺口。

  这其中的原因是:仿真场景仍要从真实问题出发,能把已知场景做多,却很难主动发现未知的失败模式。

  物理模型、车辆和行人的行为和传感器噪声只要存在偏差,海量仿真反而会放大偏差。

  其实不只是自动驾驶,现在的物理AI,例如具身智能,也正在遭遇一个之前的语言类AI没遇到过严重的问题:越真实的数据,越贵。

  换句话说,互联网可以爬10万亿Token,但机器人不能去现实世界摔10亿个杯子,自动驾驶也不能制造100万次恶劣的天气、路况。

  以机器人行业为例:国内供应商的真机操作数据报价大致在70—140美元/小时;海外复杂多传感器人形机器人数据约80—150美元/小时,而且精细标注通常另计。

  按5000小时计算,仅采集费就可能达到35万—75万美元。

  这还没算机器人折旧、场地、安全员和返工成本。

  于是,Seedance 2.5这样,能够编辑、改变视频画面的AI技术,就极大地扩展了原本智驾数据、机器人数据样本不足的短板;

  例如在智驾方面,Seedance 2.5可以将同一段路况,通过编辑功能,变成不同的天气、不同的车辆、不同的光照等等。

  虽然站在普通C端用户的角度来看,Seedance 2.5的价格比之前更贵了。

  按79元/月最低档的会员,升级到Seedance2.5以后,一段30秒的视频,直接就能将一个月的积分干没了。

  Seedance 2.5支持最长30秒生成。来源:Seedance产品界面

  但即便是“贵”了不少,如果放在现实工业层面,这样的成本,而某些行业中长尾数据的收集难度、成本比起来,简直不值一提。

  举个例子:要采一组‘暴雪夜间、行人突然横穿’的数据,实车要等天气、调车队、配安全员,而且场景难以重复;Seedance却能批量改写天气、照明和交通参与者,而这花的只是几块钱的生成费。

  可能有人会问:Seedance 2.5 虽然生成的视频很逼真,但现在在自动驾驶、机器人领域,不是也有很多仿真系统了么?

  例如在智驾方面,就有CARLA、百度Apollo云仿真,以及NVIDIA DRIVE Sim等。

  而在机器人领域,也有英伟达的Omniverse Replicator,以及用Cosmos生成合成轨迹的GR00T-Dreams。

  既然之前的仿真系统,也能生成各种不同的场景、环境,那Seedance 2.5这样的AI,意义到底是什么?既生瑜何生亮啊!

  这就涉及到了仿真领域一个重要的问题——现实鸿沟(Sim2Real Gap)。

  仿真VS生成

  讲真,虽然在机器人、自动驾驶领域,仿真系统已经存在很多年了,但这些仿真系统,都面临着一个共同的问题,这就是:仿真生成的场景,虽然可控、物理正确,但建模昂贵,而且还会有“Sim2Real”的问题。

  CARLA接入Cosmos Transfer后,可将同一场景改写为雨天

  举个例子:在CARLA里搭一条新道路,通常要先用RoadRunner或Unreal制作路网、资产、材质和交通规则,再逐项调天气、光照与传感器。即便物理和标注都精确,渲染出的路面污渍、反射与交通参与者仍可能偏离实拍分布。

  这就解释了为什么很多企业,明明知道Seedance“不懂物理”,还要用。

  因为它解决的是传统仿真一个几十年来,都没有很好解决的问题:

  仿真器非常擅长制造一个“物理上正确但长得不像现实”的世界。

  生成模型非常擅长制造一个“长得像现实但未必物理正确”的世界。

  现在产业真正想做的事情,其实是把两者拼起来。

  可能有人会问:对于自动驾驶、机器人训练这些场景来说,生成的场景像不像,真的有那么重要吗?反正这些画面是给车载AI以及机器人看的,只要物理上正确不就行了吗?

  但这里其实有一个反直觉的误区:“像不像”在很多场景下,其实比"物理精确"对感知模型的影响更大。原因不是AI有审美,而是因为神经网络"看"世界的方式和人类完全不同。

  换句话说,人类与AI最关键的区别是:神经网络不是在"看画面",而是在"统计像素分布"

  举个例子,人类看一张图,会关注"这是一辆车、它在左转、天气不错"。

  但神经网络不是这样看的。

  它学习的是像素统计规律。

  例如Transformer在看一张图时,它们提取的是低阶到高阶的统计特征:

  在低阶,AI提取到的特征,可能是边纹理频率、颜色分布、光照梯度,

  中阶,则是局部形状、阴影模式、反射特性。

  而到了高阶,就变成了语义组合、上下文关系这些特征。

  举个具体的例子。如果让CARLA渲染的雨天场景:

  物理上,CARLA可以将雨滴下落速度、挡风玻璃上的流体动力学、轮胎与湿地的摩擦系数,都调得很精确。

  但是在视觉上,这些雨滴往往看起来"太均匀"了——每一滴的大小、透明度、运动轨迹过于规则;路面反光过于"完美";而现实中的卡车,在雨天却可能沾满泥浆、被逆光遮挡、只露出半个轮廓。

  如果忽略了这些不规则的、坑坑洼洼的细节,只让AI学仿真系统,最后就可能在物理上学得完全正确,但是在现实中却处处碰壁。

  因为物理上的“正确”,不等于“真实”。

  所以,对于AI来说,所谓的"像不像",不是指画面是否"美观"或"电影感",而是指生成画面的像素统计分布是否与真实世界一致。

  产业协同

  在知道了Seedance的强项后,我们就不难理解,为什么智驾、机器人、无人机这些场景,都能用上这类视频AI了。

  从技术上来说,Seedance不能替代CARLA、Omniverse这些传统的仿真软件,因为它输出的只是统计上逼真的像素序列,缺少真正的物理规律的理解,以及和传感器模型的闭环交互。

  因此,更合理的组合,是让仿真系统负责物理与闭环,让Seedance负责视觉逼真度和多样性。

  GR00T-Dreams从少量真人示范扩展合成轨迹

  这样的组合一旦形成闭环,中国可能拥有一个非常特殊的优势。

  这个优势就是:我们既拥有全球最强的一批视频生成模型,又拥有全球密度极高的制造业、机器人和新能源汽车应用场景。

  在以前的产业格局中,字节做互联网AI,徐工做工程机械,小鹏做汽车;机器人企业做具身。

  大家各做各的,彼此几乎没有技术供应链关系。

  但是有了Seedance之后,未来可能出现一条新的产业链:

  Seedance先把少量真实视频扩写成不同天气、光照、物体和动作版本。

  工业仿真与合成数据平台再补上几何、动力学和动作标签,筛掉那些“看着真、实际做不成”的样本。

  机器人、汽车和无人机拿这些数据训练、测试,上线后再把接管、失败和异常片段回传,反过来修正生成模型。

  链条每转一圈,数据更贴近生产,模型也更有机会进入真实设备。

  于是,一个围绕物理AI的,以Seedance+各类工业领域的“物理互联网”就形成了。

  而Seedance在其中,则补上了其中关键的一环:用相对低廉的成本,生成大量原本需要昂贵的真实世界反馈,才能采集到的数据。

  相较之下,硅谷虽然也有Veo、Sora这样的产品,但要么太贵:要么像Sora这样,因为没有真实的产业衔接,最终难以为继,不得不被关停。

  按谷歌的官方API定价,Veo 3.1标准版720P为0.40美元/秒,30秒约12美元;Seedance 2.5同规格、无视频输入的官方示例折算约45.36元,即约6.3美元,只到前者一半左右。

  现在,在通往“物理AI圣杯”的道路上,全世界有大量的团队、企业,都在进行各种尝试,杨立昆、李飞飞在弄,各路机器人企业,像Figure AI、Google DeepMind、英伟达的Cosmos与GR00T、1X的世界模型实验室也都在探索。

  但这样的尝试,始终需要回答一个问题:这些活在人间,长在尘世里的物理AI,究竟靠什么“活”下来?

  Gemini Robotics ER 2多机器人协作示意。来源:Google DeepMind

  两年前,在Sora刚问世时,杨立昆曾断言:这样的视频AI,永远不可能真正懂物理。

  然而,令杨立昆没有想到的是,两年多以后,中国的视频AI,靠着各种工程、算法层面的优化,已经能做到在30秒长度上,生成画面一致的流畅视频,并且画面扭曲和物理错误也大幅减少。

  虽然Seedance这样的视频AI,至今没有真正“懂”物理,但它靠着从漫剧、广告片,商业宣传片那里赚来的钱活了下来,并反哺到了工业、智驾领域,这本身就是一种胜利。

  结语

  从“先在人间活下来”这个角度上来看,中国本质上是在用一种更迂回的策略,来接近物理AI的“圣杯”。

  物理AI的圣杯之争,表面是算法之争,底层是数据之争。

  而要想驱动数据的飞轮,首先就得驱动商业化的飞轮。

  毕竟,科技史上,已经有各种“理论正确”、方向正确,但最终却因为缺乏“粮草”,而半道崩殂的案例了。

  一个典型的例子,是曾经智驾领域的潜力选手——Argo AI。

  它拿到福特与大众数十亿美元投入,曾被视为Waymo和Cruise的有力竞争者,还在多座城市进行了L4路测。

  但问题是,L4要从试点走向规模化,还得持续烧钱扩车队、补长尾、做安全冗余,收入却迟迟覆盖不了投入。

  当资本转冷,福特又把资源转向更快变现的L2+/L3,Argo没等到规模化那天,就因找不到新投资者而关停,福特为此一次性计提27亿美元减值。

  有时候,技术路线未必全错,现金流却先到了终点。

  Seedance最重要的工业价值,也许不是制造一段“完美符合物理”的视频,而是让企业第一次,可以低成本地制造无数个“可能发生的现实”。

  而这,就让数据飞轮真正有了可以转动的“粮草”。

  这样的粮草,正是中国在通往物理AI的“圣杯”的途中,趟过最泥泞、也最艰难的一段路的必要条件。