视频DeepSeek时刻?Vidu Q4 Preview背后的效率账与世界模型底气

编辑|牛来

AI 视频生成正在进入新的竞争阶段。

如果说 DeepSeek 时刻给大模型行业留下的关键词是「前沿能力的平权」,那么视频模型也正在逼近自己的相似节点:

性能、效率与可用门槛,开始同时探向极致。

生数科技最新推出的 Vidu Q4 Preview,正是一个阶段性结果。作为 Vidu Q4 面向创作者的首个预览版本,它将重点放在三项能力上:更细腻的人物演绎、更有张力的镜头语言,以及更具冲击力的复杂视效。

0.09 元 / 秒起的真香价格引发惊呼,而真正需要解释的是:为什么一个视频模型能在人物表演、镜头调度、复杂特效和参考素材控制上同时前进,又把生成成本压到创作者更愿意反复试拍的区间。

这才是视频模型的 DeepSeek 式问题:当性能、效率和可用性同时变化,行业竞争的坐标就会被重新校准。

过去一年,中国视频模型可谓「遥遥领先」。

Seedance 以综合实力领跑;可灵凭借影像质感和消费级扩散能力,建立了很强的大众认知;Vidu 的特殊性,则在于它强大的技术根基红利,以及其作为世界模型研究头部玩家的后劲儿。尤其是越来越明显的趋势,顶尖 AGI 团队如 OpenAI 等,不会只把多模态停留在视频生成这一层,而是会继续向物理世界推进。

技术的前沿意味着什么?看看视频领域有多少「第一」出自 Vidu 之手:

2022 年:率先提出 U-ViT 架构

2024 年:发布中国首个全面对标 Sora 的视频模型;全球上线后,又首创「参考生视频」和多主体一致性

Vidu 2.0 将生成时间压缩至 10 秒以内,证明普惠是长期技术路线。

Q 系列则持续强化一致性、动态性、叙事和表现力,Q3 实现 16 秒声画同出,为剧而生;Q4 让旗舰模型人人用得起……

趁热乎,先来几个 case 尝尝咸淡。

敦煌壁画中的飞天被「唤醒」,指尖拨弦、旋身起舞,每个细节都踩准节拍。

自动播放

短短 5 秒,镜头在俯拍、侧拍、面部特写和全身景别间连续切换,人物与服装始终保持稳定,有时尚广告大片质感。

自动播放

动画细节同样出色,尤其是倒霉猴子被龙卷风卷走时手脚扑腾的小动作、惊恐的小表情很是生动。

自动播放

Vidu Q4 Preview 还支持最多 15 张参考图、参考音色输入,以及 2K、4K 画质输出。

自动播放

价格也是此次更新的重点。Q4 Preview 首发价格 0.09 元 / 秒起,同样的预算最高可以生成 5 倍内容。这意味着,以后创作者可以用更低成本反复试拍,一个镜头可以更换表演方式,也可以重新调整节奏、运镜和声音。

目前,Vidu Q4 Preview 只是正式版上线前的一次提前亮相,已经展现出的综合表现,也让人更加期待 Q4 正式版在稳定性、控制力和创作上限上的进一步突破。

「Vidu 味儿」从哪里来?

Vidu 的作品一直有种鲜明的风格心智。高动态动作、快速运镜、强情绪表演和复杂视效出现得较为频繁,尤其是动漫效果好,这也被用户概括为「Vidu 味儿」。

自动播放

视频来自 Vidu 超创 「南墙」。

在海外创作者社区里,这种「Vidu 味儿」已经形成了相当明确的口碑。一些原本做抽象艺术风格的 CPP 用户,会因为听说 Vidu 动漫能力强,转而开始尝试自己并不擅长的动漫创作;日本 AI 动漫创作者也多次对 Vidu 表示认可,甚至有全部用 Vidu 生成的 AI 动漫作品在 YouTube 获得了数十万播放。在一些横向对比视频里,用户也会特别提到 Vidu 在旋转动作、发丝动态、金币粒子效果上的表现,评论区对其动漫质感的讨论相当集中。

Vidu 已经在创作者心中形成了一种可识别的风格标签:更适合高动态镜头,更擅长强情绪表达,也更容易做出带有燃感、速度感和戏剧张力的动漫画面。

而这个用户心智,恰好可以反向解释它背后的技术能力。动漫不是一个「更简单」的视频生成场景,恰恰相反,它对模型的动作连贯性、镜头调度、角色一致性、发丝和衣料等细节动态、粒子特效和情绪爆发都有很高要求。一个模型如果能稳定生成高燃动漫,往往意味着它不只是会画漂亮画面,而是在时间、动作和空间关系上有更强的控制能力。

也正是在这里,Vidu 的产品风格和生数的世界模型路线开始接上了:用户看到的是「动漫很燃、动作很顺、镜头很带感」,技术上对应的则是模型对动态世界的建模能力。

生数科技将自身定位为通用世界模型公司。世界模型需要理解当前环境、预测未来变化,并根据反馈更新对世界的判断。在生数提出的五级路线中,Vidu 主要对应第一级「生成世界」,负责学习人物、物体、运动、空间关系和场景动态;Vidu S 系列进一步加入实时交互,Motus 与 Motubrain 则把预测能力延伸到物理行动。

放在这条路线中,视频不只是一组连续画面,也是一条不断演化的世界轨迹,视频的一致性和物理合理性都更加有了凭依。

视频预测是世界建模的一种基础形式,模型需要根据已经出现的人物、场景和动作,推演后续状态。视频越长、运动越复杂,误差越容易沿时间累积,对长序列建模和状态记忆的要求也越高。

在 Vidu 这条技术路径中,世界模型与多模态能力形成了双向促进。

低价为什么也是模型能力?

Vidu Q4 Preview 首发 0.09 元 / 秒起,但低价就是普惠吗?

过去一段时间,中国 AI 团队不断通过架构优化、工程改造和规模化服务降低前沿模型的使用门槛,视频生成领域对这种变化尤其敏感,因为它长期受到算力成本与「抽卡式生成」的双重制约。

如果模型持续生成身份漂移、动作断裂或商品变形的内容,单次价格再低,创作者仍要付出大量筛选、返工和等待成本。

因此,讨论 Vidu Q4 Preview 的价格优势,还要看它能否减少获得可用镜头所需的尝试次数。Q4 Preview 强调的传神表现力,就在于降低人物漂移、动作断裂、镜头失序和特效脱节带来的整段返工。

最多 15 张参考图、3 段参考音频,以及 2K、4K 输出,则进一步覆盖了角色控制、音色延续和交付画质等实际环节。

不过,要把这些能力以更低价格提供给用户,还要解决算力效率的问题。

视频生成是计算密集型任务。时长增加,模型需要维持更长的状态链条;分辨率提升,参与计算的视觉信息也会迅速增长。对于以 Transformer 为基础的扩散模型,长序列中的注意力计算尤其昂贵,推理速度直接决定单次生成的算力消耗。

生数团队过去几年的研究中,有相当一部分都在解决效率问题。SageAttention 尝试用低比特计算加速注意力;后续的 SLA 将稀疏注意力与线性注意力结合,进一步压缩长序列的计算量;TurboDiffusion 则把注意力加速、少步生成、量化和工程优化组合起来,在特定开源视频模型与硬件条件下取得了百倍级加速。

这些实验结果至少说明,生数对视频生成效率的优化已经深入注意力、采样步骤、数值精度和推理系统等多个环节,相关技术也已在 Vidu S1 的实时视频生成中得到产品化应用。

数据显示,Vidu Q4 Preview 图生视频速度约为同类模型的 2 倍,5 秒视频最快约 110 秒完成。速度提升会缩短等待时间,也能提高单位算力的任务吞吐量,成本由此获得继续下探的空间。

对于创作者来说,更重要的是「可用成片成本」。一次生成便宜了,加上模型对角色、镜头和参考素材的控制更稳定,获得一条可用素材所需的尝试次数就会减少。性能和效率同时进步,才能把价格优势真正转化为工作流里的实际节省。

因此,这轮降价的价值不应只按短期促销理解,首发优惠提供了入口,长期意义取决于技术效率能否持续转化为更低的生成成本。对于广告、短剧、动漫和电商内容团队,这会影响 AI 视频能否批量生产,也会影响它能否进入正式预算。

演技、镜头与特效,AI 视频在卷什么?

技术路线最终还要回到成片。接下来,我们就奉上一手实测。

先来试一段没有台词的情绪独角戏,测试下 Vidu Q4 Preview 的「演技」。

我们设定一段由克制转向爆发的短戏:强忍委屈、泪水滑落、泪中失笑、拍桌爆发、慢慢平静,五段情绪变化依次发生。参考素材只有一张女性人物图和一张木质厨房环境图。

全程固定近景,不切镜。

这项测试的难点在于,镜头始终固定在人物近景,并采用连续长镜头,模型无法通过切镜隐藏表情、动作或身份漂移。

人物需要在短时间内完成压抑、落泪、失笑、爆发和释然等多段情绪变化,眼神、眉头、嘴角、泪痕和身体姿态都要形成连续反应。

同时,灯光还要随情绪从正面暖光移向侧光、逆光,爆发时骤然增强,最后回落至昏黄摇曳,人物面部要在大幅明暗变化中保持稳定。

自动播放

Vidu Q4 Preview 完成度很高,情绪转折处也没有明显的突然「换脸感」。即使经历大幅表情和多轮明暗变化,人物的五官、短发和服装也没有明显漂移。

再来看看 Vidu Q4 Preview 的镜头编排能力。

下面这支广告中,Vidu 在 16 秒内依次完成了桌面广角推进、人物手势前景遮挡、红色圆形转场、产品穿孔匹配接取、俯拍群像、低机位人物、弧形群组运镜和最终产品定格,景别跨度大,节奏却没有散。

产品在远近镜头和多人互动中始终保持较高辨识度,粉红包装、白色吸管与樱桃图案也贯穿全片。

自动播放

切镜有承接,运镜有目的,产品在高节奏画面中依然稳稳「站在 C 位」,这已经是比较完整的广告叙事逻辑了。

来自 Vidu 超创「幻糖文化」拿 Vidu Q4 Preview 搞了个蛇皮袋的广告,相当有创意。

自动播放

特效也是 Vidu 的拿手技能。

一张静态家居图,被 Vidu Q4 Preview 做成了一场 8 秒的「空间组装秀」。

提示词:开头只有地板和墙面,各类家具以可爱果冻的动态方式分别从四周跳入场景,最终安静的形成最后的画面,图 1 作为第 5s 的结束;5s-8s: 之后,环境变暗,落地灯的灯光逐渐亮起,其中重要的是果冻式的动态跳入。

沙发、落地灯、边几、挂画、绿植和抱枕依次跃入,每件家具落地时都有压缩、回弹和轻微晃动,果冻般的弹性鲜明,又没有机械复制感。

多件物体连续进场后,外形、尺度和落点依然稳定,画面没有出现明显穿插或位置混乱。后半段环境逐渐变暗,落地灯缓缓点亮,暖光随之铺向沙发与地面,氛围切换自然。

由此可见该模型对多物体运动、弹性形变和动态光照的综合控制力。

自动播放

体验一圈下来,Vidu Q4 Preview 在需要模型「拿稳全局」的场景里,整体表现出了较高的可靠性。

视频模型的「DeepSeek 时刻」

AI 视频真正进入生产环节,需要跨过三道门槛。

第一道是模型能力上限。人物要会表演,镜头要能推动叙事,特效要与环境自然互动,参考素材也要在连续画面中保持一致。

第二道是系统效率。只有生成速度足够快、单位算力产出足够高,创作团队才能并行测试多个版本,将更多时间用于调整表演、镜头和节奏。

第三道是创作门槛。单次成本降下来,广告、电商、短剧、动漫和影视团队才能把 AI 视频纳入正常预算。

因此,视频模型的「DeepSeek 时刻」,前沿性能、系统效率和大众可用性缺一不可,前沿性能负责打开创作空间,系统效率来降低边际成本,普惠价格则让更多人拥有持续尝试的机会。三者共同成立,视频生成才能成为稳定、可规模化的内容生产工具。

Vidu Q4 Preview 交出的,正是这样一张阶段性答卷。它仍处于预览阶段,也让人更加期待正式版会将视频生成的能力上限推向何处。

输入专属邀请码:JIQIQ4,登陆 Vidu.cn,新用户注册即可获得 500 积分。感兴趣的朋友快去试试吧。

体验链接:https://www.vidu.cn/create/character2video

© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

本文来自大风号,仅代表大风号自媒体观点。