【大屏时代】首页 > 3D快报内容详情

生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配

1小时前 7 大屏时代

生数科技于9月15日正式发布了全新的 Vidu S2视频大模型系列。本次发布的 Vidu S2包含两个核心模型:面向持续交互数字角色生成的 Vidu S2-Avatar,以及面向输入视频流进行实时编辑的 Vidu S2-Editing。在此基础之上,生数科技还进一步探索了面向 VR 头显的实时空间视频生成与编辑能力。整个全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。

在模型特色方面,Vidu S2-Avatar 实现了从语音持续控制到更高交互自由度的跨越。用户上传一张角色图片后,即可通过文本或语音与模型互动,模型不仅支持说话时的表情与姿态,还增强了舞蹈等大幅度动作的指令跟随能力。更重要的是,该模型支持在视频流进行中的任意时刻动态加入物品、服装或背景参考图,让角色在互动中拿起杯子、换上指定服装或进入新场景。同时,模型引入了视觉反馈机制,确保诸如“拿起杯子然后微笑”等连续动作与状态保持的可靠性。此外,S2-Avatar 将实时输出分辨率从上一代的540P 提升至720P。

Vidu S2-Editing 则专注于接收持续输入的视频流,并根据文本指令和可选参考图进行实时编辑,让画面跟随人物抬手、转身或镜头移动自然变化。目前该模型主要支持四类任务:一是风格迁移,在保留人物轮廓、姿态和场景布局的同时改变画面笔触与色彩;二是虚拟试穿,将参考服装迁移到视频人物身上,精准处理服装边界、材质纹理及肢体遮挡关系;三是人物替换,将参考角色的面部、发型、服装和外观整体迁移至源视频,同时保留原有姿态与运动;四是背景替换,根据参考图更换环境并在人物持续运动时保持稳定的空间关系。

在空间视频探索方面,Vidu S2将 Avatar 的实时输出接入空间视频转换流程,生成同步的左右眼视图;Editing 则支持先编辑普通单目视频再转换为空间视频,或直接编辑已有的空间视频,且两类模式均支持上述四类编辑任务,相关结果可流式传输至 VR 头显。

在底层技术选择上,Vidu S2进行了多项关键技术创新。首先是提出了 Self-Replay Forcing(SRF)训练方法,模型先生成较长的自生成轨迹,再从中采样连续片段重新加噪并进行可传播梯度的因果重放训练,有效避免了小误差累积导致的身份漂移或动作断裂。其次在数据处理上,兼顾了舞蹈视频的动作丰富度与画面稳定性,并采用事件顺序描述的视频标注和偏好奖励优化。同时,S2-Avatar 引入了 VLM 智能体作为视觉反馈,用于检查动作完成情况并调整后续提示词。在性能与效率优化方面,采用轻量级单步 Refiner 恢复高分辨率细节,结合 TurboDiffusion 与 TurboServe 技术降低计算开销,实现各模块共享时间线调度。

在公开与专业评测中,Vidu S2展现了出色的综合性能。在 StreamAV-Bench 评测中,S2-Avatar 在视觉与音频质量、音画对齐及主体背景一致性等9项指标上均取得最优。在视频编辑方面,S2-Editing 在 OpenVE 与 RefVIE 联合评测中取得4.26分,在 Sparkle-Bench 上各项指标均为最优,并在 ViViD 虚拟试穿测试及多项专业人工偏好对比中大幅超越同类模型。

谈及未来规划,生数科技表示空间视频目前仍处于固定视角探索阶段,如何在头显中保持清晰画质并进一步降低延迟、探索全景空间视频将是接下来的核心攻坚方向。

体验网址:https://vidu.com/vidu-stream


相关文章

相关标签: 生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配