生数科技发布 Vidu S2双旗舰:让人工智能实时视频迈入“P视频”时代“边发生,边改写”
近日,生数科技正式发布 Vidu S2,并于发布当天全量开放在线体验。
此次发布包括两款模型:面向持续交互数字角色生成的 S2-Avatar,以及面向输入视频流实时编辑的 S2-Editing。
其中,S2-Avatar 将实时输出提升至 720P,并支持用户在互动过程中随时加入新的参考图,让角色能够持续响应新的指令和视觉信息;S2-Editing 则面向持续输入的视频流,可以实时改变画面中的风格、服装、人物和背景。
除了实时互动和实时编辑,Vidu S2 还把探索进一步延伸到了空间视频。
几乎同一时间,“实时空间视频”正在成为视频模型领域新的关注方向。9 月 7 日,彭博社援引知情人士报道称,字节跳动正在开发一款基于 Seedance 的实时空间视频生成模型,由张一鸣亲自督导,并计划面向直播、短剧、游戏以及 Pico 等 VR 场景,探索交互式虚拟世界。具体发布时间目前尚未最终确定。
Vidu S2 此次也展示了类似方向上的技术探索:将实时生成或实时编辑的视频转换为左右眼视频,并通过 VR 头显观看。
例如,一个由 S2-Avatar 实时生成的角色,可以一边与你持续对话和互动,一边以空间视频的形式呈现在头显中;基于 S2-Editing,现实世界持续输入的视频也可以被实时修改,再进一步转换为空间视频观看。
视频模型正在从“生成一段内容”,继续走向对持续视频流乃至沉浸式空间体验的实时操控。从实时生成,到实时编辑,再到空间视频,这也是 Vidu S2 相较上一代进一步扩展的能力边界。
Vidu S2 的全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。相比部分实时交互模型在发布初期采用早期体验申请或限量研究预览,Vidu S2 选择发布即全量开放。用户可通过【插入官方地址】直接使用,在实际操作中感受模型对新指令、新参考图以及持续视频输入的实时响应。
根据生数科技公布的技术报告,S2-Avatar 在实时数字角色生成基准 StreamAV-Bench 的九项指标中,均取得报告所列对比模型的最优结果;S2-Editing 在多项视频编辑基准中,也取得超过报告所列离线与流式对比模型的总体得分。


“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”
