All models

wan2.6-r2v

AlibabaVideo
13.5–46.5 Credits
Get your API key
wan2.6-r2v

用参考视频延续角色身份,创作有声短叙事

wan2.6-r2v 是阿里巴巴 Wan 2.6 系列的视频参考生成模型,适合把已有视频中的角色外观带入新的场景与故事。它以参考素材建立人物身份,再结合文字描述安排动作、环境和叙事,具备多角色与音频同步能力,适用于连续角色短片、品牌人物内容和创意镜头制作。

Alibaba模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
参考视频与文字提示联合生成
原生分辨率
720P、1080P
原生时长
2–10 秒
原生视频输出
30 fps,MP4
角色与声音
多角色、叙事、音频同步
平台素材入口
POST /wan/videos;reference_video_urls 提交参考视频地址
平台任务结果
支持异步任务;返回视频地址、尺寸与缩略图等信息

分辨率、时长、帧率和格式为原生规格;素材提交与结果获取采用本平台的 Wan 视频接口。

核心能力

了解 wan2.6-r2v 能为你的工作带来什么。

让同一个角色走进新场景

视频参考的重点是角色身份,而不是重新用文字猜测人物长相。wan2.6-r2v 可从已有片段提取角色外观,并用于新的场景创作。准备人物清晰可辨的素材,再描述目标环境、服装意图与动作,更适合围绕固定人物持续制作内容。

围绕多角色组织短叙事

模型具备多角色与叙事能力,适合表现人物相遇、互动或共同完成动作的短片。创作时可分别交代角色身份、位置和行动顺序,让短时间内的事件有明确主线;不必把复杂故事全部塞入一个片段,可按情节拆分制作。

把声音纳入镜头设计

wan2.6-r2v 的原生能力包含音频同步,适合把声音需求与人物动作、场景氛围一起规划。提示词可明确哪些事件需要声音配合,避免只写视觉标签。制作完成后,应同步检查画面和声音的对应关系,再决定是否补充剪辑或配音。

适用场景

从具体任务出发,找到模型发挥作用的位置。

固定人物的系列短片

以已有角色视频为参考,输入本集的地点、动作和情绪变化,生成延续人物身份的新片段。适合角色从室内走向街头、进入不同故事环境等创作。交付物是可继续剪辑的短视频,制作团队可逐条审核人物特征与情节衔接。

品牌人物的情境创意

围绕已有品牌人物或出镜角色,设计不同使用情境、互动方式和开场动作,用参考视频加创意脚本生成候选镜头。适合先验证人物在新场景中的表现,再选取合适片段进入广告制作;产品标识与文字细节仍应在成片阶段检查。

多角色互动的分镜试作

将短剧情整理成谁出现、谁行动、发生什么的镜头描述,并配合角色参考素材生成互动片段。交付物可用于评估构图、人物关系与叙事节奏,帮助团队讨论拍摄方案。优先测试关键互动,再将选定镜头组合成更完整的故事。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

已有视频人物,优先考虑 r2v

如果任务核心是让已有视频里的角色进入新场景,wan2.6-r2v 比从零描述人物更贴合工作方式。只有文字构想时可选择 wan2.6-t2v;以静态图片作为起点时可考虑 wan2.6-i2v。两者公开时长为 2–15 秒,而本型号为 2–10 秒,选择时应同时考虑素材类型与镜头长度。

标准版与 Flash 按目标取舍

wan2.6-r2v 明确具备音频同步、多角色和叙事能力,适合需要把人物、事件与声音一起设计的短片。wan2.6-r2v-flash 是强调快速生成的参考视频变体,可在重视迭代速度时考虑。不要仅凭名称假定两者声音控制完全一致,应围绕实际创作目标分别测试。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 本型号的原生输出时长为 2–10 秒,适合短镜头而非一次生成长剧情。超过这一范围的故事应拆成若干片段,分别安排角色动作与情节重点,再通过剪辑衔接;同系列文本或图片生成的较长时长不能直接套用。
  • 角色外观迁移不等于逐帧复制原视频,也不等于对已有视频执行精确替换或动作复刻。若目标是保留原镜头运动、逐帧修改背景或替换演员,应选择对应的编辑或动画任务,而不是把视频参考生成当成确定性编辑。
  • 参考生成适合延续角色身份,但不应将人物细节、复杂遮挡和多人交互视为绝对锁定。建议使用角色清晰、身份易区分的素材,逐段检查服饰、面部与动作连续性;对必须精确呈现的品牌元素保留后期修正环节。

常见问题

解答使用 wan2.6-r2v 时的常见疑问。

wan2.6-r2v 与普通图生视频有什么不同?

它以参考视频中的角色身份作为创作依据,把人物外观用于新的场景;图生视频则以静态图片作为生成起点。如果已有视频角色并希望继续讲述其故事,r2v 更贴合任务;如果主要希望让一张画面动起来,可考虑 wan2.6-i2v。

可以生成多长、什么清晰度的视频?

wan2.6-r2v 的原生输出规格是 2–10 秒,支持 720P 与 1080P,视频为 30 fps 的 MP4。设计脚本时应围绕短镜头安排动作,不要把 wan2.6-t2v、wan2.6-i2v 的 15 秒上限当作本型号的输出范围。

怎样提交参考视频并取得生成结果?

向 POST /wan/videos 提交 model=wan2.6-r2v,用 reference_video_urls 提供参考视频地址,并用 prompt 描述新场景。设置 async=true 可先取得 task_id,再通过 /wan/tasks 查询终态;成功后获取视频地址用于播放或下载。

提示词怎样写更适合角色迁移?

先说明参考角色在新片段中的身份,再描述环境、动作顺序和镜头意图。多角色任务要区分谁做什么,避免只写“电影感”等抽象词。把情节集中在一个明确事件上,并检查生成后的人物外观与行动是否符合创作目标。

它支持声音吗,是否等同于配音编辑?

wan2.6-r2v 具备原生音频同步能力,可用于有声短叙事,但这不等于独立的配音编辑、精确口型修复或声线克隆工具。创作时应把声音需求与场景事件一起描述,完成后检查同步效果;需要精确台词或声音处理时可再安排后期。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 wan2.6-r2v 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。