Skip to main content
Wan万相 3.0 是阿里巴巴最新的视频生成模型,现可通过合作节点在 ComfyUI 中使用。它可以在单次生成中输出最长 30 秒的视频,并带有同步音频轨道,同时将文本提示与参考图像、视频和音频相结合,以实现一致的角色和场景。

Wan万相 3.0 擅长什么

  • 长达 30 秒:单次生成具有连贯动作和音频的长片段
  • 原生音频:默认情况下,每个输出都包含同步音频轨道
  • 文本、图像和参考输入:纯文本提示词、首帧动画,或最多 10 张参考图像、5 个参考视频和 5 个参考音频片段
  • 参考标签:直接在提示词中提及连接式媒体,如 @Image1@Video1@Audio1
  • 灵活的输出:480p、720p 或 1080p 分辨率,支持自适应、16:9、9:16、1:1、4:3 或 3:4 宽高比
  • WAN3-Prime 模型model 选项还提供 wan3.0-video-prime,输出保真度更高,但每秒费率也更高
  • 双语提示:支持英语或中文提示

示例输出

仅凭提示词即可进行文生视频生成,默认包含同步音频: 图生视频生成,将单张图像动画化为完整片段: 参考生视频生成,从参考图像中保持产品和角色的一致性:

在 ComfyUI 中使用

Wan 3.0 工作流

在 ComfyUI 中运行文生视频、图生视频和参考生视频工作流,可本地运行,也可在 Comfy Cloud 上运行。