1. 選擇文字轉影片或圖片轉影片
開啟生成器,依照已有素材選擇模式。文字轉影片從場景描述開始;圖片轉影片則把你上傳的靜態圖片作為起始影格。
從初步構想到完成影片只要四個步驟,不必先在時間軸上剪接多段素材。
開啟生成器,依照已有素材選擇模式。文字轉影片從場景描述開始;圖片轉影片則把你上傳的靜態圖片作為起始影格。
逐一寫清楚主體、動作、場景、光線與運鏡,每個鏡頭使用一行。Wan 3.0 AI 對「緩慢推近」或「手持跟拍」等具體指令的理解,比單獨使用氣氛形容詞更準確。
選擇 2 至 30 秒之間的整數片長,並以 480p、720p 或 1080p 生成。啟用音訊時,Wan 3.0 AI 會同步生成配合畫面動作的音訊。
觀看生成結果,每次只修改一個變數,再重新生成以比較差異。當 Wan 3.0 AI 影片符合需求後,即可下載 MP4,直接加入剪輯流程或發布。
Wan 3.0 AI 是 Alibaba 的 Wan 系列第三代影片模型,重點在更長時間內維持場景連貫。它能在完整的 30 秒鏡頭中盡量保持臉部、服裝與光線一致,並在渲染畫面時同步生成音訊,而不是完成後再透過後製疊加。
描述想呈現的場景與動作,Wan 3.0 AI 會生成畫面、動態與環境氛圍。內建提示詞擴寫能補足簡短描述中的細節,讓精簡需求也能形成完整鏡頭。
上傳起始影格即可讓模型賦予動態;再加入結束影格時,Wan 3.0 AI 會規劃兩者之間的動態過渡,適合快速把產品照片轉成動態鏡頭。
片長是可直接選擇的設定,不必把多次生成結果拼接起來。單支影片最長可達 30 秒,讓動作與音訊在同一個連續鏡頭中自然延伸。
多主體一致性有助於人物從第一個影格到最後一個影格都保持可辨識。這種穩定度讓 Wan 3.0 AI 生成的電影感片段更容易放入實際剪輯,而不只是作為展示範例。
Wan 3.0 AI 可在一次生成中同時處理畫面、運鏡與音訊,減少在多套工具之間往返,讓可用片段更快進入審片與剪輯流程。

以下設定會直接影響影片外觀,也是開始生成前最值得先掌握的控制項目。
Wan 3.0 AI 會先把簡短提示詞擴充成較完整的場景描述,再開始渲染;即使不為每次生成撰寫長篇內容,也能補足必要細節。
圖片轉影片可以只使用起始影格,也能同時提供起始與結束影格。加入兩張圖片後,模型會規劃銜接兩者的動作與鏡頭變化。
環境音、腳步聲與空間聲響會隨畫面一起生成,而不是透過後製疊加;因此完成的電影感片段能在第一次預覽時就保持聲畫同步。
可選擇 2 至 30 之間的任一整數秒數。短版社群循環影片與完整 30 秒場景,都能使用同一套模型流程生成。
模型會在鏡頭移動時盡量維持臉部、服裝與道具的一致性,讓兩支 Wan 3.0 影片前後剪入同一段序列時更連貫。
先以較低解析度製作草稿,再將選定版本輸出為清晰的 1080p。每次生成都能獨立選擇解析度,便於平衡測試成本與最終畫質。
瀏覽 Alibaba 相關帳號、評測者與創作者公開分享的 Wan 3.0 精選貼文,查看發布資訊與生成影片範例。
觀看精選 Wan 3.0 影片介紹,在設定自己的文字轉影片或圖片轉影片要求前先了解模型。