圖生影片完整教學|PixAI I2V 模型怎麼選+提示詞寫法 (2026)
PixAI 圖生影片一次搞懂:6 種 I2V 模型差在哪、起始幀與結束幀怎麼用、設定怎麼調、提示詞照什麼順序寫,附鏡頭運動對照表。
圖生影片(I2V)大概是 PixAI 裡最多人用、成就感也最高的功能。看著原本不動的圖突然活過來,那個瞬間很難不上癮。不過「會用」跟「用得好」中間,其實隔了不小一段距離。
要跨過去得先搞懂三件事:哪個模型擅長什麼、參數該動到哪、提示詞照什麼順序寫。這篇不是看完就丟的教學,是打算讓你卡關時隨時翻回來的工具書。
先把介面認熟
從上方導覽列點Video,就會進到圖生影片的工作區。結構很單純:上半部是生成結果堆疊的地方,下半部是一條把所有工具收在一起的操作列。
提示詞列:大部分結果在這裡就決定了
介面正中央的提示詞列,把圖片上傳跟提示詞輸入併在同一排。
起始幀 & 結束幀(選填)
提示詞列左邊有兩個用箭頭串起來的上傳格:
- 起始幀 — 影片從這張圖開始。
- 結束幀(選填) — 影片停在這張圖。如果你只想從一張圖自由發展,留空就好。
值得知道的一招:首尾幀怎麼用
大部分模型都同時吃起始幀跟結束幀。與其讓 AI 自己猜要往哪走,不如把 A 圖設成起點、B 圖設成終點,模型就會去算兩者之間最順的那條路徑。如果你腦中已經有最後一格的姿勢或構圖,差別會非常明顯。
提示詞輸入框
上傳格右邊,就是你描述畫面上要發生什麼的地方。一個好的提示詞會包含主體、動作、環境三個部分,後面會單獨拆開講。
控制列:決定成品長什麼樣
提示詞列正下方那排橫向設定,決定了影片會被怎麼生出來。
💡 這裡講的是所有模型都有的共通設定。每個模型還各自帶了專屬設定,那些會放到下一節介紹模型時一起說。
模型選擇
最左邊的按鈕顯示目前選用的模型(例如 V4.0 Preview)。點下去會打開完整的模型清單。
清單最上方有基礎與專業兩個分頁,用來切換生成模式:
- 基礎 — 快、點數消耗低。適合先跑草稿、確認想法可不可行。
- 專業 — 畫質、動作細膩度、細節保留都往上提。要真的拿去用的成品選這個。
分頁下面就是模型清單
每個模型都有自己的圖示、名稱,以及一串功能標籤(像是多圖參考、影片參考、音訊、HD),掃一眼就知道它擅長什麼。
目前共有六個模型,性格各不相同。下一節會逐一走過。
生成時長
決定影片多長。依模型不同,可以從 5 秒做到 15 秒,其中 15 秒是 v4.0 Preview 系列專屬。
看範例
每個模型都配了一支事先做好的範例,讓你先看清楚它能做出什麼。
❗️這些不是其他人的即時作品,也不是你自己生的。它們是為了讓你在花點數之前先摸清每個模型的脾氣而準備的參考樣本。不確定要從哪裡下手時,拿來比較特別好用。
右上角:內容模式
頁面右上角的下拉選單用來指定這次生成的內容模式,記得挑跟你要做的東西相符的那個。
其中 Professional 模式僅開放給 Plus 以上的會員。想放寬創作範圍的話,可以先看會員方案比較,再決定要不要升級方案。
六個模型,該挑哪一個
只想要結論的話,看這段就夠:
- V4.0 Preview — 次世代旗艦。支援多圖與影片參考,最長 15 秒
- V4.0 Lite Preview — 更便宜的 v4.0,適合日常產出
- V3.2 — 完成度與提示詞服從度最好,還能生音訊
- V3.0 (High Consistency) — 專治角色和畫風跑掉
- V3.0 (Flash) — 最快,適合反覆試
- V2.7 (High Dynamics) — 鏡頭有戲的電影感動態
| 比較項 | V4.0 Preview | V4.0 Lite Preview | V3.2 | V3.0 (High Consistency) | V3.0 (Flash) | V2.7 (High Dynamics) |
| 動態品質 | ✅ 頂規,非常細膩 | ✅ 日常使用綽綽有餘 | ✅ 自然、有表情 | ✅ 穩定可控(略顯僵硬) | ⚠️ 簡單動作 OK,大動作可能要重跑 | ✅ 有力道、有電影感 |
| 鏡頭控制 | ✅ 精細的電影級控制 | ✅ 電影感做得出來 | ✅ 模型自己抓得不錯 | ⚠️ 能動,但偏死板 | — 基本款 | ✅ 專屬鏡頭下拉選單 |
| 提示詞服從度 | ✅ 非常強 | ✅ 強 | ✅ 強 | ✅ 嚴格到有點過頭(就算不自然也照做) | ⚠️ 句子要寫得夠清楚明確 | ⚠️ 普通(優先顧畫面) |
| 一致性 | ✅ 跨幀表現極佳 | ✅ 很好 | ✅ 轉場順、邏輯穩 | ✅ 角色與畫風穩定度最強 | ⚠️ 快速確認夠用 | ⚠️ 不錯,但複雜場景可能跑掉 |
| 最長時長 | ✅ 最長 15 秒 | ✅ 最長 15 秒 | 5 / 10 秒 | 5 / 10 秒 | 5 / 10 秒 | 5 / 10 秒 |
| 參考輸入 | ✅ 多圖 + 影片參考 | ✅ 多圖 + 影片參考 | 起始 / 結束幀 | 起始 / 結束幀 | 起始 / 結束幀 | 僅起始幀 |
| 速度 | 中等 | 快 | 快 | 中等 | 最快 | 偏快 |
| 獨家功能 | 🆕 多重參考模式、15 秒輸出 | 🆕 同樣能力,成本更低 | 🎙️ 音訊生成 | 💃 舞蹈預設 | ⚡ 速度最快 | 🎥 鏡頭運動下拉選單 |
| 什麼時候用 | 品質與掌控度都要顧的正式作品 | 日常創作、概念發想 | 敘事短片、講話的畫面、需要聲音的場景 | 要把角色與畫風釘死時 | 草稿、反覆測試 | 戲劇性鏡位、電影感運鏡 |
模型挑對,結果就先贏一大半。六個逐一來看。
V4.0 Preview — 次世代旗艦
V4.0 Preview 是我們目前推出過最先進的圖生影片模型,也是最有企圖心的功能會優先落地的地方。
動態品質、鏡頭控制、場景一致性三項各往上跳了一級,寫給想榨出 PixAI 最高完成度的人用。模型本身的細節說明,可以看v4.0 Preview 介紹文。
V4.0 Preview 的差別在哪
- 動作更像真的 — 物理表現更合理,幀與幀之間的銜接更順
- 難場景比較不會垮 — 高難度動作、持續性的大動作都撐得住
- 鏡頭控制到得了細節 — 做得出有導演意圖的鏡位
- 詮釋空間更大 — 會自己把缺的部分補起來,把簡單想法撐成完整場景
- 一致性更好 — 角色、畫風、場景細節都守得住
🌟 多重參考(v4.0 Preview 獨有)
只有 v4.0 Preview 系列有這顆按鈕。點開下拉選單,就能換一種方式去引導生成。
上傳多張參考圖,或是一支參考影片,把外觀、構圖、動態抓得更精準。
額外功能:加入音訊
- 加入音訊 ON(預設) — 選一種語言,把角色要講的話直接打在提示詞框裡,模型會生出配音並對進影片。
- SE Only — 只有音效。沒有台詞,但會有符合情境的聲音。
- 加入音訊 OFF — 完全無聲(沒有人聲也沒有音效)。
什麼時候用:認真做的作品、電影感敘事、需要精細掌控、目標是頂規畫質的時候。
💡 還在 Preview 階段,有些內容類型尚未支援。生不出來的話,改一下提示詞或換掉參考素材再試。
V4.0 Lite Preview — 天天用的 v4.0
V4.0 Lite Preview 把 v4.0 世代拉到比較好入手的價位。想吃到 v4.0 的品質提升,又不想每跑一次都心痛點數的話,拿來做概念發想跟日常產出剛剛好。
底層跟 V4.0 Preview 共用同一套能力,旗艦功能一個沒少:
- 🖼️ 多圖參考
- 🎞️ 影片參考
- ⏱️ 最長 15 秒影片
什麼時候用:日常創作、想法試水溫、想用 v4.0 這套工具多跑幾輪又不想太傷成本的時候。
V3.2 — 會說故事的那一個(有音訊)
用 V3.2 的話,你的短片可以帶對白(配音)和貼合場景的音效。它是整個陣容裡唯一內建音訊生成的模型。
撇開音訊不談,V3.2 對提示詞的服從度也更高,「它為什麼要那樣做」的瞬間明顯變少。動作也比較看得出意圖:轉場順、鏡頭流暢,整體收得比較像一支片。
什麼時候用:有劇情的短片、需要提示詞被準確執行、要求收尾乾淨、或是需要人聲跟音效的時候。
V3.0 (High Consistency) — 把角色釘住的那一個
如果你遇過角色一動起來臉就變、衣服就糊、畫風就慢慢飄走——V3.0 (High Consistency) 就是為了對付這件事做的。
它的強項是穩。就算動作幅度變大,角色設計跟整體外觀還是守得相當牢。
什麼時候用:角色一致性、畫風穩定、短又可靠的片段(尤其是跳舞)。想先把角色設定固定下來,也可以先跑一次角色設定圖生成器。
額外功能:動作預設
V3.0 (High Consistency) 內建9 組動作預設,不用描述舞步就能做出當紅的跳舞影片。挑一支舞、按生成,結束。
V3.0 Flash — 給狂跑實驗的人的速度
V3.0 Flash 主打的就是速度跟成本。
沒有一堆模型專屬設定要顧,上手很快。如果你習慣多跑幾輪、測不同變化,或者只是想少花點數快點拿到堪用的結果,把它設成日常預設很合理。
什麼時候用:草稿、發想、快速測試、趕件。
V2.7 (High Dynamics) — 電影感運鏡
如果 V3.0 負責穩定,V2.7 (High Dynamics) 就是負責演出的那一個。
它是衝著更戲劇化的動態去設計的:景深更強、動作更有勁,畫面會有一種「鏡頭正在做事」的感覺。複雜場景也吃得下,提示詞就算寫得比較簡單,往往還是能生出很有動感的結果。
什麼時候用:電影感運鏡、有力道的片段、不想把提示詞寫複雜但又要控鏡頭的時候。
額外功能:鏡頭控制
V2.7 有一個只有它才有的鏡頭設定。不必把運鏡指令寫進提示詞,直接從下拉選單挑就好(例如水平或垂直橫搖)。指定好鏡頭運動之後,提示詞就能專心描述場景和動作,攝影交給模型處理。
提示詞怎麼寫才有用
這是最關鍵的一段。與其只丟範例給你,不如把每個技巧背後的道理一起講清楚——懂了原理,你才寫得出屬於自己情境的提示詞。
會成功的提示詞,通常長這個樣子:
提示詞 = 主體 + 動作 + 環境
從最底下那層開始拆。
第 1 層:定義主體
既然是圖生影片,主體已經在畫面上了,所以不需要寫一長串角色描述。但還是要簡單交代一下主體是誰。原因是這能讓模型抓住頭髮、服裝、五官這些視覺錨點,在動起來的時候維持一致性。想讓同一個角色跨多支影片都長一樣,可以參考OC / VTuber 設定圖生成指南。
A white-haired girl with cat ears and violet eyes
你寫下的每一個特徵,都會變成 AI 在整段動畫裡要追蹤並守住的東西。
第 2 層:指定動作
這是動畫的靈魂。你在告訴模型主體正在做什麼,所以要寫得具體、有意圖。動作一定要跟主體綁在一起寫,模型才知道要動誰、怎麼動。
✅ 好的寫法
The white-haired girl gently adjusts her bangs with one hand, tilting her head slightly
避免這種含糊的動作:
She moves around
改成這樣:
She slowly leans forward to pet the cat on her lap, her expression softening as the cat purrs.
幾個訣竅
- 用同時帶動作和質感的動詞(例如 leaps gracefully、glances quickly、twirls with hesitation)
- 不要只丟 moves、interacts 這種抽象詞
- 把身體動作跟情緒或節奏疊在一起寫,效果好很多
第 3 層:環境
模型也需要知道主體在哪裡,才能套上正確的打光、反射、空氣感,甚至風或粒子這類物理效果。
✅ 好的寫法
Sitting on a wooden classroom desk bathed in afternoon sunlight, dust particles dancing in the golden light
或是:
Standing beside a misty lake at dawn, soft light reflecting on the water’s surface
這些資訊就是模型計算光影、氛圍與背景互動的依據。
第 4 層:鏡頭運動(選填)
想要電影感就加鏡頭指令。但期待值要抓實際一點:基本運鏡大部分模型都做得到,複雜的鏡頭語言則是 v4.0 Preview 系列、V3.2、V2.7 支援得比較好。
提示詞 = 鏡頭運動 + 主體 + 動作 + 環境 + 攝影術語
鏡頭提示詞是在告訴 AI 怎麼取景、怎麼穿過場景。寫的時候把自己當導演:描述鏡頭在空間裡實際怎麼移動——是往前滑、往上仰,還是橫向掃過去。也要考慮時間感,別把走位設計得太複雜,AI 才執行得乾淨。
最重要的一點是:把鏡頭指令放在場景描述裡「那個動作真正發生」的位置。
Camera slowly pushes in through the crowd toward the girl,
transitioning into an over-the-shoulder shot as she gazes up
at the departures board.
這樣寫,AI 才不會搞混什麼時候該動、怎麼動。想在 v4.0 系列上把鏡頭玩得更細,可以參考v4.0 Preview 提示詞攻略,裡面有實際範例。
鏡頭運動對照表
| 運鏡方式 | 提示詞寫法 | 適合用在 |
|---|---|---|
| 推鏡 Push In | “camera slowly pushes in from [wide/medium] to [medium/close-up]” | 情緒揭露 |
| 拉鏡 Pull Back | “camera pulls back to reveal [context/environment]” | 交代情境 |
| 橫搖 Pan | “camera pans smoothly from left to right across the scene” | 帶出場景全貌 |
| 直搖 Tilt | “camera tilts up from [feet/ground] to [face/sky]” | 角色登場 |
| 環繞 Orbit | “camera orbits around the subject in a [clockwise/counter-clockwise] motion” | 動感展示角色 |
| 跟拍 Track | “camera tracks alongside as [subject] moves [direction]” | 跟隨動作 |
| 升降 Crane | “camera cranes up from ground level to bird’s eye view” | 戲劇性的尺度轉換 |
| 推軌 Dolly | “smooth dolly shot moving [forward/backward] while maintaining focus” | 電影感的靠近 |
收個尾
整條流程就到這裡。要講故事就找 V3.2,要把角色釘住就找 V3.0 High Consistency——先挑對引擎,再把提示詞一層一層疊上去。剩下的就是多跑幾次、把手感養出來。
圖生影片功能後續的更新,可以持續追I2V 教學更新那一篇。
延伸閱讀
