PixAI v4.0 Preview 提示詞攻略— 從一張角色圖到一支 15 秒動漫短片
参考素材怎麼疊、迭代怎麼跑、台詞和 SFX 怎麼寫、Mio.2 怎麼接管前製 ── 我們做出 15 秒動漫短片靠的這套流程,這篇全部攤開來給你看。
第一次接觸 v4.0 Preview 的人,建議先把整體能力地圖看過一遍 ── 它能做什麼、跟 PixAI 既有模型差在哪、音效生成跟參考影片又解鎖了哪些做法。這些概要我們另外整理在這篇:什麼是 PixAI v4.0 Preview? →
如果你想橫向看清整個 PixAI 影片模型陣容,或想從 i2v 面板的每個設定項目逐一搞懂,這篇也很對胃口:PixAI 圖片轉影片完整教學 →(英文文章)。否則就直接往下讀。
在 PixAI v4.0 處理參考素材
— 圖片、影片、音訊
v4.0 Preview 在工作流中,會接受三種完全不同的參考素材。每一種對應的並不是「視覺品質」,而是模型在生成中要參考的「語意層級」。
用「@image1 的角色」這種寫法引用。v4.0 會解讀圖片中角色的特徵,後續動作則由提示詞決定。
用「@video1 的鏡頭運動」這種寫法引用。v4.0 會分析影片的運鏡軌跡、節奏感和情緒氛圍,把它移植到新場景中。
用「@audio1 的嗓音」或「@audio1 的配樂氛圍」引用。文字難以描述的音色質感,就交給音訊參考。
參考圖片 ── 用來鎖角色,而不是鎖場景
越是「乾淨的圖」,得到的角色一致性越強。
提到「參考圖片」,很多人第一反應是「丟一張喜歡的圖讓 AI 模仿」── 但 v4.0 Preview 的設計不是這樣。它把參考圖當作角色身份的錨點:髮色、五官、服裝、配件、體型 ── 這些是它應該抓取的;至於姿勢、表情、鏡頭、光影、背景 ── 那是提示詞要決定的。
換句話說,你給的參考圖越單純 ── 像角色立繪、白底人物像、乾淨半身照 ── v4.0 越能精準抓住「角色本身」。如果你給一張背景複雜、姿勢戲劇化、後製濾鏡很重的構圖圖,模型容易把那些「環境元素」也當成角色特徵帶過去,結果就是角色一致性被稀釋掉。
在團隊內部我們有一個簡單的判斷準則 ── 「這張圖如果拿去做角色設定資料夾的封面,會不會合理?」如果答案是 yes,那就是好的參考圖。
參考圖只負責「她是誰」;鏡頭、表情、氛圍都由提示詞決定。
寧靜近景。角色一致,鏡頭緩慢推進。氛圍由提示詞建立,不靠原圖。
雨夜街景。完全不同的環境,角色依然是同一個她。
教室回眸。動作與情緒交給提示詞,角色由參考圖鎖定。
參考影片 ── 拿來借鏡頭運動,不是借畫面
這裡最容易踩的雷,是把參考影片當成「截圖再生成」的素材。
v4.0 Preview 對「參考影片」的處理方式跟參考圖完全不同 ── 它不是要重現你給的畫面,而是抓住那段影片裡的鏡頭軌跡、節奏和氛圍密度,再把這個「運動骨架」套到你新場景的人物與環境上。
所以挑參考影片時,要看的是 ──「這段鏡頭怎麼動?是慢慢推近還是急速橫掃?節奏是緊湊還是悠長?情緒是壓抑還是奔放?」 而不是「畫面好不好看」。同一段「鏡頭緩慢推進、聚焦人物面部,主角微微回眸」的參考影片,套到日系教室、街頭、海邊、奇幻場景上,每次都會給出非常合適、卻完全不同的結果。
提示詞的寫法也對應這個邏輯 ── 借用 @video1 的鏡頭運動,用在 @image1 的角色身上,這比直接複製整段參考影片要精準得多。
參考影片不是用來重現畫面 ── 是用來抽取運鏡的「骨架」。
不同角色,但鏡頭推進的速度、節奏完全照搬自 @video1。
場景、角色、光線都換了,唯一保留的是 @video1 的運鏡邏輯。
第三個場景。同樣的「鏡頭緩慢推近 + 微微回眸」節奏。
支援格式為 mp4,檔案大小 50MB 以內,單段長度 15 秒以內。若使用多個影片參考,總時長也不可超過 15 秒。
參考音訊 ── 嗓音特質與配樂氛圍
用來處理文字描述不出來的音色質感。
v4.0 Preview 接受音訊檔做參考,鎖定特定的「聲音指紋」。你想讓角色說出某種嗓音 ── 那種文字寫不清楚的、需要用耳朵才能對齊的音色;或者你想讓 BGM 的氣氛跟編曲走某個方向 ── 都可以拿一個範本音檔做參考。
提示詞裡明確寫出你要借的是「什麼」── 借用 @audio1 的嗓音特質,或者 配樂氛圍跟編曲走 @audio1 的方向。這跟影片參考的邏輯相同。
不過要注意 ── 對白、環境音、音效(SFX)通常不需要音訊參考。這些直接寫進提示詞文字就夠了(後面會詳細說)。音訊參考的真正用處,是在處理「文字寫不清楚的音色」或「氛圍密度」這類需要耳朵對齊的問題。
角色、提示詞、動作完全相同。改變的只有音訊參考。
哀傷。低沉弦樂、緩慢節拍、稀薄的空氣感。
夢幻。飄浮的合成 pad、停留在空中的音色、輕柔的混響。
輕快。明亮節奏、有活力的編曲、暖色調情緒。
▸ 查看提示詞
@Image1 — hair strands drift and flutter gently in the breeze. The flowers behind her sway softly with the wind. The camera slowly moves in to a close-up on her face as she reaches out her hand to touch a bubble floating in the air. Reference the rhythm and atmosphere of @Audio1.
動畫影片的文字提示詞寫法
— 分成兩種情境來處理
市面上多數提示詞教學丟一條「公式」就結束。但實際在工作流中,寫提示詞會分成兩種完全不同的情境 ── 對應的技巧也不一樣。
腦中已經有想做的鏡頭時
鏡頭已經清楚的話 ── 例如「鏡頭緩慢推進她的臉,櫻花瓣由左向右掠過,第二拍時她回頭」── 直接寫出來就行。
這裡最容易踩的陷阱是「看起來很電影、但其實很模糊的表述」。「鏡頭推近」對 v4.0 Preview 來說,遠遠不如「鏡頭隨著她回頭的動作緩慢拉近」精確。與其用「鏡頭運動」這種抽象詞,不如直接用實拍術語 ── push in(推進)、pull back(拉遠)、tilt up(上仰)、drift(漂移)、orbit(環繞)、pan(搖鏡)、dolly(軌道)。傳達動作順序時,「然後」、「接著」這類連接詞很重要。「她垂下視線,緩緩抬眼望向鏡頭,露出淡淡微笑」── 這樣寫,先垂眼 → 再望向鏡頭 → 最後微笑的時序就確立了。沒有連接詞,模型會把多個動作壓成一個靜止瞬間。
這個情境相對簡單。如果你已經有清楚的鏡頭畫面,可以跳到 提示詞寫作習慣 那段。
有圖、但還不知道要讓它怎麼動
事實上,大部分影片生成都是從這裡開始的。你找到一張喜歡的插畫,想「把它動起來」,但具體要做什麼動作還沒想好。多數教學文章會跳過這個情境,因為它們假設你腦中已經有完成版的畫面。
這種情況下,真正有效的是下面這個迭代改進迴圈。
用 LLM 產出初稿。
把圖片丟給 Claude 或 ChatGPT,請它寫一段短的影片提示詞。把這份輸出當作原料、不是成品。
用輕量模型做測試。
把初稿丟到 v4.0 Lite Preview 或 v2.7 高動態模型上跑。又快又省錢,結構大致跟 Preview 一樣。模型比較請看 什麼是 PixAI v4.0 Preview?
讀「失敗」,不是讀提示詞。
看生成出來的影片,找出哪裡偏離了原本的意圖。要修的不是你寫的字句,而是「意圖」與「結果」之間的差距。
最終版本才上 v4.0 Preview。
同一份提示詞,這次在 v4.0 Preview 上生成。性能差別會直接讓動作更流暢、角色一致性更高、光影表現更細膩。
寫初稿 → 用輕量模型測 → 讀失敗 → 跑最終版本。這個迴圈,就是「真正吃透工具的人」做出來的影片,跟「第一次嘗試就交件」差別的根本。
在 v4.0 上要避開的 AI 影片提示詞錯誤
五種失敗模式,五個對應的修法。
前面說的迭代迴圈要真的能轉起來,必須能準確指出「什麼是失敗」。下面是我們最常遇到的五種失敗模式,以及實際有效的修正方法。
LLM 自作主張加上原圖沒有的角色特徵
你說「貓耳少女」,LLM 順手就猜出「也應該有尾巴」。你說「水手服」,圖裡明明沒有領帶,它也會自己補一條。問題在於那些「自動補上的元素」會在影片中途突然冒出來 ── 我們的測試中這種錯誤出現了四次。
把初稿提示詞跟參考圖並排,逐行重讀,把實際在圖上看不到的元素全部刪掉。
▸ 查看失敗案例影片
▸ 提示詞(標出 LLM 自作主張加上的 her tail flicking gently)
A cute young anime cat girl in close-up, white short hair, cat ears, heart-shaped ahoge, large purple eyes with small pink hearts in the pupils, wearing a navy sailor uniform with a blue ribbon scarf and a small black beret on her head, soft pink blush on her cheeks. She is resting her chin on both hands cupped under her face, gazing softly at the camera with a shy smile. Small pink heart particles and sparkle stars float gently around her in the air. Soft cyan and pink pastel light surrounds her like a dreamy glow. The video starts with her looking down shyly, then she slowly lifts her eyes to meet the camera and gives a tiny knowing smile, her tail flicking gently behind her, one heart particle drifting up past her face. The camera slowly pushes in toward her face during this moment. Anime illustration style, soft painterly textures, kawaii aesthetic, dreamy pastel lighting, intimate close-up framing, gentle slow motion energy.
LLM 只描述、不導戲
初稿提示詞常見的模式 ── 一路描述靜止畫面。緞帶、配件、衣服皺褶,外觀描述塞了一堆,但卻沒有任何動作。結果就是出來的影片實際上跟靜畫沒兩樣。
把描述句果斷刪掉,只留下「什麼東西在變化」的動詞。
▸ 查看失敗案例影片
▸ 提示詞
Two cat girls appear together in this video, facing each other as opposites — the angel and the devil. Character from @image1 and character from @image2 face each other in an empty void of soft pastel light, no environment, no background — only the two characters and a dreamy gradient atmosphere of soft pink and lavender mist around them. They stand close together, the angel on one side and the devil on the other, eyes meeting in mutual recognition. The angel slowly raises her hands to form a heart shape near her chest with a gentle smile. The devil mirrors the gesture but with a playful smirk, sticking out her tongue. They lean slightly toward each other, sharing a quiet moment of acknowledgment as if they understand they are two halves of the same person. Soft sparkle particles drift between them in the void. The camera holds steady at medium shot, framing both characters in the same frame throughout.
一個鏡頭裡塞太多元素
問 LLM 一個情人節氛圍的場景,它有時會給你這樣的建議 ──「她站在玫瑰園裡,手拿玫瑰,花瓣紛飛,氣球飄浮,巧克力流淌」。一個鏡頭塞了十五個元素。結果就只是視覺雜訊。
一個鏡頭就一個主體、一個動作、一個環境氛圍。其他全部刪掉。
模型為了「合理化」提示詞,硬補出物理常識
我們之前寫過 ──「金魚在她身邊漂浮」,結果 v4.0 為了解釋「金魚為什麼會在這裡」,自己加上了水窪和水下空間。模型如果沒有額外指示,它會盡可能讓畫面符合真實物理規則。
超現實的元素,要連前提一起寫清楚 ──「金魚漂浮在空中。這是夢境,不需要符合真實物理」。
▸ 對比:原始結果 vs 修正後
▸ 修正後提示詞(關鍵修正:明確的「夢境」框架 + 分拍時序)
Transform this static character art from @image1 into a gacha-style animated character card, following the same camera motion and pacing style as @video1. CAMERA MOTION (mirroring the path of @video1): [0-1.2s] Open on a close-up of her left hand holding the small red-stringed charm pouch (omamori) at her waist. Soft warm light on the red fabric, goldfish drifting slowly past in the soft background blur. [1.2-2.5s] The camera slowly drifts upward along her body — past her green striped yukata, settling onto her face. More goldfish become visible, gently swimming through the air around her, pink petals drifting across the frame. [2.5-3.5s] At her face, the camera gently lingers — her purple eye meeting the viewer softly, the goldfish continuing their slow parallax behind her. The camera makes a subtle floating motion as if caught in the same dream. [3.5-4.2s] The camera slowly pulls back to reveal the full composition — her standing beneath the temple roof eaves, goldfish suspended in the air around her, petals drifting. [4.2-5s] CARD REVEAL CLIMAX — multiple goldfish swim into view from the edges joining the dream, soft bloom intensifies around the frame.
只寫了「轉場」,卻沒給模型「轉場的橋」
「畫面溶入霧氣,然後她出現在舞台上」── 對人類來說很順,但模型多半就只給你硬切。
給模型一個它真的能動的「物理上的橋」── 鏡子變成傳送門、簾幕慢慢拉開、花瓣橫掃過整個畫面。
寫出乾淨輸出的提示詞習慣
跑得夠多之後,自然會看見一些共通的習慣。
用「導演」的視角寫,而不是「小說家」
句子短、確定。每一句只放一個資訊。「頭髮微微飄動。固定鏡頭。慢慢眨眼。」── 這樣寫,v4.0 Preview 會把它讀成導演的指令,而不是文學描寫。
注意你用的是哪一種時間戳記
[Scene 1: 0-3s] 這種寫法是要求 v4.0 Preview「切換鏡頭」。而 [0-1.2s] 這種寫法則是「在同一個連續鏡頭內標出節奏」。紙面上看起來差不多,用途完全不同 ── 混用是讓多鏡頭提示詞跑出投影片感的主因。
對白有固定格式
語音對白由三部分組成 ── 嗓音特質 → 情緒語氣 → 對白原文(保留原語言字符)。
Voice line — 害羞王子般的嗓音,溫暖而微顫的語氣:「那個…… 中午要不要一起?」
關鍵是不要羅馬拼音化。v4.0 Preview 處理語音時,原語言字符的解析準確度高過拼音。
音效寫法跟電影音效設計同邏輯
音效不要用長句描述,把元素切開、用破折號排列:
SFX:磅礡雨聲 — 遠處低沉雷鳴 — 寂靜 — 一聲心跳
比把音景寫成段落要準確得多。
「漫畫條輸出模式」是真實存在的
想用就明確寫出來:
From left to right, top to bottom, present this as a comic strip. Add special sound effects for scene transitions.
這樣寫,v4.0 Preview 會切到多格漫畫模式 ── 分格動畫 + 場景過場音效。用來做會動的漫畫頁、或同人 PV 都很合適。
整合起來看一下
實務上一次 v4.0 Preview 生成大概是這樣組成的:
@image1── 角色參考(乾淨的立繪、姿勢自由)@image2── 只放舞台背景的場景圖@video1── 用作鏡頭運動的動畫參考
@image1 的角色站在 @image2 舞台中央,以沉靜的自信感望向正前方。鏡頭緩慢推近她的臉,幾片櫻花瓣由側邊飄入畫面。借用 @video1 緩慢、夢幻的鏡頭節奏。
三個參考、四句提示、一支電影感影片。關鍵在於 ── 真正承擔工作量的是參考素材,提示詞只負責勾勒動作與運鏡方向,剩下的就交給迭代迴圈來抓失敗、做修正。
v4.0 Preview 真正發揮的時候,工作流就是長這樣。
製作工作流
— Mio.2 前製作業 + Edit Pro 漫畫
什麼時候用 Mio.2,什麼時候直接寫提示詞
角色有了,但具體的影片畫面還沒明確的時候。Mio.2 這個 AI Agent 會幫你跑完六階段前製作業 ── 提案、腳本、分鏡表、生成參考圖 ── 並在最後直接吐出一份完整的 v4.0 Preview 提示詞。
腦中已經有清楚的鏡頭跟運鏡方向(前面的情境 1)。跳過前製階段,配上 1~2 張參考圖跟簡潔的 v4.0 Preview 提示詞,直接生成。
實務上的影片製作多半是前者。所以工作流 1 才有存在的價值 ── Mio.2 是「我有一個喜歡的角色」變成「我有一支可以公開發布的 15 秒動畫」中間的那座橋。
用 Mio.2 跑 AI 影片的六階段前製作業
從角色 + 模糊想法,到 15 秒短片。
角色有了,想法也有,但要填滿 15 秒卻沒頭緒 ── 這時候才用得上這個工作流。六個階段全部跑在同一個 Mio.2 對話裡,這樣 Agent 才能保留前後脈絡,從提案到完成一氣呵成。
下面這個範例是真實案例 ──「她沒能交付的心意」,一支百合 × 悲劇短片。主角是一個銀髮、貓耳、戴眼罩的賭徒少女。
「她沒能交付的心意」── 六階段工作流產出的 15 秒短片。
產出故事提案
先上傳角色圖,然後這樣對 Mio.2 說:
Based on the character in this image, suggest 5 short-form anime story pitches in the [genre/vibe] direction. For each pitch, include a one-line logline, the opening shot or first line, and what emotional reaction it's going for.
這樣寫的原因:在 [genre/vibe] 裡填上你想要的方向 ──「jirai-yuri tragedy(地雷系 × 百合 × 悲劇)」、「isekai villainess comedy(異世界 × 反派千金 × 喜劇)」、「casino gambling thriller(賭場 × 賭博 × 驚悚)」、「slice-of-life with one twist(帶一個轉折的日常)」。空著的話,就只會吐出泛泛、安全的提案。一旦明確指定氛圍跟類型,產出的提案就可以直接帶進製作流程。
挑一個提案來打磨
挑了喜歡的提案,給出明確的修改指示來打磨:
Develop pitch #[N]. Change: [what to adjust]. Keep: [what to preserve]. Rewrite the pitch with these changes, keeping the same emotional core.
這樣寫的原因:Change(要改的)/ Keep(要保留的)的結構可以避免 AI 把整個提案大規模改寫。沒有這個結構的話,AI 會在對話歷史裡偷偷覆蓋掉前一版的提案。
先做完整結構,再來壓縮
先做完整版:
Outline this pitch as a [15-second] anime short with a hook (first 2s), build (story beats with rough timing), and final image. Include the actual dialogue lines. The premise should be conveyed indirectly through visuals and subtext — never stated out loud.
這樣寫的原因:把你要的影片長度填進 [duration]。提示詞裡的「絕對不要用嘴巴講出來」是最關鍵的限制 ── AI 在壓縮短內容時很容易說明過頭。有這一條,對白就會以「潛台詞」而不是「說明」的方式運作。
產出分鏡表
Break this script into a shot list with a maximum of [number] shots. For each shot, specify timing, frame composition, what's in the frame, camera movement, key visual detail, and dialogue or on-screen text. If you produce more than [number] shots, compress to exactly [number] — each shot must do irreplaceable work.
這樣寫的原因:在 [number] 填入跟你打算用的參考圖數量一致。v4.0 Preview 最多接受 6 張參考圖,但實務上 3~4 張會比 6 張更穩定。參考越多,模型的注意力就越分散 ── 先讓 Mio.2 多列一點、再壓回少數幾個鏡頭,反而能挑出更好的構圖。
產出參考圖
給 Mio.2(或圖片生成 Agent)的提示詞:
Based on the shot list below, generate [N] storyboard images for video generation. Use the attached character reference image(s) to keep the character consistent across all shots. Do not include any text in the images. Match the art style of the reference. [Paste your Stage 4 shot list here.]
這樣寫的原因:務必附上角色參考圖 ── Mio.2 會把它當作「鎖定角色一致性的基準」。「圖中不要出現任何文字」、「依照參考圖的畫風生成」── 這兩個限制可以保證產出的圖直接拿去當 v4.0 的參考素材時,狀態是乾淨可用的。
第一次生成幾乎不可能一次到位。常見的問題 ── 髮型長度不一致、瞳色變了、單人鏡頭莫名多了一個角色、招牌配件套到別人身上。這些都可以一次指示修好。重點是要明確指出「哪裡錯了」:
「請重新生成 Shot 3。畫面只要賭徒一個人,請去掉第二個角色。瞳色請確認是清晰的紫色。也請修改 Shot 2 ── 水手服貓耳少女不要戴眼罩。」
讓 Mio.2 寫出 v4.0 提示詞 ── 收尾
前面五階段的工就在這裡收成:
Based on the script and shot list from earlier in this conversation, write a v4.0 Preview video prompt for the [N] reference images you just generated. For each timestamped beat, include: time range, which @image to reference, action and camera description, dialogue (with the exact lines from the script), and SFX cues. Use em dashes for layered SFX. Keep total prompt length under 2000 characters. Example output format: 0s–Xs: @Image 1 [Action description with camera movement]. [Character]: "[Exact line from script.]" SFX: [sound 1] — [sound 2] — [sound 3] Xs–Ys: @Image 2 [Action description]. [Character]: "[Exact line.]" SFX: [layered sounds with em dashes] [Continue for each beat. End with fade-to-black instruction if applicable.]
這樣寫的原因:「exact lines from the script(直接使用腳本對白原文)」這一條是關鍵。AI 在寫提示詞時很常把對白自行改寫一遍,這樣會把 Stage 3 仔細經營的潛台詞跟情緒層次直接弄掉。
Mio.2 輸出提示詞之後,把它複製、配上前面生成的 4 張參考圖,貼進 v4.0 Preview,跑生成。這次測試片用的最終提示詞:
▸ 最終 V4.0 PREVIEW 提示詞
0s–2s: The white-haired catgirl gambler spins a gold coin between her fingers, smirking confidently. Gold coins float around her in dramatic lighting. SFX: metallic spin — tense atmosphere 2s–4s: Cut to sailor catgirl across the table, her hand trembling, heart pendant catching light. She whispers: "You said you'd find me again. Even if it took everything." SFX: soft tearful voice 4s–6s: Back to gambler, leaning in with delighted grin: "Cute line. Did you rehearse it?" Cards slap down. SFX: playful tone — card impact 6s–10s: Match cut — the coin falls through memory space. Two catgirls on a cliff, heart pendant being clasped, promise whispered. Everything dissolves into golden dust as coin lands. SFX: warm wind — ethereal chime — distant promise 10s–13s: Gambler blinks, something behind her eyes going quiet. She looks up, studying the crying girl with genuine curious smile: "...sorry, kitten. Do I know you?" SFX: silence — single heartbeat 13s–15s: Sailor catgirl's hand closes around her heart pendant. She smiles through tears, soft: "Not yet. Deal again?" Fade to black. Coins fall. SFX: emotional catch — coin clatter — silence
4 張參考、6 個拍點、3 句對白、層次堆疊的 SFX。這 15 秒,不是一個提示詞憑空生出來的,而是六階段一步一步累積出來的故事。
用 Edit Pro × v4.0 Preview 做動態漫畫
同人 PV 與會動的漫畫頁專用。
想把多格漫畫頁變成會動的工作流 ── 適合做動態反應、節奏鮮明的搞笑橋段、同人 PV 風格的成品。
Edit Pro 負責版面:分鏡配置、每格構圖、讀者視線順序,整合成一張完整的漫畫頁。把這張圖丟給 v4.0 Preview,配上下面這段提示詞:
Present the comic story from top to bottom in a [tone] style, with smooth storytelling and expressive character reactions. Add adorable anime-style sound effects throughout the scenes, such as "boing," "bam," "wah," and "sparkle," to enhance the atmosphere and make the comic feel lively and dynamic.
在 [tone] 填入你想要的氛圍 ──「cute and humorous(可愛、搞笑)」、「elegant(優雅、細膩)」、「dramatic(戲劇張力)」。我們從 2 格梗到 6 格構成都測過,同樣這套模板都能 cover。
常見問題
一支 v4.0 Preview 提示詞最多能附幾張參考圖?
最多 6 張。但實務上,我們測試下來 2~3 張挑得好的參考,會比塞滿 6 張更穩定。每多塞一張,就等於多加一票「角色該長什麼樣」的意見進去,模型最後就會把這些意見平均掉。
v4.0 Preview 的「參考圖」跟「起始幀」差在哪?
參考圖是語意層級的參考 ── v4.0 從圖中讀取角色特徵,後續的姿勢、動作交給提示詞決定。起始幀(keyframe 模式)則是把影片第一格畫面固定下來。關鍵幀模式與多重參考模式無法同時啟用,要看你的工作流選一個。i2v 面板的每個設定項目都想搞懂的話,可以一起讀 PixAI Image-to-Video Tutorial(英文文章)。
v4.0 Preview 可以生成中文或日文對白嗎?
可以。對白務必直接寫原語言字符 ── 中文用「」,日文用「」。千萬不要轉成羅馬拼音。「Konnichiwa」這種羅馬拼音寫法,幾乎一定會產出不對勁的發音。
v4.0 Preview 最長能生成幾秒?
單次生成最長 15 秒。參考影片也有同樣的限制 ── 即使用多支影片參考,總時長也不能超過 15 秒。
調整提示詞時,該用 v4.0 Preview 還是 v4.0 Lite Preview?
初稿與結構測試建議用 v4.0 Lite Preview 或 v2.7 High Dynamics。它們速度快,足以抓出以下問題 ── 動作指示不清、轉場生硬、參考素材不夠。提示詞定稿後,最終生成用 v4.0 Preview。模型之間的差別可以在 PixAI v4.0 Preview 能力總覽 看到。
延伸閱讀
▸ v4.0 PREVIEW 能力總覽什麼是 PixAI v4.0 Preview?新功能與既有模型的差異音效生成、參考影片、參考圖的語意解讀 ── v4.0 Preview 在 PixAI 影片模型陣容中的位置一覽。
▸ MIO.2 入門Mio.2 入門:你想像,Mio 幫你畫出來本文工作流 1 中負責六階段前製作業的 Mio.2,基本對話設計與擅長的工作領域全解析。
▸ EDIT PRO 指南PixAI Edit Pro ── 複雜編輯的 AI 影像編輯工具工作流 2 中負責版面整合的 Edit Pro。分鏡排版、構圖、多圖合成的實作用法搭配範例完整介紹。
▸ REFERENCE PRO 指南PixAI Reference Pro 指南 ── 用自然語言做多圖編輯參考圖搭配自然語言提示詞的技法。Stage 5 生成的參考圖在丟給 v4.0 前再次精修時很實用。
▸ TSUBAKI.2 完整指南Tsubaki.2 ── PixAI 最新旗艦模型完整解析本文 Stage 5 生成參考圖時的核心模型。能直接處理含中文在內的自然語言提示詞,Tsubaki 系列最新版的完整解說。
