PixAI v4.0 Preview — 具備角色參考、語音與電影攝影的動漫影像轉影片模型
認識 PixAI v4.0 Preview——內建原生語音生成、電影攝影控制與一致角色參考的動漫影像轉影片 AI。透過 3 輪相同提示對決,與 5 款舊版 PixAI 影片模型一較高下。
— PIXAI V4.0 PREVIEW 功能精選 —
先解釋一下 v4.0 Preview 在實務上意味著什麼。你有一張 OC 坐在長椅上的圖,你想讓她躍起、轉身、把魔法卡牌甩出一個收尾動作。在我們既有的任何一款影片模型上,你會看到她半起身、卡牌歪掉、眼罩在第 3 秒從正確的眼睛滑到另一隻眼睛上。
v4.0 Preview 是我們第一款讓她真的躍起的模型。她落地。眼罩留在原位。她用你寫的那句台詞開口說話,嘴型同步。櫻花瓣從你指定的角落落下。
本篇拆解 v4.0 Preview 的四大核心功能 ── 角色一致性、電影運鏡、風格轉移、原生語音 ── 並用三輪同提示詞實測,跟 PixAI 線上所有既有影片模型做對照比較。如果你想直接學提示詞寫法,先看姊妹篇:PixAI v4.0 Preview 提示詞寫法 →
想橫向了解 PixAI 影片模型陣容、或從 i2v 面板的每個設定項目逐一搞懂的話:PixAI 圖片轉影片完整教學 →(英文文章)。否則直接往下讀。
兩款模型,一套功能
v4.0 Preview 與 v4.0 Lite Preview。
v4.0 Preview 系列同時推出兩個版本。
v4.0 Preview 是頂規模型。畫面細膩度最高、動作表現最細緻、音訊也最自然。當你做的是真的要拿出去的作品時用它 ── 作品集裡的主視覺、要拿來發布的角色卡、運鏡本身就是賣點的場景。它跑得比較慢、消耗的點數也較多,但成果看得出差距。
v4.0 Lite Preview(之後簡稱 Lite)是日常工作用的版本。架構相同、參考素材支援相同、語音生成能力相同。速度更快、成本更低,對創作者每天會做的大多數工作來說已經夠用 ── 氛圍 loop、簡單角色動畫、有對白的場景、扭蛋風格卡片。多數情況下,Lite 才是正解。
扭蛋風格的動態角色卡
▸ 查看完整提示詞
Transform this static character art from @image1 into a gacha-style animated character card, following the same camera motion and pacing style as @video1. CAMERA MOTION (mirroring the path of @video1): [0-1.2s] Open on a close-up of her left hand holding the small red-stringed charm pouch (omamori) at her waist. [1.2-2.5s] The camera slowly drifts upward along her body — past her green striped yukata, settling onto her face. [2.5-3.5s] At her face, the camera gently lingers — her purple eye meeting the viewer softly. [3.5-4.2s] The camera slowly pulls back to reveal the full composition — her standing beneath the temple roof eaves. [4.2-5s] CARD REVEAL CLIMAX — multiple goldfish swim into view from the edges joining the dream, soft bloom intensifies around the frame.
兩款模型都支援完整的 v4.0 功能集 ── 最多 6 張參考圖、3 段參考影片、3 段參考音訊、多語言語音、電影運鏡控制。差別在於畫面細膩度,不在於能做什麼。
參考素材上傳流程的快速導覽。
— 我們的工作原則 —用 Lite 起草、用 Lite 迭代、用 Preview 收尾。
我們團隊絕大多數工作都從 Lite 開始,等提示詞調到位之後,最後再用 Preview 跑一次定稿。後面的實測會說明這條原則的根據 ── 在其中一輪比較裡,Lite 真的贏過 Preview。這個結果會改變你選模型的思路。
本篇後面的示範作多半用 Preview ── 不是因為 Lite 做不到(兩款都能跑),而是因為要把 v4.0 系列的能力呈現得最清楚,就用呈現效果最好的版本。
v4.0 Preview 實際上能做什麼
四項核心功能,每項都附對照範例和示範影片。
角色一致性
你的 OC,跨多個鏡頭、多個場景都還是同一個她。
以前的影片模型,把你的參考圖當成「第一幀」。角色的姿勢、背景的元素 ── 全部被釘死在第 0 秒。原圖裡她坐著,你寫「她奔跑」,那她只會勉強起身、跑兩步又陷回椅子。整整 5 秒都在跟你的提示詞拔河。
v4.0 Preview 的解讀方式不一樣。它把參考圖當成語意層級的參考 ── 角色身份(髮型、瞳色、虎牙、眼罩、衣著輪廓)從那一個瞬間的姿勢中抽離出來。同一張參考圖、無數種變化。她可以在戲劇性的場景切換中、在換裝中、在多鏡頭序列中、甚至跟你的第二個角色同畫面 ── 還是看得出是她。以前需要十幾次重生才能達成的一致性,現在第一次就出來了。
同一角色、三個世界 ── 開放世界遊戲風格的探索場景
▸ 查看提示詞
Use @Image1 as the main character. Create an open-world exploration game style animation. Show a translucent pink game UI on the screen with directional pad, attack button, and jump button — the character walks and explores the world. 0–5s: Game world references the background of @Image1. A gust of wind sweeps cherry blossom petals across the screen. Character walks slowly through the environment. When she touches a floating ribbon, an item-reward popup appears on the UI. 6–10s: After continued walking, the game scene transitions from @Image1 to @Image2. As she walks, a strong gust blows photographs across the scene one by one. She can pick them up as they pass. 11–15s: After continued walking, the game scene transitions to @Image3. The environment is now filled with giant yellow tulips. Bubbles from @Image3 drift gently through the entire scene.
兩個角色、同一畫面、各自保有自己的身份
▸ 查看提示詞
Scene opens in darkness. A flicker of deep purple light shimmers on the left side of the frame. The Devil enters from the left, gradually materializing through a swirl of deep violet mist and drifting violet embers. Her small black horns catch the indigo glow. Her eyes open with a playful gleam; the corner of her mouth slowly curls into a mischievous smile. She tilts her head slightly, sticks her tongue out a bit, raises one hand lazily. Black flames curl upward behind her silhouette. A moment of silence. Then, a warm soft light blooms on the right side. The Angel descends gently from the right, riding a soft cascade of rose-gold light and drifting white feathers. A faint halo materializes above her head. Her eyes open softly, warm and unhurried. She smiles quietly, raises her hands, and forms a heart shape at her chest. Now both are in the frame. Their gazes meet across the void. The space between them — deep purple on the left, soft pink on the right — begins to shimmer and merge into a shared pink-purple gradient mist. Dreamy cinematic atmosphere, soft volumetric light, smooth animation, anime style, stable camera, no hard cuts.
多角色、多鏡頭序列,跨剪輯保持角色身份不漂移。
電影運鏡與漫畫格敘事
導演一個場景,而不只是生成一段片段。
v4.0 Preview 把電影運鏡語彙當成指令、不當裝飾。push in(推近)、pull back(拉遠)、orbit(環繞)、tilt(傾斜)、rack focus(移焦)、slow drift(緩慢漂移) ── 每一個都是模型聽得懂、做得出來的精確指示。多鏡頭序列在剪輯切換中保持角色身份,所以 15 秒裡可以放 ── 開場特寫、反應中景、最終全景 ── 而不會讓角色在剪輯中途變成另一個人。
v4.0 也支援漫畫格模式 ── 動態的漫畫頁、單一畫面 4~6 格、每格自己有動作、過場用音效標記。這是我們第一款能輸出「看起來不像 AI 影片、而是看起來像漫畫被動畫化」的模型。
v4.0 Preview 運鏡指令的實際表現。
高密度多鏡頭序列、伴隨快速場景切換。
Q 版 Mio 的春季樂團公路旅行 ── 概念短片。
從動畫參考做風格轉移
借用一段動畫的感覺,套到你自己的角色上。
把你想參考的影片丟給 v4.0 Preview ── 短片開場、MV 片段、或某部你喜歡氛圍的電影段落都行。模型會分析它的鏡頭結構、運鏡軌跡、節奏、氛圍密度,然後把那套取景語言套到你的場景、你的角色身上。
轉移過去的是結構與氛圍感受 ── 鏡頭怎麼運動、每一拍的停留感、色彩光線的調性、剪輯的能量密度。保留下來的是你自己的畫風。你的動漫角色不會被渲染成參考影片裡那種真人外貌。你那張柔美粉彩的插畫,也不會突然變成電影黑色風格。v4.0 把參考影片當成導演的 vision board,而不是濾鏡。
▸ 查看提示詞
Transform this static character art from @image1 into a gacha-style animated character card, following the same camera motion and pacing style as @video1.
▸ 查看提示詞
Use @Image1 as the main character. Reference the framing, motion, and overall style of @Video1, but replace the actions with the following: Make a finger-heart gesture and wink, eat a piece of cake with a blissful satisfied expression, wear headphones and sway her head gently left and right to the music. Match the rhythm and atmosphere of @Audio1.
跨類型風格轉移:格鬥遊戲第一人稱視角 + 雜誌跨頁。
原生語音與音效
一個場景,而不是一段無聲影片。
這是 v4.0 跟所有既有模型之間最清楚的分界線。v4.0 之前的模型給你一段無聲片段;v4.0 給你的是一個有聲音的場景。
語音生成原生支援英文、日文等多種語言。用實際的語言寫對白進去,v4.0 Preview 就會產出嘴型對齊的同步音訊 ── 包括貓娘的「にゃ」尾音、美少女遊戲式的氣音耳語、活力 vlog 風的咯咯笑聲這類風格化細節都能還原。BGM、環境音、SFX 全部跑在同一條音軌上 ── 告白場景背後的心跳、悲劇橋段的雨聲與雷鳴、喜悅時刻準時切入的暖調背景音樂。結果是 AI 影片過去兩年一直缺少的東西 ── 一段 5~15 秒的片段、真的像是一個完成品。
語音表演跨越戀愛場景與偶像舞台。
同提示詞、六款模型實測
— 三輪、6 款模型、同一張原圖
說新模型比較好很簡單,要證明它很難。所以我們做了最直接也最誠實的事 ── 同一份提示詞、同一張原圖,在 PixAI 線上每一款影片模型上各跑一次。
原本預期會看到 v4.0 Preview 一路碾壓的清楚排名 ── 實際看到的結果比預期更有用。
這次實測在比什麼
三個場景裡,我們同時關注五件事:
你可能會對其中某些角度的權重不同 ── 對你來說細膩度可能比動態自然度更重要,或反過來。後面的評語照你自己的優先順序看就好。
一個簡單的時刻
── 差距最小的那一輪
創作者日常會跑的那種生成。角色靠在窗邊、慢慢把頭轉向鏡頭、露出一個淡淡的微笑、背景一片葉子飄落。五秒鐘。六款模型用同一張原圖。
▸ 使用的提示詞
畫面中的角色輕輕倚在窗框上,柔和地望向側邊,接著緩緩把頭轉向鏡頭、露出一個帶點俏皮的小微笑,虎牙在光線下閃過。背景的窗外有一片葉子飄落。鏡頭緩慢推近她的臉。整段影片保留角色外觀與原圖中溫暖的自然窗光。動漫插畫風、柔和的慢動作節奏。
v4.0 Preview。明顯最精緻。眼神高光、髮絲繪畫感、真實的窗光都到位。唯一的問題 ── 它多做了一個提示詞裡沒寫的手部動作。
v4.0 Lite Preview。提示詞遵循度完美,沒有多餘動作,葉子自然飄落。畫面細膩度比 Preview 差半步,但點數消耗只有不到一半。最有意思的發現 ── 這一輪 Lite 在提示詞遵循度上贏過 Preview。
v3.2。尷尬的中間地帶。它把線條銳化過頭,反而毀了原圖那種夢幻插畫感。三輪實測裡,我們找不到任何一個情境會建議選它而不選 Lite。
v3.0 高一致性。所有模型中對角色參考保真度最高。代價是 ── 她幾乎不動,多半時間只是默默動嘴。
v3.0 Flash。跟 Lite 同一個點數級距,表現比預期好。簡單提示詞的情境下,是合理的日常預算選擇。
v2.7 高動態。速度遠超其他模型,但眼罩在片段中間沒被指示就自己滑掉了。
— 第 1 輪結論 —日常的簡單動畫,你不需要 v4.0 Preview。Lite 就是正解。
一場舞台魔術表演
第 1 輪是入門模式。第 2 輪是「看起來還可以」開始崩盤的地方。
▸ 使用的提示詞(連續 5 秒舞台魔術表演)
Anime jester catgirl from @image1 performs a continuous 5-second stage magic act in one unbroken shot. The camera follows her performance. Opening: She stands center stage in an opening pose, eyes closed, gathering focus quietly. After a beat she slowly opens her purple eyes, locks eyes with the camera, and grins playfully with her fang visible. Build: She raises both arms gracefully — the small bear plushie charm on her outfit clearly visible — then sharply throws her arms wide. A tornado of playing cards bursts from her hands, gold coins scatter, red and blue balloons drift up. Climax: She leaps for a mid-air spin, plaid skirt and red cape flaring dramatically, the card array continuing to fan outward in slow motion as the camera arcs around her. Resolution: She lands lightly, cards and coins still suspended around her, head turns to camera, finger raised playfully to her lips, final mysterious smile with fang showing. Throughout: Full character identity preserved — white hair with pink highlights, white heart ahoge, one purple eye exposed and a black leather eyepatch with a red heart charm on the other (consistent same eye), fang, cat ears, cat tail, red and black harlequin outfit with white lace collar, harlequin stockings. Anime illustration style matching the original art, dramatic stage lighting, deep red and gold palette, continuous single-shot camera energy in the style of Satoshi Kon's flowing sequences.
v4.0 Preview。每個拍點都做出來了。眼神揭示、卡牌從手中爆發、躍起、空中旋轉、最後的「噓」手勢。旋轉時眼罩沒換邊。在劇烈動作中還保住了角色身份。最極端的幾幀畫風略偏離原圖的繪畫感 ── 合理的取捨。
v4.0 Lite Preview。勉強過關但走了捷徑。最難的拍點(躍起、空中旋轉)被柔化或跳過。你看那個旋轉 ── 她只轉了一半,鏡頭就把剩下的部分蓋掉。
v3.2。選了相反的取捨。動作序列勉強完成了,但角色在中途漂移成另一個人。第一幀跟最後一幀看起來像兩個人。
v3.0 高一致性。選錯了戰場。畫風保留完美,但她大部分時間都坐著不動。拒絕執行你要的動作。
v3.0 Flash。整個崩了。眼罩戴錯邊、服裝改變、四肢扭曲到不可能的姿勢。
v2.7 高動態。動作勉強過關,一致性崩了。眼罩消失、小熊吊飾被丟掉、卡牌陣像卡住的動畫一樣循環了三次。
— 第 2 輪結論 —模型之間的差距不是固定值 ── 它會隨著提示詞的野心程度放大。
在「轉頭」這個簡單動作上能用的模型,到了舞台魔術表演就會徹底翻車。每一款舊版模型崩潰的方式不同 ── 每一種崩潰方式都告訴你一些 AI 影片模型在壓力下的行為模式。
雙角色互動場景
影片生成裡最難的假設,就是「角色身份能維持」。只有一個角色時,你希望模型在 5 秒裡守住她的髮型、衣服、眼罩。但兩個角色同框時,你要的是同時守住兩個不同的身份 ── 不會讓一個角色的特徵汙染到另一個。
▸ 使用的提示詞
鏡頭從角色腰部緩緩向上傾斜。花瓣在空中飄散,微風輕柔地吹動她們的頭髮跟衣服。左側的角色輕輕撫摸另一人的臉頰,接著切到特寫鏡頭。下一個場景裡,兩個角色緩緩同時輕閉雙眼。
v4.0 Preview。提示詞執行到位,電影感的向上傾斜、乾淨的特寫切換都做出來了。唯一看得出的瑕疵 ── 其中一個角色的眉下中途多出一條小繃帶,是對原圖的細微誤讀。
v4.0 Lite Preview。執行扎實,但鏡頭傾斜略顯倉促。切到特寫的過場接得不如 Preview 流暢。
v3.2。鏡頭之間沒有真正的過場,運鏡笨拙,畫風嚴重漂移。
v3.0 高一致性。結尾的同步閉眼看起來極不自然。幾乎沒有任何運鏡。唯一的優點 ── 對原圖的畫風保真度。
v3.0 Flash。原圖畫風保留得還行,但角色站得詭異地僵硬 ── 眼神接觸看起來像凍住、不像活著。鏡頭只是一直往前推,沒做「先傾斜、再特寫」的指令。
v2.7 高動態。動態還可以,但一個角色的眼罩中途掉了,畫風前後明顯轉變 ── 幾乎像同一個角色的兩個不同版本。
— 第 3 輪結論 —雙角色場景並不是「最難」的任務 ── 它只是把我們在第 1 輪就看到的基本弱點放大了。
原本預期「兩個角色同框」會比第 2 輪複雜的單角色動作對舊版模型更具殺傷力。結果不是。Preview 真正拉開差距的是運鏡傾斜跟特寫切換的精緻度 ──「鏡頭像電影那樣向上傾斜」這條指令,只有它聽懂了。
這對挑選模型意味著什麼
模型之間的差距,是「提示詞野心程度」的函數,不是固定值。
迭代用便宜的、交付用最好的。
起草階段用 Lite 或 v2.7。只有場景本身的野心值得這個成本時,才用 Preview 跑定稿。
常見問題
該用 v4.0 Preview 還是 v4.0 Lite Preview?
畫面細膩度真的重要的最終交付作品 ── 用 Preview。日常工作、提示詞迭代、簡單動作 ── 用 Lite,又快又便宜,多數情況效果一樣好。我們的經驗法則 ── 用 Lite 起草、用 Preview 收尾。完整的提示詞寫法請看 PixAI v4.0 Preview 提示詞寫法。
能上傳幾張參考圖?
一次最多 6 張。但實務上,挑得精準的 2~3 張比 6 張更穩定 ── 圖太多會讓模型的注意力被稀釋。多不一定好。
參考圖、參考影片、參考音訊可以同時用嗎?
可以 ── 而且這其實是最強的工作流。參考圖鎖角色,參考影片定運鏡風格跟節奏,參考音訊塑造嗓音或氛圍。三者並用,你可以把特定的動畫風格套到你自己的角色上,配上你自己指定的語音方向。
v4.0 Preview 一次最長能做幾秒?
單次生成最長 15 秒。參考影片也受同樣限制 ── 用多支參考影片時,合計長度也必須在 15 秒內。
多重參考模式跟關鍵幀模式可以同時用嗎?
不行,兩者互斥。多重參考模式用於附加多個語意層級的參考(角色、場景、風格)。關鍵幀模式用於指定影片的第一幀跟最後一幀。哪個適合你的工作流就用哪個。
為什麼我的角色在複雜動作中途會漂移?
提示詞裡對角色長相的描述太多時,會抵銷掉參考圖的鎖定效果。把角色細節放在參考圖裡、讓提示詞專心寫「該發生什麼事」就好。這個議題還有更多細節整理在姊妹篇:PixAI v4.0 Preview 提示詞寫法 →
v4.0 Preview 可以商用嗎?
可以 ── 在 PixAI 上生成的內容適用標準使用條款。最新細節以服務條款為準。
延伸閱讀
▸ I2V 完整教學 (英文文章)PixAI Image-to-Video Tutorial: Model Comparison & Prompt WritingPixAI 所有影片模型的橫向比較、i2v 面板各設定項目的意義、不同用途的模型挑選建議 ── 一篇看完整個產品線。
▸ MIO.2 入門Mio.2 入門:你想像,Mio 幫你畫出來想用 AI Agent 做前製作業的話,Mio.2 是搭配 v4.0 Preview 最順手的伙伴。提案、劇本、分鏡、提示詞 ── 一條對話跑到底。
▸ EDIT PRO 指南PixAI Edit Pro ── 複雜編輯的 AI 影像編輯工具想把多格漫畫變成動態漫畫頁 ── Edit Pro 負責版面整合,v4.0 Preview 負責動起來。兩者搭配的工作流案例與實作說明。
▸ REFERENCE PRO 指南PixAI Reference Pro 指南 ── 用自然語言做多圖編輯v4.0 Preview 上你的參考圖素材怎麼來?Reference Pro 提供用自然語言精修參考圖的工作流,能直接餵給後續的影片生成。
▸ TSUBAKI.2 完整指南Tsubaki.2 ── PixAI 最新旗艦圖片模型完整解析v4.0 Preview 用的參考圖大多由 Tsubaki.2 產出。它直接支援自然語言提示詞(含中文)── 是這套工作流上游的關鍵環節。
