DiT LoRA 訓練指南:Tsubaki 與 Tsubaki.2 開訓前該知道的事
目前只有 Tsubaki 和 Tsubaki.2 能當訓練基礎。訓練時間、觸發詞規則、資料集規格與相容性陷阱,開訓前一次看完。
PixAI / DiT LoRA 訓練指南
DiT LoRA 訓練已經是在 PixAI 上做自訂角色和風格最有力的方式。DiT.1 和比較新的 DiT.2 架構都支援,你可以直接針對 PixAI 的旗艦 DiT 底模訓練自己的 LoRA。
這篇把第一次開訓之前該知道的事整理完:有哪些 DiT 模型、哪幾個真的能拿來當訓練基礎、大概要跑多久、DiT.1 和 DiT.2 各自的觸發詞格式、建議的資料集規格,以及新手最常翻車的地方。
PART ONE — 為什麼選 DiT
DiT LoRA 訓練為什麼比 SDXL 適合現在的需求
用 SDXL 系的模型畫兩個以上的角色同框時,很容易遇到「特徵融合」:臉、頭髮、衣服這些視覺元素會在角色之間互相混進去。畫面上放到三個人以上,情況會明顯更糟。
DiT 架構處理多角色構圖穩定得多。它會把每個角色的特徵分開保留,距離和互動也抓得比較自然,視線、手勢、前後重疊都畫得出來。如果你要的是一個放進多人場景還撐得住的 LoRA,或單純想用上 PixAI 最新底模的品質,現在走 DiT LoRA 訓練是比較好的路。底模和 LoRA 的關係還沒搞清楚的話,可以先看 模型與 LoRA 的基礎。
PART TWO — 模型陣容
PixAI 上的 DiT 模型總覽
以下是目前可以用的 DiT 底模全部陣容。
DiT.1 模型
- Tsubaki 的強化版,美感和細節都有提升
- 臉部、服裝、背景的表現更細緻
- 整體畫面完成度與色彩協調更好
- Tsubaki 的官方高速版本
- LoRA 相容性高,特別是用原版 Tsubaki 訓練出來的 LoRA
DiT.2 模型
Tsubaki.2 — PixAI 的旗艦 DiT.2 模型。生成品質和對提示詞的理解力都比 DiT.1 那條線高出一截。實際用起來的感覺可以看 Tsubaki.2 使用心得,提示詞怎麼寫則在 DiT 模型提示詞指南。
PART THREE — 能訓練哪些
哪些 DiT 模型可以拿來訓練 LoRA
不是每個 DiT 底模都開放當訓練基礎。到 2026 年為止,PixAI 支援的 DiT LoRA 訓練基礎只有兩個:
| 模型 | 架構 | 可當訓練基礎 | 可生成 |
|---|---|---|---|
| Tsubaki | DiT.1 | ✅ | ✅ |
| Tsubaki v1.1 | DiT.1 | ❌ | ✅ |
| Tsubaki Flash | DiT.1 | ❌ | ✅ |
| Serin | DiT.1 | ❌ | ✅ |
| Tsubaki.2 | DiT.2 | ✅ | ✅ |
Tsubaki v1.1、Tsubaki Flash 和 Serin 可以拿來生成,但在 LoRA 訓練面板裡選不到、不能當訓練基礎。不過「能不能當訓練基礎」和「訓練好的 LoRA 能在哪裡跑」是兩件事。用 Tsubaki 訓練的 LoRA 和 Tsubaki Flash 的推論相容性很高,這正是 Tsubaki 到現在還是 PixAI 上 DiT.1 標準訓練基礎的原因——訓練一次,能在相容的底模之間通用。
⚠️ 重要:Tsubaki.2 不向下相容。 Tsubaki.2 是獨立的底模。用 Tsubaki、Tsubaki v1.1、Tsubaki Flash、Serin 或任何其他模型訓練出來的 LoRA,在 Tsubaki.2 上都不會生效。要在 Tsubaki.2 上用 LoRA,就必須專門針對 Tsubaki.2 重新訓練。
如果你手上已經有一個效果不錯的 Tsubaki LoRA,想把同一個概念搬到 Tsubaki.2,PixAI 的資料集重複使用功能可以幾下點擊就把原本的資料集再套一次,而且資料集原封不動重用時訓練費用打五折。完整流程在 多版本 LoRA 與資料集重用指南。
PART FOUR — 訓練時間
DiT LoRA 訓練要跑多久
DiT LoRA 訓練比舊的 SDXL 訓練慢,底層架構本來就重得多。時間可以這樣抓:
| 訓練基礎 | 單次耗時 |
|---|---|
| Tsubaki(DiT.1) | 約 70 分鐘 |
| Tsubaki.2(DiT.2) | 約 2 小時 |
訓練佇列上顯示的預估時間只是參考,不是保證值。實際長短會隨佇列負載和資料集大小變動,而且一開始跳出來的那個估計最不準。丟進佇列之後就去做別的事,不用一直重新整理頁面。真的跑得比預期久,原因和處理方式整理在 LoRA 訓練為什麼變慢。
PART FIVE — 觸發詞
DiT LoRA 訓練的觸發詞規則
PixAI 的 DiT LoRA 系統裡,觸發詞的邏輯和大家在 SDXL 流程裡習慣的逗號堆標籤不一樣。而且 DiT.1 和 DiT.2 的規則彼此不同——這是第一次訓練 DiT LoRA 的人最常翻車的地方。如果你對觸發詞本身還不熟,先看 LoRA 觸發詞完整說明 會比較好上手。
Tsubaki LoRA(DiT.1)的觸發詞
訓練 Tsubaki LoRA 時,觸發詞要短、要準。
角色 LoRA — 照這個格式寫:
character_name, source_work, other_attributes
範例:
hatsune_miku, vocaloid, twin_tails
風格或概念 LoRA — 抓住整份資料集共通的那個核心特徵:
ink_wash_style
DiT.1 通用原則:
- 觸發詞要短而具體
- 避免多重子句的長觸發句
- 找出資料集中每張圖都共有的那個最關鍵特徵
Tsubaki.2 LoRA(DiT.2)的觸發詞
DiT.2 把「越短越好」整個反過來。訓練 Tsubaki.2 LoRA 時,建議用至少 30 個字元的觸發詞,把主體的核心特徵描述清楚。描述得越完整,Tsubaki.2 在訓練時越能把你的概念定住。
好的 Tsubaki.2 觸發句讀起來比較像一份濃縮的特徵清單,而不是單一個代號——寫的是可辨識的視覺特徵,不只是一個名字。
A young woman with long silver hair, golden eyes, and a futuristic black visor
觸發詞不到 30 個字元,等於白白放掉可以拿到的訓練品質。
PART SIX — 資料集
DiT LoRA 訓練的資料集建議規格
不管你用哪個 DiT 底模訓練,資料集的規則都一樣。
圖片張數
DiT LoRA 訓練的甜蜜點是 30 到 100 張。低於 30 張,LoRA 泛化不出來;超過 100 張,多半只是拉長訓練時間,品質不會等比例提升。
圖片品質與一致性
- 每張圖都要有你想教會它的那個共同特徵(同一個角色、同一種風格、同一個概念)
- 盡量讓整份資料集的圖片尺寸一致
- 主題或風格的統一性要明確——資料集混亂,訓練出來的 LoRA 也會混亂
重複使用既有資料集
如果你在 PixAI 訓練過 LoRA 想重跑一次——例如把舊的 Tsubaki 概念搬到 Tsubaki.2,或是想試新的訓練參數——可以直接沿用原本的資料集。原始資料集原封不動重用時,PixAI 會自動給訓練費用五折。流程細節在 多版本 LoRA 與資料集重用指南。
PART SEVEN — 開始訓練
第一次跑 DiT LoRA 訓練的步驟
- 前往 PixAI 的 LoRA 訓練頁面。
- 在 Model Type 選 DiT.2(訓練 Tsubaki.2)或 DiT.1(訓練 Tsubaki)。
- 確認 Model Theme:DiT.1 是 Tsubaki,DiT.2 是 Tsubaki.2。
- 上傳 30 到 100 張的資料集。
- 照上面的規則設定觸發詞(Tsubaki 要短,Tsubaki.2 要 30 字元以上)。
- 送出後等待。Tsubaki 大約 70 分鐘,Tsubaki.2 大約 2 小時。
QUESTIONS
DiT LoRA 訓練常見問題
哪些 DiT 模型可以訓練 LoRA?
PixAI 目前支援兩個 DiT LoRA 訓練基礎:Tsubaki(DiT.1)和 Tsubaki.2(DiT.2)。其他 DiT 模型——Tsubaki v1.1、Tsubaki Flash、Serin——可以拿來生成,但不會出現在 LoRA 訓練面板的訓練基礎選項裡。
PixAI 的 DiT.1 和 DiT.2 差在哪?
DiT.1 是 PixAI 第一代的 DiT,能訓練的 DiT.1 底模是 Tsubaki,而 Tsubaki v1.1、Tsubaki Flash、Serin 只能生成。DiT.2 是下一代架構,目前 Tsubaki.2 跑在上面。DiT.2 的輸出品質更高、訓練更慢,觸發詞的寫法也和 DiT.1 不同。
DiT LoRA 訓練要多久?
Tsubaki(DiT.1)LoRA 訓練單次約 70 分鐘,Tsubaki.2(DiT.2)LoRA 訓練約 2 小時。佇列上顯示的時間是估算值,會隨系統負載變動。
用 Tsubaki 訓練的 LoRA 能在 Tsubaki Flash 上跑嗎?
可以。Tsubaki Flash 在設計上就對原版 Tsubaki 訓練出來的 LoRA 有高相容性,同一個 Tsubaki LoRA 通常在兩個底模上都跑得起來。這講的是推論相容性,和訓練相容性是兩回事——Tsubaki.2 不管怎樣都不相容。
Tsubaki 的 LoRA 可以用在 Tsubaki.2 上嗎?
不行。Tsubaki.2 是獨立底模,和任何其他模型訓練出來的 LoRA 都不相容,包括 Tsubaki 和 Tsubaki v1.1。你必須針對 Tsubaki.2 重新訓練。用 PixAI 的資料集重用功能可以很快重跑,而且重訓費用打五折。
Tsubaki.2 的觸發詞要寫多長?
訓練 Tsubaki.2 LoRA 時,目標是至少 30 個字元,把主體的核心特徵描述清楚。這和 Tsubaki(DiT.1)LoRA 那種簡短的逗號分隔觸發詞是明顯不同的做法。
訓練一個 DiT LoRA 需要幾張圖?
Tsubaki 和 Tsubaki.2 都建議 30 到 100 張,並且維持品質與尺寸一致、整份資料集的主題統一。
Tsubaki 和 Tsubaki.2 的 LoRA 訓練現在都開著。挑一個符合你要的畫面的底模,照那一代的觸發詞規則寫,就可以開訓了。
