DiT LoRA 訓練指南:Tsubaki 與 Tsubaki.2 開訓前該知道的事

目前只有 Tsubaki 和 Tsubaki.2 能當訓練基礎。訓練時間、觸發詞規則、資料集規格與相容性陷阱,開訓前一次看完。

PixAI / DiT LoRA 訓練指南

DiT LoRA 訓練已經是在 PixAI 上做自訂角色和風格最有力的方式。DiT.1 和比較新的 DiT.2 架構都支援,你可以直接針對 PixAI 的旗艦 DiT 底模訓練自己的 LoRA。

這篇把第一次開訓之前該知道的事整理完:有哪些 DiT 模型、哪幾個真的能拿來當訓練基礎、大概要跑多久、DiT.1 和 DiT.2 各自的觸發詞格式、建議的資料集規格,以及新手最常翻車的地方。

在 PixAI 開始 DiT LoRA 訓練的畫面

PART ONE — 為什麼選 DiT

DiT LoRA 訓練為什麼比 SDXL 適合現在的需求

用 SDXL 系的模型畫兩個以上的角色同框時,很容易遇到「特徵融合」:臉、頭髮、衣服這些視覺元素會在角色之間互相混進去。畫面上放到三個人以上,情況會明顯更糟。

DiT 架構處理多角色構圖穩定得多。它會把每個角色的特徵分開保留,距離和互動也抓得比較自然,視線、手勢、前後重疊都畫得出來。如果你要的是一個放進多人場景還撐得住的 LoRA,或單純想用上 PixAI 最新底模的品質,現在走 DiT LoRA 訓練是比較好的路。底模和 LoRA 的關係還沒搞清楚的話,可以先看 模型與 LoRA 的基礎


PART TWO — 模型陣容

PixAI 上的 DiT 模型總覽

以下是目前可以用的 DiT 底模全部陣容。

DiT.1 模型

👉 查看所有 DiT 系底模

PixAI DiT.1 底模 Tsubaki 的生成範例

Tsubaki

  • 支援自然語言提示詞(標籤可有可無)
  • 多角色生成品質更好(距離、互動、平衡)
  • 角色互動更自然(視線、手勢、前後重疊)

👉 看詳細介紹

PixAI Tsubaki v1.1 生成範例,細節與色彩更精緻

Tsubaki v1.1

  • Tsubaki 的強化版,美感和細節都有提升
  • 臉部、服裝、背景的表現更細緻
  • 整體畫面完成度與色彩協調更好
PixAI Tsubaki Flash 生成範例,官方高速版本

Tsubaki Flash

  • Tsubaki 的官方高速版本
  • LoRA 相容性高,特別是用原版 Tsubaki 訓練出來的 LoRA
PixAI Serin 生成範例,韓系插畫風格

Serin

  • 道地的韓系畫風
  • 角色設計完成度高
  • 男女角色的表現都穩
  • 風格適應範圍廣

👉 看詳細介紹

DiT.2 模型

Tsubaki.2 — PixAI 的旗艦 DiT.2 模型。生成品質和對提示詞的理解力都比 DiT.1 那條線高出一截。實際用起來的感覺可以看 Tsubaki.2 使用心得,提示詞怎麼寫則在 DiT 模型提示詞指南

PixAI 旗艦 DiT.2 模型 Tsubaki.2 的生成範例

PART THREE — 能訓練哪些

哪些 DiT 模型可以拿來訓練 LoRA

不是每個 DiT 底模都開放當訓練基礎。到 2026 年為止,PixAI 支援的 DiT LoRA 訓練基礎只有兩個:

模型架構可當訓練基礎可生成
TsubakiDiT.1
Tsubaki v1.1DiT.1
Tsubaki FlashDiT.1
SerinDiT.1
Tsubaki.2DiT.2
PixAI LoRA 訓練面板中選擇 DiT.1 模型類型的畫面
PixAI LoRA 訓練面板中選擇 DiT.2 與 Tsubaki.2 的畫面

Tsubaki v1.1、Tsubaki Flash 和 Serin 可以拿來生成,但在 LoRA 訓練面板裡選不到、不能當訓練基礎。不過「能不能當訓練基礎」和「訓練好的 LoRA 能在哪裡跑」是兩件事。用 Tsubaki 訓練的 LoRA 和 Tsubaki Flash 的推論相容性很高,這正是 Tsubaki 到現在還是 PixAI 上 DiT.1 標準訓練基礎的原因——訓練一次,能在相容的底模之間通用。

⚠️ 重要:Tsubaki.2 不向下相容。 Tsubaki.2 是獨立的底模。用 Tsubaki、Tsubaki v1.1、Tsubaki Flash、Serin 或任何其他模型訓練出來的 LoRA,在 Tsubaki.2 上都不會生效。要在 Tsubaki.2 上用 LoRA,就必須專門針對 Tsubaki.2 重新訓練。

針對 Tsubaki.2 訓練的 PixAI LoRA 作品範例
為 Tsubaki.2 重新訓練的 PixAI LoRA 作品範例

如果你手上已經有一個效果不錯的 Tsubaki LoRA,想把同一個概念搬到 Tsubaki.2,PixAI 的資料集重複使用功能可以幾下點擊就把原本的資料集再套一次,而且資料集原封不動重用時訓練費用打五折。完整流程在 多版本 LoRA 與資料集重用指南


PART FOUR — 訓練時間

DiT LoRA 訓練要跑多久

DiT LoRA 訓練比舊的 SDXL 訓練慢,底層架構本來就重得多。時間可以這樣抓:

訓練基礎單次耗時
Tsubaki(DiT.1)約 70 分鐘
Tsubaki.2(DiT.2)約 2 小時

訓練佇列上顯示的預估時間只是參考,不是保證值。實際長短會隨佇列負載和資料集大小變動,而且一開始跳出來的那個估計最不準。丟進佇列之後就去做別的事,不用一直重新整理頁面。真的跑得比預期久,原因和處理方式整理在 LoRA 訓練為什麼變慢


PART FIVE — 觸發詞

DiT LoRA 訓練的觸發詞規則

PixAI 的 DiT LoRA 系統裡,觸發詞的邏輯和大家在 SDXL 流程裡習慣的逗號堆標籤不一樣。而且 DiT.1 和 DiT.2 的規則彼此不同——這是第一次訓練 DiT LoRA 的人最常翻車的地方。如果你對觸發詞本身還不熟,先看 LoRA 觸發詞完整說明 會比較好上手。

Tsubaki LoRA(DiT.1)的觸發詞

訓練 Tsubaki LoRA 時,觸發詞要短、要準。

角色 LoRA — 照這個格式寫:

character_name, source_work, other_attributes

範例:

hatsune_miku, vocaloid, twin_tails

風格或概念 LoRA — 抓住整份資料集共通的那個核心特徵:

ink_wash_style

DiT.1 通用原則:

  • 觸發詞要短而具體
  • 避免多重子句的長觸發句
  • 找出資料集中每張圖都共有的那個最關鍵特徵

Tsubaki.2 LoRA(DiT.2)的觸發詞

DiT.2 把「越短越好」整個反過來。訓練 Tsubaki.2 LoRA 時,建議用至少 30 個字元的觸發詞,把主體的核心特徵描述清楚。描述得越完整,Tsubaki.2 在訓練時越能把你的概念定住。

好的 Tsubaki.2 觸發句讀起來比較像一份濃縮的特徵清單,而不是單一個代號——寫的是可辨識的視覺特徵,不只是一個名字。

A young woman with long silver hair, golden eyes, and a futuristic black visor

觸發詞不到 30 個字元,等於白白放掉可以拿到的訓練品質。


PART SIX — 資料集

DiT LoRA 訓練的資料集建議規格

不管你用哪個 DiT 底模訓練,資料集的規則都一樣。

圖片張數

DiT LoRA 訓練的甜蜜點是 30 到 100 張。低於 30 張,LoRA 泛化不出來;超過 100 張,多半只是拉長訓練時間,品質不會等比例提升。

圖片品質與一致性

  • 每張圖都要有你想教會它的那個共同特徵(同一個角色、同一種風格、同一個概念)
  • 盡量讓整份資料集的圖片尺寸一致
  • 主題或風格的統一性要明確——資料集混亂,訓練出來的 LoRA 也會混亂

重複使用既有資料集

如果你在 PixAI 訓練過 LoRA 想重跑一次——例如把舊的 Tsubaki 概念搬到 Tsubaki.2,或是想試新的訓練參數——可以直接沿用原本的資料集。原始資料集原封不動重用時,PixAI 會自動給訓練費用五折。流程細節在 多版本 LoRA 與資料集重用指南


PART SEVEN — 開始訓練

第一次跑 DiT LoRA 訓練的步驟

  1. 前往 PixAI 的 LoRA 訓練頁面
  2. Model TypeDiT.2(訓練 Tsubaki.2)或 DiT.1(訓練 Tsubaki)。
  3. 確認 Model Theme:DiT.1 是 Tsubaki,DiT.2 是 Tsubaki.2。
  4. 上傳 30 到 100 張的資料集。
  5. 照上面的規則設定觸發詞(Tsubaki 要短,Tsubaki.2 要 30 字元以上)。
  6. 送出後等待。Tsubaki 大約 70 分鐘,Tsubaki.2 大約 2 小時。

QUESTIONS

DiT LoRA 訓練常見問題

哪些 DiT 模型可以訓練 LoRA?

PixAI 目前支援兩個 DiT LoRA 訓練基礎:Tsubaki(DiT.1)和 Tsubaki.2(DiT.2)。其他 DiT 模型——Tsubaki v1.1、Tsubaki Flash、Serin——可以拿來生成,但不會出現在 LoRA 訓練面板的訓練基礎選項裡。

PixAI 的 DiT.1 和 DiT.2 差在哪?

DiT.1 是 PixAI 第一代的 DiT,能訓練的 DiT.1 底模是 Tsubaki,而 Tsubaki v1.1、Tsubaki Flash、Serin 只能生成。DiT.2 是下一代架構,目前 Tsubaki.2 跑在上面。DiT.2 的輸出品質更高、訓練更慢,觸發詞的寫法也和 DiT.1 不同。

DiT LoRA 訓練要多久?

Tsubaki(DiT.1)LoRA 訓練單次約 70 分鐘,Tsubaki.2(DiT.2)LoRA 訓練約 2 小時。佇列上顯示的時間是估算值,會隨系統負載變動。

用 Tsubaki 訓練的 LoRA 能在 Tsubaki Flash 上跑嗎?

可以。Tsubaki Flash 在設計上就對原版 Tsubaki 訓練出來的 LoRA 有高相容性,同一個 Tsubaki LoRA 通常在兩個底模上都跑得起來。這講的是推論相容性,和訓練相容性是兩回事——Tsubaki.2 不管怎樣都不相容。

Tsubaki 的 LoRA 可以用在 Tsubaki.2 上嗎?

不行。Tsubaki.2 是獨立底模,和任何其他模型訓練出來的 LoRA 都不相容,包括 Tsubaki 和 Tsubaki v1.1。你必須針對 Tsubaki.2 重新訓練。用 PixAI 的資料集重用功能可以很快重跑,而且重訓費用打五折。

Tsubaki.2 的觸發詞要寫多長?

訓練 Tsubaki.2 LoRA 時,目標是至少 30 個字元,把主體的核心特徵描述清楚。這和 Tsubaki(DiT.1)LoRA 那種簡短的逗號分隔觸發詞是明顯不同的做法。

訓練一個 DiT LoRA 需要幾張圖?

Tsubaki 和 Tsubaki.2 都建議 30 到 100 張,並且維持品質與尺寸一致、整份資料集的主題統一。

Tsubaki 和 Tsubaki.2 的 LoRA 訓練現在都開著。挑一個符合你要的畫面的底模,照那一代的觸發詞規則寫,就可以開訓了。

內容索引