專題文章

AI 繪圖不是只寫提示詞|10 個步驟,創作一個有延續性的角色

AI 繪圖角色一致性 Reference Image 視覺母版示例

專題導讀:這篇文章整理 AI 繪圖角色一致性的完整工作流,由 Reference Image、角色設定、故事線到多圖連續創作,幫助創作者由 prompt writer 進一步變成 character director。

AI 繪圖角色一致性的 Reference Image 視覺母版示例
Reference Image:先固定角色身份,再延伸場景。

很多人開始玩 AI 繪圖時,第一個想解決的問題都是:

怎樣令同一個人物每次都長得一樣?

於是大家會不斷在提示詞入面加外貌描述:金髮、藍眼睛、長睫毛、瓜子臉、精緻五官、白皙皮膚、修長身形。

但玩了一陣子之後,你會發現一件事:外貌描述寫得再仔細,每張圖仍然可能像不同人。原因很簡單。因為 AI 很多時候記住的是「外觀特徵」,不是「角色本身」。

真正穩定的角色,不只是五官組合,而是一個有身份、有氣質、有習慣、有行為邏輯的人物。換句話說,AI 繪圖真正要固定的,不只是樣貌,而是角色的存在感。

引言:為什麼現在更需要「導演思維」?

之前提過,現在的 AI 繪圖已經不只是「輸入一句 prompt,然後 render 一張圖」。愈來愈多 AI 圖像工具和研究方向,正在走向多輪理解、多輪修改和 iterative refinement 的流程。

簡單來說,就是 AI 先理解你的要求,生成初步畫面,然後根據畫面結果作出檢查,再判斷哪些地方需要修正,最後進入下一輪修改。

在技術上,這類方向有時會被描述為 multi-turn editing、closed-loop feedback、planning-reasoning-generation,甚至是 perception-reasoning-action loop。

不用被這些名詞嚇到。用創作語言來說,其實就是:AI 不再只是一次過畫完就算。它開始可以在多輪互動中,理解上下文、保留部分元素、修改指定細節,甚至根據前一版結果再作調整。

正因如此,創作者的角色反而更加重要。因為當 AI 只是一個一次性 render 工具時,你可能只需要寫一條漂亮 prompt,讓它生成一張漂亮圖片。

但當 AI 開始可以多輪理解和修正時,問題就變成:你到底想它保留什麼?你想它改變什麼?這一張圖和上一張圖有什麼關係?這個角色在故事裡是否仍然是同一個人?

如果創作者沒有先定好這些標準,AI 的多輪修正反而可能愈修愈偏。它可能保留了你不想保留的元素,也可能改走了你最想固定的角色特徵。更常見的是,每一張圖單獨看都很漂亮,但放在一起卻不像同一個角色,也不像同一條故事線。

所以,AI 圖像工具愈進步,創作者愈不應該只做 prompt writer,而應該開始做 character director。AI 可以幫你 render,但你要負責 continuity。AI 可以幫你畫下一張,但你要知道她的下一幕。

10 個步驟,建立有延續性的 AI 角色

1. 理解角色一致性,不只是樣貌一致

現在愈來愈多人討論 Character Consistency,也就是角色一致性。網上不少 AI 圖像工具、教學和研究,都開始強調 reference image、character reference、character bible、storytelling workflow 等概念。

意思是:如果你想做出一個能夠跨場景、跨服裝、跨鏡頭延續的人物,就不能每次只靠一句新的提示詞重新抽獎。

這裡最容易犯的錯誤,就是把角色一致性理解成「樣貌一致」。當然,樣貌很重要。但一個真正讓人記得住的角色,不只是臉一樣。

她的眼神要一致。氣質要一致。年齡感要一致。穿衣邏輯要一致。行為方式要一致。甚至她在不同場景中的反應,也要有一種「這就是她會做的事」的感覺。

所以,角色一致性的核心不是:每一張都畫到同一張臉。而是:每一幕都仍然像同一個人。

2. 先建立理想的 Reference Image

在講提示詞之前,其實有一個更重要的基礎:Reference Image。

很多人會太快進入提示詞階段,但如果連角色的視覺母版都未先固定,後面再多描述也容易漂移。比較穩妥的做法,是先用圖片,或者先用 AI 反覆調教出一張最理想的角色 reference image。

這張圖不只是「好看」那麼簡單。它要能夠清楚代表這個角色的臉、髮型、氣質、年齡感與整體身份。

簡單來說:文字描述,是幫 AI 理解角色概念。Reference image,是幫 AI 鎖定角色身份。兩者要一起使用,角色才會更穩定。

所以,第一步不是寫提示詞,而是先建立角色的視覺錨點。不要拿一張「差不多」的圖做 reference。要先調教到「就是她」那張,才開始延伸。

3. 檢查 Reference Image 是否適合做母版

一張好的 reference image,最好有幾個條件。

第一,臉部要清楚。五官、臉型、眼神、眉形、鼻樑、嘴唇和下巴輪廓最好都能看得清楚。

第二,髮型要明確。髮色、長度、分界、瀏海、捲直程度,最好不要太模糊。

第三,角度不要太極端。太側面、太低角度、太誇張光影,都可能令 AI 後面難以判斷這個角色真正的標準樣貌。

第四,表情不要太誇張。如果 reference image 本身是大笑、驚訝、誇張表情,之後 AI 可能會把這種表情誤當成角色身份的一部分。比較穩妥的母版,通常是自然表情、清晰五官、穩定光線。

第五,氣質要鮮明。她是陽光、清冷、溫柔、成熟、神秘,還是活潑?Reference image 應該能讓人一眼感受到。

第六,風格要穩定。你想走寫實、日系、電影感、時尚感、漫畫感,最好一開始就定清楚。因為風格本身也是角色記憶的一部分。

4. 了解不同平台做法:Reference Image 或 LoRA

當然,不同 AI 圖像平台有不同限制。有些平台可以直接透過 reference image、character reference 或 image prompt 去維持角色一致性。

有些平台則更適合透過 LoRA 或角色模型訓練,將人物特徵固定下來。後者在角色一致性上往往可以更穩定,特別適合長期創作同一個人物系列。

不過,LoRA 訓練涉及資料準備、模型訓練、權重控制和平台差異,屬於比較專業的技術流程,這篇先不詳細討論。

這裡先記住一個重點:工具方法可以不同,但目標是一樣的。你要先固定角色身份,再去變化場景和故事。

5. 寫出基本樣貌描述

有了 reference image 之後,下一步才是補上基本樣貌描述。雖然提示詞不是最核心,但外貌描述仍然需要。只是它不應該亂寫,而應該有系統。

你可以分成幾個部分。臉部特徵:臉型、眼形、眉形、鼻樑、嘴唇、下巴、輪廓線。

髮型特徵:髮色、長度、分界、瀏海、捲曲程度、髮質。

身形特徵:身高比例、肩膀、腰線、體態、運動感或柔和感。

氣質特徵:清冷、陽光、成熟、活潑、神秘、優雅、鄰家感。

標誌元素:常戴的飾物、常穿的顏色、某種表情、某種姿勢。

例如,不要只寫:美麗日本女性。

一位成年日本女性角色,柔和鵝蛋臉,眼神明亮但帶一點安靜感,黑色中長髮,空氣感瀏海,笑容自然,不誇張,身形健康修長,氣質介乎清純與成熟之間,整體感覺溫柔、乾淨、有生活感。

這樣 AI 接收到的就不是一堆散亂形容詞,而是一個有辨識度的人物方向。

6. 建立角色設定檔 Character Bible

這一步很多人會忽略,但其實非常重要。因為角色一致性不只是臉一致,而是她在不同場景下仍然像同一個人。

你要問自己:她是誰?她的年齡感是怎樣?她平時說話快還是慢?她遇到陌生環境會主動探索,還是先觀察?

她喜歡熱鬧還是安靜?她是自信、害羞、理性、感性,還是帶一點反差?她的穿衣習慣是簡約、時尚、運動、復古,還是高級感?她在鏡頭前會自然微笑,還是習慣避開眼神?

這些資料可以整理成一份 Character Bible,即角色聖經。角色聖經不一定要很長,但要穩定。它的作用是讓你每次生成圖片前,都有一份角色核心設定可以重複使用。

例如:她是一個喜歡安靜旅行的人。她不會每張圖都擺出誇張 pose。她的表情通常自然、溫和、有一點觀察感。她的服裝可以變,但大方向偏簡約、乾淨、有生活感。她在鏡頭前不會過度表演,而是像被捕捉到一個自然瞬間。

這些設定,會令角色比單純外貌描述更穩。

7. 建立故事線,而不是只想單張圖

很多人生成圖片時會想:下一張畫什麼?但如果你想角色有延續性,應該改成:她接下來會去哪裡?

入住飯店 → 房間整理行李 → 泡湯 → 穿浴衣去陽台看夕陽 → 夜景酒吧喝一杯 → 第二天清晨在街角咖啡店寫明信片。

這樣角色不再只是漂亮圖片,而是有時間線、有情緒推進、有生活脈絡的人物。故事線有一個好處:它會自然限制 AI 不要每次重新發明角色。因為每一張圖都不是獨立存在,而是上一幕的延續。

這裡的重點不是寫一個很複雜的劇本。而是最少要知道:上一幕發生了什麼。這一幕她在哪裡。她正在做什麼。她的情緒有沒有變。下一幕可以怎樣自然接下去。

當你用這種方式思考,畫面就不會只是 random image。它會開始有 continuity。

構圖參考照:角色故事線示例

以下五張相片放在第 7 點之後,用來示範同一角色在不同情景中的延續。重點不是每一張圖都一模一樣,而是在不同場景、服裝與情緒之間,仍然保持同一角色的身份與故事感。

同一 AI 角色在酒店大堂 Check-in 的故事線示例
情景一:酒店大堂 Check-in
同一 AI 角色在房間整理行李的故事線示例
情景二:房間整理行李
同一 AI 角色在溫泉放鬆的故事線示例
情景三:溫泉放鬆時刻
同一 AI 角色在陽台看夕陽的故事線示例
情景四:陽台看夕陽
同一 AI 角色在夜景酒吧的故事線示例
情景五:夜景酒吧
同一 AI 角色在清晨街角咖啡店的故事線示例
情景六:清晨街角咖啡店

同一角色延續到第二天早上的咖啡店場景,作為故事線收結與生活感延伸。

8. 最後才寫提示詞

提示詞不是魔法。它只是導演和 AI 溝通的語言。

一個比較穩定的提示詞,可以用這個結構:角色身份 + reference image + 固定外貌 + 固定氣質 + 當前場景 + 當前動作 + 服裝變化 + 光線鏡頭 + 保持不變項目。

使用同一位成年日本女性角色,以 reference image 作為角色身份基準,保持她的柔和鵝蛋臉、明亮安靜的眼神、黑色中長髮、空氣感瀏海、自然笑容、健康修長身形與溫柔乾淨的氣質。這一幕是她入住溫泉飯店後,穿著簡約米白色針織外套,站在房間窗邊望向夕陽。畫面為寫實電影感攝影,柔和自然光,半身構圖。請保持同一角色身份,不改變臉部比例、髮型基礎、年齡感與整體氣質。

這裡最重要的不是詞多,而是前面的角色工作有沒有做足。提示詞不是每次重新創造角色。而是每次提醒 AI:這仍然是同一個角色,只是進入了新的場景。

9. 分清楚哪些元素固定,哪些元素可以變

做角色一致性,最重要的不是所有東西都不變。如果所有東西都不變,畫面會變得死板。真正要做的是分清楚:哪些元素必須固定?哪些元素可以因應場景改變?

固定的通常是:臉部比例、年齡感、髮型基礎、氣質、身形比例、角色性格。

可以變的是:衣服、場景、姿勢、情緒強弱、鏡頭角度、光線時間。

例如,同一個角色可以在酒店大堂 check-in,可以在房間整理行李,可以在溫泉裡放鬆,也可以在夜景酒吧喝一杯。場景變了。服裝變了。光線變了。但她仍然要像同一個人。這就是 continuity。

角色一致性不是把角色鎖死。而是讓角色可以在不同場景裡合理變化,但仍然保留核心身份。

10. 每次生成後做一致性檢查

不要只問圖片漂不漂亮,而要問:這還是不是同一個人?眼神有沒有變?臉型有沒有漂移?年齡感有沒有改變?氣質是否仍然符合角色?服裝雖然不同,但穿衣邏輯是否一致?這一幕是否合理接住上一幕?

如果答案是否定的,就不要只補一句「更像上一張」。你要指出哪裡不一致。

例如:保持上一張的眼形和下巴輪廓,不要把臉變得更尖。保持原本安靜溫柔的氣質,不要變成過度誇張表情。保持黑色中長髮和空氣瀏海,不要改成金髮或大波浪。保持同一位角色的年齡感,不要變成熟十歲。

這種修正會比單純說「保持一致」更有效。而這裡,正好配合現在 AI 繪圖的多輪修正趨勢。AI 愈能夠理解和修改,你愈需要提供清楚的判斷標準。否則 AI 只知道你想「改靚啲」,但不知道什麼不能改。

結語:AI 繪圖是在當導演

總結來說,AI 繪圖的核心,正在由 prompt engineering 走向 character directing。

以前我們以為重點是寫出一條神級提示詞。但真正玩到後面,你會發現:Reference image 先於提示詞。角色先於畫面。故事先於單張圖片。Continuity 先於每一次 render。導演思維先於技術操作。

很多人用 AI 繪圖,仍然是逐張圖片去想:這張要畫什麼?但如果你想做出有連貫性的角色作品,更好的問題其實是:她接下來會去哪裡?

這個分別很重要。逐張 render 的思維,是每次重新生成一張漂亮圖片。角色導演的思維,是讓同一個人物在不同場景裡自然延續。前者追求的是單張好看。後者追求的是系列成立。

當 AI 工具愈來愈能理解上下文、進行多輪修正、延續角色與畫面細節,創作者就更需要負責方向感。AI 負責生成畫面。你負責角色 continuity。AI 負責把圖畫出來。你負責判斷這一幕是否仍然是她。

所以,AI 繪圖的真正進階,不是把 prompt 寫得愈來愈長。而是把角色、故事、場景和視覺記憶點建立得愈來愈清楚。

當這些基礎建立好之後,提示詞反而可以變得更簡單。因為 AI 已經知道你想創作的,不是一張孤立圖片,而是一個可以繼續走下去的角色。

AI 可以幫你畫下一張。但你要知道她的下一幕。AI 可以幫你 render。但你要負責 continuity。AI 繪圖不是在寫提示詞。AI 繪圖是在當導演。

補充:當角色建立完成,可以用簡單指令做多圖連續創作

當你完成前面的角色建立流程後,AI 其實已經不只是理解一張圖片,而是開始掌握一個角色系統。

它知道這個角色的樣貌、氣質、性格、故事線、哪些元素不能變,以及哪些元素可以隨場景調整。這時候,你就不需要每一張圖片都重新寫一大段完整提示詞。

更有效的做法,是用一個較高層次的簡單指令,要求 AI 按照既定角色設定和故事脈絡,一次產出多張互相連貫、但各自獨立可用的照片。

根據以上角色設定,把她入住酒店後的一連串情景,變成多張構圖參考照片,並逐一產出。場景包括:酒店 check-in、房間整理行李、泡湯、陽台看夕陽、夜景酒吧,以及第二天清晨在咖啡店寫明信片。請保持同一角色身份、氣質、年齡感和故事連貫性,但每張照片都要有獨立構圖和完整畫面。

這個方法的好處是,AI 不再每次由零開始理解角色。它是在一個已經建立好的角色框架入面繼續創作。

所以整體會更容易保持:角色一致性、畫面連貫性、故事節奏感,以及系列作品的統一氣質。

這也是 GPT 在 AI 繪圖上的一個很實用技巧。前面不是為了把提示詞寫得更長。而是為了讓 AI 真正理解:這個角色是誰。她在哪個故事裡。她接下來會去哪裡。

當這些都建立好之後,你只需要用簡單指令推進情節,AI 就可以幫你把角色延伸成一組連續照片。這才是由「逐張 render」進入「角色導演」的真正分別。

AI 可以幫你畫下一張。但你要知道她的下一幕。AI 繪圖不是在寫提示詞。AI 繪圖是在當導演。

📸 Reference image 先於提示詞🎬 角色先於畫面✨ 故事先於單張圖片🔁 多輪修正放大導演判斷🎥 提示詞只是最後的翻譯工具

歡迎討論。