AI 畫漫畫怎麼從分鏡做到完稿?五個階段的分工地圖:哪幾道能交給 AI、哪幾道不行
先講結論:現在沒有任何工具能「輸入一段故事,輸出一部漫畫」。 但這不代表 AI 幫不上忙——把漫畫製作拆成分鏡腳本、構圖、線稿、完稿、嵌字五個階段之後,中間那三道(構圖、線稿、完稿)是目前最值得交給 AI 的,而頭尾兩道是敘事決策,交出去通常更慢。
真正卡住多數人的不是「AI 畫得夠不夠好」,而是交接點:分鏡怎麼寫 AI 才看得懂、角色要先準備什麼才不會每格長得不一樣、生出來不滿意時該微調還是重來。這篇把五個階段和它們之間的交接點講完。
為什麼「一鍵生成整部漫畫」現在做不到
不是算力問題,是漫畫這個載體本身的三個要求,跟目前生圖模型的能力錯開:
- 跨格連續性:同一個角色要在幾十格裡維持同一張臉、同一套衣服、同一個身高比例。生圖模型每次生成本質上是獨立事件,「記得上一格」要靠外部餵參考圖,不是模型自己會的。
- 畫面裡的文字:漫畫的對白框、擬聲詞是版面的一部分。生圖模型畫出來的文字經常是亂碼或近似字形,中日文尤其明顯。
- 版面即敘事:哪一格大、哪一格小、讀者視線怎麼走,是作者的敘事決策。模型沒有你的故事節奏,它產不出「這一格要滿版因為這是高潮」。
所以務實的做法不是等一鍵生成,而是把 AI 放進它真的強的那幾段——這也是下面五階段的分法由來。
五個階段 × AI 分工地圖
| 階段 | 這一步在做什麼 | AI 適合度 | 為什麼 |
|---|---|---|---|
| 1. 分鏡腳本 | 決定格數、每格畫什麼、台詞落點 | ❌ 人來 | 這是敘事決策,也是後面每一步的輸入 |
| 2. 構圖草稿 | 姿勢、鏡頭、人物在畫面裡的位置 | ✅ 很適合 | 便宜、可大量試錯,不用管畫風 |
| 3. 線稿 | 把草稿收成乾淨的線 | ✅ 適合 | 有草稿當基準,穩定度高 |
| 4. 完稿(黑白網點/彩色) | 明暗、材質、氣氛 | ✅ 適合 | 風格統一靠參考圖,不靠重描 |
| 5. 台詞嵌字 | 對白框位置、字級、留白 | ❌ 人來 | 模型畫不準文字,且框的落點是節奏 |
⚠️ 先釐清一個常被混用的詞。 這裡的「分鏡腳本」指的是文字——每一格的鏡頭、動作、場景、台詞寫成欄位。真正畫出來、有草圖和格線的那份分鏡(日文叫ネーム)是它的下游產物。很多 AI 教學把兩者混為一談,結果讀者以為「用 AI 畫分鏡」,其實在講的是寫規格。
看得出來 AI 吃的是中段的作畫工時,不是頭尾的判斷。這也解釋了為什麼很多人「用了 AI 但沒變快」——他們把第 1 步跳過,直接讓 AI 猜故事,然後花更多時間在挑圖。
這是一種分工,不是產業規則。 也有人在第 1 階段用語言模型把散文拆成分格清單,也有人第 3 階段的 AI 線稿還是得手動重描手部和背景透視。下面講的是一條實務上跑得動的路線,不是唯一解。
階段 1:分鏡腳本要寫成 AI 讀得懂的結構
分鏡本來就是漫畫的施工圖,差別只在於:要餵給 AI 的那份得是文字規格,而且要把「畫面資訊」和「敘事資訊」分開寫。
每一格至少要有這四欄,缺一個 AI 就會自己編:
- 鏡頭:特寫/半身/全身/遠景,仰角或俯角
- 角色與動作:誰在畫面裡、在做什麼、朝哪邊
- 場景:地點、時間、光源
- 對白:寫在欄位裡,不要寫進畫面描述(否則模型會試著把字畫上去)
反例是「主角很難過地站在雨中」——沒有鏡頭、沒有距離、沒有光源,模型每次都會給你不同的答案。改成「中景、微俯角、主角站在無人的巷口,夜雨,唯一光源是身後的招牌」,一致性立刻上一個檔次。
階段 2:先固定角色,再生第一格
這是整條流程最關鍵、也最常被跳過的一步:在生任何一格畫面之前,先讓每個角色有一組固定的參考圖。
作法是先做一組角色設定圖——白底、不帶文字,把這個角色的長相固定下來。之後每一格生成都拿同一組圖當參考,模型才有「這個人長這樣」的基準。
⚠️ 參考圖怎麼餵,比有沒有參考圖更關鍵。 拿一張把正面、側面、背面全塞在一起的多視角大圖直接當參考丟進去,常見的結果是模型把它讀成「畫面裡有三個人」,或者把背面的設計混到正面來。實務上更穩的是每次只餵單一視角、乾淨、沒有雜訊的單張圖,需求更高時才走訓練角色專屬模型那條路。
沒有這一步,你會遇到的就是最常見的抱怨:第 3 格的主角和第 17 格的主角看起來像兄弟姊妹。角色一致性有一整套技巧(參考圖張數、描述怎麼寫、什麼時候該訓練專屬模型),細節在另一篇,這裡只強調流程上的位置:它是前置作業,不是出問題後的補救。
順帶一提,角色的外觀描述要跟人設描述分開存。身高、體型、髮色、瞳色、常穿的衣服是作畫用的;性格、背景故事、動機是寫故事用的。把後者一起餵進生圖 prompt,只會稀釋掉真正重要的外觀資訊——這也是角色設定表要分欄的實務理由。
階段 3:從構圖草稿逐階段推進,不要一次到位
新手最常見的作法是直接叫 AI 生一張全彩完成圖,不滿意就整張重生。這樣做有兩個問題:貴,而且每次重生都會把你原本滿意的部分一起洗掉。
比較穩的作法是分階段推進,每一階段都以前一階段當基礎:
- 構圖草稿:只要姿勢、體型比例、場景配置,不要畫風、不要細節。這一階段最便宜,就是拿來大量試錯的——一格試五六個構圖都不心疼。
- 線稿:構圖定了再收線。這時候把角色參考圖餵進去,身分才固定得住。
- 完稿:線稿定了再往下。這裡要先決定你做的是黑白漫畫(貼網點、鋪黑、加效果)還是彩色漫畫/條漫(上色)——兩者是不同的工序和不同的成品形態,別混著講。風格統一靠的是整話都用同一組參考,不是每張重調 prompt。
⚠️ 這一段要講清楚機制:生圖模型預設是「一次生出完整彩圖」,不會自己乖乖只給你線稿。要跑出上面這種階段流水線,必須明確用以前一階段的圖當輸入再生成(image-to-image)這類串接手段把它逼出來,不是打一句 prompt 就有的。另一條同樣主流的路線是反過來:人自己畫構圖草稿,只讓 AI 做後段的線稿與完稿——如果你本來就會畫,那條路的可控性更高。
每一階段的產出都留著,不要覆蓋。你會需要回頭比對「完稿前的線稿是不是比較好」,而且下一話遇到同樣的場景時,舊的構圖草稿可以直接重用。
階段 4:不滿意時,先問「該微調還是該重來」
這是最省時間的一個判斷,可惜大部分人只會按「重新生成」:
| 狀況 | 該做的 |
|---|---|
| 構圖、角度、角色都對,只有某個細節不對(表情、手的位置、背景一個東西) | 微調:指定「只改這裡,其他保持不變」 |
| 鏡頭或姿勢從根本上就不是你要的 | 重來:回到構圖階段重新試,不要在完成圖上硬修 |
| 角色臉不像 | 回頭處理參考,不是重生——重生一百次也不會變像 |
「角色臉不像就一直重生」是最典型的白費工。模型不會因為你多按幾次就突然認識這個角色。要動的是輸入端,而且不是把參考圖越加越多(加太多反而互相稀釋):換掉品質不好的那張、把參考的影響力調高、只針對臉做局部重繪,或者乾脆訓練一個角色專屬模型。
階段 5:台詞和嵌字一定要人來
這裡其實有兩個獨立的理由,常被混在一起講:
- 技術面:讓模型把文字直接畫進畫面,出來多半是壞掉的字形,中日文尤其明顯。
- 演出面:就算文字畫得夠準,對話框放在畫面的哪個位置,決定讀者的視線動線和停頓長度。這是分鏡決策的延伸——而且畫的時候本來就要替框預留空間,不能等畫完再硬塞。
實務上最穩的做法是讓對白以疊層的方式蓋在圖上,而不是讓模型把字畫進畫面裡。這樣的好處很直接:改台詞不用重生圖、翻譯成別的語言只要換那一層、字級和換行都還能調。至於台詞本身怎麼寫得像人在講話,那是另一件事。
Before / After:一鍵思維 vs 流水線思維
| 一鍵思維(❌) | 流水線思維(✅) | |
|---|---|---|
| 起點 | 直接餵故事叫 AI 生漫畫 | 先寫結構化的分鏡腳本,四欄齊全 |
| 角色 | 每格靠 prompt 描述 | 先固定乾淨的參考圖,每格餵同一組 |
| 生成 | 一次要全彩完成圖 | 構圖 → 線稿 → 完稿,逐階段推進 |
| 不滿意 | 整張重生 | 分辨要微調、重來、還是補參考圖 |
| 台詞 | 讓模型畫進畫面 | 疊層蓋上去,可改可翻譯 |
| 結果 | 單張很漂亮、連不成一話 | 一話讀起來是同一個世界 |
三個常見誤區
- 跳過分鏡腳本直接生圖:AI 不知道你的故事節奏,它只會給你「還算好看的獨立插圖」。腳本是輸入,不是可以省略的前置。
- 角色不做設定表就開工:這是跨格臉不一樣的根因。補參考圖的成本遠低於整話重生。
- 只會整張重生:把滿意的部分一起洗掉,然後在挑圖上花掉省下來的時間。學會「微調 vs 重來」的分界,比換工具有用。
治本:讓分鏡、角色、每一階段的圖待在同一個地方
上面五個階段真正難的不是任何單一步驟,而是它們之間要一直互相對照——生第 17 格時要看第 3 格的角色長怎樣、完稿時要看線稿、改台詞時要回頭看腳本。分散在不同工具裡,你就會一直在切視窗、找檔案、對照舊圖。
LitMemo 的漫畫生圖是直接長在分鏡上的:每一格都有自己的製作階段流水線(構圖草稿 → 線稿 → 網點 → 全彩),每個階段的產出都留著、可以回頭比對,而且每一階段都可以選擇讓 AI 生、或是自己畫好上傳,兩種混搭也沒問題。頁面上顯示的是最進階的那一階段,所以製作途中一話可以「有些格已經完稿、有些格還在線稿」地並行推進——這是進度狀態,不是出版時的樣子。
角色的部分則從角色管理帶進來:角色還沒有參考圖時,系統會先擋下來、請你生一張設定表,而不是讓你生完整話才發現臉不一樣。對白是疊在圖上的獨立圖層,改字、翻譯都不用重生圖。
小結
AI 畫漫畫的正確問法不是「能不能一鍵生成」,而是「我的哪一道工序可以交出去」。
答案通常是中間三道:構圖、線稿、完稿。頭尾兩道——分鏡腳本和嵌字——是敘事決策,交給 AI 多半更慢。而讓中間三道真的省到時間的前提有兩個:分鏡腳本要寫成結構化的四欄,以及角色要先有乾淨的參考圖當基準。做到這兩件事,剩下的就是逐階段推進、學會分辨微調和重來。
LitMemo