AI 畫漫畫怎麼從分鏡做到完稿?五個階段的分工地圖:哪幾道能交給 AI、哪幾道不行

先講結論:現在沒有任何工具能「輸入一段故事,輸出一部漫畫」。 但這不代表 AI 幫不上忙——把漫畫製作拆成分鏡腳本、構圖、線稿、完稿、嵌字五個階段之後,中間那三道(構圖、線稿、完稿)是目前最值得交給 AI 的,而頭尾兩道是敘事決策,交出去通常更慢。

真正卡住多數人的不是「AI 畫得夠不夠好」,而是交接點:分鏡怎麼寫 AI 才看得懂、角色要先準備什麼才不會每格長得不一樣、生出來不滿意時該微調還是重來。這篇把五個階段和它們之間的交接點講完。

為什麼「一鍵生成整部漫畫」現在做不到

不是算力問題,是漫畫這個載體本身的三個要求,跟目前生圖模型的能力錯開:

  • 跨格連續性:同一個角色要在幾十格裡維持同一張臉、同一套衣服、同一個身高比例。生圖模型每次生成本質上是獨立事件,「記得上一格」要靠外部餵參考圖,不是模型自己會的。
  • 畫面裡的文字:漫畫的對白框、擬聲詞是版面的一部分。生圖模型畫出來的文字經常是亂碼或近似字形,中日文尤其明顯。
  • 版面即敘事:哪一格大、哪一格小、讀者視線怎麼走,是作者的敘事決策。模型沒有你的故事節奏,它產不出「這一格要滿版因為這是高潮」。

所以務實的做法不是等一鍵生成,而是把 AI 放進它真的強的那幾段——這也是下面五階段的分法由來。

五個階段 × AI 分工地圖

階段這一步在做什麼AI 適合度為什麼
1. 分鏡腳本決定格數、每格畫什麼、台詞落點人來這是敘事決策,也是後面每一步的輸入
2. 構圖草稿姿勢、鏡頭、人物在畫面裡的位置很適合便宜、可大量試錯,不用管畫風
3. 線稿把草稿收成乾淨的線適合有草稿當基準,穩定度高
4. 完稿(黑白網點/彩色)明暗、材質、氣氛適合風格統一靠參考圖,不靠重描
5. 台詞嵌字對白框位置、字級、留白人來模型畫不準文字,且框的落點是節奏

⚠️ 先釐清一個常被混用的詞。 這裡的「分鏡腳本」指的是文字——每一格的鏡頭、動作、場景、台詞寫成欄位。真正畫出來、有草圖和格線的那份分鏡(日文叫ネーム)是它的下游產物。很多 AI 教學把兩者混為一談,結果讀者以為「用 AI 畫分鏡」,其實在講的是寫規格。

看得出來 AI 吃的是中段的作畫工時,不是頭尾的判斷。這也解釋了為什麼很多人「用了 AI 但沒變快」——他們把第 1 步跳過,直接讓 AI 猜故事,然後花更多時間在挑圖。

這是一種分工,不是產業規則。 也有人在第 1 階段用語言模型把散文拆成分格清單,也有人第 3 階段的 AI 線稿還是得手動重描手部和背景透視。下面講的是一條實務上跑得動的路線,不是唯一解。

階段 1:分鏡腳本要寫成 AI 讀得懂的結構

分鏡本來就是漫畫的施工圖,差別只在於:要餵給 AI 的那份得是文字規格,而且要把「畫面資訊」和「敘事資訊」分開寫。

每一格至少要有這四欄,缺一個 AI 就會自己編:

  • 鏡頭:特寫/半身/全身/遠景,仰角或俯角
  • 角色與動作:誰在畫面裡、在做什麼、朝哪邊
  • 場景:地點、時間、光源
  • 對白:寫在欄位裡,不要寫進畫面描述(否則模型會試著把字畫上去)

反例是「主角很難過地站在雨中」——沒有鏡頭、沒有距離、沒有光源,模型每次都會給你不同的答案。改成「中景、微俯角、主角站在無人的巷口,夜雨,唯一光源是身後的招牌」,一致性立刻上一個檔次。

階段 2:先固定角色,再生第一格

這是整條流程最關鍵、也最常被跳過的一步:在生任何一格畫面之前,先讓每個角色有一組固定的參考圖。

作法是先做一組角色設定圖——白底、不帶文字,把這個角色的長相固定下來。之後每一格生成都拿同一組圖當參考,模型才有「這個人長這樣」的基準。

⚠️ 參考圖怎麼餵,比有沒有參考圖更關鍵。 拿一張把正面、側面、背面全塞在一起的多視角大圖直接當參考丟進去,常見的結果是模型把它讀成「畫面裡有三個人」,或者把背面的設計混到正面來。實務上更穩的是每次只餵單一視角、乾淨、沒有雜訊的單張圖,需求更高時才走訓練角色專屬模型那條路。

沒有這一步,你會遇到的就是最常見的抱怨:第 3 格的主角和第 17 格的主角看起來像兄弟姊妹。角色一致性有一整套技巧(參考圖張數、描述怎麼寫、什麼時候該訓練專屬模型),細節在另一篇,這裡只強調流程上的位置:它是前置作業,不是出問題後的補救

順帶一提,角色的外觀描述要跟人設描述分開存。身高、體型、髮色、瞳色、常穿的衣服是作畫用的;性格、背景故事、動機是寫故事用的。把後者一起餵進生圖 prompt,只會稀釋掉真正重要的外觀資訊——這也是角色設定表要分欄的實務理由。

階段 3:從構圖草稿逐階段推進,不要一次到位

新手最常見的作法是直接叫 AI 生一張全彩完成圖,不滿意就整張重生。這樣做有兩個問題:貴,而且每次重生都會把你原本滿意的部分一起洗掉

比較穩的作法是分階段推進,每一階段都以前一階段當基礎:

  1. 構圖草稿:只要姿勢、體型比例、場景配置,不要畫風、不要細節。這一階段最便宜,就是拿來大量試錯的——一格試五六個構圖都不心疼。
  2. 線稿:構圖定了再收線。這時候把角色參考圖餵進去,身分才固定得住。
  3. 完稿:線稿定了再往下。這裡要先決定你做的是黑白漫畫(貼網點、鋪黑、加效果)還是彩色漫畫/條漫(上色)——兩者是不同的工序和不同的成品形態,別混著講。風格統一靠的是整話都用同一組參考,不是每張重調 prompt。

⚠️ 這一段要講清楚機制:生圖模型預設是「一次生出完整彩圖」,不會自己乖乖只給你線稿。要跑出上面這種階段流水線,必須明確用以前一階段的圖當輸入再生成(image-to-image)這類串接手段把它逼出來,不是打一句 prompt 就有的。另一條同樣主流的路線是反過來:人自己畫構圖草稿,只讓 AI 做後段的線稿與完稿——如果你本來就會畫,那條路的可控性更高。

每一階段的產出都留著,不要覆蓋。你會需要回頭比對「完稿前的線稿是不是比較好」,而且下一話遇到同樣的場景時,舊的構圖草稿可以直接重用。

階段 4:不滿意時,先問「該微調還是該重來」

這是最省時間的一個判斷,可惜大部分人只會按「重新生成」:

狀況該做的
構圖、角度、角色都對,只有某個細節不對(表情、手的位置、背景一個東西)微調:指定「只改這裡,其他保持不變」
鏡頭或姿勢從根本上就不是你要的重來:回到構圖階段重新試,不要在完成圖上硬修
角色臉不像回頭處理參考,不是重生——重生一百次也不會變像

「角色臉不像就一直重生」是最典型的白費工。模型不會因為你多按幾次就突然認識這個角色。要動的是輸入端,而且不是把參考圖越加越多(加太多反而互相稀釋):換掉品質不好的那張、把參考的影響力調高、只針對臉做局部重繪,或者乾脆訓練一個角色專屬模型

階段 5:台詞和嵌字一定要人來

這裡其實有兩個獨立的理由,常被混在一起講:

  1. 技術面:讓模型把文字直接畫進畫面,出來多半是壞掉的字形,中日文尤其明顯。
  2. 演出面:就算文字畫得夠準,對話框放在畫面的哪個位置,決定讀者的視線動線和停頓長度。這是分鏡決策的延伸——而且畫的時候本來就要替框預留空間,不能等畫完再硬塞。

實務上最穩的做法是讓對白以疊層的方式蓋在圖上,而不是讓模型把字畫進畫面裡。這樣的好處很直接:改台詞不用重生圖、翻譯成別的語言只要換那一層、字級和換行都還能調。至於台詞本身怎麼寫得像人在講話,那是另一件事

Before / After:一鍵思維 vs 流水線思維

一鍵思維(❌)流水線思維(✅)
起點直接餵故事叫 AI 生漫畫先寫結構化的分鏡腳本,四欄齊全
角色每格靠 prompt 描述先固定乾淨的參考圖,每格餵同一組
生成一次要全彩完成圖構圖 → 線稿 → 完稿,逐階段推進
不滿意整張重生分辨要微調、重來、還是補參考圖
台詞讓模型畫進畫面疊層蓋上去,可改可翻譯
結果單張很漂亮、連不成一話一話讀起來是同一個世界

三個常見誤區

  • 跳過分鏡腳本直接生圖:AI 不知道你的故事節奏,它只會給你「還算好看的獨立插圖」。腳本是輸入,不是可以省略的前置。
  • 角色不做設定表就開工:這是跨格臉不一樣的根因。補參考圖的成本遠低於整話重生。
  • 只會整張重生:把滿意的部分一起洗掉,然後在挑圖上花掉省下來的時間。學會「微調 vs 重來」的分界,比換工具有用。

治本:讓分鏡、角色、每一階段的圖待在同一個地方

上面五個階段真正難的不是任何單一步驟,而是它們之間要一直互相對照——生第 17 格時要看第 3 格的角色長怎樣、完稿時要看線稿、改台詞時要回頭看腳本。分散在不同工具裡,你就會一直在切視窗、找檔案、對照舊圖。

LitMemo 的漫畫生圖是直接長在分鏡上的:每一格都有自己的製作階段流水線(構圖草稿 → 線稿 → 網點 → 全彩),每個階段的產出都留著、可以回頭比對,而且每一階段都可以選擇讓 AI 生、或是自己畫好上傳,兩種混搭也沒問題。頁面上顯示的是最進階的那一階段,所以製作途中一話可以「有些格已經完稿、有些格還在線稿」地並行推進——這是進度狀態,不是出版時的樣子。

角色的部分則從角色管理帶進來:角色還沒有參考圖時,系統會先擋下來、請你生一張設定表,而不是讓你生完整話才發現臉不一樣。對白是疊在圖上的獨立圖層,改字、翻譯都不用重生圖。

小結

AI 畫漫畫的正確問法不是「能不能一鍵生成」,而是「我的哪一道工序可以交出去」。

答案通常是中間三道:構圖、線稿、完稿。頭尾兩道——分鏡腳本和嵌字——是敘事決策,交給 AI 多半更慢。而讓中間三道真的省到時間的前提有兩個:分鏡腳本要寫成結構化的四欄,以及角色要先有乾淨的參考圖當基準。做到這兩件事,剩下的就是逐階段推進、學會分辨微調和重來。

常見問題

AI 現在能一鍵生成整部漫畫嗎?
不能。三個結構性的原因:跨格角色一致性要靠外部餵參考圖(模型不會自己記得上一格)、畫面裡的文字經常出錯(中日文尤其明顯)、版面大小是敘事決策而模型不知道你的故事節奏。務實的用法是把漫畫拆成五個階段,把中間的構圖、線稿、完稿交給 AI。
分鏡該讓 AI 畫嗎?
不建議。這裡先分清楚兩件事:畫出來、有草圖和格線的那份分鏡(日文的 ネーム)是敘事成品;要餵給 AI 的是它上游的**文字腳本**。腳本是後面所有階段的輸入——格數、鏡頭、台詞落點都在這裡定,建議寫成四欄:鏡頭(距離+角度)、角色與動作、場景(地點/時間/光源)、對白。對白要寫在獨立欄位,不要寫進畫面描述,否則模型會試著把字畫上去。
為什麼每一格的角色長得都不一樣?
因為沒有固定的參考錨點。生圖模型每次生成都是獨立事件,只靠文字描述無法讓它每次都畫出同一張臉。解法是先把角色的參考圖固定下來——白底、無文字、每張只有單一視角的乾淨圖,之後每格生成都餵同一組。注意別拿正/側/背擠在一起的多視角大圖直接當參考,模型很容易讀成畫面裡有三個人。這是前置作業,不是事後補救——臉不像的時候重生一百次也不會變像。
生出來不滿意,該重新生成還是修改?
看是哪裡不對。構圖和角色都對、只有細節不對(表情、手的位置、背景某個東西)→ 用微調,明確指定「只改這裡,其他保持不變」。鏡頭或姿勢從根本就不對 → 回到構圖階段重試,別在完成圖上硬修。角色臉不像 → 動輸入端:換掉品質不好的參考圖、調高參考的影響力、只對臉做局部重繪,或訓練角色專屬模型(不是無腦增加參考張數,加太多會互相稀釋)。整張重生的問題是會把你原本滿意的部分一起洗掉。
為什麼建議分階段生成,而不是一次生全彩完成圖?
兩個理由。一是試錯成本:構圖階段只需要姿勢和塊面、不要畫風,最便宜,適合一格試五六個版本;等構圖定了再收線稿、再完稿,每一階段都有前一階段當基準,穩定度更高。要注意這種流水線不是模型的預設行為——生圖模型預設一次就給你完整彩圖,得靠「拿上一階段的圖再生成」這類串接手段才逼得出來。二是可回溯:每階段產出都留著,你能回頭比對,也能在下一話重用舊構圖。
台詞可以讓 AI 直接畫進畫面裡嗎?
技術上模型會嘗試,但結果通常是亂碼或近似字形,中日文特別明顯。更重要的是實務理由:把對白做成疊在圖上的獨立圖層,改台詞不用重生圖、翻譯只要換那一層、字級和換行都還能調。而且對話框放在哪裡決定讀者的視線動線和停頓長度,那是分鏡決策的延伸,本來就該由人決定。