AI 画漫画怎么从分镜做到完稿?五个阶段的分工地图:哪几道能交给 AI、哪几道不行
先讲结论:现在没有任何工具能「输入一段故事,输出一部漫画」。 但这不代表 AI 帮不上忙——把漫画制作拆成分镜脚本、构图、线稿、完稿、嵌字五个阶段之后,中间那三道(构图、线稿、完稿)是目前最值得交给 AI 的,而头尾两道是叙事决策,交出去通常更慢。
真正卡住多数人的不是「AI 画得够不够好」,而是交接点:分镜怎么写 AI 才看得懂、角色要先准备什么才不会每格长得不一样、生出来不满意时该微调还是重来。这篇把五个阶段和它们之间的交接点讲完。
为什么「一键生成整部漫画」现在做不到
不是算力问题,是漫画这个载体本身的三个要求,跟目前生图模型的能力错开:
- 跨格连续性:同一个角色要在几十格里维持同一张脸、同一套衣服、同一个身高比例。生图模型每次生成本质上是独立事件,「记得上一格」要靠外部喂参考图,不是模型自己会的。
- 画面里的文字:漫画的对白框、拟声词是版面的一部分。生图模型画出来的文字经常是乱码或近似字形,中日文尤其明显。
- 版面即叙事:哪一格大、哪一格小、读者视线怎么走,是作者的叙事决策。模型没有你的故事节奏,它产不出「这一格要满版因为这是高潮」。
所以务实的做法不是等一键生成,而是把 AI 放进它真的强的那几段——这也是下面五阶段的分法由来。
五个阶段 × AI 分工地图
| 阶段 | 这一步在做什么 | AI 适合度 | 为什么 |
|---|---|---|---|
| 1. 分镜脚本 | 决定格数、每格画什么、台词落点 | ❌ 人来 | 这是叙事决策,也是后面每一步的输入 |
| 2. 构图草稿 | 姿势、镜头、人物在画面里的位置 | ✅ 很适合 | 便宜、可大量试错,不用管画风 |
| 3. 线稿 | 把草稿收成干净的线 | ✅ 适合 | 有草稿当基准,稳定度高 |
| 4. 完稿(黑白网点/彩色) | 明暗、材质、气氛 | ✅ 适合 | 风格统一靠参考图,不靠重描 |
| 5. 台词嵌字 | 对白框位置、字级、留白 | ❌ 人来 | 模型画不准文字,且框的落点是节奏 |
⚠️ 先厘清一个常被混用的词。 这里的「分镜脚本」指的是文字——每一格的镜头、动作、场景、台词写成栏位。真正画出来、有草图和格线的那份分镜(日文叫ネーム)是它的下游产物。很多 AI 教学把两者混为一谈,结果读者以为「用 AI 画分镜」,其实在讲的是写规格。
看得出来 AI 吃的是中段的作画工时,不是头尾的判断。这也解释了为什么很多人「用了 AI 但没变快」——他们把第 1 步跳过,直接让 AI 猜故事,然后花更多时间在挑图。
这是一种分工,不是产业规则。 也有人在第 1 阶段用语言模型把散文拆成分格清单,也有人第 3 阶段的 AI 线稿还是得手动重描手部和背景透视。下面讲的是一条实务上跑得动的路线,不是唯一解。
阶段 1:分镜脚本要写成 AI 读得懂的结构
分镜本来就是漫画的施工图,差别只在于:要喂给 AI 的那份得是文字规格,而且要把「画面资讯」和「叙事资讯」分开写。
每一格至少要有这四栏,缺一个 AI 就会自己编:
- 镜头:特写/半身/全身/远景,仰角或俯角
- 角色与动作:谁在画面里、在做什么、朝哪边
- 场景:地点、时间、光源
- 对白:写在栏位里,不要写进画面描述(否则模型会试著把字画上去)
反例是「主角很难过地站在雨中」——没有镜头、没有距离、没有光源,模型每次都会给你不同的答案。改成「中景、微俯角、主角站在无人的巷口,夜雨,唯一光源是身后的招牌」,一致性立刻上一个档次。
阶段 2:先固定角色,再生第一格
这是整条流程最关键、也最常被跳过的一步:在生任何一格画面之前,先让每个角色有一组固定的参考图。
作法是先做一组角色设定图——白底、不带文字,把这个角色的长相固定下来。之后每一格生成都拿同一组图当参考,模型才有「这个人长这样」的基准。
⚠️ 参考图怎么喂,比有没有参考图更关键。 拿一张把正面、侧面、背面全塞在一起的多视角大图直接当参考丢进去,常见的结果是模型把它读成「画面里有三个人」,或者把背面的设计混到正面来。实务上更稳的是每次只喂单一视角、干净、没有杂讯的单张图,需求更高时才走训练角色专属模型那条路。
没有这一步,你会遇到的就是最常见的抱怨:第 3 格的主角和第 17 格的主角看起来像兄弟姊妹。角色一致性有一整套技巧(参考图张数、描述怎么写、什么时候该训练专属模型),细节在另一篇,这里只强调流程上的位置:它是前置作业,不是出问题后的补救。
顺带一提,角色的外观描述要跟人设描述分开存。身高、体型、发色、瞳色、常穿的衣服是作画用的;性格、背景故事、动机是写故事用的。把后者一起喂进生图 prompt,只会稀释掉真正重要的外观资讯——这也是角色设定表要分栏的实务理由。
阶段 3:从构图草稿逐阶段推进,不要一次到位
新手最常见的作法是直接叫 AI 生一张全彩完成图,不满意就整张重生。这样做有两个问题:贵,而且每次重生都会把你原本满意的部分一起洗掉。
比较稳的作法是分阶段推进,每一阶段都以前一阶段当基础:
- 构图草稿:只要姿势、体型比例、场景配置,不要画风、不要细节。这一阶段最便宜,就是拿来大量试错的——一格试五六个构图都不心疼。
- 线稿:构图定了再收线。这时候把角色参考图喂进去,身分才固定得住。
- 完稿:线稿定了再往下。这里要先决定你做的是黑白漫画(贴网点、铺黑、加效果)还是彩色漫画/条漫(上色)——两者是不同的工序和不同的成品形态,别混著讲。风格统一靠的是整话都用同一组参考,不是每张重调 prompt。
⚠️ 这一段要讲清楚机制:生图模型预设是「一次生出完整彩图」,不会自己乖乖只给你线稿。要跑出上面这种阶段流水线,必须明确用以前一阶段的图当输入再生成(image-to-image)这类串接手段把它逼出来,不是打一句 prompt 就有的。另一条同样主流的路线是反过来:人自己画构图草稿,只让 AI 做后段的线稿与完稿——如果你本来就会画,那条路的可控性更高。
每一阶段的产出都留著,不要覆盖。你会需要回头比对「完稿前的线稿是不是比较好」,而且下一话遇到同样的场景时,旧的构图草稿可以直接重用。
阶段 4:不满意时,先问「该微调还是该重来」
这是最省时间的一个判断,可惜大部分人只会按「重新生成」:
| 状况 | 该做的 |
|---|---|
| 构图、角度、角色都对,只有某个细节不对(表情、手的位置、背景一个东西) | 微调:指定「只改这里,其他保持不变」 |
| 镜头或姿势从根本上就不是你要的 | 重来:回到构图阶段重新试,不要在完成图上硬修 |
| 角色脸不像 | 回头处理参考,不是重生——重生一百次也不会变像 |
「角色脸不像就一直重生」是最典型的白费工。模型不会因为你多按几次就突然认识这个角色。要动的是输入端,而且不是把参考图越加越多(加太多反而互相稀释):换掉品质不好的那张、把参考的影响力调高、只针对脸做局部重绘,或者干脆训练一个角色专属模型。
阶段 5:台词和嵌字一定要人来
这里其实有两个独立的理由,常被混在一起讲:
- 技术面:让模型把文字直接画进画面,出来多半是坏掉的字形,中日文尤其明显。
- 演出面:就算文字画得够准,对话框放在画面的哪个位置,决定读者的视线动线和停顿长度。这是分镜决策的延伸——而且画的时候本来就要替框预留空间,不能等画完再硬塞。
实务上最稳的做法是让对白以叠层的方式盖在图上,而不是让模型把字画进画面里。这样的好处很直接:改台词不用重生图、翻译成别的语言只要换那一层、字级和换行都还能调。至于台词本身怎么写得像人在讲话,那是另一件事。
Before / After:一键思维 vs 流水线思维
| 一键思维(❌) | 流水线思维(✅) | |
|---|---|---|
| 起点 | 直接喂故事叫 AI 生漫画 | 先写结构化的分镜脚本,四栏齐全 |
| 角色 | 每格靠 prompt 描述 | 先固定干净的参考图,每格喂同一组 |
| 生成 | 一次要全彩完成图 | 构图 → 线稿 → 完稿,逐阶段推进 |
| 不满意 | 整张重生 | 分辨要微调、重来、还是补参考图 |
| 台词 | 让模型画进画面 | 叠层盖上去,可改可翻译 |
| 结果 | 单张很漂亮、连不成一话 | 一话读起来是同一个世界 |
三个常见误区
- 跳过分镜脚本直接生图:AI 不知道你的故事节奏,它只会给你「还算好看的独立插图」。脚本是输入,不是可以省略的前置。
- 角色不做设定表就开工:这是跨格脸不一样的根因。补参考图的成本远低于整话重生。
- 只会整张重生:把满意的部分一起洗掉,然后在挑图上花掉省下来的时间。学会「微调 vs 重来」的分界,比换工具有用。
治本:让分镜、角色、每一阶段的图待在同一个地方
上面五个阶段真正难的不是任何单一步骤,而是它们之间要一直互相对照——生第 17 格时要看第 3 格的角色长怎样、完稿时要看线稿、改台词时要回头看脚本。分散在不同工具里,你就会一直在切视窗、找档案、对照旧图。
LitMemo 的漫画生图是直接长在分镜上的:每一格都有自己的制作阶段流水线(构图草稿 → 线稿 → 网点 → 全彩),每个阶段的产出都留著、可以回头比对,而且每一阶段都可以选择让 AI 生、或是自己画好上传,两种混搭也没问题。页面上显示的是最进阶的那一阶段,所以制作途中一话可以「有些格已经完稿、有些格还在线稿」地并行推进——这是进度状态,不是出版时的样子。
角色的部分则从角色管理带进来:角色还没有参考图时,系统会先挡下来、请你生一张设定表,而不是让你生完整话才发现脸不一样。对白是叠在图上的独立图层,改字、翻译都不用重生图。
小结
AI 画漫画的正确问法不是「能不能一键生成」,而是「我的哪一道工序可以交出去」。
答案通常是中间三道:构图、线稿、完稿。头尾两道——分镜脚本和嵌字——是叙事决策,交给 AI 多半更慢。而让中间三道真的省到时间的前提有两个:分镜脚本要写成结构化的四栏,以及角色要先有干净的参考图当基准。做到这两件事,剩下的就是逐阶段推进、学会分辨微调和重来。
LitMemo