2026-08-14

持久角色参考设定表在维持一致性方面明显优于根据文本提示词重新生成每个分镜,因为以参考图为条件的生成会将身份锚定到固定的视觉嵌入,而不是每次都仅从语言中重新采样身份。重生成会逐格累积漂移:每次生成都是从模型分布中独立抽取,因此面部结构、服装细节和身体比例会不断游移,且没有校正机制。参考图工作流则通过在每次生成中回传同一张源图,大幅压缩这种方差。
学术基准测试记录了这种可量化差距。在 arXiv 上的 Character-Adapter 研究中,以参考图为条件的方法在单角色一致性上取得了 84.8% CLIP-I 和 68.1% DINO-I,而没有进行适当区域特征提取的免训练方法,CLIP-I 最低仅为 63.8%。纯文本提示词没有可报告的一致性得分:不存在可用于衡量的身份锚点。
区分可靠角色连续性与逐格漂移的关键因素:
✅ 身份锚定——参考图提供持久的视觉嵌入;文本提示词则不能 ✅ 漂移累积——重生成的错误在每个分镜中相互独立,因此方差会随序列增长 ✅ 细节还原度——Midjourney 的文档明确警告,即使使用参考图,雀斑或服装标志等精细细节也“未必能完全正确呈现” ✅ 成本不对称——参考条件控制带来额外计算成本;Midjourney 指出,Omni Reference 的 GPU 时间是标准 V7 图像的 2× ✅ 输入质量依赖——参考图工作流的稳定程度取决于源设定表质量,这会将失败点前移到上游
这种取舍并不是一致与不一致之间的选择,而是在前期投入及单图成本,与后期不断累积的修正工作之间权衡;正确答案取决于序列长度、艺术风格,以及项目实际需要的身份精确度。
文本提示词对身份的描述不足。例如,“一名留着黑色短发、戴着蒸汽朋克护目镜的女性”描述的是一类面孔,而非某一张特定面孔;每次生成都会从这一类别中抽取不同的个体。即便提示词和设置完全相同,更换种子也会生成另一个碰巧符合相同描述的人。
问题是结构性的,而不是调参问题。扩散模型从噪声出发,并以文本嵌入作为条件生成图像;自然语言无法编码让一张脸可被辨认的数千种微妙几何关系,例如瞳距、下颌收窄程度、鼻孔形状,以及上唇的精确曲线。
从零重生成的漫画工作流中会出现三种漂移模式:
社区讨论也反映了这一点。广受引用的
之所以存在,正是因为只依靠提示词的生成无法满足漫画、故事板和书籍创作需求——每一种被记录的方法都会在文本之上加入某种视觉条件控制。**实用漂移测试:**使用不同种子,将相同角色提示词生成八次,再将输出排成网格。若读者在未被告知的情况下无法认出它们是同一个人,纯提示词重生成就无法支撑多分镜序列。
持久角色参考设定表是一种固定的视觉资产——通常包含正面、侧面和背面视图的三视图,以及细节标注——它会作为条件输入回传给每一次生成。传统动画数十年来一直使用角色设定表,让不同画师绘制的数百张图始终符合角色设定;AI 工作流则将同一种资产用作机器可读的身份锚点。

不同平台的技术机制各不相同,但模式一致:
@ 符号内联调用它们。面向 AI 的参考设定表不同于供人类画师使用的角色设定表。Runway 的文档建议采用自然、均匀的光线,中等质量,以及中性的主体表情,以制作可简化后续转换的“空白画布”。若将戏剧化光影或极端表情固化在参考图中,它们会传播到每一次后续生成。
推荐组成部分:
没有任何单一工具能在所有维度获胜——正确选择取决于你优先考虑风格保真度、参考精确度,还是工作流控制力。Midjourney 的风格连贯性最强,但处理外部参考图的能力最弱;Runway 的多参考图组合最灵活;开源技术栈的控制力最强,但搭建成本也最高。
| 维度 | Midjourney | Runway Gen-4 References | Leonardo.Ai | 开源方案(ComfyUI + IP-Adapter) |
|---|---|---|---|---|
| 参考机制 | V6/Niji 6 中的 Character Reference(--cref);V7+ 中的 Omni Reference | 每次生成最多 3 个带标签参考图,通过 @name 调用 | Character Reference 和 Image Guidance 选项 | IP-Adapter、FaceID、ControlNet、LoRA——可组合 |
| 一致性强度调节 | --cw 0(仅脸部)至 --cw 100(脸部、头发、服装) | 迭代式参考路径;输出可成为新的参考图 | 每个参考图都可调整引导权重 | 可完整控制每个适配器的权重和层级 |
| 外部照片处理 | 较弱——称它“非常擅长处理 Midjourney 制作的角色”,但对第三方参考图效果不佳 | 较强——专为均匀照明的上传照片设计 | 中等 | 使用 FaceID 变体时最强 |
| 计算成本溢价 | Omni Reference 相比标准 V7 图像消耗 2× GPU 时间 | 按每次生成消耗积分 | 在 12 token 基础上,每个 Image Guidance 选项消耗 2 token,Leonardo 帮助中心说明 | 仅消耗本地 GPU 时间 |
| 多角色场景 | 有限——概念混淆很常见 | 通过多参考图支持 | 有限 | 结合区域条件控制时表现强 |
| 价格 | 订阅分级 | 标准套餐起价 $15/月,含 625 积分,第三方分析 | 付费套餐起价 $12/月,含 8,500 token(约 340 张图),Sonary 的评测 | 软件免费;需承担硬件成本 |
| 获得首个一致分镜的搭建时间 | 数分钟 | 数分钟 | 数分钟 | 数小时至数天 |
| 最适合 | 艺术指导比精确相貌更重要的风格化漫画 | 电影化序列及场景一致的补充镜头 | 重视预算的大批量创作 | 需要精确、可重复控制的技术型创作者 |
价格和功能细节反映的是撰写时公开可得的信息,且经常变化。
所有基于参考图工具都存在的真实限制:
对于探索性创作、单图输出,以及尚未锁定角色设计的项目,从零重生成才是正确选择。参考条件控制本来就会限制输出空间——这正是它的用途——因此在构思阶段反而会妨碍创作。
重生成在四种特定场景中更具优势:
实践中,有经验的创作者很少只选择一种方法。主流工作流采用两阶段模式:
Runway 的文档描述了完全相同的迭代模式:将鼠标悬停在任一输出上,选择“作为图像参考”,生成结果便会成为新的锚点。其指南演示了如何将中间输出保存为 fullbodyelfbryan 并从那里继续——参考设定表不是静态输入,而是会随着序列推进不断完善的动态资产。
**大多数指南遗漏的一项改进:**当你的参考图已经包含一个主体,而你想将另一名角色合成进这个场景时,Runway 建议在上传前,先用照片编辑器中的黑色方框遮住现有面孔。这样可防止模型混淆原始主体与目标角色——这一小型预处理步骤可消除一种常见且令人困惑的失败模式。
参考设定表的前期成本和单次生成成本更高,但返工成本会大幅降低;交叉点通常比大多数创作者预想得更早,一般在 5 至 10 个分镜之间出现。
成本结构对比:
| 成本组成 | 从零重生成 | 持久角色参考设定表 |
|---|---|---|
| 搭建投入 | 几乎为零 | 花费 1–3 小时制作和验证设定表 |
| 单次生成计算成本 | 基础费率 | Midjourney Omni Reference 为 2×;Leonardo 的每个引导选项增加 2 token |
| 废弃率 | 高——多数输出无法匹配身份 | 低——多数输出可直接使用或接近可用 |
| 返工成本 | 随序列长度增长 | 大致保持平稳 |
| 失败模式 | 在组装时才发现隐性漂移 | 在生成时即可发现明显不匹配 |
废弃率是主导变量,也是创作者最经常误算的变量。如果纯提示词重生成每八次只能得到一个符合角色设定的分镜,那么每个可用分镜就要付出八次基础费率生成。参考条件控制即使成本为 2×,但命中率达到二分之一,其单个可用输出成本依然更低——这还未计算审阅和丢弃失败结果所需的人力。
**二阶成本在于发现问题的时机。**纯提示词漂移往往在单格查看时并不明显,只有当分镜并排放在完成的页面上时才会暴露。此时,修复不仅需要重生成已通过单独审阅的分镜,还需重新匹配其与相邻画格的光影和构图。参考图工作流会在生成当下暴露身份不匹配,而此时修正成本最低。
也存在合理的反方观点。Character-Adapter 的基准测试发现,LoRA 等微调方法需要 1,050 秒的搭建计算时间,而免训练的参考条件控制仅需 7.2 秒,效率差距达到 70×。沉重的参考基础设施确有实际成本;对于短序列,其搭建投入可能永远无法摊销。
应以与最终分镜相同的艺术风格制作设定表,从单一锁定输出生成它,而不是将来自不同生成结果的视图拼合;然后在投入制作前,使用一组严格测试序列对它进行验证。
设定表验证完成后,分镜生成将遵循可重复的模式。在支持命名参考图的平台上,内联调用角色,并且只描述场景:
“
@marisa站在夜晚被雨水打湿的屋顶边缘,下方是城市灯光,从背后以四分之三视角拍摄,戏剧化的逆光”
以下两条提示词规则比其他任何规则都重要:
Midjourney 的角色权重参数是最明确的控制项之一,但大多数创作者从不调整它。在 --cw 100 时,模型会从参考图中提取脸部、头发和服装;在 --cw 0 时,模型几乎只关注脸部。
实用对应关系:
--cw 100——角色穿着与参考图相同服装的分镜--cw 0 至 --cw 30——服装变化、时间跳跃、替代服饰;仅需保持脸部一致的场景那些表示参考条件控制会“阻碍”服装变化的创作者,通常是在本应降低权重时仍使用默认权重。
对于使用对话式 AI 平台而非专用图像工具的创作者,Jenova 上的 Comic Creator、Manga Creator 和 Webtoon Creator 等智能体,可通过持久的跨会话记忆处理连续叙事艺术;这让角色描述和已确定的设计决策能够在长期项目中持续可用,而无需每次会话重新指定。其取舍是参数控制不如专用图像平台细致——你无法直接设置角色权重值。可在 jenova.ai 使用;免费层级包含有限的每日使用量,付费套餐起价为 $20/月。
从业者普遍认为,对于任何序列性工作,参考图与重生成的争论已经得出结论:参考图更具优势;但真正的技能重点已从编写提示词转向筛选和管理参考图。
“多数人提出这个问题时的框架是反的。他们问哪种方法能带来更好的一致性,但真正的变量是你要交付多少个分镜。少于三个分镜时,重生成足够可用,而参考图是额外负担。超过十个分镜后,纯提示词工作流的废弃率在经济上已无法成立——你要为八次生成付费才能得到一个可用分镜,而且直到组装页面时才会发现失败。”
“我们最常见到的失败并非工具选择,而是参考图质量。创作者从一张戏剧化光线、表情强烈的主视觉图制作设定表,然后不明白为什么每个分镜都有相同的光线和半微笑。参考图是一张约束表面——其中固化的一切都会传播。中性光线和中性表情并非审美偏好,而是技术要求。”
“另一个未被充分使用的控制项是一致性权重。Midjourney 提供从 0 到 100 的调节范围,几乎没人去碰它。如果角色在第二幕更换服装,使用完整角色权重意味着你在每次生成时都要与参考图对抗。将它降至仅脸部,冲突便会消失。工具早已解决这个问题——知识缺口在创作者一方。”
——Jenova 产品团队,拥有 6 年创意 AI 智能体工作流构建经验
应根据序列长度和身份容忍度匹配方法——这两个变量比工具偏好或预算更能决定答案。
适合选择从零重生成的情况:
适合选择持久角色参考设定表的情况:
适合选择混合模式的情况:
**一条实用的决策准则:**如果你会注意到同一组图像中任意两张之间的角色发生了变化,就使用参考图;如果不会,就不必支付额外成本。
有一种真正值得提出的逆向观点:参考设定表经常被过度应用于实际上不需要它们的项目。一组四格、扁平极简风格的社交媒体条漫,仅靠提示词生成也会显得一致;花数小时构建并验证三视图不会带来可见改进。一致性是让读者沉浸的手段,而不是目的本身——超过某个阈值后,额外的一致性将不可见。