哪种方法更能保持 AI 角色一致:重生成分镜,还是使用参考设定表?


2026-08-14


角色设计参考设定表:展示一名战士角色的彩色设计、正侧背三视图、武器细节和服装结构线

参考锚定工作流与从零重生成工作流在漂移累积上有何不同?

持久角色参考设定表在维持一致性方面明显优于根据文本提示词重新生成每个分镜,因为以参考图为条件的生成会将身份锚定到固定的视觉嵌入,而不是每次都仅从语言中重新采样身份。重生成会逐格累积漂移:每次生成都是从模型分布中独立抽取,因此面部结构、服装细节和身体比例会不断游移,且没有校正机制。参考图工作流则通过在每次生成中回传同一张源图,大幅压缩这种方差。

学术基准测试记录了这种可量化差距。在 arXiv 上的 Character-Adapter 研究中,以参考图为条件的方法在单角色一致性上取得了 84.8% CLIP-I68.1% DINO-I,而没有进行适当区域特征提取的免训练方法,CLIP-I 最低仅为 63.8%。纯文本提示词没有可报告的一致性得分:不存在可用于衡量的身份锚点。

区分可靠角色连续性与逐格漂移的关键因素:

身份锚定——参考图提供持久的视觉嵌入;文本提示词则不能 ✅ 漂移累积——重生成的错误在每个分镜中相互独立,因此方差会随序列增长 ✅ 细节还原度——Midjourney 的文档明确警告,即使使用参考图,雀斑或服装标志等精细细节也“未必能完全正确呈现” ✅ 成本不对称——参考条件控制带来额外计算成本;Midjourney 指出,Omni Reference 的 GPU 时间是标准 V7 图像的 输入质量依赖——参考图工作流的稳定程度取决于源设定表质量,这会将失败点前移到上游

这种取舍并不是一致与不一致之间的选择,而是在前期投入及单图成本,与后期不断累积的修正工作之间权衡;正确答案取决于序列长度、艺术风格,以及项目实际需要的身份精确度。

为什么从文本提示词重生成会导致角色漂移?

文本提示词对身份的描述不足。例如,“一名留着黑色短发、戴着蒸汽朋克护目镜的女性”描述的是一类面孔,而非某一张特定面孔;每次生成都会从这一类别中抽取不同的个体。即便提示词和设置完全相同,更换种子也会生成另一个碰巧符合相同描述的人。

问题是结构性的,而不是调参问题。扩散模型从噪声出发,并以文本嵌入作为条件生成图像;自然语言无法编码让一张脸可被辨认的数千种微妙几何关系,例如瞳距、下颌收窄程度、鼻孔形状,以及上唇的精确曲线。

从零重生成的漫画工作流中会出现三种漂移模式:

  1. 面部身份漂移——最明显的失败。读者会立刻察觉面孔发生变化,即使他们说不清具体变了什么。
  2. 服装漂移——扣环数量、夹克长度、武器位置和配饰细节会发生变化,因为提示词很少枚举每一个元素。
  3. 风格漂移——线条粗细、渲染密度和色温会在分镜之间变化,破坏页面的视觉统一性。

社区讨论也反映了这一点。广受引用的

之所以存在,正是因为只依靠提示词的生成无法满足漫画、故事板和书籍创作需求——每一种被记录的方法都会在文本之上加入某种视觉条件控制。

**实用漂移测试:**使用不同种子,将相同角色提示词生成八次,再将输出排成网格。若读者在未被告知的情况下无法认出它们是同一个人,纯提示词重生成就无法支撑多分镜序列。

什么是持久角色参考设定表,AI 如何使用它?

持久角色参考设定表是一种固定的视觉资产——通常包含正面、侧面和背面视图的三视图,以及细节标注——它会作为条件输入回传给每一次生成。传统动画数十年来一直使用角色设定表,让不同画师绘制的数百张图始终符合角色设定;AI 工作流则将同一种资产用作机器可读的身份锚点。

传统动画角色设定表:展示同一角色的多个标准视图和表情,以确保始终符合角色设定

不同平台的技术机制各不相同,但模式一致:

  • 图像嵌入注入——将参考图编码后,与文本嵌入一起注入扩散过程。Tencent 的 IP-Adapter将其确立为“一种有效且轻量的适配器,可为预训练文生图扩散模型实现图像提示能力”。
  • 区域特征提取——更先进的方法会将参考图分割为不同区域,例如脸部、服装和配饰,并分别施加条件。Character-Adapter 使用提示词引导的分割和动态区域级适配器,专门防止“概念混淆”,即模型混合不同角色或物体的属性。
  • 命名参考标签——商业平台允许你按名称保存并调用参考图。Runway 的 Gen-4 References每次生成最多支持三个活动参考图,并可在提示词中通过 @ 符号内联调用它们。

📋 用于 AI 的参考设定表应包含什么?

面向 AI 的参考设定表不同于供人类画师使用的角色设定表。Runway 的文档建议采用自然、均匀的光线,中等质量,以及中性的主体表情,以制作可简化后续转换的“空白画布”。若将戏剧化光影或极端表情固化在参考图中,它们会传播到每一次后续生成。

推荐组成部分:

  1. 中性正面视图——均匀照明、中性表情,是主要的身份锚点
  2. 四分之三视图与侧面视图——支持非正面角度的分镜
  3. 全身图——Runway 指出,在提示词中描述鞋子或裤子,能够可靠地触发全身构图
  4. 服装细节标注——配饰、武器、徽记的独立裁切图
  5. 风格锁定的渲染——参考图应匹配你的目标艺术风格,而非以照片写实风格作为基线

主流角色一致性工具实际表现如何?

没有任何单一工具能在所有维度获胜——正确选择取决于你优先考虑风格保真度、参考精确度,还是工作流控制力。Midjourney 的风格连贯性最强,但处理外部参考图的能力最弱;Runway 的多参考图组合最灵活;开源技术栈的控制力最强,但搭建成本也最高。

维度MidjourneyRunway Gen-4 ReferencesLeonardo.Ai开源方案(ComfyUI + IP-Adapter)
参考机制V6/Niji 6 中的 Character Reference(--cref);V7+ 中的 Omni Reference每次生成最多 3 个带标签参考图,通过 @name 调用Character Reference 和 Image Guidance 选项IP-Adapter、FaceID、ControlNet、LoRA——可组合
一致性强度调节--cw 0(仅脸部)至 --cw 100(脸部、头发、服装)迭代式参考路径;输出可成为新的参考图每个参考图都可调整引导权重可完整控制每个适配器的权重和层级
外部照片处理较弱——称它“非常擅长处理 Midjourney 制作的角色”,但对第三方参考图效果不佳较强——专为均匀照明的上传照片设计中等使用 FaceID 变体时最强
计算成本溢价Omni Reference 相比标准 V7 图像消耗 2× GPU 时间按每次生成消耗积分在 12 token 基础上,每个 Image Guidance 选项消耗 2 tokenLeonardo 帮助中心说明仅消耗本地 GPU 时间
多角色场景有限——概念混淆很常见通过多参考图支持有限结合区域条件控制时表现强
价格订阅分级标准套餐起价 $15/月,含 625 积分,第三方分析付费套餐起价 $12/月,含 8,500 token(约 340 张图),Sonary 的评测软件免费;需承担硬件成本
获得首个一致分镜的搭建时间数分钟数分钟数分钟数小时至数天
最适合艺术指导比精确相貌更重要的风格化漫画电影化序列及场景一致的补充镜头重视预算的大批量创作需要精确、可重复控制的技术型创作者

价格和功能细节反映的是撰写时公开可得的信息,且经常变化。

所有基于参考图工具都存在的真实限制:

  • Midjourney 的文档明确指出,模型“使用 Image Prompts 和参考图作为引导新创作的灵感,而不会精确复制它们”。参考条件控制会降低漂移,但不会彻底消除漂移。
  • IP-Adapter 经常被错误使用。一则 直言,单独使用 IP-Adapter “并非用于创建一致角色”——它们会迁移视觉风格,而锁定身份则需要 FaceID 等角色专用变体。
  • Character-Adapter 自身论文也承认,“在涉及极其复杂的服装图案时,我们的模型可能无法完全保留原始细节”。

何时从零重生成反而是更好的选择?

对于探索性创作、单图输出,以及尚未锁定角色设计的项目,从零重生成才是正确选择。参考条件控制本来就会限制输出空间——这正是它的用途——因此在构思阶段反而会妨碍创作。

重生成在四种特定场景中更具优势:

  • **设计探索。**你是在寻找角色,而不是复现某个角色。对宽泛提示词运行二十个种子,可以发现参考设定表会压制的选项。
  • **单格或独立插画。**不存在序列,也就没有可以漂移偏离的对象。参考条件控制的计算成本无法带来收益。
  • **人群与背景角色。**变化本身就是目标。将每个背景人物锁定到参考图,会产生诡异的克隆感。
  • **相貌容忍度较高的强风格化艺术。**Q 版、极简和高度抽象化风格的身份承载特征更少,因此纯提示词生成的漂移仍处于读者可接受的范围内。

大多数专业工作流实际采用的混合模式

实践中,有经验的创作者很少只选择一种方法。主流工作流采用两阶段模式:

  1. 第一阶段——自由重生成,以发现角色。不使用参考图,采用高种子变化和宽泛的提示词空间。
  2. **第二阶段——锁定并锚定。**选择最强的输出,为其生成三视图,将其保存为命名参考图,并在制作序列中完全切换至参考条件生成。

Runway 的文档描述了完全相同的迭代模式:将鼠标悬停在任一输出上,选择“作为图像参考”,生成结果便会成为新的锚点。其指南演示了如何将中间输出保存为 fullbodyelfbryan 并从那里继续——参考设定表不是静态输入,而是会随着序列推进不断完善的动态资产。

**大多数指南遗漏的一项改进:**当你的参考图已经包含一个主体,而你想将另一名角色合成进这个场景时,Runway 建议在上传前,先用照片编辑器中的黑色方框遮住现有面孔。这样可防止模型混淆原始主体与目标角色——这一小型预处理步骤可消除一种常见且令人困惑的失败模式。

两种方法在真实成本与时间上如何取舍?

参考设定表的前期成本和单次生成成本更高,但返工成本会大幅降低;交叉点通常比大多数创作者预想得更早,一般在 5 至 10 个分镜之间出现。

成本结构对比:

成本组成从零重生成持久角色参考设定表
搭建投入几乎为零花费 1–3 小时制作和验证设定表
单次生成计算成本基础费率Midjourney Omni Reference 为 2×;Leonardo 的每个引导选项增加 2 token
废弃率高——多数输出无法匹配身份低——多数输出可直接使用或接近可用
返工成本随序列长度增长大致保持平稳
失败模式在组装时才发现隐性漂移在生成时即可发现明显不匹配

废弃率是主导变量,也是创作者最经常误算的变量。如果纯提示词重生成每八次只能得到一个符合角色设定的分镜,那么每个可用分镜就要付出八次基础费率生成。参考条件控制即使成本为 2×,但命中率达到二分之一,其单个可用输出成本依然更低——这还未计算审阅和丢弃失败结果所需的人力。

**二阶成本在于发现问题的时机。**纯提示词漂移往往在单格查看时并不明显,只有当分镜并排放在完成的页面上时才会暴露。此时,修复不仅需要重生成已通过单独审阅的分镜,还需重新匹配其与相邻画格的光影和构图。参考图工作流会在生成当下暴露身份不匹配,而此时修正成本最低。

也存在合理的反方观点。Character-Adapter 的基准测试发现,LoRA 等微调方法需要 1,050 秒的搭建计算时间,而免训练的参考条件控制仅需 7.2 秒,效率差距达到 70×。沉重的参考基础设施确有实际成本;对于短序列,其搭建投入可能永远无法摊销。

如何构建并部署一份真正稳定的参考设定表?

应以与最终分镜相同的艺术风格制作设定表,从单一锁定输出生成它,而不是将来自不同生成结果的视图拼合;然后在投入制作前,使用一组严格测试序列对它进行验证。

分步操作:构建参考设定表

  1. **锁定一张主视觉图。**先进行纯提示词探索,直到某个输出完美呈现角色。它将成为所有后续内容的种子。
  2. **从主视觉图生成三视图,而非从提示词生成。**将主视觉图作为参考图回传,并提示生成侧面、四分之三和背面视图。若分别从文本独立生成这些视图,就会得到三个不同角色。
  3. **统一光线与表情。**遵循 Runway 的空白画布建议:均匀光线、中性表情、中等质量。不要在参考图中固化任何你不希望出现在每一个分镜中的元素。
  4. **添加服装细节裁切图。**配饰、武器设计和徽记的独立特写,为最先发生漂移的细节提供明确目标。
  5. **保存并命名参考图。**在 Runway 中,将鼠标悬停于图像,点击标签以保存并输入名称;否则该参考图仅在当前会话暂存,浏览器刷新后便会消失。
  6. **进行验证压力测试。**让角色出现在五种刻意严苛的条件中:极近特写、全身远景、背面四分之三角度、戏剧化侧光以及高强度动作姿势。若身份在五种条件下均能保持一致,该设定表便可投入制作。

在分镜工作流中部署设定表

设定表验证完成后,分镜生成将遵循可重复的模式。在支持命名参考图的平台上,内联调用角色,并且只描述场景:

@marisa 站在夜晚被雨水打湿的屋顶边缘,下方是城市灯光,从背后以四分之三视角拍摄,戏剧化的逆光”

以下两条提示词规则比其他任何规则都重要:

  • **不要再次描述角色。**Midjourney 的文档给出了明确对比:糟糕的提示词会重新指定“一个蓝色头发、戴金色眼镜的男人坐在咖啡馆里”,而好的提示词只说“一个男人独自坐在咖啡馆里的插画”。重新描述外貌特征会在文本条件与图像条件之间制造冲突。
  • **务必详细描述其他一切。**Midjourney 的指导明确指出,文本“对于传达完整场景,以及参考图未展示的额外细节同样重要”。

🎯 调节一致性强度

Midjourney 的角色权重参数是最明确的控制项之一,但大多数创作者从不调整它。在 --cw 100 时,模型会从参考图中提取脸部、头发和服装;在 --cw 0 时,模型几乎只关注脸部。

实用对应关系:

  • --cw 100——角色穿着与参考图相同服装的分镜
  • --cw 0--cw 30——服装变化、时间跳跃、替代服饰;仅需保持脸部一致的场景

那些表示参考条件控制会“阻碍”服装变化的创作者,通常是在本应降低权重时仍使用默认权重。

对于使用对话式 AI 平台而非专用图像工具的创作者,Jenova 上的 Comic CreatorManga CreatorWebtoon Creator 等智能体,可通过持久的跨会话记忆处理连续叙事艺术;这让角色描述和已确定的设计决策能够在长期项目中持续可用,而无需每次会话重新指定。其取舍是参数控制不如专用图像平台细致——你无法直接设置角色权重值。可在 jenova.ai 使用;免费层级包含有限的每日使用量,付费套餐起价为 $20/月。

从业者如何评价制作流程中的参考设定表?

从业者普遍认为,对于任何序列性工作,参考图与重生成的争论已经得出结论:参考图更具优势;但真正的技能重点已从编写提示词转向筛选和管理参考图。

“多数人提出这个问题时的框架是反的。他们问哪种方法能带来更好的一致性,但真正的变量是你要交付多少个分镜。少于三个分镜时,重生成足够可用,而参考图是额外负担。超过十个分镜后,纯提示词工作流的废弃率在经济上已无法成立——你要为八次生成付费才能得到一个可用分镜,而且直到组装页面时才会发现失败。”

“我们最常见到的失败并非工具选择,而是参考图质量。创作者从一张戏剧化光线、表情强烈的主视觉图制作设定表,然后不明白为什么每个分镜都有相同的光线和半微笑。参考图是一张约束表面——其中固化的一切都会传播。中性光线和中性表情并非审美偏好,而是技术要求。”

“另一个未被充分使用的控制项是一致性权重。Midjourney 提供从 0 到 100 的调节范围,几乎没人去碰它。如果角色在第二幕更换服装,使用完整角色权重意味着你在每次生成时都要与参考图对抗。将它降至仅脸部,冲突便会消失。工具早已解决这个问题——知识缺口在创作者一方。”

——Jenova 产品团队,拥有 6 年创意 AI 智能体工作流构建经验

应为你的具体项目选择哪种方法?

应根据序列长度和身份容忍度匹配方法——这两个变量比工具偏好或预算更能决定答案。

适合选择从零重生成的情况:

  • 总共只制作 1–3 张图像
  • 在锁定角色前探索角色设计
  • 生成需要变化性的背景或人群角色
  • 使用身份解析度较低的高度抽象风格
  • 单次生成预算严格,且对风格偏差容忍度高

适合选择持久角色参考设定表的情况:

  • 制作 5 个以上的连续分镜
  • 角色脸部会出现在近景特写中
  • 项目跨越多个会话或由多位创作者参与
  • 服装和配饰细节承载重要叙事意义
  • 输出为客户项目,且预期会有修改需求

适合选择混合模式的情况:

  • 角色尚未设计完成,但序列很长——几乎每一个严肃的漫画、故事板或绘本项目都属于此类

**一条实用的决策准则:**如果你会注意到同一组图像中任意两张之间的角色发生了变化,就使用参考图;如果不会,就不必支付额外成本。

有一种真正值得提出的逆向观点:参考设定表经常被过度应用于实际上不需要它们的项目。一组四格、扁平极简风格的社交媒体条漫,仅靠提示词生成也会显得一致;花数小时构建并验证三视图不会带来可见改进。一致性是让读者沉浸的手段,而不是目的本身——超过某个阈值后,额外的一致性将不可见。

参考资料

  1. Character-Adapter:用于高保真角色定制的提示词引导区域控制——包含 CLIP-I、DINO-I 和效率基准的 arXiv 研究论文
  2. Midjourney 文档——Character Reference 参数、角色权重与最佳实践
  3. Midjourney 文档——Omni Reference 的 GPU 成本
  4. Runway 帮助中心——使用 Gen-4 Image References 创作、参考图标签与迭代工作流
  5. Leonardo.Ai 帮助中心——Image Guidance 的 token 成本
  6. Tencent AI Lab——IP-Adapter 仓库与技术说明
  7. Wikipedia——Model sheet 与传统动画角色参考标准
  8. Kie.ai——Runway Gen-4 套餐层级与积分分配分析
  9. Sonary——Leonardo.AI Image Generator 评测、套餐价格与 token 分配