为什么 AI 撰写的小说会出现角色漂移和连续性错误?


2026-08-08


蒸汽朋克风格插画:一只机械机器人手臂握着羽毛笔,悬于一本摊开的书上方;书中布满航海图和几何图示,周围环绕着地球仪、罗盘和黄铜仪器

为什么 AI 撰写的小说会出现角色漂移和连续性错误?

AI 撰写的小说会发生漂移,是因为大型语言模型以词元为单位向前生成文本,优化的是局部合理性,而不是全局叙事一致性;同时,没有任何模型能在写作时把整部手稿完整保留在工作注意力中。结果就是:第一章还言辞犀利的主角,到第十五章变得泛泛友善;已经被砍断的手又出现了;或某个兄弟姐妹在不同场景之间改变了性别。这是架构问题,而不是提示词技巧不足的问题。

发表于 arXiv 的研究明确指出了核心限制:Transformer 系统“通过前向生成运行——依据此前上下文预测下一个词元,因此优化的是局部连贯性与统计可能性,而非长期情节弧线”;它们也缺少“从预期叙事效果反向推演的机制”(《AI 的现代小说依赖问题》,arXiv)。

导致角色漂移和连续性失效的关键因素包括:

✅ 仅能前向生成——当后续事件改变了哪些信息重要时,模型无法修改先前的注意力权重 ✅ 上下文窗口上限——即使窗口很大,面对散落在整部手稿中的证据时,表现仍会下降 ✅ 原型坍缩——经过 RLHF 的模型会默认采用易识别的角色模板和圆满收束 ✅ 没有持久化的结构化状态——角色事实存在于散文中,而非模型能够查询的记录中 ✅ 情感扁平化——模型可以维持句子层面的连贯,却无法维持从场景到情节弧线的情感架构

理解这些失败为何发生,才能让它们变得可修复。本指南接下来将拆解每种机制,并评估真正能缓解问题的工具与工作流——也会如实说明它们的局限。


什么是 AI 生成小说中的角色漂移?

角色漂移是指在一篇较长的生成文本中,角色的性格、声音、外貌特征或既定经历逐渐发生无意的变化。它不同于有意设计的角色弧线——后者的变化具有动机且会被追踪;漂移则是没有动机地向统计平均值侵蚀。

漂移通常以四种形式出现:

  • 声音漂移——对话语域逐渐扁平为中性、讨好的默认风格。一个谨慎、讽刺的主角会在没有任何叙事原因的情况下变得热情而坦率。
  • 特质漂移——既定的身体或生平事实悄然改变。角色在第四章失去一只手,却在第三十章双手握剑。
  • 动机漂移——角色已经明确的目标,悄悄调整为适应当前场景所需的目标。
  • 关系漂移——“谁知道什么”的关系网络发生变化。某个角色从未得知的秘密,突然变成了公开信息。

Sudowrite 自己的产品文档几乎用同样的措辞描述这一模式,称角色漂移为“无声的手稿杀手”,并指出作者往往直到修订时才发现问题,“而此时你已经要重写 1 万字对话”(Sudowrite)。

连续性错误则是漂移在情节层面的近亲:时间线矛盾、被毁物品重新出现、世界观规则在章节之间改变。在作者社群中讨论 AI 辅助系列创作的作者,恰好报告了这一组问题:“世界观规则改变、角色忘记过去发生的事、无人处理的逻辑漏洞”(LitRPG 作者社群讨论)。


为什么大型语言模型不能直接记住整部小说?

因为记住与基于记忆进行推理是不同的问题,而扩大上下文窗口只能解决前者。模型在技术上可以把 10 万字放进上下文,却仍然无法注意到第三章与第二十九章相互矛盾。

NoCha 基准测试将这种差距量化了。AI 系统在句子层面小说分析任务中的准确率达到 59.8%,但当任务要求跨越整本书进行全局推理时,表现下降至 41.6%(《AI 的现代小说依赖问题》,arXiv)。这正是在连续性所需的推理类型上出现了 18 个百分点的崩塌——整合叙事中多个不连续部分的证据。

NovelQA 基准进一步印证了这一结果:模型“始终无法完成需要综合叙事中多个非连续部分证据的任务”(arXiv)。

长上下文建模的学术研究从系统角度得出了同样结论:尽管取得显著进展,大型语言模型“仍因记忆限制而难以处理长上下文”(ACL Anthology,EMNLP 2025 Findings)。而基于检索的替代方案也有自己的代价——一项 2026 年研究发现,RAG “在 NarrativeQA 上的退化最为明显,证实了分块检索会打断全局叙事连贯性”(ResearchGate)。

因此,两种显而易见的修复方案——更大的窗口或检索——各自朝不同方向失效。更大的窗口会稀释注意力;检索会切碎叙事流动。


究竟哪些架构限制会导致连续性失败?

有三种不同的架构机制会产生连续性失败,它们并不是同一个问题换了不同说法。区分它们很重要,因为每一种都需要不同的缓解方式。

1. 叙事因果与前向生成

小说要求事件“当下令人意外,回看却又不可避免”——这是一种时间悖论,“从根本上与 Transformer 架构的前向生成逻辑冲突”(arXiv)。物理因果向前推进。叙事因果则必须被构造出来,以满足模型尚未抵达的未来条件。

2. 信息价值重估

这是讨论最少、也可以说破坏性最大的机制。在小说中,某个细节的重要性会被追溯性地改变。一场晚宴起初只是背景噪声,直到一桩谋杀案将它重新定义为动机和作案机会。词元本身没有改变;改变的是它们的信息权重。

Transformer 架构无法执行这种重新加权。正如 arXiv 分析所说:“注意力权重在前向传递期间设定,无法根据后续揭示进行追溯性修订。模型无法依据未来知识重构过去信息的重要性层级。它们以累积式而非变革式的方式处理信息”(arXiv)。

这解释了许多作者报告的一个令人困惑的现象:即使上下文窗口极大,AI “读过”伏笔,却仍未据此行动。信息存在,但其优先级错了。

3. 多尺度情感架构

引人入胜的小说需要同时在词语、句子、场景和情节弧线层面编排情感。当前模型“擅长局部语义连贯……但难以应对小说所要求的多尺度情感架构”(arXiv)。

实证迹象是一致的。对 Stephen Marche 那部主要由 AI 生成的小说 《一位作者之死》 的评论称,即使发生了戏剧性或令人不安的事件,书中仍弥漫着“一种诡异的平静”。Rettberg 和 Wigers 对 11,800 篇 AI 生成故事进行的大规模分析发现,作品压倒性地遵循单一情节模板,并系统性回避叙事张力;它们以“怀旧与和解”取代“真实世界冲突”(arXiv)。

值得注意的是,当显式的话语层面特征——故事弧线、转折点和情感动态——被注入生成过程时,性能提升了 超过 40%。这证明缺陷一部分来自架构,另一部分则取决于模型获得了什么可供处理的内容(arXiv)。


角色漂移只是糟糕的提示词,还是更深层的问题?

它更深层——但提示词和前期设置确实会显著改变问题的程度。这是 AI 写作讨论中争议较大的观点之一,而证据支持的是细致立场,而非任何一个极端。

证明其属于架构问题的证据包括:基准测试中的性能下降、固定的注意力权重,以及跨模型研究中五种不同模型架构都表现出的同质化现象——“无论架构差异如何,特定姓名、地点、职业和主题都会持续重复出现”(arXiv)。

证明前期设置重要的证据包括:研究人员发现,早期在个别作者语料上进行微调的模型“似乎学会了针对特定类型的信息加权启发法”。采用默认安全约束设置和通用提示词的后 ChatGPT 聊天界面,生成的小说明显逊于使用自定义超参数的早期直接 API 实验。该研究给出的比喻非常贴切——“一位接受过特定风格训练、能够创造性即兴演奏的爵士乐手,与一位拿着短语手册的游客之间的区别”(arXiv)。

还有一个值得认真思考的反直觉发现。一项由 《卫报》 报道的 2026 年同行评审研究发现,阅读 AI 生成故事的参与者,认为故事更引人入胜且质量更高,超过阅读人类创作故事的参与者(《卫报》);BBC 也报道了这一结果(BBC)。相关研究发现,AI 叙事被认为“更令人愉悦”,而人类叙事则“更受欣赏”(ScienceDirect)。

关键限定是:这些研究测试的是短篇故事。角色漂移和连续性失败是长度相关的病症。一篇 1,500 字的 AI 故事几乎没有机会自相矛盾;一部 9 万字小说则有数千次机会。质量发现和漂移发现并不冲突——它们描述的是不同的篇幅区间。

**实际结论:**漂移在起源上属于架构问题,但在程度上可以控制。结构化外部记忆、明确的状态追踪和人类参与的迭代能够显著降低它。没有一种方法能够彻底消除它。


检索和状态追踪框架如何减少连续性错误?

在基础模型之上加入明确状态追踪的研究框架,已经带来了可量化、公开发表的改进——而这些改进的规模说明,有多少问题可以在工具层得到修复。

SCORE 框架(Story Coherence and Retrieval Enhancement)结合了三项组件:动态状态追踪(通过符号逻辑监控物品和角色)、上下文感知摘要(分层情节摘要)以及混合检索(TF-IDF 关键词相关性加余弦相似度语义嵌入),并将它们接入时间对齐的 RAG 管线(SCORE,arXiv)。

其相对于基线模型的报告结果如下:

指标相比基线 GPT 的提升
叙事连贯性(NCI-2.0)+23.6%
情感一致性(EASM)89.7%
幻觉减少少 41.8%

物品状态指标最具启发性。基线模型在追踪必需叙事物品是否正确存在方面得分为 0——也就是说,被标记为遗失或毁坏的物品会反复在没有解释的情况下重新出现。使用 SCORE 增强后的版本,得分根据底层模型不同,介于 76.2 到 98 之间(SCORE,arXiv)。

同一研究中的各模型结果:

基础模型一致性(基础 → SCORE)连贯性(基础 → SCORE)物品状态(基础 → SCORE)
GPT-483.21 → 85.6184.32 → 86.900 → 98
GPT-4o86.78 → 88.6882.21 → 89.910 → 96
Claude 384.60 → 87.2080.90 → 85.700 → 93.1
Gemini Pro82.20 → 85.2083.40 → 86.000 → 95.0
Llama-13B71.30 → 79.1069.80 → 73.400 → 76.2

有两种模式值得提炼。第一,较弱的基础模型获益更多——Llama-13B 在一致性上提升了 7.8 个百分点,而 GPT-4 仅提升 2.4 个百分点。结构化记忆能部分弥补原始模型能力的不足。第二,**连贯性和一致性的提升幅度不大(2–8 个百分点),而物品追踪从零接近完美。**明确状态追踪彻底解决了记账问题,却几乎没有触及更深层的叙事因果问题。

框架作者也承认其局限:“关键物品连续性依赖检索准确率,以及分层摘要带来的计算开销”(SCORE,arXiv)。


哪些 AI 写作工具最擅长维持角色一致性?

面向消费者的 AI 写作工具主要通过一种策略应对漂移:外部结构化记录——名称可能是 Story Bible、Codex 或 Lorebook——在每次生成时被注入上下文。这些工具的差异在于自动化程度、记忆覆盖范围以及所需的设置工作量。

这里的评估框架针对漂移问题,权衡五个维度:持久化结构化记忆、有效上下文覆盖范围、跨书连续性、设置负担以及显式连续性检查。有意不纳入通用的“散文质量”——它与漂移的关联最弱。

📚 Sudowrite

Sudowrite 的 Write 功能可读取最多 20,000 字前文,以及最多 25 个关联章节文档;同时结合 Story Bible 中的角色、世界观、类型、风格、简介和大纲数据。角色卡包含代词、性格、背景、外貌描述和对话风格。Series Folder 可在多本书之间共享 Story Bible 数据,Chapter Continuity 则关联文档以支持长篇记忆(Sudowrite, Sudowrite 系列创作指南)。

**优势:**在专用小说工具中设置阻力最低。模型针对小说进行了优化。自动强制执行 POV 和时态。具有明确的系列级连续性支持。

**局限:**20,000 字窗口是硬上限——对于 10 万字小说而言,大约只覆盖最新的五分之一。章节关联需要手动完成,也很容易被忽略;Sudowrite 自己的指南警告,未关联的文档会让 AI 对“第一章到第九章完全没有记忆”。Story Bible 的准确性完全取决于你的输入,并且不会根据你写出的散文自动更新。

🗂️ Novelcrafter

Novelcrafter 使用 Codex 系统作为其结构化记忆层。在 Sudowrite 自己的竞品比较中,该机制被直接描述为:“AI 的长期记忆,实际上就是你费力输入 Codex 的信息。这会形成强大的反馈循环”(Sudowrite)。

**优势:**可深度、细粒度控制模型看到的内容。支持自带模型。深受那些会在起草前进行大量规划的作者青睐。

**局限:**设置成本是反复出现的抱怨。一篇详细的 2026 年评测称它是“我测试过的最强大的 AI 写作工具之一,也是起步最艰难的一个”(Medium 评测)。连续性质量与 Codex 维护纪律直接成正比——Codex 稀疏,角色就会漂移。

💬 通用助手(ChatGPT、Claude、Gemini)

**优势:**原始推理能力和散文灵活性最强。不受限于单一写作环境的订阅。作为连续性审计员非常出色——将一段手稿交给它并要求标记矛盾,是切实有效的用途,也是作者积极讨论的做法(

)。

**局限:**默认没有持久化的结构化故事记忆。每次会话都必须重新建立上下文。POV 和时态需要手动指示。一篇面向作者的评测指出,通用助手可能“不适合小说,因为它会‘修复’刻意的风格选择,并剥离你的声音”(

)。

🧠 Jenova

Jenova 对漂移的处理位于平台层面而非手稿层面:持久化跨会话记忆、无限聊天记录和可附加知识库,意味着故事圣经可以作为智能体跨会话引用的基础文档,而不是被反复粘贴。Creative Fiction Writer 智能体和 Writing Assistant 可以读取上传的手稿及角色参考资料;多模型访问还意味着你可以将连续性审计交给一个模型、将散文生成交给另一个模型,而无需维护多个账户。

**局限——直言不讳地说:**Jenova 并非专为手稿管理打造的环境。它没有章节关联系统、场景卡界面、专用连续性检查流程,也没有 Series Folder 的对应功能。希望在一个结构化工作区中同时容纳手稿、大纲和 AI 的作者,会发现 Sudowrite 或 Novelcrafter 更适合这项工作。Jenova 的优势是记忆持久性和模型灵活性,而不是手稿脚手架。

对比表

维度SudowriteNovelcrafterChatGPT / ClaudeJenova
结构化故事记忆Story Bible 与角色卡(持久化)Codex,手动维护(持久化)默认无可附加知识库 + 跨会话记忆
有效上下文覆盖范围20,000 字 + 25 个关联章节Codex 注入,取决于模型仅限单次会话;需重新粘贴跨会话持久化;历史记录不限
跨书连续性Series Folder 在书籍间共享 Story BibleCodex 可跨项目复用手动维护知识库可跨会话复用
设置负担低至中等高(广泛被提及)极低(但没有记忆收益)低
显式连续性检查Chapter Continuity 功能由 Codex 驱动,间接实现作为手动审计员很强通过智能体手动审计
模型选择Muse(专有、小说优化)自带模型每个工具仅单一供应商多供应商(OpenAI、Anthropic、Google、xAI、DeepSeek)
定价未验证——请查看当前方案未验证——请查看当前方案因供应商而异免费层;Plus $20/月(免费用量的 30×);Premium $50/月(75×)
最适合希望以最少设置获得小说专用工具的作者愿意投入时间构建详细 Codex 的规划型作者连续性审计和灵活起草希望跨项目使用持久记忆和模型灵活性的作者

关于这一领域流传的供应商发布统计数据:例如“89% 使用专业小说 AI 工具的作者认为散文质量更好”和“92% 的 Sudowrite 用户更快完成手稿”等数字,均出现在 Sudowrite 自己引用内部调查的营销材料中(Sudowrite)。应据此看待第一方调查数据——它们未经独立验证,而且自选用户调查通常会偏向正面结果。


使用 AI 写作时,如何防止角色漂移?

预防的核心在于:将模型无法保存的状态外部化,并以足够短的间隔进行审计,让修复漂移的成本保持低廉。以下工作流适用于各种工具;文中会标注工具特定步骤。

1. 在起草前建立角色档案,而不是在起草过程中。

每个主要角色都需要一份锁定档案,包含外貌特征、说话语域、生平事实、当前知识状态(他们知道什么、何时得知)以及关系图。在 Sudowrite 中,这是 Story Bible 里的角色卡;在 Novelcrafter 中,这是 Codex 条目;在通用助手或 Jenova 中,则应作为上传的参考文档。

Sudowrite 自己的建议很具体:“每位主要角色预先投入 15 分钟。之后能节省数小时修订时间”(Sudowrite)。

2. 维护持续更新的状态台账,而不只是静态圣经。

这是大多数作者跳过、也是 SCORE 研究最直接验证的一步。静态角色简介无法防止物品状态错误——动态状态可以。保留一个纯文本台账,每次状态变化记一行:

Ch4  — Elena loses left hand (permanent)
Ch8  — Marcus switches allegiance to the Vale faction
Ch11 — The ledger is destroyed by fire (unrecoverable)
Ch12 — Elena learns Marcus's betrayal (Kira does NOT know)

将这份台账与正在起草的章节一起输入上下文。这相当于手动实现 SCORE 的动态状态追踪;该功能让各模型的物品状态准确率从 0 提升至 93–98(SCORE,arXiv)。

3. 每五章审计一次,而不是等到结尾。

对滚动窗口运行专门的连续性检查。适合任何通用助手的提示词如下:

“以下是我小说的第 8–12 章以及角色台账。不要改写任何内容。只列出:(a) 与台账矛盾的陈述;(b) 对话语域偏离既定声音的角色;(c) 在此前没有引入却突然出现的任何物品或知识。请为每项标明章节和行号。”

“不要改写任何内容”这一限制很重要——它能防止模型悄悄修补矛盾,而不是将问题暴露出来。

4. 使用不同模型分别进行起草和审计。

生成了漂移的模型通常不擅长发现它。将审计交给不同模型,可以发现起草模型已视为正常的错误。在提供多供应商访问的平台上这很直接;在单一供应商工具中,则需要第二份订阅。

5. 续写时让最后一句保持未完成。

这是一个小技巧,但确实有效。Sudowrite 指出,保留未完成句子会“产生明显更自然的续写”,因为模型会从思路中段接续,而不是冷启动重新开始(Sudowrite)。它能减少场景边界上的声音重置漂移。

6. 让创造性设置匹配场景功能。

头脑风暴和探索性场景使用高温度。必须落在特定情节节点上的场景使用低温度。高温度会加速漂移,正是因为模型因此获得了偏离既定模式的奖励。


研究人员和实践者如何看待 AI 小说的一致性问题?

研究人员的共识是,连续性失败是更深层架构错配的症状,而现有缓解措施管理的是症状,并未治愈根源。

“注意力权重在前向传递期间设定,无法根据后续揭示进行追溯性修订。模型无法依据未来知识重构过去信息的重要性层级。它们以累积式而非变革式的方式处理信息。这解释了为什么即使拥有巨大上下文窗口的模型,仍难以理解叙事。问题不是记忆不足,而是一种内建的架构模型;它没有针对小说叙事所需的持续信息重估进行优化。”

“当前系统缺少一种机制,无法从预期叙事效果反向工作,也无法在选择同时满足意外性和必然性约束的路径时维持多个可能的情节轨迹……我们目前发现,包含人类参与的迭代式叙事生成,是成功生成小说的唯一方法。”

— Katherine Elkins,Kenyon College 人文研究与 AI CoLab 综合项目 (《AI 的现代小说依赖问题》,arXiv)

从事约束外围构建的工程团队,则从另一个方向得出了相容的结论。

“我们反复看到的模式是,作者会把 AI 漂移归咎于自己——他们以为是提示词写得不好。实际上,失败是结构性的。被要求续写第三十章的模型,最多只能部分看到第一到第二十九章;更完全没有机制认识到,第三章中的某个细节在第二十章变成了关键承重信息。更好的提示词可以改善边际表现,但不会改变问题的形状。”

“真正带来显著改善的是状态外部化。SCORE 的结果很有启发性:基线模型在追踪叙事物品是否正确存在方面得分为零,而加入明确的状态追踪后,得分提升至九十多分。这不是边际改进——而是一个系统能否记账的区别。但同一研究只将连贯性提升了两到八个百分点。这个差距准确说明了哪些问题工具可以解决,哪些仍然是作者的工作。”

“我们给作者的实际建议是:把 AI 当作患有失忆症的起草引擎,并以自己能够控制的形式建立记忆。谨慎使用的纯文本状态台账,胜过随意使用的复杂工具。并且,审计时应使用与起草不同的模型——模型会系统性地看不见自身的漂移模式。”

— Jenova 产品团队,拥有 4 年构建持久记忆智能体系统的经验


未来的 AI 模型会解决角色漂移吗?

会部分解决,而且可能不会只靠扩大上下文窗口。证据指向架构变化和混合系统,而不是单纯扩展规模。

**规模可能无法解决的部分:**信息价值重估问题是结构性的。更大的窗口不会让前向传递架构在第二十章揭示第三章的重要性后,获得追溯性重新加权第三章注意力的能力。长上下文研究反复发现,模型“因记忆限制及其固有的”架构约束而难以处理长上下文(ACL Anthology),并且随着上下文增长,噪声会降低性能(ResearchGate)。

更有前景的方向:

  • 生成—评估架构——探索多条叙事轨迹,并追溯性地评估每一条是否具备意外性和必然性,而不是押注于单一的前向路径(arXiv)
  • 增量式知识图谱构建——SCORE 的模块化设计已经支持将持久故事记忆构建为结构化图谱,而非文本块(SCORE,arXiv)
  • 话语层面特征注入——显式情节弧线和转折点特征使性能提升超过 40%,表明只要更好地告知模型叙事结构,仍有很大提升空间(arXiv)
  • 用于长上下文追踪的强化学习——专门奖励模型在长时间交互中维持连贯叙事(Medium 分析)

**诚实的近期判断:**截至 2026 年,根据最直接研究这一问题的研究人员,人类参与的迭代仍是生成长篇小说唯一可靠有效的方法(arXiv)。工具层——故事圣经、Codex、状态台账和检索管线——已明确解决了问题中“记账”的一半。叙事因果的另一半仍未解决。

对作者而言,这对应着清晰的分工。让工具负责事实连续性:谁拥有什么、谁知道什么、何时发生了什么。请自己掌握意义的连续性:为什么这个事件重要、为什么必须是这个角色、为什么结局从一开始就不可避免。第二类问题正是 AI 生成小说仍会呈现出 Elkins 那句令人难忘的“诡异平静”的地方。

Jenova 的 Creative Fiction Writer 可在 jenova.ai/a/creative-fiction-writer 使用,并提供持久化跨会话记忆和可附加知识库来保存故事参考资料。免费层包含有限的每月用量;Plus 为 $20/月,提供免费额度的 30×。Sudowrite 的小说工具文档位于 sudowrite.com,Novelcrafter 的 Codex 系统则见于 novelcrafter.com。在撰写本文时,这三者的定价和功能集变化频繁——请直接核实当前详情。