AI가 작성한 소설은 왜 캐릭터 드리프트와 연속성 오류를 겪을까?


2026-08-08


항해 지도와 기하학 도표로 가득한 펼친 책 위에서 깃펜을 든 기계식 로봇 팔, 그리고 그 주변의 지구본·나침반·황동 기구를 묘사한 스팀펑크 일러스트

AI가 작성한 소설은 왜 캐릭터 드리프트와 연속성 오류를 겪을까?

AI가 쓴 소설이 흔들리는 이유는 대규모 언어 모델이 전체 서사의 일관성보다 국소적 개연성을 최적화하며 토큰 단위로 앞을 향해 텍스트를 생성하기 때문이며, 어떤 모델도 집필 중에 소설 원고 전체를 작업 주의 안에 유지할 수 없기 때문이다. 그 결과 1장에서는 독설가였던 주인공이 15장에서는 특별한 이유 없이 무난하고 상냥해지고, 잘린 손이 다시 나타나거나, 장면 사이에서 형제자매의 성별이 바뀌기도 한다. 이는 프롬프트 역량 부족의 문제가 아니라 아키텍처의 문제다.

arXiv에 발표된 연구는 핵심 제약을 명확히 짚는다. 트랜스포머 시스템은 “이전 컨텍스트를 바탕으로 다음 토큰을 예측하는 순방향 생성으로 작동하며, 장기적 서사 구조보다는 국소적 일관성과 통계적 가능성을 최적화한다.” 또한 “의도한 서사 효과에서 거꾸로 작업할 수 있는 메커니즘”이 없다(AI의 현대 소설 의존성 문제, arXiv).

캐릭터 드리프트와 연속성 실패를 유발하는 핵심 요인은 다음과 같다.

✅ 순방향 전용 생성 — 이후 사건이 무엇이 중요했는지를 바꿔도 모델은 이전 주의 가중치를 수정할 수 없다
✅ 컨텍스트 윈도우 상한 — 큰 윈도우라도 원고 전체에 흩어진 근거를 다룰 때 성능이 저하된다
✅ 원형적 캐릭터로의 붕괴 — RLHF 이후 모델은 알아보기 쉬운 캐릭터 템플릿과 깔끔한 결말로 기본 설정되는 경향이 있다
✅ 지속적인 구조화 상태 부재 — 캐릭터 사실은 모델이 조회할 수 있는 기록이 아니라 산문 속에 존재한다
✅ 감정의 평탄화 — 모델은 문장 수준의 일관성은 유지하지만 장면에서 장기 서사로 이어지는 감정적 구조는 유지하지 못한다

이러한 실패가 발생하는 이유를 이해해야 해결 가능해진다. 이 가이드의 나머지 부분에서는 각 메커니즘을 해부한 뒤, 실제로 이를 완화하는 도구와 워크플로, 그리고 그 솔직한 한계를 평가한다.


AI 생성 소설에서 캐릭터 드리프트란 무엇인가?

캐릭터 드리프트는 긴 생성 텍스트 전반에서 캐릭터의 성격, 말투, 신체적 특성 또는 확립된 이력이 점진적이고 의도치 않게 변질되는 현상이다. 변화에 동기가 부여되고 추적되는 의도적 캐릭터 아크와 달리, 드리프트는 통계적 평균을 향한 이유 없는 침식이다.

드리프트는 일반적으로 네 가지 형태로 나타난다.

  • 목소리 드리프트 — 대화체의 어조가 중립적이고 순응적인 기본값으로 평탄해진다. 경계심 강하고 냉소적인 주인공이 서사적 이유 없이 따뜻하고 거리낌 없이 말하게 된다.
  • 특성 드리프트 — 확립된 신체적 또는 전기적 사실이 조용히 바뀐다. 4장에서 한 손을 잃은 캐릭터가 30장에서 두 주먹으로 검을 움켜쥔다.
  • 동기 드리프트 — 캐릭터가 명시한 목표가 현재 장면에 필요한 방향으로 슬그머니 재정렬된다.
  • 관계 드리프트 — 누가 무엇을 아는지에 관한 관계망이 바뀐다. 한 캐릭터가 결코 알지 못했던 비밀이 갑자기 모두의 상식이 된다.

Sudowrite의 제품 문서는 이 패턴을 거의 동일한 표현으로 설명하며, 캐릭터 드리프트를 “조용한 원고 살인자”라고 부른다. 작가들은 대개 수정 단계에 이르러서야 알아차리고, “이제 10,000단어 분량의 대화를 다시 써야 한다”는 상황에 처한다고 지적한다(Sudowrite).

연속성 오류는 드리프트의 플롯 수준 사촌 격이다. 시간선의 모순, 파괴된 뒤 다시 나타나는 물건, 장마다 바뀌는 세계관 규칙 등이 이에 해당한다. 작가 커뮤니티에서 AI 보조 시리즈를 논의하는 작가들은 정확히 이런 문제 묶음을 보고한다. “세계관 규칙이 바뀌고, 캐릭터가 과거 사건을 잊고, 아무도 해결하지 않는 논리적 공백이 생긴다”(LitRPG 작가 커뮤니티 토론).


대규모 언어 모델은 왜 소설 전체를 그냥 기억할 수 없을까?

기억하는 일과 추론하는 일은 서로 다른 문제이며, 컨텍스트 윈도우를 확장하는 것은 전자만 해결하기 때문이다. 모델은 기술적으로 100,000단어를 컨텍스트에 담을 수 있어도 3장이 29장과 모순된다는 사실을 알아차리지 못할 수 있다.

NoCha 벤치마크는 이 격차를 수치로 보여 준다. AI 시스템은 문장 수준 소설 분석 과제에서 59.8%의 정확도를 달성하지만, 책 전체를 아우르는 전역적 추론이 필요한 과제에서는 성능이 41.6%까지 하락한다(AI의 현대 소설 의존성 문제, arXiv). 이는 연속성이 요구하는 바로 그 추론, 즉 이야기의 여러 비연속적 부분에 있는 증거를 종합하는 능력에서 18포인트가 붕괴한 것이다.

NovelQA 벤치마크도 이 결과를 뒷받침한다. 모델은 “서사의 여러 비연속적 부분에서 나온 증거를 종합해야 하는 과제에서 일관되게 실패했다”(arXiv).

롱 컨텍스트 모델링에 대한 학술 연구도 시스템 측면에서 같은 결론에 도달한다. 상당한 진전에도 불구하고 대규모 언어 모델은 “메모리 한계로 인해 여전히 긴 컨텍스트에 어려움을 겪는다”고 지적한다(ACL Anthology, EMNLP 2025 Findings). 검색 기반 우회책에도 비용이 있다. 2026년의 한 연구는 RAG가 “NarrativeQA에서 가장 가파르게 성능이 저하되며, 청크 수준 검색이 전역적 서사 일관성을 방해한다는 점을 확인했다”고 밝혔다(ResearchGate).

따라서 가장 자명해 보이는 두 해결책, 즉 더 큰 윈도우와 검색은 서로 다른 방향에서 실패한다. 큰 윈도우는 주의를 희석하고, 검색은 서사 흐름을 조각낸다.


실제로 연속성 실패를 일으키는 아키텍처적 한계는 무엇인가?

연속성 실패는 세 가지 구별되는 아키텍처 메커니즘에서 발생하며, 이는 같은 문제가 다른 모습으로 나타난 것이 아니다. 이를 구분하는 일이 중요한 이유는 각각에 필요한 완화책이 다르기 때문이다.

1. 서사적 인과성과 순방향 생성

소설은 사건이 “그 순간에는 놀랍지만 되돌아보면 필연적인 것처럼” 느껴지기를 요구한다. 이는 “트랜스포머 아키텍처의 순방향 생성 논리와 근본적으로 충돌하는” 시간적 역설이다(arXiv). 물리적 인과관계는 앞으로 진행된다. 서사적 인과관계는 모델이 아직 도달하지 않은 미래 조건을 만족하도록 구성되어야 한다.

2. 정보의 재평가

이는 가장 적게 논의되지만, 틀림없이 가장 큰 피해를 주는 메커니즘이다. 소설에서 어떤 세부 사항의 중요도는 소급적으로 변한다. 만찬 장면은 살인 사건이 그것을 동기와 기회의 장면으로 재구성하기 전까지는 배경 소음에 불과하다. 토큰 자체는 바뀌지 않지만, 그 정보적 무게는 변한다.

트랜스포머 아키텍처는 이런 재가중을 수행할 수 없다. arXiv 분석은 다음과 같이 설명한다. “주의 가중치는 순방향 패스 중에 설정되며 이후의 폭로에 따라 소급적으로 수정될 수 없다. 모델은 미래 지식을 바탕으로 과거 정보의 중요도 위계를 재구성할 수 없다. 정보를 변환적으로가 아니라 누적적으로 처리한다”(arXiv).

이는 많은 작가가 보고하는 난해한 현상을 설명한다. 아무리 거대한 컨텍스트 윈도우를 써도 AI는 복선을 “읽었지만” 그것에 따라 행동하지 않는다. 정보는 존재했다. 우선순위가 잘못됐을 뿐이다.

3. 다중 스케일 감정 아키텍처

매력적인 소설은 단어, 문장, 장면, 아크 수준에서 동시에 감정을 조율한다. 현행 모델은 “국소적 의미 일관성에는 탁월하지만, 소설이 요구하는 종류의 다중 스케일 감정 아키텍처에는 어려움을 겪는다”(arXiv).

실증적 징후는 일관된다. Stephen Marche의 대부분 AI 생성 소설 Death of an Author에 대한 평론은 “사건이 벌어지거나 불안한 일이 일어날 때조차 기묘한 평온함이 지배한다”고 묘사한다. Rettberg와 Wigers가 수행한 11,800편의 AI 생성 이야기 대규모 분석은 단일 플롯 템플릿에 대한 압도적 순응과 서사 긴장의 체계적 회피를 발견했다. 즉, “향수와 화해”를 선호하며 “현실 세계의 갈등을 정화”하는 경향이다(arXiv).

주목할 점은 명시적인 담화 수준 특성, 즉 이야기 아크·전환점·정서 역학을 생성 과정에 주입했을 때 성능이 40% 이상 개선되었다는 것이다. 이는 결함이 부분적으로는 아키텍처의 문제이고, 부분적으로는 모델에 무엇을 제공하는가의 문제라는 증거다(arXiv).


캐릭터 드리프트는 단지 나쁜 프롬프팅의 문제일까, 아니면 더 깊은 문제일까?

더 깊은 문제다. 그러나 프롬프팅과 사전 설정은 그 규모를 의미 있게 바꾼다. 이는 AI 글쓰기 담론에서 더 논쟁적인 주장 중 하나이며, 증거는 어느 한쪽의 극단보다 미묘한 입장을 지지한다.

아키텍처 문제라는 증거는 벤치마크 성능 하락, 고정된 주의 가중치, 그리고 서로 다른 다섯 모델 아키텍처를 비교한 연구에서 “특정 이름, 장소, 직업, 주제의 일관된 반복”이 “아키텍처 차이와 무관하게” 나타난 동질성에 있다(arXiv).

사전 설정이 중요하다는 증거도 있다. 연구자들은 개별 작가의 코퍼스로 초기 파인튜닝된 모델이 “정보 가중치를 위한 장르 특화 휴리스틱을 학습한 것으로 보인다”고 밝혔다. 기본 안전 제약 설정과 일반적 프롬프트를 사용하는 ChatGPT 이후의 채팅 인터페이스는, 맞춤형 하이퍼파라미터를 사용한 초기 직접 API 실험보다 눈에 띄게 떨어지는 소설을 생성한다. 이 비교는 적절하다. “특정 스타일로 훈련받아 창의적으로 즉흥 연주할 수 있는 재즈 음악가와, 회화책을 사용하는 관광객의 차이”다(arXiv).

곱씹어 볼 만한 반직관적 발견도 있다. The Guardian이 보도한 2026년 동료 심사 연구에서는 AI 생성 이야기를 읽은 참가자가 인간이 쓴 이야기를 읽은 참가자보다 이를 더 몰입감 있고 더 높은 품질로 평가했다(The Guardian). BBC도 이 결과를 보도했다(BBC). 관련 연구에서는 AI 서사가 “더 즐거운 것으로 인식”된 반면, 인간 서사는 “더 높이 평가”되는 것으로 나타났다(ScienceDirect).

핵심적인 단서는 이 연구들이 단편소설을 시험했다는 점이다. 캐릭터 드리프트와 연속성 실패는 길이에 의존하는 병리 현상이다. 1,500단어짜리 AI 이야기는 자기모순을 일으킬 기회가 거의 없다. 90,000단어짜리 소설에는 수천 번의 기회가 있다. 품질에 관한 발견과 드리프트에 관한 발견은 충돌하지 않는다. 서로 다른 길이 영역을 설명할 뿐이다.

실무적 결론: 드리프트는 기원상 아키텍처적이지만, 정도는 다룰 수 있다. 구조화된 외부 메모리, 명시적 상태 추적, 인간 참여 반복은 이를 측정 가능하게 줄인다. 어느 것도 완전히 제거하지는 못한다.


검색 및 상태 추적 프레임워크는 어떻게 연속성 오류를 줄일까?

기본 모델 위에 명시적 상태 추적을 추가하는 연구 프레임워크는 측정 가능하고 공개된 개선을 만들어 낸다. 그리고 그 개선 폭은 도구 계층에서 문제가 얼마나 해결 가능한지를 보여 준다.

SCORE 프레임워크(Story Coherence and Retrieval Enhancement)는 세 구성 요소를 결합한다. Dynamic State Tracking(기호 논리를 통한 객체 및 캐릭터 모니터링), Context-Aware Summarization(계층적 에피소드 요약), Hybrid Retrieval(TF-IDF 키워드 관련성과 코사인 유사도 의미 임베딩)이다. 이들은 시간 정렬 RAG 파이프라인으로 연결된다(SCORE, arXiv).

기준선 모델 대비 보고된 결과는 다음과 같다.

지표기준선 GPT 대비 개선
서사 일관성(NCI-2.0)+23.6%
감정 일관성(EASM)89.7%
환각 감소41.8% 감소

아이템 상태 지표가 가장 많은 것을 보여 준다. 기준선 모델은 필수 서사 아이템이 올바르게 존재하는지를 추적하는 점수에서 0점을 받았다. 즉, 분실되거나 파괴되었다고 표시된 아이템이 설명 없이 일상적으로 다시 나타났다는 뜻이다. SCORE가 보강된 버전은 기반 모델에 따라 76.2에서 98점 사이를 기록했다(SCORE, arXiv).

같은 연구의 모델별 결과는 다음과 같다.

기반 모델일관성(기본 → SCORE)응집성(기본 → SCORE)아이템 상태(기본 → SCORE)
GPT-483.21 → 85.6184.32 → 86.900 → 98
GPT-4o86.78 → 88.6882.21 → 89.910 → 96
Claude 384.60 → 87.2080.90 → 85.700 → 93.1
Gemini Pro82.20 → 85.2083.40 → 86.000 → 95.0
Llama-13B71.30 → 79.1069.80 → 73.400 → 76.2

여기서 추출할 만한 패턴은 두 가지다. 첫째, 더 약한 기반 모델일수록 더 크게 향상된다. Llama-13B는 일관성에서 7.8포인트 상승한 반면 GPT-4는 2.4포인트 상승했다. 구조화된 메모리는 순수 모델 역량의 일부를 보완한다. 둘째, 응집성과 일관성의 향상은 2~8포인트로 크지 않은 반면, 아이템 추적은 0에서 거의 완벽한 수준으로 올라간다. 명시적 상태 추적은 장부 관리 문제를 결정적으로 해결한다. 그러나 더 깊은 서사적 인과관계 문제에는 거의 닿지 못한다.

프레임워크 저자들도 한계를 인정한다. “핵심 아이템 연속성을 위한 검색 정확도 의존성과 계층적 요약에서 발생하는 계산 오버헤드”다(SCORE, arXiv).


어떤 AI 글쓰기 도구가 캐릭터 일관성을 가장 잘 다룰까?

소비자용 AI 글쓰기 도구는 하나의 지배적 전략으로 드리프트에 대응한다. 매번 생성 시 컨텍스트에 주입되는 외부 구조화 기록, 즉 Story Bible, Codex 또는 Lorebook이라고 불리는 자료다. 도구별 차이는 자동화 수준, 메모리 도달 범위, 요구되는 설정량에 있다.

여기서의 평가 프레임워크는 드리프트 문제에 특화된 다섯 차원을 반영한다. 지속적인 구조화 메모리, 실효 컨텍스트 도달 범위, 도서 간 연속성, 설정 부담, 명시적 연속성 검사다. 일반적인 “산문 품질”은 의도적으로 제외했다. 드리프트와 가장 관련이 적은 차원이기 때문이다.

📚 Sudowrite

Sudowrite의 Write 기능은 이전 텍스트 최대 20,000단어와 최대 25개의 연결된 장 문서를 읽으며, 캐릭터·세계관·장르·스타일·시놉시스·아웃라인을 다루는 Story Bible 데이터와 결합한다. 캐릭터 카드에는 대명사, 성격, 배경, 외형 묘사, 대화 스타일이 담긴다. Series Folder는 여러 책에 걸쳐 Story Bible 데이터를 공유하며, Chapter Continuity는 장문 형식 메모리를 위해 문서를 연결한다(Sudowrite, Sudowrite 시리즈 가이드).

강점: 소설 전용 도구 중 설정 마찰이 가장 낮다. 소설에 맞춰 조정된 모델이다. 시점과 시제를 자동으로 강제한다. 시리즈 수준의 연속성을 명시적으로 지원한다.

한계: 20,000단어 윈도우는 엄격한 상한이다. 100,000단어 소설이라면 대략 가장 최근의 5분의 1에 해당한다. 장 연결은 수동이며 쉽게 누락된다. Sudowrite의 자체 가이드도 연결되지 않은 문서는 AI가 “1장부터 9장까지를 전혀 기억하지 못하게” 만든다고 경고한다. Story Bible은 사용자가 입력한 만큼만 정확하며, 작성한 산문을 바탕으로 스스로 업데이트되지 않는다.

🗂️ Novelcrafter

Novelcrafter는 구조화 메모리 계층으로 Codex 시스템을 사용한다. Sudowrite의 자체 경쟁 비교 자료는 이 메커니즘을 직접적으로 설명한다. “AI의 장기 메모리는 사실상 여러분이 Codex에 공들여 입력한 정보다. 이것은 강력한 피드백 루프를 만든다”(Sudowrite).

강점: 모델이 보는 정보를 세밀하게 통제할 수 있다. 원하는 모델을 직접 가져와 쓸 수 있는 유연성이 있다. 초고 작성 전에 광범위하게 계획하는 작가가 선호한다.

한계: 반복해서 제기되는 불만은 설정 비용이다. 2026년의 한 상세 리뷰는 이를 “테스트한 AI 글쓰기 도구 중 가장 강력한 도구 중 하나이자, 시작 과정이 가장 거친 도구”라고 평가했다(Medium 리뷰). 연속성 품질은 Codex 관리 규율에 정비례한다. Codex가 빈약하면 캐릭터는 흔들린다.

💬 범용 어시스턴트(ChatGPT, Claude, Gemini)

강점: 가장 뛰어난 원시 추론 능력과 산문 유연성을 제공한다. 단일 글쓰기 환경에 구독이 묶이지 않는다. 연속성 감사자로도 탁월하다. 원고 일부를 제공하고 모순을 표시해 달라고 요청하는 것은 실제로 효과적인 활용법이며, 작가들도 이를 활발히 논의한다(

).

한계: 기본적으로 지속적인 구조화 스토리 메모리가 없다. 매 세션마다 컨텍스트를 다시 구축해야 한다. 시점과 시제는 수동 지시가 필요하다. 작가 중심 리뷰 하나는 범용 어시스턴트가 “의도적인 스타일 선택을 ‘수정’하고 작가의 목소리를 지워 버리기 때문에 소설에 좋지 않을 수 있다”고 지적했다(

).

🧠 Jenova

Jenova의 드리프트 대응 방식은 원고 수준이 아니라 플랫폼 수준이다. 지속적인 세션 간 메모리, 무제한 채팅 기록, 첨부 가능한 지식 베이스를 통해 스토리 바이블을 매번 다시 붙여 넣는 대신, 에이전트가 세션 전반에서 참조하는 기준 문서로 유지할 수 있다. Creative Fiction Writer 에이전트와 Writing Assistant는 업로드한 원고 및 캐릭터 참고 자료를 바탕으로 작업할 수 있다. 멀티 모델 접근도 제공하므로, 별도 계정을 유지하지 않고도 연속성 감사는 한 모델에, 산문 생성은 다른 모델에 맡길 수 있다.

한계 — 분명히 말하면: Jenova는 목적에 맞춰 설계된 원고 관리 환경이 아니다. 장 연결 시스템, 장면 카드 인터페이스, 전용 연속성 검사 패스, Series Folder에 상응하는 기능이 없다. 원고·아웃라인·AI를 하나의 구조화된 작업 공간에 담고 싶은 작가에게는 Sudowrite 또는 Novelcrafter가 더 적합하다. Jenova의 장점은 원고 작업 발판이 아니라 메모리 지속성과 모델 유연성이다.

비교표

차원SudowriteNovelcrafterChatGPT / ClaudeJenova
구조화 스토리 메모리캐릭터 카드가 포함된 Story Bible(지속적)수동 관리 Codex(지속적)기본적으로 없음첨부 가능한 지식 베이스 + 세션 간 메모리
실효 컨텍스트 도달 범위20,000단어 + 연결된 25개 장Codex 주입, 모델 의존적세션 단위만 가능, 다시 붙여 넣기 필요세션 간 지속적, 무제한 기록
도서 간 연속성Series Folder가 책 간 Bible 공유프로젝트 간 Codex 재사용수동세션 간 지식 베이스 재사용
설정 부담낮음~보통높음(널리 보고됨)매우 낮음(하지만 메모리 이점 없음)낮음
명시적 연속성 검사Chapter Continuity 기능Codex 기반, 간접적수동 감사자로 강력함에이전트를 통한 수동 감사
모델 선택Muse(독점적, 소설 특화)원하는 모델 직접 사용도구당 단일 공급자멀티 공급자(OpenAI, Anthropic, Google, xAI, DeepSeek)
가격검증되지 않음 — 현재 요금제 확인 필요검증되지 않음 — 현재 요금제 확인 필요공급자별 상이무료 요금제, Plus 월 $20(무료 사용량의 30×), Premium 월 $50(75×)
적합한 대상최소한의 설정으로 소설 특화 도구를 원하는 소설가상세 Codex에 투자할 계획가연속성 감사 및 유연한 초고 작성프로젝트 전반에서 지속 메모리와 모델 유연성을 원하는 작가

이 분야에 유통되는 공급업체 발표 통계에 관해서는 유의할 필요가 있다. 예를 들어 “전문 소설 AI 도구 사용 작가의 89%가 더 나은 산문 품질을 보고했다”, “Sudowrite 사용자의 92%가 원고를 더 빨리 완성한다” 같은 수치는 내부 설문을 인용한 Sudowrite의 자체 마케팅 자료에 등장한다(Sudowrite). 이러한 자사 설문 데이터는 그에 맞게 받아들여야 한다. 독립 검증을 거치지 않았고, 자가 선택된 사용자 설문은 긍정적으로 치우친다.


AI로 글을 쓸 때 캐릭터 드리프트를 어떻게 방지할 수 있을까?

방지는 모델이 보유할 수 없는 상태를 외부화하고, 수정 비용이 낮을 만큼 짧은 간격으로 감사하는 일에 달려 있다. 아래 워크플로는 도구 전반에 적용되며, 도구별 단계는 별도로 표시했다.

1. 초고 작성 전에 캐릭터 기록을 만들고, 작성 중에 만들지 말 것.

모든 주요 캐릭터에는 신체적 특성, 말투, 전기적 사실, 현재 지식 상태(무엇을 언제 알게 되었는지), 관계 지도를 담은 고정 기록이 필요하다. Sudowrite에서는 Story Bible의 캐릭터 카드다. Novelcrafter에서는 Codex 항목이다. 범용 어시스턴트 또는 Jenova에서는 업로드한 참고 문서다.

Sudowrite의 자체 가이드도 구체적으로 권한다. “주요 캐릭터마다 처음에 15분을 투자하세요. 나중에 몇 시간의 수정 시간을 아낄 수 있습니다”(Sudowrite).

2. 정적 바이블만이 아니라, 계속 갱신하는 상태 원장을 유지할 것.

이 단계는 대부분 작가가 건너뛰지만 SCORE 연구가 가장 직접적으로 검증하는 단계다. 정적인 캐릭터 소개는 아이템 상태 오류를 막지 못한다. 동적인 상태가 필요하다. 상태 변화마다 한 줄씩 일반 텍스트 원장에 기록하라.

Ch4  — Elena loses left hand (permanent)
Ch8  — Marcus switches allegiance to the Vale faction
Ch11 — The ledger is destroyed by fire (unrecoverable)
Ch12 — Elena learns Marcus's betrayal (Kira does NOT know)

이 원장을 작성 중인 장과 함께 컨텍스트에 제공하라. 이는 SCORE의 Dynamic State Tracking을 수동으로 구현한 것과 같다. 이 기능은 모델 전반에서 아이템 상태 정확도를 0에서 93~98로 끌어올렸다(SCORE, arXiv).

3. 마지막이 아니라 5장마다 감사할 것.

이동식 구간을 대상으로 전용 연속성 검사를 실행하라. 어떤 범용 어시스턴트에도 잘 작동하는 프롬프트는 다음과 같다.

“내 소설 8~12장과 캐릭터 원장을 제공합니다. 어떤 것도 다시 쓰지 마세요. 다음만 목록으로 제시하세요. (a) 원장과 모순되는 진술, (b) 확립된 목소리에서 대화체 어조가 벗어난 캐릭터, (c) 사전 도입 없이 등장하는 물건 또는 지식. 각각에 장과 행을 인용하세요.”

“어떤 것도 다시 쓰지 마세요”라는 제약은 중요하다. 모델이 모순을 드러내는 대신 조용히 봉합해 버리는 일을 막는다.

4. 초고 작성과 감사에 서로 다른 모델을 사용할 것.

드리프트를 생성한 모델은 그것을 감지하는 데 좋지 않다. 감사를 다른 모델로 보내면 초고 모델이 정상화한 오류가 드러난다. 멀티 공급자 접근을 제공하는 플랫폼에서는 간단하며, 단일 공급자 도구에서는 두 번째 구독이 필요하다.

5. 이어 쓸 때 마지막 문장을 미완성으로 남길 것.

작지만 실질적으로 효과적인 기법이다. Sudowrite는 문장을 미완성으로 남기면 모델이 차갑게 다시 시작하는 대신 생각의 중간을 이어받기 때문에 “눈에 띄게 더 자연스러운 이어쓰기”가 나온다고 설명한다(Sudowrite). 장면 경계에서 발생하는 목소리 초기화 드리프트를 줄인다.

6. 창의성 설정을 장면 기능에 맞출 것.

브레인스토밍과 탐색적 장면에는 높은 temperature를 사용하고, 특정 플롯 비트를 정확히 맞춰야 하는 장면에는 낮은 temperature를 사용하라. 높은 temperature에서는 확립된 패턴에서 벗어나는 일이 모델에 보상되므로 드리프트가 빨라진다.


연구자와 실무자는 AI 소설의 일관성 문제를 어떻게 말할까?

연구자들 사이의 합의는 연속성 실패가 더 깊은 아키텍처적 불일치의 증상이며, 현재의 완화책은 원인을 치료하기보다 증상을 관리한다는 것이다.

“주의 가중치는 순방향 패스 중에 설정되며 이후의 폭로에 따라 소급적으로 수정될 수 없다. 모델은 미래 지식을 기반으로 과거 정보의 중요도 위계를 재구성할 수 없다. 정보를 변환적으로가 아니라 누적적으로 처리한다. 이것이 거대한 컨텍스트 윈도우를 가진 모델조차 서사 이해에 어려움을 겪는 이유다. 문제는 메모리 부족이 아니라, 허구적 서사가 요구하는 끊임없는 정보 재가중 수행에 최적화되지 않은 내장형 아키텍처 모델에 있다.”

“현행 시스템에는 원하는 서사 효과에서 거꾸로 작업하거나, 놀라움과 필연성 제약을 모두 만족하는 경로를 선택하는 동안 여러 가능한 플롯 궤적을 동시에 유지할 메커니즘이 없다… 인간이 참여하는 서사 생성의 반복적 과정이 현재 우리가 성공적인 소설 생성을 위해 찾아낸 유일한 방법이다.”

— Katherine Elkins, Kenyon College의 Integrated Program in Humane Studies 및 AI CoLab(AI의 현대 소설 의존성 문제, arXiv)

이 제약을 우회하는 시스템을 구축하는 엔지니어링 관점도 다른 방향에서 호환되는 결론에 도달한다.

“우리가 반복해서 보는 패턴은 작가들이 AI 드리프트를 자기 탓으로 돌린다는 것이다. 프롬프트를 잘못 썼다고 생각한다. 실제로 실패는 구조적이다. 30장을 계속 작성하라는 요청을 받은 모델은 기껏해야 1~29장을 부분적으로만 볼 수 있으며, 3장의 세부 사항이 20장에서 핵심 지지 요소가 되었다는 사실을 인식하는 메커니즘은 전혀 없다. 더 나은 프롬프팅은 여유 폭을 개선한다. 문제의 형태 자체를 바꾸지는 못한다.”

“실제로 차이를 만드는 것은 상태의 외부화다. SCORE 결과는 여기서 시사하는 바가 크다. 기준선 모델은 서사 아이템이 올바르게 존재하는지 추적하는 점수에서 0점을 받았고, 명시적 상태 추적을 추가하자 90점대 중반까지 올라갔다. 이는 미미한 개선이 아니다. 장부를 관리할 수 있는 시스템과 없는 시스템의 차이다. 그러나 같은 연구에서 응집성은 2~8포인트만 올랐다. 그 격차는 도구가 해결하는 문제와 여전히 작가의 몫으로 남는 문제를 정확히 알려 준다.”

“작가들에게 드리는 실무적 권고는 AI를 기억상실증이 있는 초고 작성 엔진으로 보고, 통제 가능한 형식으로 스스로 메모리를 구축하라는 것이다. 평범한 텍스트 상태 원장도 부주의하게 사용한 정교한 도구보다 낫다. 그리고 초고를 쓴 모델과 다른 모델로 감사하라. 모델은 자기 자신의 드리프트 패턴을 체계적으로 보지 못한다.”

— Jenova 제품 팀, 지속 메모리 에이전트 시스템을 4년간 구축


미래의 AI 모델은 캐릭터 드리프트를 해결할까?

부분적으로는 해결하겠지만, 컨텍스트 윈도우만으로는 어려울 가능성이 크다. 증거는 규모 확장보다 아키텍처 변화와 하이브리드 시스템을 가리킨다.

규모 확장만으로 해결될 가능성이 낮은 것: 정보 재평가 문제는 구조적이다. 더 큰 윈도우가 순방향 패스 아키텍처에 20장에서 그 중요성이 드러났을 때 3장의 주의를 소급적으로 재가중하는 능력을 부여하지는 않는다. 롱 컨텍스트 연구는 모델이 “메모리 한계와 고유한” 아키텍처 제약으로 긴 컨텍스트에 어려움을 겪는다고 반복해서 밝히며(ACL Anthology), 컨텍스트가 커질수록 노이즈가 성능을 떨어뜨린다는 점도 보여 준다(ResearchGate).

더 유망해 보이는 방향:

  • 생성 후 평가 아키텍처 — 하나의 순방향 경로에 고정하는 대신 여러 서사 궤적을 탐색하고, 각 경로의 놀라움과 필연성을 소급적으로 평가한다(arXiv)
  • 점진적 지식 그래프 구축 — SCORE의 모듈형 설계는 이미 텍스트 덩어리가 아니라 구조화 그래프로 지속적인 스토리 메모리를 구축하는 방식을 지원한다(SCORE, arXiv)
  • 담화 수준 특성 주입 — 명시적 아크와 전환점 특성이 성능을 40% 이상 개선했다는 발견은 서사 구조에 관해 모델에 알려줄 수 있는 정보에 상당한 여지가 있음을 시사한다(arXiv)
  • 롱 컨텍스트 추적을 위한 강화학습 — 확장된 상호작용 전반에서 일관된 서사를 유지하도록 모델에 구체적으로 보상한다(Medium 분석)

솔직한 단기 평가: 2026년 현재, 이를 가장 직접적으로 연구하는 연구자들에 따르면 인간이 참여하는 반복 작업은 장편 소설 생성에 유일하게 신뢰할 수 있는 효과적 방법으로 남아 있다(arXiv). 스토리 바이블, Codex, 상태 원장, 검색 파이프라인이라는 도구 계층은 문제의 장부 관리 절반을 입증 가능하게 해결했다. 서사적 인과관계 절반은 여전히 미해결이다.

작가에게 이는 명확한 역할 분담으로 이어진다. 누가 무엇을 가지고 있는지, 누가 무엇을 아는지, 언제 무슨 일이 있었는지 같은 사실의 연속성은 도구에 맡겨라. 이 사건이 왜 중요한지, 왜 반드시 이 캐릭터여야 했는지, 왜 결말이 처음부터 필연적이었는지처럼 의미의 연속성은 직접 책임져라. Elkins의 기억에 남는 표현대로, 이 두 번째 범주에서 AI 생성 소설은 여전히 “기묘한 평온함”을 띤다.

Jenova의 Creative Fiction Writer는 스토리 참고 자료를 위한 지속적인 세션 간 메모리와 첨부 가능한 지식 베이스를 제공하며 jenova.ai/a/creative-fiction-writer에서 이용할 수 있다. 무료 요금제에는 제한된 월간 사용량이 포함되며, Plus는 월 $20로 무료 할당량의 30×를 제공한다. Sudowrite의 소설 도구는 sudowrite.com에서, Novelcrafter의 Codex 시스템은 novelcrafter.com에서 문서화되어 있다. 작성 시점 기준으로 세 서비스 모두의 가격과 기능 구성은 자주 바뀌므로, 최신 세부 사항은 직접 확인해야 한다.