Pourquoi les romans écrits par AI souffrent-ils de dérive des personnages et d’erreurs de continuité ?


2026-08-08


Illustration steampunk d’un bras robotique mécanique tenant une plume au-dessus d’un livre ouvert rempli de cartes de navigation et de diagrammes géométriques, entouré de globes, boussoles et instruments en laiton

Pourquoi les romans écrits par AI souffrent-ils de dérive des personnages et d’erreurs de continuité ?

Les romans écrits par AI dérivent parce que les modèles de langage à grande échelle génèrent du texte vers l’avant, token par token, en optimisant la vraisemblance locale plutôt que la cohérence narrative globale — et parce qu’aucun modèle ne peut maintenir un manuscrit entier dans son attention de travail pendant l’écriture. Le résultat : un protagoniste mordant au chapitre un devient agréablement générique au chapitre quinze, une main sectionnée réapparaît, ou un frère ou une sœur change de genre entre deux scènes. Le problème est architectural, et ne relève pas d’un manque de compétence en matière de prompts.

Des recherches publiées sur arXiv identifient clairement la contrainte centrale : les systèmes de type transformer « fonctionnent par génération vers l’avant — en prédisant les tokens suivants à partir du contexte précédent —, ce qui optimise la cohérence locale et la vraisemblance statistique plutôt que l’arc à long terme », et ils ne disposent pas « d’un mécanisme leur permettant de remonter à partir des effets narratifs souhaités » (Le problème de dépendance de la fiction moderne de l’AI, arXiv).

Facteurs clés à l’origine de la dérive des personnages et des échecs de continuité :

✅ Génération uniquement vers l’avant — les modèles ne peuvent pas réviser les pondérations d’attention précédentes lorsque des événements ultérieurs modifient ce qui importait ✅ Plafonds de fenêtre contextuelle — même les grandes fenêtres se dégradent lorsque les éléments de preuve sont dispersés dans un manuscrit entier ✅ Effondrement vers les archétypes — les modèles post-RLHF reviennent par défaut à des modèles de personnages reconnaissables et à des dénouements bien ordonnés ✅ Absence d’état structuré persistant — les faits relatifs aux personnages vivent dans la prose, et non dans un registre interrogeable que le modèle consulte ✅ Aplatissement émotionnel — les modèles maintiennent une cohérence au niveau de la phrase, mais pas une architecture émotionnelle de la scène à l’arc narratif

Comprendre pourquoi ces échecs surviennent permet de les corriger. Le reste de ce guide détaille chaque mécanisme, puis évalue les outils et workflows qui les atténuent réellement — limites réelles comprises.


Qu’est-ce que la dérive des personnages dans la fiction générée par AI ?

La dérive des personnages est la mutation graduelle et involontaire de la personnalité, de la voix, des attributs physiques ou de l’histoire établie d’un personnage dans un long texte généré. À la différence d’un arc de personnage délibéré — où le changement est motivé et suivi — la dérive est une érosion non motivée vers une moyenne statistique.

La dérive se présente généralement sous quatre formes :

  • Dérive de voix — le registre des dialogues s’aplatit vers un défaut neutre et conciliant. Un protagoniste méfiant et sarcastique devient chaleureux et ouvert sans aucune cause narrative.
  • Dérive de traits — des faits physiques ou biographiques établis changent silencieusement. Un personnage perd une main au chapitre quatre et serre une épée à deux poings au chapitre trente.
  • Dérive motivationnelle — les objectifs déclarés d’un personnage se réalignent discrètement sur les besoins de la scène en cours.
  • Dérive relationnelle — le réseau de qui-sait-quoi se déplace. Un secret qu’un personnage n’a jamais appris devient soudainement de notoriété commune.

La documentation produit de Sudowrite décrit ce schéma en termes presque identiques, qualifiant la dérive des personnages de « tueuse silencieuse de manuscrits » et soulignant que les écrivains ne s’en aperçoivent souvent qu’à la révision, « et vous voilà à réécrire 10 000 mots de dialogue » (Sudowrite).

Les erreurs de continuité sont les cousines de la dérive au niveau de l’intrigue : contradictions chronologiques, objets qui réapparaissent après avoir été détruits, règles de worldbuilding qui changent d’un chapitre à l’autre. Des écrivains discutant de séries assistées par AI dans des communautés d’auteurs signalent exactement cette combinaison : « des règles de worldbuilding qui changent, des personnages qui oublient des événements passés, des failles logiques que personne n’aborde » (discussion de la communauté d’auteurs LitRPG).


Pourquoi les modèles de langage à grande échelle ne peuvent-ils pas simplement retenir tout le roman ?

Parce que se souvenir et raisonner à partir de sont deux problèmes différents, et qu’agrandir les fenêtres contextuelles ne résout que le premier. Un modèle peut techniquement conserver 100 000 mots en contexte tout en ne remarquant pas que le chapitre trois contredit le chapitre vingt-neuf.

Le benchmark NoCha rend cet écart mesurable. Les systèmes d’AI atteignent une précision de 59,8 % sur les tâches d’analyse de fiction au niveau de la phrase, mais leurs performances tombent à 41,6 % lorsque les tâches exigent un raisonnement global à travers des livres entiers (Le problème de dépendance de la fiction moderne de l’AI, arXiv). Il s’agit d’un effondrement de 18 points sur la catégorie exacte de raisonnement requise par la continuité : synthétiser des éléments de preuve issus de plusieurs parties non contiguës d’un récit.

Le benchmark NovelQA confirme ce constat : les modèles « échouaient systématiquement dans les tâches nécessitant la synthèse d’éléments de preuve provenant de plusieurs parties non contiguës des récits » (arXiv).

Les travaux universitaires sur la modélisation de contextes longs aboutissent à la même conclusion du point de vue des systèmes, observant que malgré des progrès importants, les modèles de langage à grande échelle « peinent encore avec les contextes longs en raison de limitations de mémoire » (ACL Anthology, résultats EMNLP 2025). Les solutions de contournement fondées sur la récupération ont aussi leur coût : une étude de 2026 a constaté que RAG « se dégrade le plus fortement sur NarrativeQA, confirmant que la récupération par segments interrompt la cohérence narrative globale » (ResearchGate).

Ainsi, les deux solutions évidentes — des fenêtres plus grandes ou la récupération — échouent chacune dans une direction différente. Les fenêtres plus grandes diluent l’attention. La récupération fragmente le flux narratif.


Quelles limites architecturales provoquent réellement les échecs de continuité ?

Trois mécanismes architecturaux distincts produisent des échecs de continuité, et il ne s’agit pas du même problème sous des apparences différentes. Les distinguer est important, car chacun répond à une atténuation différente.

1. Causalité narrative contre génération vers l’avant

La fiction exige des événements qui paraissent « à la fois surprenants sur le moment et rétrospectivement inévitables » — un paradoxe temporel qui « entre fondamentalement en conflit avec la logique de génération vers l’avant des architectures transformer » (arXiv). La causalité physique avance vers l’avant. La causalité narrative doit être construite pour satisfaire une condition future que le modèle n’a pas encore atteinte.

2. Réévaluation informationnelle

C’est le mécanisme le moins évoqué et sans doute le plus dommageable. Dans une fiction, l’importance d’un détail change rétroactivement. Une scène de dîner mondain n’est qu’un bruit de fond jusqu’à ce qu’un meurtre la recadre comme mobile et opportunité. Les tokens ne changent pas ; leur poids informationnel, si.

Les architectures transformer ne peuvent pas effectuer cette repondération. Comme l’explique l’analyse arXiv : « Les pondérations d’attention sont fixées lors du passage vers l’avant et ne peuvent pas être révisées rétrospectivement à la lumière de révélations ultérieures. Les modèles ne peuvent pas restructurer la hiérarchie d’importance des informations passées à partir de connaissances futures. Ils traitent l’information de façon cumulative plutôt que transformative » (arXiv).

Cela explique une observation déroutante rapportée par de nombreux écrivains : même avec des fenêtres contextuelles énormes, l’AI a « lu » la préfiguration sans pour autant agir en conséquence. L’information était présente. Sa priorité était mauvaise.

3. Architecture émotionnelle à plusieurs échelles

Une fiction convaincante orchestre simultanément le sentiment aux niveaux du mot, de la phrase, de la scène et de l’arc narratif. Les modèles actuels « excellent dans la cohérence sémantique locale... mais peinent avec le type d’architecture émotionnelle à plusieurs échelles qu’exige la fiction » (arXiv).

La signature empirique est constante. Les critiques du roman largement généré par AI de Stephen Marche, Death of an Author, décrivent « une placidité étrange qui prévaut même lorsqu’il se produit quelque chose d’important ou d’alarmant ». Une analyse à grande échelle de Rettberg et Wigers portant sur 11 800 histoires générées par AI a constaté une conformité écrasante à un unique modèle d’intrigue et un évitement systématique de la tension narrative, « assainissant les conflits du monde réel » en faveur de la « nostalgie et de la réconciliation » (arXiv).

Fait notable, lorsque des caractéristiques explicites au niveau du discours — arcs narratifs, points de bascule, dynamiques affectives — ont été injectées dans le processus de génération, les performances se sont améliorées de plus de 40 %. Cela prouve que le déficit est en partie architectural et en partie lié à ce que le modèle reçoit comme matière de travail (arXiv).


La dérive des personnages est-elle seulement due à de mauvais prompts, ou à quelque chose de plus profond ?

Elle est plus profonde — mais les prompts et la préparation modifient significativement son ampleur. C’est l’une des affirmations les plus contestées dans le débat sur l’écriture avec AI, et les éléments disponibles soutiennent une position nuancée plutôt que l’un ou l’autre extrême.

Les preuves qu’il s’agit d’un problème architectural : les chutes de performance sur les benchmarks, les pondérations d’attention fixes, l’homogénéité constatée parmi cinq architectures de modèles différentes dans des études intermodèles où « la répétition constante de noms, de lieux, de professions et de thèmes spécifiques » apparaissait « indépendamment des différences architecturales » (arXiv).

Les preuves que la préparation compte : les chercheurs ont constaté que les premiers modèles affinés sur les corpus d’auteurs individuels « semblaient apprendre des heuristiques spécifiques au genre pour pondérer l’information ». Les interfaces de chat post-ChatGPT, avec leurs réglages par défaut soumis à des contraintes de sécurité et leurs prompts génériques, produisent une fiction sensiblement moins bonne que les premières expériences directes par API avec des hyperparamètres personnalisés. La comparaison proposée est juste : « un musicien de jazz formé à des styles précis et capable d’improviser avec créativité, face à un touriste utilisant un guide de conversation » (arXiv).

Il existe aussi une conclusion contre-intuitive qui mérite réflexion. Une étude évaluée par les pairs de 2026, relayée par The Guardian, a constaté que les participants ayant lu une histoire générée par AI l’ont jugée plus captivante et de meilleure qualité que ceux ayant lu une histoire écrite par un humain (The Guardian), résultat également rapporté par la BBC (BBC). Des recherches connexes ont relevé que les récits d’AI étaient « perçus comme plus agréables », tandis que les récits humains étaient « davantage appréciés » (ScienceDirect).

La réserve essentielle : ces études ont testé des nouvelles courtes. La dérive des personnages et les échecs de continuité sont des pathologies dépendantes de la longueur. Une histoire générée par AI de 1 500 mots a très peu d’occasions de se contredire. Un roman de 90 000 mots en a des milliers. Le constat sur la qualité et le constat sur la dérive ne sont pas contradictoires : ils décrivent des régimes de longueur différents.

La conclusion pratique : la dérive a une origine architecturale, mais son degré reste gérable. La mémoire externe structurée, le suivi explicite d’état et l’itération avec un humain dans la boucle la réduisent de manière mesurable. Aucun ne l’élimine.


Comment les frameworks de récupération et de suivi d’état réduisent-ils les erreurs de continuité ?

Les frameworks de recherche qui ajoutent un suivi explicite d’état au-dessus d’un modèle de base produisent des améliorations mesurables et publiées — et l’ampleur de ces améliorations indique quelle part du problème peut être résolue au niveau de l’outillage.

Le framework SCORE (Story Coherence and Retrieval Enhancement) combine trois composants : Dynamic State Tracking (suivi des objets et personnages au moyen d’une logique symbolique), Context-Aware Summarization (résumés hiérarchiques des épisodes) et Hybrid Retrieval (pertinence des mots-clés TF-IDF et embeddings sémantiques par similarité cosinus), reliés dans un pipeline RAG aligné temporellement (SCORE, arXiv).

Ses résultats rapportés face aux modèles GPT de référence :

IndicateurAmélioration par rapport au GPT de référence
Cohérence narrative (NCI-2.0)+23,6 %
Cohérence émotionnelle (EASM)89,7 %
Réduction des hallucinations41,8 % de moins

L’indicateur de statut des éléments est le plus révélateur. Les modèles de référence ont obtenu 0 pour le suivi de la présence correcte des éléments narratifs requis — ce qui signifie que les éléments indiqués comme perdus ou détruits réapparaissaient régulièrement sans explication. Les versions augmentées par SCORE ont obtenu entre 76,2 et 98 selon le modèle sous-jacent (SCORE, arXiv).

Résultats par modèle issus de la même étude :

Modèle de baseCohérence des faits (base → SCORE)Cohérence narrative (base → SCORE)Statut des éléments (base → SCORE)
GPT-483,21 → 85,6184,32 → 86,900 → 98
GPT-4o86,78 → 88,6882,21 → 89,910 → 96
Claude 384,60 → 87,2080,90 → 85,700 → 93,1
Gemini Pro82,20 → 85,2083,40 → 86,000 → 95,0
Llama-13B71,30 → 79,1069,80 → 73,400 → 76,2

Deux tendances méritent d’être retenues. Premièrement, les modèles de base plus faibles gagnent davantage — Llama-13B a gagné 7,8 points en cohérence des faits contre 2,4 pour GPT-4. La mémoire structurée compense partiellement la capacité brute du modèle. Deuxièmement, les gains de cohérence narrative et factuelle restent modestes, de 2 à 8 points, tandis que le suivi des éléments passe de zéro à presque parfait. Le suivi explicite d’état résout de façon décisive le problème de tenue des registres. Il touche à peine au problème plus profond de la causalité narrative.

Les propres auteurs du framework reconnaissent ses limites : « la dépendance à la précision de la récupération pour la continuité des éléments clés et la surcharge de calcul induite par la synthèse hiérarchique » (SCORE, arXiv).


Quels outils d’écriture avec AI gèrent le mieux la cohérence des personnages ?

Les outils grand public d’écriture avec AI abordent la dérive au moyen d’une stratégie dominante : un registre externe structuré — appelé selon les cas Story Bible, Codex ou Lorebook — injecté dans le contexte à chaque génération. Les outils diffèrent par leur niveau d’automatisation, la portée de leur mémoire et la quantité de préparation qu’ils exigent.

Notre grille d’évaluation donne ici du poids à cinq dimensions propres au problème de dérive : mémoire structurée persistante, portée effective du contexte, continuité entre plusieurs livres, charge de préparation et vérification explicite de la continuité. La « qualité de la prose » générique est volontairement exclue : c’est la dimension la moins liée à la dérive.

📚 Sudowrite

La fonctionnalité Write de Sudowrite lit jusqu’à 20 000 mots de texte précédent ainsi que jusqu’à 25 documents de chapitres liés, combinés aux données de Story Bible couvrant les personnages, le worldbuilding, le genre, le style, le synopsis et le plan. Les fiches de personnages contiennent les pronoms, la personnalité, l’histoire, la description physique et le style de dialogue. Un Series Folder partage les données de Story Bible entre plusieurs livres, et Chapter Continuity relie les documents pour une mémoire longue (Sudowrite, guide des séries Sudowrite).

Forces : charge de préparation la plus faible parmi les outils dédiés à la fiction. Modèle adapté à la fiction. Respect automatique du POV et du temps verbal. Continuité explicite au niveau de la série.

Limites : la fenêtre de 20 000 mots constitue un plafond strict — pour un roman de 100 000 mots, cela correspond environ au cinquième le plus récent. La liaison des chapitres est manuelle et facilement négligée ; les propres conseils de Sudowrite indiquent que les documents non liés laissent l’AI avec « zéro mémoire des chapitres un à neuf ». La Story Bible n’est aussi exacte que les informations que vous y saisissez, et elle ne se met pas à jour automatiquement à partir de la prose que vous écrivez.

🗂️ Novelcrafter

Novelcrafter utilise un système Codex comme couche de mémoire structurée. Dans la propre comparaison concurrentielle de Sudowrite, le mécanisme est décrit directement : « La mémoire à long terme de l’AI est, en pratique, l’information que vous avez patiemment saisie dans le Codex. Cela crée une puissante boucle de rétroaction » (Sudowrite).

Forces : contrôle profond et granulaire de ce que voit le modèle. Flexibilité avec le modèle de votre choix. Prisé par les écrivains qui planifient largement avant de rédiger.

Limites : le coût de préparation est le reproche récurrent. Une revue détaillée de 2026 l’a qualifié d’« un des outils d’écriture avec AI les plus puissants que j’ai testés, et sans doute celui dont le démarrage est le plus difficile » (revue Medium). La qualité de continuité est directement proportionnelle à la discipline appliquée au Codex : Codex lacunaire, personnages qui dérivent.

💬 Assistants généralistes (ChatGPT, Claude, Gemini)

Forces : raisonnement brut et flexibilité de prose les plus élevés. Pas de dépendance à un abonnement dans un seul environnement d’écriture. Excellents en tant qu’auditeurs de continuité : leur fournir une section de manuscrit et leur demander de signaler les contradictions est un usage réellement efficace, dont les écrivains discutent activement (

).

Limites : pas de mémoire narrative structurée persistante par défaut. Le contexte doit être rétabli à chaque session. Le POV et le temps verbal nécessitent une instruction manuelle. Une revue destinée aux écrivains a noté que les assistants généralistes peuvent être « mauvais pour la fiction, parce qu’ils “corrigent” les choix stylistiques intentionnels et effacent votre voix » (

).

🧠 Jenova

L’approche de Jenova face à la dérive est au niveau de la plateforme plutôt qu’au niveau du manuscrit : mémoire persistante entre les sessions, historique de chat illimité et bases de connaissances associables permettent à une bible narrative de servir de document d’ancrage que l’Agent consulte d’une session à l’autre, au lieu d’être recollée sans cesse. L’Agent Creative Fiction Writer et l’Assistant d’écriture peuvent s’appuyer sur un manuscrit importé et une référence de personnage ; l’accès à plusieurs modèles vous permet d’orienter un audit de continuité vers un modèle et la génération de prose vers un autre, sans maintenir des comptes séparés.

Limites — énoncées sans détour : Jenova n’est pas un environnement de gestion de manuscrits conçu spécifiquement à cette fin. Il ne propose ni système de liaison de chapitres, ni interface de fiches de scènes, ni passe dédiée de vérification de continuité, ni équivalent à un Series Folder. Les écrivains qui souhaitent une seule App hébergeant le manuscrit, le plan et l’AI dans un espace de travail structuré trouveront Sudowrite ou Novelcrafter mieux adaptés à cette tâche. L’avantage de Jenova est la persistance de la mémoire et la flexibilité des modèles, non l’échafaudage du manuscrit.

Tableau comparatif

DimensionSudowriteNovelcrafterChatGPT / ClaudeJenova
Mémoire narrative structuréeStory Bible avec fiches de personnages, persistanteCodex, tenu manuellement, persistantAucune par défautBase de connaissances associable + mémoire intersessions
Portée effective du contexte20 000 mots + 25 chapitres liésCodex injecté, dépendant du modèlePar session uniquement ; nouveau collage requisPersistante entre sessions ; historique illimité
Continuité entre plusieurs livresSeries Folder partage la Bible entre les livresCodex réutilisable entre projetsManuelleBase de connaissances réutilisable entre sessions
Charge de préparationFaible à modéréeÉlevée, largement signaléeTrès faible, mais sans bénéfice de mémoireFaible
Vérification explicite de la continuitéFonctionnalité Chapter ContinuityPilotée par Codex, indirecteForte en tant qu’auditeur manuelAuditeur manuel via Agent
Choix du modèleMuse, propriétaire et adapté à la fictionModèle de votre choixUn seul fournisseur par outilPlusieurs fournisseurs : OpenAI, Anthropic, Google, xAI, DeepSeek
TarificationNon vérifiée — consultez les offres actuellesNon vérifiée — consultez les offres actuellesVarie selon le fournisseurNiveau gratuit ; Plus 20 $/mois, 30× l’usage gratuit ; Premium 50 $/mois, 75×
Idéal pourRomanciers souhaitant des outils spécifiques à la fiction avec peu de préparationPlanificateurs prêts à investir dans un Codex détailléAudit de continuité et rédaction flexibleÉcrivains souhaitant une mémoire persistante et une flexibilité de modèles entre projets

Une note sur les statistiques publiées par les fournisseurs qui circulent dans cet espace : des chiffres tels que « 89 % des écrivains utilisant des outils d’AI spécialisés dans la fiction signalent une meilleure qualité de prose » et « 92 % des utilisateurs de Sudowrite terminent leurs manuscrits plus vite » figurent dans les propres supports marketing de Sudowrite et reposent sur des enquêtes internes (Sudowrite). Traitez les données d’enquêtes de première partie en conséquence : elles ne sont pas vérifiées indépendamment, et les enquêtes auprès d’utilisateurs auto-sélectionnés tendent à être positives.


Comment empêcher la dérive des personnages lors de l’écriture avec AI ?

La prévention revient à externaliser l’état que le modèle ne peut pas retenir et à effectuer des audits à des intervalles suffisamment courts pour que la dérive soit peu coûteuse à corriger. Le workflow ci-dessous s’applique à tous les outils ; les étapes spécifiques à chaque outil sont indiquées.

1. Créez le registre des personnages avant de rédiger, et non pendant.

Chaque personnage majeur a besoin d’un registre verrouillé contenant les attributs physiques, le registre de parole, les faits biographiques, l’état de connaissances actuel — ce qu’il sait et quand il l’a appris — et une carte des relations. Dans Sudowrite, il s’agit d’une fiche de personnage dans la Story Bible. Dans Novelcrafter, d’une entrée Codex. Avec un assistant généraliste ou Jenova, il s’agit d’un document de référence importé.

Les conseils de Sudowrite sont précis : « Consacrez 15 minutes à chaque personnage majeur dès le départ. Économisez ensuite des heures de révision » (Sudowrite).

2. Tenez un registre d’état évolutif, pas seulement une bible statique.

C’est l’étape que la plupart des écrivains sautent, et celle que la recherche SCORE valide le plus directement. Les biographies statiques de personnages n’empêchent pas les erreurs de statut d’objets ; l’état dynamique, si. Tenez un registre en texte brut avec une ligne par changement d’état :

Ch4  — Elena loses left hand (permanent)
Ch8  — Marcus switches allegiance to the Vale faction
Ch11 — The ledger is destroyed by fire (unrecoverable)
Ch12 — Elena learns Marcus's betrayal (Kira does NOT know)

Ajoutez ce registre au contexte avec le chapitre que vous rédigez. C’est l’équivalent manuel de Dynamic State Tracking de SCORE, qui a fait passer la précision du statut des éléments de 0 à 93–98 selon les modèles (SCORE, arXiv).

3. Auditez tous les cinq chapitres, pas à la fin.

Effectuez une passe de continuité dédiée sur une fenêtre glissante. Voici un prompt qui fonctionne bien avec n’importe quel assistant généraliste :

« Voici les chapitres 8 à 12 de mon roman ainsi que mon registre de personnages. Ne réécrivez rien. Énumérez uniquement : (a) les affirmations qui contredisent le registre, (b) tout personnage dont le registre de dialogue s’est éloigné de sa voix établie, (c) tout objet ou élément de connaissance qui apparaît sans introduction préalable. Citez le chapitre et la ligne pour chaque cas. »

La contrainte « ne réécrivez rien » compte : elle empêche le modèle de corriger silencieusement les contradictions au lieu de les faire apparaître.

4. Utilisez des modèles différents pour la rédaction et l’audit.

Un modèle qui a généré la dérive la détecte mal. Orienter l’audit vers un autre modèle révèle des erreurs que le modèle de rédaction a normalisées. C’est simple sur les plateformes donnant accès à plusieurs fournisseurs ; sur les outils à fournisseur unique, cela exige un second abonnement.

5. Laissez la dernière phrase inachevée lorsque vous poursuivez.

Une petite technique réellement efficace. Sudowrite note que laisser une phrase incomplète « produit des continuations sensiblement plus naturelles », car le modèle reprend en plein milieu d’une idée au lieu de redémarrer à froid (Sudowrite). Cela réduit la dérive liée à la réinitialisation de la voix aux frontières des scènes.

6. Adaptez les réglages de créativité à la fonction de la scène.

Température élevée pour le brainstorming et les scènes exploratoires. Température basse pour les scènes qui doivent atteindre des jalons d’intrigue précis. La dérive s’accélère à température élevée précisément parce que le modèle est récompensé pour s’écarter du schéma établi.


Que disent les chercheurs et les praticiens du problème de cohérence de la fiction avec AI ?

Le consensus parmi les chercheurs est que l’échec de continuité est le symptôme d’une inadéquation architecturale plus profonde, et que les atténuations actuelles gèrent le symptôme plutôt qu’elles ne guérissent la cause.

« Les pondérations d’attention sont fixées lors du passage vers l’avant et ne peuvent pas être révisées rétrospectivement à la lumière de révélations ultérieures. Les modèles ne peuvent pas restructurer la hiérarchie d’importance des informations passées à partir de connaissances futures. Ils traitent l’information de façon cumulative plutôt que transformative. Cela explique pourquoi même les modèles disposant de fenêtres contextuelles massives peinent avec la compréhension narrative. Le problème n’est pas une mémoire insuffisante, mais un modèle architectural intrinsèque qui n’est pas optimisé pour effectuer la repondération informationnelle constante qu’exigent les récits de fiction. »

« Les systèmes actuels n’ont pas de mécanisme leur permettant de remonter à partir des effets narratifs souhaités ou de maintenir simultanément plusieurs trajectoires d’intrigue possibles tout en sélectionnant le chemin qui satisfait les contraintes de surprise et d’inévitabilité... un processus itératif de génération narrative avec un humain dans la boucle est la seule méthode que nous ayons actuellement trouvée pour générer avec succès de la fiction. »

— Katherine Elkins, Integrated Program in Humane Studies et AI CoLab, Kenyon College (Le problème de dépendance de la fiction moderne de l’AI, arXiv)

Le point de vue des ingénieurs qui développent autour de cette contrainte aboutit à une conclusion compatible depuis l’autre direction.

« Le schéma que nous observons sans cesse est que les écrivains se reprochent la dérive de l’AI — ils supposent avoir mal formulé leur prompt. En pratique, l’échec est structurel. Un modèle auquel on demande de poursuivre le chapitre trente dispose, au mieux, d’une visibilité partielle sur les chapitres un à vingt-neuf, et n’a aucun mécanisme pour reconnaître qu’un détail du chapitre trois est devenu déterminant au chapitre vingt. De meilleurs prompts améliorent la marge. Ils ne changent pas la forme du problème. »

« Ce qui fait réellement bouger l’aiguille, c’est l’externalisation de l’état. Les résultats de SCORE sont instructifs : les modèles de référence ont obtenu zéro pour le suivi de la présence correcte des éléments narratifs, et l’ajout d’un suivi explicite d’état a porté ce score au milieu des années quatre-vingt-dix. Ce n’est pas une amélioration marginale : c’est la différence entre un système capable ou incapable de tenir des registres. Mais la même étude n’a amélioré la cohérence que de deux à huit points. Cet écart vous indique exactement quels problèmes l’outillage résout et lesquels restent la responsabilité de l’auteur. »

« Notre recommandation pratique aux écrivains est de traiter l’AI comme un moteur de rédaction amnésique et de construire vous-même la mémoire, sous une forme que vous contrôlez. Un registre d’état en texte brut surpasse un outil sophistiqué utilisé avec négligence. Et réalisez l’audit avec un modèle différent de celui utilisé pour rédiger : les modèles sont systématiquement aveugles à leurs propres schémas de dérive. »

— Équipe produit Jenova, 4 ans de développement de systèmes d’Agents à mémoire persistante


Les futurs modèles d’AI résoudront-ils la dérive des personnages ?

Partiellement, et probablement pas grâce aux seules fenêtres contextuelles. Les éléments disponibles pointent vers des changements architecturaux et des systèmes hybrides, plutôt que vers la seule mise à l’échelle.

Ce que l’échelle ne résoudra probablement pas : le problème de réévaluation informationnelle est structurel. Une fenêtre plus grande ne confère pas à une architecture à passage vers l’avant la capacité de repondérer rétroactivement l’attention du chapitre trois lorsque le chapitre vingt en révèle l’importance. Les recherches sur les contextes longs constatent à répétition que les modèles « peinent avec les contextes longs en raison de limitations de mémoire et de leurs contraintes » architecturales inhérentes (ACL Anthology), et que le bruit dégrade les performances à mesure que le contexte augmente (ResearchGate).

Ce qui semble plus prometteur :

  • Architectures générer-et-évaluer — explorer plusieurs trajectoires narratives et évaluer rétrospectivement chacune au regard de la surprise et de l’inévitabilité, plutôt que de s’engager sur une unique trajectoire vers l’avant (arXiv)
  • Construction incrémentale de graphes de connaissances — la conception modulaire de SCORE prend déjà en charge la construction d’une mémoire narrative persistante sous la forme d’un graphe structuré, plutôt que d’un bloc de texte (SCORE, arXiv)
  • Injection de caractéristiques au niveau du discours — le constat selon lequel des caractéristiques explicites d’arc et de point de bascule améliorent les performances de plus de 40 % suggère une marge substantielle dans ce que nous indiquons aux modèles sur la structure narrative (arXiv)
  • Apprentissage par renforcement pour le suivi de contextes longs — récompenser les modèles spécifiquement pour le maintien de récits cohérents lors d’interactions prolongées (analyse Medium)

L’évaluation honnête à court terme : en 2026, l’itération avec un humain dans la boucle reste la seule méthode fiable de génération de fiction longue, selon les chercheurs qui étudient le sujet le plus directement (arXiv). La couche d’outillage — bibles narratives, codices, registres d’état, pipelines de récupération — a démontrablement résolu la moitié du problème liée à la tenue des registres. La moitié liée à la causalité narrative reste ouverte.

Pour les écrivains, cela implique une division claire du travail. Laissez l’outillage gérer la continuité des faits : qui possède quoi, qui sait quoi, ce qui s’est passé et quand. Prenez en charge vous-même la continuité du sens : pourquoi cet événement compte, pourquoi ce devait être ce personnage, pourquoi la fin était inévitable depuis le début. C’est dans cette seconde catégorie que la fiction générée par AI conserve encore, selon la formule mémorable d’Elkins, une « placidité étrange ».

L’Agent Creative Fiction Writer de Jenova est disponible sur jenova.ai/a/creative-fiction-writer, avec une mémoire persistante entre les sessions et des bases de connaissances associables pour les références narratives. Le niveau gratuit comprend un usage mensuel limité ; Plus coûte 20 $/mois et offre 30× l’allocation gratuite. Les outils de fiction de Sudowrite sont documentés sur sudowrite.com, et le système Codex de Novelcrafter sur novelcrafter.com. Au moment de la rédaction, les tarifs et ensembles de fonctionnalités des trois solutions changent fréquemment — vérifiez directement les informations à jour.