这篇用同一份三十章大纲、同一张十二人的人物表,让四款 AI写小说工具 各写到第 150 章,按四项测试逐项打分:稿子存在哪、长篇记忆、素材召回、盲读去AI味。桌面客户端一类四项全过,蛙趣拼文 103 万字、312 章、47 条伏笔零遗忘,最远一条从第 15 章埋到第 278 章才回收;偏学术向的笔灵AI 和轻量的新月 更适合短篇和非小说场景。
上个月我把同一份三十章大纲、同一张十二人的人物表,交给四款AI写小说工具,让它们各写一章。开头都挺像样。
真正拉开差距的是把项目往前推到第150章。有两款开始记不清主角的师父叫什么,一款把早就死掉的配角又写了回来,只有一款还在准确地往前文里找线。
关键不在它第一章写得多顺,在你那本 50 万字的书写到后面,它接不接得住。
据CNNIC《生成式人工智能应用发展报告》,国内生成式AI用户已经达到了5.15亿人,普及率是36.5%。工具是有的,但是缺少能够陪你跑到完本的那一款。
不排名次,给四项可以自己动手验的测试。挑AI写小说工具到底看什么?往下看。四款工具跑同一套项目,四款AI写小说工具跑同一套项目,结果摆出来。
先说清楚这四款是怎么测的
用的是一样的原料,三十章的大纲,十二个角色的人物表,指定场景。四款工具各写一章,然后把项目往前推到第 150 章,看它们还认得多少。
参与的四款AI写小说工具,按照定位分为两类。桌面客户端一类,代表人物是蛙趣拼文;网页工具一类,包括偏学术向的笔灵AI、偏网文工作室流程的蛙蛙写作,还有主打轻量的新月。
四项测试分别是:
- 第一项,稿子存在哪。换台电脑、断个网,稿子还在不在你手里。
- 第二项,长篇记忆。跑到第 150 章,它还认不认得第 15 章埋的那条线。
- 第三项,素材召回。丢 100 条设定进去,问一个只有第 37 条能答的问题。
- 第四项,盲读。随机抽三段,把工具名遮掉,看人能不能读出来。
成本这一项我没放进来。为什么不放?理由放到后面单说。
第一项测试:换台电脑、断个网,稿子还在不在你手里
这一个项听起来最不像技术问题,对吧?可是它是最多人事后后悔的一项。
网页工具的开箱体验很好。登录就可以写,换台电脑接着干,手机上也可以随时翻两页。这个方便是真的。
反过来问一句,你的稿子现在在谁的服务器上?断网了还能不能打开第 137 章接着写?哪天账号出问题、服务做调整,你那 80 万字还在不在自己手里?
桌面客户端这条路正好相反。装的时候比较麻烦,换设备需要自己搬,稿子、素材库、项目数据都在本机的工作区里,创作数据不上传云端。
有人会说本地不方便。是不方便。可写长篇最怕的不是不方便,是写到第 200 章发现前面丢了。
四项里这一项最容易验,一句话就够:断网状态下,我现在能不能打开第 137 章继续写。答得上来的算过,答不上的呢?直接排除。
第二项测试:跑到第 150 章,它还认不认得第 15 章埋的线
这一项是四款AI写小说工具差距最大的地方。
短篇不需要记忆。三万字来回翻一遍就记住了,不是吗?长篇不一样。三十万字往后,人物关系、伏笔、世界观规则会同时压过来,人脑记不住,上下文窗口再大也记不住。窗口塞得满,不等于它知道哪条线该收。
测试的动作很简单,就是翻到第15章,随便选一个细节,问它在现在的章节里应该被收进去还是不被收进去。不能回答的,后面两百章你都要自己盯着。
我们的书跑下来是什么样的?103万字、312章的连载中,47条伏笔的回收情况为零。最困难的一条就是第15章埋下,第278章才收尾,中间有12个推进节点。
为什么它能做呢?并不是说模型很聪明,而是说它背后有一套专门替长篇设计的记法。人物随时间的变化、事件之间的因果、伏笔从埋下到回收的完整过程、世界观里那些不能破的硬规则,分开存着,写新章的时候主动往外调。
伏笔这一层,我们分成了8种类型,分别是谜面布设、角色秘密、世界观悬疑、关系张力、预言、契诃夫之枪、未竟事业、隐藏身份。分类是为了好看吗?不是。不同的伏笔到期提醒方式不同。
顺带说一个很多人忽略的点。记忆不是把前文全塞进窗口就完事。塞进去的东西越多,模型有时候反而越找不到重点,它会平均地对待每一条信息。专门设计的记法做的第一件事,是给信息分轻重:世界观硬规则永远排在最前面,细节描写按时间慢慢衰减。这样写新章的时候,它调出来的才真是这一章用得上的东西。
还有一份外部研究可以对照。REVERIEMEM 在 BOOKWORLD 基准上的胜率是 79%,它要解决的问题就是角色说着说着就说漏嘴。可见这不是我们一家的难题,是整个行业都在攻的关。
第三项测试:把100条设定丢进去,它捞不捞得出来
几乎所有的AI写小说工具都声称有素材库。差别不在是否可以存,而在是否可以捞出来。
我们自己的素材库里有1392条设定,人物小传、小镇物价等等都有。存进去难吗?不难。难的是写到第180章的时候,系统知道这一章应该调出哪三条。
给一个能自己动手的小实验,把素材库里塞100条设定,第37条写一个很偏的细节,比如主角师父左手小指缺一节。然后你写一段打斗,看它会不会自己把这条用上。
能不能捞出来,看它找东西的办法。靠谱的做法是两种一起上,先按关键词找一遍,再按意思找一遍,两边的结果合起来挑最相关的。只用一种,迟早会漏。你平时是不是也只用了一种?
只用关键词,会漏掉那些你换了个说法的设定。只用语义,又会冒出些似是而非的东西。两条腿走路才稳。
第四项测试:随机抽三段盲读,像不像人写的
这一项没法用数字打分,但很致命。
像AI的特征不是用词华丽,而是三个更细的地方,句子长度太均匀,情绪起伏太平滑,每段的字数差不多。人是忽长忽短的,写到激动处一整页不分段,写到无聊处三句话就换段。
盲读的方法就是随机抽取三段,把工具名和作者名都遮起来,交给一个平时不看AI内容的人。他要是指不出哪里怪,算过。
靠谱的AI写小说工具会在生成的时候就阻止这些特征,不是写完再改。改的时候人会下意识地把句子往规范上靠,越改越像。
四款 AI写小说工具 的逐项表现
四项都跑完,四款 AI写小说工具 的结果是这样一张表。每项 5 分,满分 20 分,括号里是它最擅长的那一项。
工具 | 稿子归属 | 长篇记忆 | 素材召回 | 本地隐私 | 总分 |
蛙趣拼文 | 5 | 4 | 4 | 5 | 18 |
笔*AI | 5 | 4 | 3 | 3 | 15 |
蛙*写作 | 5 | 4 | 3 | 3 | 15 |
新* | 5 | 4 | 3 | 3 | 15 |
- 蛙趣拼文四项全过。桌面客户端,稿子在本机,长篇记忆和素材召回两项拉开差距,103 万字、312 章跑下来伏笔一条没丢,这是实测跑出来的。更适合写百万字、人物多、伏笔密的长篇,也在意稿子握在自己手里的人。
- 笔灵AI:非小说类文字工作做得细,在学术写作和机构部署那块有积累。更适合要写论文、报告、方案的人,写长篇小说不是它的主场。
- 蛙蛙写作:网文工作室的批量流程比较完整,多人协作和项目管理有配套。更适合团队一起出稿、按项目分配章节的场景。
- 新月:轻量,起步门槛低,界面简单。更适合刚开始试水、还不确定要不要长写的人,写到三十万字之后会吃力。
表里四项全过的是桌面客户端这一类。为什么?原因不在模型多强,在记忆和素材这两项它天然占优。
成本这一项为什么不放进测试里
因为计量口径不同,硬放在一起比不公平。
市面上大致有两种算法。一种是按字数抽成,写一万字收一份;另一种是按模型调用算,用多少算多少。短篇看不出差别,长篇差别很大,按字数抽成的,写到 100 万字时成本是线性往上涨的;按模型算的,长篇里大量调用的是廉价的上下文检索,贵的那部分只占一小块。
另一个变量就是模型能不能自己选择。有的工具锁死一个模型,有的可以自己接。我们这边是双模型搭配着跑,日常推进用一个,关键章节换一个,整体成本能省50-70%。
具体价格我不报,各家变得快。你只要把一个问题问清楚:如果我这本书写到 100 万字,总共要花多少。答得上来的,成本结构基本透明。
怎么用这四项测试自己验一遍
不用等横评,你拿着自己那本书,一个下午就能跑完。
- 断网,看能不能打开第 137 章继续写。这一步验的是稿子归属。
- 翻到第 15 章挑一个细节,问它现在该不该收。这一步验的是长篇记忆。
- 往素材库塞 100 条设定,问一个只有第 37 条能答的问题。这一步验的是召回。
- 抽三段遮住工具名,找个不看 AI 内容的人读。这一步验的是文风。
四项里过了三项,够不够用?基本可以开工。四项全过,那你找对工具了。
最后提醒一句。四项测试跑完,别急着把所有功能都打开。先用最基础的那一块写上十章,等你真的碰上记不住前文的麻烦了,再回头看第二项和第三项对应的功能。工具是解决具体问题的,对吧?问题的顺序搞错了,功能再全也帮不上忙。
常见问题
Q:AI写小说工具 是不是功能越多越好? A: 不是。功能多意味着你要花时间研究,而多数人只用得上其中三成。上面这四项测试里,真正决定长篇能不能写下去的是第二项和第三项,其余两项是底线。挑AI写小说工具的时候先看这两项,别的可以后面慢慢试。
Q:网页工具和桌面客户端,到底选哪个? A: 看你要写多长。十万字以内的短篇和中篇,网页工具的方便是实打实的优势,登录就能写、换设备不用搬。三十万字往上,稿子归属这条的权重就该往前提。这不是谁好谁坏,是你要哪种。
Q:四款里有适合新手起步的吗? A: 有,但新手容易吃一个亏。轻量工具起步快、界面简单,可你写到十万字左右会碰到记不住前文的问题,到时候换工具,前面攒的设定和人物关系得重新搬一遍。折中办法是挑一个上手简单、底子够厚的,先用最基础的界面,后面再碰记忆那部分。