如今,这场争议已经动摇了用户对AI写作的基本预期。模型未必越写越好,提示词也不再长期有效。
AI写作的黄金时代,正在崩塌!
进入,模型一代比一代强,文章却一篇比一篇烂。
它知道什么时候列出几条建议,在哪里塞进小标题,也不会忘记在结尾补上一句总结。
但通篇读完,脑子里却一句话都留不下来。
模型越强,文章越不像人话
最近,剑桥大学博士后Adam Hunt也注意到了这个现象。他的研究方向是演化精神病学与人类演化。
Hunt过去一直看好AI。可到了7月28日,他却在一篇长帖里坦言:自己现在越来越悲观。
之前有一种流行的比喻,是把模型能力画成一个带尖峰的圆。
首先是代码和数学超过人类,然后随着规模扩大,每个方向逐步增长,最终实现AGI。
但实际上,代码和数学那根刺确实是越来越长了,而语言表达和简单推理却没有同步提升。
从强化学习的角度,这件事几乎是必然的。
早几代LLM看起来「全面变聪明」,是因为训练语料本身就是全领域的,从诗歌到论文,整个互联网都在。
不过,那是语料的副产品,不是模型真正的「理解力」。
思维链和网页搜索随后诞生,给模型续了一波命。只不过,这条路终究还是撞墙了。
紧接着,急于翻盘的AI公司盯上了代码。
原因很简单,它有源源不断的训练数据。
GitHub上的提交、审查、PR全是现成的。而且和数学类似,代码有明确的反馈信号:跑得通就是跑得通。
写文章呢?你用什么东西给「一段散文写得好不好」自动打分?没有奖励,RL就不会往那个方向优化。
于是,所有训练火力都转移到了代码上,而语言表达只能吃预训练阶段留的老本。
老本只能是越吃越薄,甚至为了配合其他领域的提升,还会出现退化。
这正是古德哈特定律容易显形的地方。
当一项指标成为训练目标,它就不再准确反映真实能力。实验室用基准测试优化模型,再用同类测试证明变强。
榜单上的准确率还会继续上涨。实际使用体验却可能停滞,甚至下降。
这一次,模仿也被限制了
能力在退化的同时,另一件事也在发生。
一位Reddit用户发帖抱怨,自己用ChatGPT写了几个月的书,订阅了高级模型。中间休息了一阵。
等他回来,那条一直能用的提示词,突然返回拒绝。
提示词本身并不复杂:指定一位作家,要求增加对话、丰富细节、避免碎句。
过去只要写明作家名字,模型就能生成接近其文风的内容,不需要额外解释句长、节奏、视角。
现在,这类提示用不了了。
Ars Technica测试了斯蒂芬·金、J.K. 罗琳、谭恩美、狄更斯、海明威,Engadget则测试了阿加莎·克里斯蒂,ChatGPT全都拒绝模仿。
如果你不点名,只要求「悬念强度」「叙事节奏」「对话密度」这些抽象特征的话,倒是可以输出。但味儿,就不是原来那个味儿了。
AI写作的黄金时代,崩塌了
如今,这场争议已经动摇了用户对AI写作的基本预期。
模型未必越写越好,提示词也不再长期有效。
平台一改规则,围绕特定模型搭建的整条写作流水线,说塌就塌。
不过,AI写作不会消失,它只是退回到了自己该在的位置:工具。
它可以查资料、理结构、改句子,却无法替作者决定写什么、为什么写。
换句话说,人的经验、判断和表达欲,正越来越值钱。