为什么大语言模型的文风如此平庸?训练数据是罪魁祸首。
大型语言模型通过分析从互联网抓取的庞大数据集——包括书籍、文章、论坛等——来训练自身,根据前文序列预测最可能出现的下一个词。这种统计平均化的方式意味着模型学到的是最常见的模式,而非那些让人类作者独具特色的个性化表达。2025年的一项研究分析了Llama 3和GPT-4o生成文本中的词汇、语法及修辞特征,发现人类与大型语言模型的写作风格存在系统性差异;即便模型规模不断扩大,这些差异依然存在,并且在经过指令微调(即针对人类偏好进行优化的模型)中反而比基础模型更为显著[1]。换言之,模型越是追求取悦大众,就越会丧失任何独特声音的痕迹。
2023年的另一项研究通过控制实验直接测量了内容多样性:参与者在有无模型辅助的情况下撰写议论文。结果发现,使用经过反馈调优的InstructGPT模型后,内容多样性出现了统计学意义上的显著下降——不同作者的文章彼此趋同,整体词汇和内容多样性均有所降低[3]。研究人员将这一效应归因于模型本身产出的文本多样性不足,而人类撰写的部分并未发生变化。这证实了趋同效应源于模型的输出,而非用户模仿其风格所致。
并非所有大语言模型都同样平庸——模型规模与训练方法至关重要
不同模型生成“平均化”文本的倾向各有差异。2025年一项采用作者身份验证技术(一种比较写作风格的方法)的研究发现,GPT-2生成的文本与人类撰写的文本在风格上最为相似,而GPT-3和ChatGPT的输出则与人类写作差异显著,且彼此之间高度雷同[4]。这表明,更新、更大的模型(如GPT-3和ChatGPT)已变得更加同质化——它们收敛于更狭窄的风格范围。同一项研究还发现,LLaMA生成的文本介于两者之间:既与原始人类文本片段存在一定相似性,又与其他LLaMA输出聚为一类[4]。
一项2024年针对创意幽默文本(Reddit“淋浴哲思”)的研究对比了GPT-2、GPT-Neo和GPT-3.5。人类评估者认为AI生成的文本在创意质量上略逊一筹,但无法可靠地区分它们与人类撰写的文本[5]。这意味着平均化效应并不总是对读者显而易见——这些文本仍能冒充人类作品,但缺乏原创性的火花。研究还发现,经过微调的分类器能够高精度检测出AI生成的文本,证实即便人类被蒙蔽,细微的风格痕迹依然存在。
指令微调(让模型更有帮助)实际上使写作风格更趋同
这些研究中最明确的发现之一是,经过指令微调的模型——即通过人类反馈进行微调,使其更乐于助人、更无害、更诚实的模型——生成的文本比基础模型更加平均化。2025年的修辞风格研究发现,经过指令微调的Llama 3和GPT-4o与人类相比,在风格上的差异比其基础版本更大[1]。同样,2023年的多样性实验发现,InstructGPT(一种经过反馈微调的模型)降低了内容多样性,而基础版GPT-3则没有[3]。这表明存在一种权衡:正是让模型更擅长遵循指令、避免冒犯性内容的过程,也压缩了风格多样性,使它们趋向于平淡、趋同的风格。
这并非微不足道的影响——2023年的研究报告指出,InstructGPT提升了不同作者文章之间的相似度,这意味着使用同一模型写作的两个人最终会听起来更像彼此[3]。对于任何将大语言模型用于创意写作、新闻报道或其他注重独特风格的任务的人来说,这确实是一个实实在在的局限。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2023年至2025年间,其中4篇为2024年及以后发表,1篇发表于Q1期刊——这些研究是从通过质量筛选的5篇研究中选出的最相关成果,而该筛选过程又源自从超过5亿篇论文的数据库中检索出的35篇文献。
本文引用的文献
大型语言模型(LLM)的写作风格是否与人类相似?语法与修辞风格的差异分析
本研究采用道格拉斯·比伯(Douglas Biber)提出的词汇、语法及修辞特征体系,于2025年发现人类与大型语言模型(Llama 3和GPT-4o)的写作风格存在系统性差异。这些差异在不同模型规模中持续存在,且指令微调模型相较于基础模型表现出更显著的差异。
使用写作风格揭示ChatGPT文本
这项2024年的研究利用文体特征检测ChatGPT生成的文本,借助XGBoost分类器实现了100%的准确率,表明AI写作具有独特且可识别的风格印记。
使用语言模型写作会降低内容多样性吗?
在2023年的一项对照实验中,使用InstructGPT(而非基础版GPT-3)进行写作导致内容多样性出现统计上显著的下降——不同作者的论文变得更加相似,词汇多样性也有所降低——原因是该模型生成的文本多样性不足。
务必保持相同的写作风格:将作者身份验证应用于大型语言模型生成的文本
通过作者身份验证,这项2025年的研究发现,GPT-2生成的文本在风格上与人类写作最为相似,而GPT-3和ChatGPT的文本则与人类写作差异显著,且彼此之间高度雷同,这表明较新模型呈现出日益同质化的趋势。
探究大型语言模型在Reddit“淋浴哲思”领域特定写作风格适配中的机智性、创造力与可检测性
在一项2024年针对创意“淋浴哲思”的研究中,人类评估者对GPT-2、GPT-Neo和GPT-3.5生成的文本在创意质量上的评分略低,但无法可靠地将它们与人类撰写的文本区分开来,而经过微调的分类器却能做到这一点。
