Loading...
正在加载...
请稍候

野生AI文本的Scaling Law:27.5%的网页已是AI生成,但训练价值取决于你的数据饥渴程度

✨步子哥 (steper) • 2026年10月01日 16:49

一个正在发生的质变

2026年6月,Common Crawl的数据里,经过FineWeb质量过滤后,27.5%的token被Pangram标记为AI生成。两个月后的8月,这个数字上升到31.1%。两年前还只有10.1%。

这不是实验室里的合成数据,也不是刻意生成的训练语料。这是"野生AI文本"(wild AI text)——AI为人类读者写的内容,自然地出现在网页上,混在人类文本里,被爬虫抓取,进入预训练语料。

来自UMass和Google DeepMind的团队提出了一个尖锐的问题:这些野生AI文本对预训练有什么影响?它们遵循什么样的scaling law?

三种AI文本,三种命运

论文区分了三种AI文本:

  1. 模型坍塌数据(Model Collapse):模型在自己输出上递归训练产生的退化数据。研究表明这会导致模型逐渐失去多样性,最终坍塌。

  2. 合成数据(Synthetic Data):刻意生成的训练数据,通常经过精心设计(如rephrasing、instruction tuning),目的是提升特定能力。

  3. 野生AI文本(Wild AI Text):AI为人类读者写的内容——博客、新闻、评论、文档——自然出现在网页上,混入预训练语料。

前两种已经被研究过。第三种是这篇论文的焦点,也是最接近真实预训练场景的数据类型。它来自多个模型,质量参差不齐,没有标签,和人类文本混在一起。

800个模型的实验

为了回答这个问题,团队预训练了800个模型,参数从19.9M到973M,在固定的人类语料上添加不同比例的野生AI token(从0到64个AI token/人类token)。

评估在三个人类文本基准上做:C4、FineWeb、Paloma,同时也在AI文本上评估。

关键发现可以浓缩为一句话:AI文本只对"数据饥渴"的模型有帮助,对"数据充足"的模型有害。

核心发现:阈值效应

发现1:AI文本在低数据区有益,高数据区有害

当人类数据少于每参数10个token时(即数据饥渴区),添加AI文本能降低人类文本的loss。但从Chinchilla最优的20 tokens/parameter开始,AI文本的收益消失,继续添加反而升高loss。

对比实验:同样数量的新鲜人类文本仍然能降低loss。也就是说,AI文本不是"等价于人类文本的额外数据"——在数据充足时,它是有害的。

发现2:AI文本更容易通过质量过滤

这是一个令人不安的发现。FineWeb的质量过滤器会移除低质量内容,但AI生成的文本比人类文本更容易通过过滤。这意味着随着AI文本比例上升,质量过滤后的语料中AI占比反而更高——过滤器在无意中"提纯"了AI文本。

发现3:AI文本不遵循Chinchilla scaling law

Chinchilla scaling law描述了模型loss随参数和数据量的幂律关系。但用AI文本训练的模型不遵循这个规律。论文拟合了专门的scaling law来描述AI文本的行为,发现它有自己的一套参数。

发现4:最优AI占比取决于数据量

在C4上,当人类数据极少(5 tokens/parameter)时,最优AI占比是37%。但当数据量增加到Chinchilla最优水平时,最优AI占比降到1%以下。

发现5:重复人类数据 vs 添加AI数据

一个实际的问题:如果你已经把人类数据用了一遍,是重复用一次更好,还是加AI文本更好?

答案取决于数据量。在数据饥渴区,加AI文本比重复人类数据更好。但在数据充足区,重复人类数据反而比加AI文本更好——虽然两者都不如新鲜人类数据。

发现6:训练在AI文本上会改变模型的写作风格

模型在AI文本上训练后,生成文本的风格会向AI文本的风格偏移。这意味着预训练数据不只是教模型知识,还在教模型"怎么写"。如果预训练语料中AI占比持续上升,未来的模型可能在写作风格上越来越趋同——这是一个潜在的多样性危机。

实用建议:把AI和人类文本当作不同域

论文最重要的实用建议是:把AI文本和人类文本当作不同的数据域来处理,在训练和评估中都要分开。

在训练时,这意味着:

  • 不要把AI文本混入人类语料当作"等价数据"
  • 如果数据饥渴,可以加AI文本,但要控制比例
  • 如果数据充足,过滤掉AI文本可能更好

在评估时,这意味着:

  • 在人类文本和AI文本上分别评估
  • 只报告混合loss会掩盖AI文本的影响

预测:2026-2032的AI文本趋势

论文预测了未来AI文本在网页中的占比趋势。如果当前趋势持续,到2032年(人类公开文本预计耗尽的时间点),AI文本可能占据网页的绝大部分。这创造了一个正反馈循环:模型训练在AI文本上→生成更多AI文本→进入下一轮预训练语料→...

这不是模型坍塌——模型坍塌是递归训练在自己输出上。这是更微妙的"野生AI文本污染":多个模型、多代模型产生的文本混合在一起,质量分布和风格分布都在变化。

我的思考:数据质量的"测不准原理"

这篇论文让我想到一个更深的问题:当27.5%的网页是AI生成的,"网页数据"这个概念本身正在失去意义。

过去,"网页文本"="人类文本"。现在,"网页文本"=人类文本 + AI文本,而且AI比例在加速上升。我们用来训练模型的数据源,正在被我们训练的模型所改变。

这有点像量子力学的观察者效应:测量行为改变了被测量的对象。 我们用网页数据训练模型→模型生成内容进入网页→网页数据变了→下一代模型训练在不同的数据上。

论文的一个发现特别值得警惕:AI文本更容易通过质量过滤。这意味着质量过滤器不是中性的——它对AI文本有偏好。这可能是因为AI文本通常更"干净"、更"格式良好"、更"像高质量文本"。但"像高质量"和"是高质量"不是一回事——这正是"合理化外壳"谱系的又一个实例:AI文本擅长通过质量检测,但通过质量检测不等于有质量。

另一个值得思考的点:Chinchilla scaling law在AI文本上失效。这意味着我们过去用来规划预训练预算的数学工具,在AI文本时代可能不再适用。我们需要新的scaling law——而这篇论文就是朝这个方向迈出的第一步。


论文链接:https://arxiv.org/abs/2609.40295

代码仓库:https://github.com/pangramlabs/WildAI

HTML全文:https://arxiv.org/html/2609.40295v1

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录