写作圈流传着一张判别清单,列着十几条"一看就是 AI 写的"标志:破折号太多、比喻太多、总在自问自答、句子长短太均匀。这张清单在社交媒体上反复传播,快要变成常识了。
可是从来没有人拿秤称过。
GitHub 上的开源项目 lieflat-less-ai-tone 做了这件事。研究者把 629 篇文章(生成侧 300 篇,覆盖 Claude、DeepSeek、Gemini、GPT、Kimi 五个模型;人类侧 329 篇)堆在一起,总计 2,826,972 个汉字、95,551 个句子、45,721 个段落,逐项称量那张流行清单上的 26 个条目。
称出来的数据推翻了清单里的大部分条目。
1. 称反了的那些条目
先看三组被推翻的数据。
比喻。 人类作家每千字使用比喻标记的频率是生成文本的 2.4 倍,以比喻独立起段的频率是 8 倍。流行清单认定"AI 爱用比喻包装概念",实测方向相反。差异在于喻体选择:生成文本偏好"像一位智慧的导师""一个永不疲倦的审查员"这类理想化职业人设(\(R = 7.3\));人类更常写"像一个老师傅""像人脉很广的医生朋友"。前者在抒情,后者在说明。
设问。 人类正文中的设问句频率是生成文本的 17 倍。按"删掉设问"这条流行建议改写文章,会把文章推得离人类写作更远。
句长均匀度。 研究初期的确测出过"AI 句长均匀度为人类 51 倍"这个数字。后来查到原因:断句程序没有过滤 Markdown 表格和无句末标点的列表项,导致某组句长标准差被算成了均值的 27 倍。修正切分程序后重新测算,比值是 0.87——两边没有差异。
| 流行清单条目 | 流行判断 | 实测频率比 \(R\) (AI ÷ 人类) | 实际结论 |
|---|---|---|---|
| 比喻修辞 | "AI 专属" | 0.42 | 人类用得更多,2.4 倍于 AI |
| 正文设问句 | "AI 专属" | 0.06 | 人类用得更多,17 倍于 AI |
| 句长均匀度 | "AI 太整齐" | 0.87 | 无差异,初期数据因程序缺陷失真 |
| 句内同构排比 | "AI 爱排比" | 接近 1.0 | 无差异,人类同样使用 |
频率比 \(R\):生成文本中某特征的出现频率除以人类文本中的出现频率。\(R \ge 2.0\) 说明 AI 明显更高;\(R < 0.8\) 说明人类更高。
2. 真正称出差异的 11 项特征
26 项里通过检验的有 11 项,集中在篇章结构和句法层面。以下是区分力排前几位的。
段首零回指评论(\(R = 4.4\),区分力最高)。 新段开头直接写"值得注意的是""听起来像一条功能描述",不交代在评论什么,读者必须翻回上一段去找。段首衔接词的总密度两侧几乎一样(人类 15.1%,AI 14.4%),差异只在评论句省掉了回指对象。补一个"这"字就能修复。
冒号引出空转列表(\(R = 9.4\))。 一句话不含任何信息,只用来宣布"下面有个列表",以冒号结尾,紧接着就是编号或列表项。人类侧各组都接近零。
拟人化虚妄喻体(\(R = 7.3\))。 把工具比作"一位智慧的导师""贴身的数字秘书",喻体后面通常跟着一串褒义修饰。比喻本身不是问题(人类用得更多),有问题的只是这一类悬浮人设。
对举结构(\(R = 3.4\))。 "不是 A 而是 B""并非……而是……"——在没有矛盾需要修正的地方强行制造翻转。
具体数字密度(\(R = 0.35\),反向)。 人类文本中数字出现密度是 AI 的近 3 倍。AI 爱写"显著提升""大幅优化",人类更常给出确切数值。
段首零回指评论:在新段落开头直接输出主观评价,但省略了代词(如"这项设计""这一现象"),导致评价对象不明,读者被迫回溯猜测。
3. 同一特征在不同模型上差了 47 倍
破折号使用频率,DeepSeek 每千字 5.16 次,Claude 4.25 次,GPT 只有 0.11 次。极差接近 47 倍。
提示性冒号最高的是 DeepSeek 和 Claude,问句小标题最高的是 Gemini,对举结构最高的是 GPT。基于单一模型样本总结出的规律换个模型就不成立,研究初期有多项误判就来自样本量太小。
这组数据说明一件事:不存在统一的"AI 文风"。用某个模型的怪癖去套所有文本,规则很快就会失效。
4. 从统计到执行:改写只动 11 项,其余逐字保留
研究者把 11 项通过检验的特征转写成了可执行的改写规则(发布为 SKILL.md),同时设了三道硬约束。
白名单原则。 只处理清单内的 11 项。没有命中任何规则的句子逐字保留,标题层级、段落顺序、列表结构不动。
信息守恒。 改写后每个实词必须能在原文里指出出处。不能新增姓名、数字、日期、因果,也不能删掉原文的限定词("可能""通常""据说")。把"可能提升"改成"提升"属于篡改判断强度。
排除主观语义判断。 比喻贴不贴切、设问有没有必要、并列案例算不算堆砌——这三类判断依赖语义理解,无法转写成可执行算子。写进规则只会诱导执行者按主观语感乱改,一律不做处理。
5. 六次翻车记录
研究报告里列出了六次测量失误,全部是正则算子的匹配范围比规则定义宽。
比较典型的一次:初期测过长前置定语频率是 3.04/千字,看起来差异很大。检查命中实例后发现算子把普通短句也纳入了,修正后降到 0.35。另一次:比喻标记算子用了 11 个固定词项的查找表,实际比喻表达全不在表内,初期测出 0.000,修正后 \(R = 0.42\)(人类更高)。
六项里有四项如果没修正,会直接写进规则集,其中两项方向相反——按错误规则改写的文章,会比改写前更像 AI。
📚 考据与开源档案
-
开源项目:
- 名称:Lieflat Less AI Tone(去AI味.skill)
- 作者:Larashero & Moxt 开源社区(2026)
- 仓库:github.com/larashero3-dotcom/lieflat-less-ai-tone
- 语料规模:629 篇文章,2,826,972 汉字,95,551 句,45,721 段
- 覆盖模型:Claude claude-opus-4-6、DeepSeek deepseek-v4-pro、Gemini gemini-3.1-pro、GPT gpt-5.6-sol、Kimi kimi-k3
- 核心结论:26 项候选特征中 11 项通过检验,15 项无区分力(其中比喻、设问方向与流行认知相反)
-
语料库语言学基础文献:
- Biber, D. (1988). Variation across speech and writing. Cambridge University Press.
- 创立了多维度-多特征语料库计量框架,为机器生成文本与人类文本的篇章特征差异分析奠定了方法论基础。
#去AI味 #语料库语言学 #文本分析 #大语言模型 #写作 #智柴系统实验室🎙️ #智柴
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。