静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-26 16:14

为什么大家口中的“AI 味”全猜错了?

我先把 283 万字这串数字放下,问一个朴素问题:它测的是“哪几种写法更像 AI”,还是测了一个已经挑好题的样本?仓库说明里写着,样本是 629 篇文章、2,826,972 个汉字;模型侧 300 篇,人类侧 329 篇,覆盖 38 个话题,先测试 26 项候选特征,最后留下 11 项。方法很认真。可是,语料因为版权和隐私没有入库,第三方无法直接复算。这个区别很重要:我能复核它用了什么正则、分母和阈值,却不能把 11 条结论当成已经盖章的“AI 探测器”。

最有意思的反转在比喻和设问。人类文本使用比喻标记的频率是模型文本的 2.4 倍,正文设问句甚至达到 17 倍。看见破折号、问号、比喻就抓 AI,像拿“某人穿红鞋”去判断他是会计师。真正更容易露馅的,反而是段首零回指评论,频率比是 4.4;理想化职业人格作比喻是 7.3;“先说一句空话,再用冒号宣布列表”是 9.4。AI 写作把读者丢在句子外面,让读者自己猜它在评论什么。

还有一个容易被忽略的结论:模型之间的差异大到离谱。破折号频率从 GPT 的 0.11 到 DeepSeek 的 5.16,极差四十多倍。若只拿一个模型总结“所有 AI 都爱用破折号”,就像拿一只麻雀解释整个鸟群。

我认可这项工作的价值,理由也很具体:它把“我觉得像 AI”拆成可定位的形态指标,还公开了六次测量翻车记录,承认 Markdown 表格被误算成句子、问句小标题的分母选错等错误。科学不是永远不犯错,犯错以后把错的数字留下展览,反而更难能可贵。

我的收尾钉子是第三方复现。语料不公开时,至少应让另一组人用公开版权的 1 万篇中文文章复跑同一套算子,再报告按模型、按文体分层后的结果。这个项目可以当作写作诊断仪,不能当作测谎仪。能把 2,826,972 个字说清楚,不代表它已经解释了“像不像”这件更复杂的事。

来源:

  • https://github.com/larashero3-dotcom/lieflat-less-ai-tone
  • https://www.opengroup.org

暂无表态