你以为你在画"埃及客厅",AI 偷偷帮你加了金字塔
想象一下:你打开 DALL-E,输入"一个客厅"(用阿拉伯语写,带上"埃及"作为上下文)。你期待看到开罗某户人家的沙发、茶几、电视。但你拿到的是——金字塔、狮身人面像、象形文字装饰。
你以为这是图像模型的"理解"出了问题?不。问题出在你和图像模型之间那个你看不见的层——prompt 修订层。在你按下回车之后、图像生成之前,系统已经悄悄把你的"一个客厅"改成了"一个带有金字塔和法老装饰的埃及客厅"。
图像模型只是忠实地画出了它收到的指令。真正"加料"的,是中间那个幽灵。
今天这篇论文做了一件此前没人做过的事:把 T2I 系统的管道拆开,单独审计那个隐藏的修订层。结果触目惊心。
一、被忽视的幽灵层
商业文生图系统(DALL-E-3、Imagen-4、GPT-Image-1.5)并不是"一个模型"。它是一条流水线:
用户输入 → [prompt 修订层] → 修订后的 prompt → [图像生成模型] → 最终图像
那个 prompt 修订层做什么?它"优化"你的输入——补充细节、添加风格描述、确保安全。问题是:
- 用户看不见它改了什么——API 返回的是最终图像,修订后的 prompt 需要专门请求才能拿到
- 用户关不掉它——商业系统把这个层当核心竞争力,不提供关闭选项
- 此前的偏见审计全部跳过了它——所有现有研究都把"输入→输出"当成黑盒,只看最终图像的文化偏见
这就像审计一家工厂:你只检查出厂的成品,却没检查流水线上那个偷偷加料的工人。
二、三步审计法:WORLDVIEW 基准
论文构建了 WORLDVIEW 基准,包含 8,960 条 prompt,覆盖 15 种语言 × 31 个语言-文化配对,横跨 14 个领域(家庭、交通、政治、宗教、工作、假期等)。每个 prompt 有两个版本:
- 基线版:英文,不带任何地理标记("a living room")
- 上下文版:翻译成对应语言,加上地理标记("a living room in Egypt",用阿拉伯语)
然后对三个商业系统的修订层做三步审计:
第一步:语境标记度(CMS)——谁被改得最多?
CMS 测量修订层对"带文化上下文的 prompt"做了多大改动,相对于"不带任何标记的英文基线"。
结果是一条清晰的"标记阶梯":
| 上下文 | CMS 范围 | 含义 |
|---|---|---|
| 美国 | 0.21–0.31 | 几乎不改——美国就是"默认值" |
| 英国 | 0.24–0.35 | 略改——盎格鲁圈是"近默认" |
| 德国 | 中等 | 欧洲核心圈 |
| 芬兰 | 最高(达 0.47) | 改动最大——离盎格鲁默认最远 |
| 中东/北非 | 高 | 阿拉伯语境被大量"补充" |
核心发现:美国是"无标记默认"。系统对"美国的客厅"几乎不做任何文化补充——因为它默认客厅就是美国的客厅。但对"埃及的客厅",它会大量添加"文化元素"。
这就像一个只吃过麦当劳的人,去哪家餐厅都说"给我加个汉堡"——对他来说,汉堡不是"一种食物",而是"食物的默认形态"。
第二步:文化压平度(CFS)——是不是用几个词概括了整个文化?
CFS 衡量修订层是否把每个文化压缩成了一组狭窄的关键词,然后不分场合地塞进所有 prompt。
它由两个子指标合成:
- 词频集中度:插入的词汇中,有多少是"该文化专属"的?
- 词频扩散度:这些专属词出现在多少个不相关的 prompt 里?
只有两者都高,才算"压平"——用少量词汇覆盖一切场景。
结果:
- 瑞士:CFS 最高。"alps"、"chalet"、"chocolate"、"fondue" 出现在 77-96% 的 prompt 里——不管是客厅、政治集会还是广告
- 芬兰:"snow"、"pine"、"northern"、"birch" 出现在几乎所有 prompt 里
- 沙特:"desert"、"thobe"、"palm"、"islamic" 无处不在
- 埃及:"pyramid"、"sphinx"、"pharaonic"、"hieroglyph"——当代埃及被压缩成古埃及
- 墨西哥:"sombrero"、"mariachi"、"cactus"、"tacos"
注意 CMS 和 CFS 不是一回事。瑞士的 CMS 中等,但 CFS 最高——意味着修订层对瑞士的改动不算最大,但改动方式最"一刀切"。阿拉伯语境被大量修改(高 CMS),但修改内容相对多样(中 CFS)。瑞士被少量但无处不在的刻板印象覆盖(高 CFS)。
第三步:刻板内容分析——这些词是偏见吗?
定性检查每个文化的 top-20 TF-IDF 词,发现它们高度对应"可识别的文化刻板印象":
- 芬兰的广告 prompt 被加上"snow"——哪怕广告和雪毫无关系
- 埃及的政治 prompt 被加上"pyramid"——当代埃及的政治生活被法老化
- 墨西哥的家庭 prompt 被加上"sombrero"——家庭场景被民俗化
这些不是"文化代表性",是文化压平——把一个活生生的复杂社会压缩成旅游手册的封面。
三、因果链:修订层不只是"相关",是"原因"
以上三步只证明了"修订层有偏见"。但偏见是修订层引入的,还是图像模型本身的?论文做了一个精巧的因果实验:
实验设计:
- 取 GPT-Image 修订层输出的"修订后 prompt"和用户原始的"未修订 prompt"
- 把两种 prompt 分别喂给没有修订层的开源模型(SDXL Lightning 和 Flux-2-Dev)
- 对比两组图像的文化标记度
逻辑:如果修订层只是"顺应"了图像模型的偏见,那么用原始 prompt 和修订后 prompt 生成的图像应该差不多。如果修订层是偏见的来源,那么修订后 prompt 的图像应该明显更刻板。
结果:
- 修订后 prompt 的图像 CMS 显著更高(Wilcoxon 检验 p < 0.001)
- CFS 从 0.75→0.86(SDXL)、0.85→0.98(Flux)——修订层让压平度飙升
- 英国 CMS 增幅最大(+34% SDXL、+52% Flux)
- 修订后专属词是"outback"、"kangaroo"(澳大利亚)、"cobblestone"、"pub"(英国)、"marigold"、"taj"(印度)——可识别的刻板印象
- 原始 prompt 专属词大多是"非文化噪音"
印度是部分例外:图像模型自己就会从原始 prompt 生成"bindi"、"dhoti"、"curry"——说明图像模型的训练数据本身也有偏见。但修订层额外加了"marigold"、"rangoli"、"taj"——另一套刻板印象。
关键结论:33-46% 的视觉刻板词汇在修订阶段就已经被注入了。图像模型只是忠实地执行了修订层的"指示"。
四、为什么这很重要?
1. 审计盲区定律的又一例
此前的 T2I 偏见研究把整个系统当黑盒,只看"输入→输出"。这就像审计一家工厂只看成品的合格率,却没检查流水线上那个加料工人的操作记录。
WORLDVIEW 的贡献是拆开管道:把"用户输入→修订层→图像模型→最终图像"分成两段,分别审计。结果发现偏见的主要来源不是图像模型,而是那个被忽视的修订层。
这和"判断-闸门解耦"同构:图像模型是"执行者",修订层是"决策者"。你修图像模型的偏见,就像修门锁——但钥匙在修订层手里。
2. "默认值"的政治学
论文最深刻的发现不是"埃及被加金字塔",而是美国不被加任何东西。
美国是修订层的"无标记默认"——系统对"美国的客厅"不做任何文化补充,因为它默认客厅就是美国的客厅。这就像"肤色"标签:白色不被标记,其他颜色都是"有色"。
这不是技术 bug,是数据殖民主义的体现。训练数据以西方互联网内容为主,修订层学到的"正常"就是西方的正常。非西方的一切都是"需要被补充的异常"。
3. 修复方向:修修订层,不只修图像模型
论文的因果实验有一个直接的工程含义:
一个忠实地执行输入 prompt 的图像模型,如果输入已经被修订层注入了刻板印象,它仍然会生成刻板图像。
所以只修图像模型是不够的。你需要在修订层做干预——要么让修订层对文化上下文更敏感(而不是用 5 个关键词概括一个国家),要么让用户能看到修订层改了什么、能拒绝特定的修改。
但论文也指出,修修订层也不够——训练数据、模型架构、评测范式的西方中心偏差都需要同步解决。修订层只是"一个新的、此前未被审视的干预点"。
五、方法论启发:可迁移的审计框架
WORLDVIEW 的三步审计法(CMS → CFS → 刻板内容分析 + 因果消融)不限于文化偏见。同样的框架可以用于:
- 性别偏见:生成不同性别的人在各种场景下的 prompt,用 CMS/CFS 测量修订层是否对某些性别"加料"更多
- 种族偏见:同理
- 职业偏见:看修订层是否对不同职业添加不同的"风格化"词汇
核心思路是通用的:把管道拆开,分别审计每个阶段,用因果消融确定偏见的来源。
六、个人思考:幽灵层的普遍性
这篇论文让我想到一个更普遍的现象:所有"优化用户输入"的中间层都是潜在的偏见注入点。
- 搜索引擎的 query rewriting
- 推荐系统的用户画像扩展
- 翻译系统的"意译优化"
- 编程助手的"代码风格修正"
这些中间层都有一个共同特征:用户看不见、关不掉、无法审计。它们被设计成"帮用户做得更好",但"更好"的定义由系统决定——而系统的"更好"默认值,往往就是"西方的、男性的、英语的"。
WORLDVIEW 给出的不只是"T2I 有偏见"这个结论,而是一个审计方法论:拆开管道、分别测量、因果归因。这个方法论适用于所有"用户输入→中间层→输出"的系统。
下一步的研究方向很清楚:把修订层的"黑盒"打开,让用户能看到"系统帮我加了什么",能选择"我不要这个补充",能自定义"我想要的文化代表性"。透明度和可控性,是比"修模型"更直接的解法。
论文:Urman, A., Lichtenegger, E., Hannak, A., et al. WORLDVIEW: Auditing the Prompt Revision Layer in Commercial Text-to-Image Systems. arXiv:2609.11532.
代码:github.com/aurman21/worldview_prompt-revision
数据:8,960 条 prompt × 3 个系统,覆盖 15 种语言、31 个文化上下文、14 个领域。匿名仓库可在论文中找到。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。