静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-09-20 03:00

旋钮里的去噪:用一台旧电视理解扩散模型

一台 1987 年的电视,和 2026 年的 AI

伦敦的一个展厅里,摆着一台 GoldStar CMX-4200 13 寸 CRT 电视,生产于 1987 年。它的外壳泛黄,屏幕微微凸起,天线是那种老式的金属拉杆。观众走过来,随手拨弄天线——画面从一片雪花逐渐变清晰,一只渡渡鸟的轮廓浮出来,发出低沉的鸣叫。

这不是复古电器展,而是一个 AI 艺术装置。屏幕上播放的渡渡鸟不是真实影像,而是 Stable Diffusion XL 生成的 AI 图像。观众拨弄天线的过程,实际上是在控制扩散模型的去噪步骤——天线角度对应去噪进度,从纯噪声到清晰图像。

这是 2026 年 Sihwa Park 的作品 Diffusion TV,一篇发表在 arXiv 上的论文兼艺术装置。它做了一件罕见的事:把扩散模型最核心的数学过程——去噪——变成了一次物理体验

被隐藏的中间状态

扩散模型的原理,用一句话说就是"从噪声中雕刻图像"。模型从一张纯噪声开始,逐步去掉噪声,最终浮现出有意义的图像。这个去噪过程通常需要 20-50 步,每一步都会产生一个中间状态——从混沌到半成型到清晰。

但这些中间状态在常规使用中是隐形的。你用 Midjourney 生成一张图,看到的是最终结果,中间那 50 步从噪声到图像的演化过程被完全跳过。即使有些工具能展示去噪过程,那也只是一个进度条或一个快进动画——你看着它变清晰,但你无法"介入"这个过程。

Park 的洞察是:去噪过程本身就是值得体验的。扩散模型不只是一个"输入提示词、输出图片"的黑盒,它的中间状态蕴含着模型"思考"的痕迹——从混沌中逐渐浮现结构的过程,和人类创作时的"从模糊到清晰"有某种共鸣。

但如何让观众"体验"去噪?屏幕上的动画太被动了。Park 选择了更直接的方案:让观众用手控制去噪进度

天线即去噪旋钮

Diffusion TV 的技术架构出人意料地朴素。一台 1987 年的 CRT 电视,一台 Raspberry Pi 5 作为控制器,一个 HDMI 转 RF 的调制器把数字信号变成电视能接收的模拟信号。

关键的交互设计在天线上。电视的拉杆天线通过 3D 打印的连接器固定在一个旋转编码器上。观众转动天线的水平角度,编码器把角度转换成连续的控制信号,映射到去噪步骤的索引——转到最左边是第 0 步(纯噪声),转到最右边是最后一步(完全清晰的图像)。

电视的 VHF 调谐器旋钮也没闲着——它连着一个磁性编码器,用来切换"频道"。Diffusion TV 有三个频道:

Past 频道:16 种已灭绝动物。渡渡鸟、袋狼、旅鸽、巨狐猴……每种动物都用 Stable Diffusion XL 生成图像,用 Stable Audio Open 生成声音。观众看到的是 AI 对已逝生命的想象——这些物种的真实影像大多不存在,AI 的生成本身就是一种"数字复活"。

Present 频道:14 种现存濒危动物。雪豹、苏门答腊猩猩、长江白鳍豚……这些物种还活着但正在消失。AI 生成的图像和声音来自真实的保护数据,但经过了风格化处理。

Future 频道:12 种"推测物种"。这些动物完全不存在——它们是 ChatGPT o3 根据环境变化趋势"预测"会出现的物种。有适应海洋酸化的珊瑚共生体、有进化出塑料代谢能力的细菌群落、有在北极冰盖融化后出现的新型两栖哺乳动物。

三个频道形成了一条时间线:过去(已失去)、现在(正在失去)、未来(可能到来也可能不会)。观众在频道间切换,就像在时间轴上滑动。

为什么用旧电视

Park 选择 CRT 电视不是随意的怀旧。论文中有一个概念叫"媒体考古学"(media archaeology)——旧技术不是过时的遗物,而是理解新技术的镜子。

CRT 电视有几个特性让它成为扩散模型的完美隐喻:

1. 物理旋钮的具身性。 触屏上的滑块是抽象的——你的手指在玻璃上滑动,数字在后台变化。但天线的旋转是物理的——你能感受到金属的阻力,看到天线的角度变化,听到旋钮的咔嗒声。这种身体参与让"控制去噪进度"从一个抽象操作变成了一个具身体验。

2. 雪花噪声的视觉共鸣。 CRT 电视的雪花屏和扩散模型的初始噪声在视觉上高度相似——都是无意义的随机像素。当观众看到雪花屏上的渡渡鸟从噪声中浮现,他们不仅在"看 AI 生成图片",也在经历一个"从信号到意义"的过程。这和调电视找信号的体验天然共鸣——你转天线,信号从模糊变清晰,就像你转旋钮,图像从噪声变清晰。

3. 频道切换的时间隐喻。 电视换台是一个有物理感的动作——咔嗒一声,一个世界消失,另一个世界出现。Park 把三个频道设计成 Past/Present/Future,让换台变成了时间旅行。这比在屏幕上点"上一个/下一个"有更强的仪式感。

体验式 AI 可解释性

Diffusion TV 不只是一个艺术作品,它代表了一种 AI 可解释性的新路径。

传统的 XAI(Explainable AI)试图用技术手段解释 AI 的决策过程——注意力热力图、梯度可视化、特征归因。这些方法对研究者有用,但对普通公众来说门槛太高。你把一张注意力热力图给一个不懂深度学习的人看,他看到的只是一张彩色斑点图,不知道该从中获得什么理解。

Park 的论文引用了一个概念叫"体验式 AI"(experiential AI)——不通过技术解释,而通过物理体验来传达 AI 的工作原理。观众不需要知道什么是"去噪步骤""DDPM""latent space",他们只需要转动天线,就能"感受到"扩散模型的核心机制:从噪声到图像是一个渐进过程,每一步都在去掉一点噪声、增加一点结构

这和"可触碰 AI"(tangible AI)的理念一脉相承。不是所有理解都需要通过语言和数学——有时候,让身体先理解了,大脑自然会跟上。一个孩子转动 Diffusion TV 的天线,看到渡渡鸟从雪花中浮现,他不需要任何数学知识就能直觉地"懂"扩散模型在做什么。这种理解是前语言的、具身的,但恰恰因此更深刻。

艺术作为桥梁

Diffusion TV 最值得关注的不是它的技术实现——Raspberry Pi + 旋转编码器 + Stable Diffusion,任何有经验的创客都能做出来。它的价值在于提出了一个问题:AI 的内部过程,能不能通过艺术体验来传达?

当前 AI 可解释性的主流路径是"更精细的技术可视化"——更清晰的注意力图、更准确的特征归因、更可解释的神经元。这条路对研究者有效,但有天花板:它永远在用"看"来理解 AI,但 AI 的工作方式不全是视觉的。

Park 的装置提出了另一条路:用"做"来理解 AI。转动天线就是在做去噪,切换频道就是在做条件生成。观众不是在"看"AI 的解释,而是在"操作"AI 的过程。这种从"看"到"做"的转换,可能是打破 AI 黑盒的更有效方式。

当然,Diffusion TV 只是一个起点。它的交互还比较简单——一个旋钮控制一个维度(去噪进度)。更复杂的模型(如 LLM 的思维链、RL 的探索过程)能不能也用类似的方式具身化?这还是一个开放问题。但 Park 至少证明了:旧电视的天线旋钮,可以成为理解最前沿 AI 的接口

有时候,理解新事物最好的方式,不是造一个更新的工具,而是找一个足够旧的、足够熟悉的、足够"上手"的东西。

---

*论文:Diffusion TV: Experiencing Diffusion Models through Tangible, Embodied Interaction* *作者:Sihwa Park* *arXiv: 2609.05404* *项目页:sihwapark.com*

👍 1