一九五六年,埃舍尔刻下石版画《画廊》,并写下他的困惑:「一个年轻人饶有兴趣地看着墙上一幅展品,而展品里正是他自己。这怎么可能?」
近半个世纪后,有数学分析给出了这把锁的钥匙:整幅画与一张未扭曲的源图之间,隔着一个共形幂映射 z 映射到 z 的 α 次方。
这篇论文接着做了一件更过分的事:不再满足于解构那一张画,而是让机器生成新的自指涉场景。而且用的是冻结的文生图扩散模型——具体说是 FLUX.1-dev,半精度,128 步流匹配,1024×1024。权重一个字没改。
三条路都撞墙
作者把能试的笨办法都试了一遍。只靠提示词不行,递归约束不住。后处理也不行——先正常生成一张图,再做几何变换,结构接不上。在采样过程中施加变换同样不够:去噪器会把你想造的畸变「修」回去,或者干脆漂出规定几何。
于是他们造了一个更精巧的零件:为非可逆变换 T 构造广义逆 T†,让它适配递归约束。理想化表述下,Penrose 恒等式 T 乘 T† 乘 T 等于 T 成立,T 乘 T† 就成了到「几何可行图像集」上的幂等投影——一张合规的图,绕一圈回来还是它自己。
但光有投影还不够。只对变换后的图去噪,仍然是分布外任务。所以他们把去噪步骤和 T、T† 编织在一起:源空间的那一步负责搭未扭曲的场景,变换空间的那一步负责精修它在最终几何里的外观和连接。用作者的话说,这不是扭曲一张已经完成的画,而是让场景和它的畸变一起长出来。
必须补的一盆冷水
这篇的画面是真的漂亮,但它的评测是真的空。
论文自己写的是:「We evaluate qualitatively」——我们做的是定性评估,靠肉眼看递归布局和小图里的内容。没有 FID,没有 CLIP,没有人工用户研究,没有任何样本量统计。基线对比(纯提示、加长提示、后处理变换)在图 8 里全是并排的图片,原文只能说一句「它们看起来合理但缺少嵌套结构」,没有一个计数或评分。
全文唯一像数字的东西,藏在附录 D:幂等残差 0.011、0.012、0.014。而作者自己补了一句,这三个数「都在双线性重采样的地板上」,而且它并不保证最终去噪图像的一致性。
还有一处措辞要收紧。Penrose 恒等式让它成了幂等映射,但论文明确声明:这不是 Moore–Penrose 意义上的最近点投影,没有「最接近」的保证。中文读者容易把「投影」自动脑补成「最优投影」。
最后,代码与数据没有开源声明,只给了一个项目页动画。作者的局限一栏也老实地列了:固定的递归中心可能错过想要的主体;可选的「时间旅行」步骤有时候会放大接缝而不是抹平它;有限分辨率加上后续去噪,让连续域里的恒等式在最终位图里只是近似成立。
一句话总结这篇的处境:数学那一半是焊死的,视觉那一半是目测的。它证明了一个漂亮构造能跑起来,但还没证明它能稳定地跑对。
不要扭曲一张画完的画,让画面和它的畸变一起长——但长成什么样,它还没学会打分。