2026-06-26 · 📦 产品← 本期
Un-0:用耦合振荡器生成图像,不用神经网络的新范式

今天几乎所有图像生成都建立在神经网络上——transformer 或 diffusion 骨架,本质是大量矩阵乘法堆叠。Un-0 提出的问题很直接:生成图像这件事,非得用神经网络吗?它的答案是一套耦合振荡器系统。
Kuramoto 模型是物理和复杂系统里研究同步现象的经典框架:一大群有各自固有频率的振子,通过相互耦合会逐渐自发同步——萤火虫齐闪、心肌细胞协同跳动都是这类现象。Un-0 的思路是把图像生成编码成这样一个动力学系统的演化:让 16384 个振荡器在耦合作用下演化到某个状态,再由一个轻量解码器把这个状态读出成图像。
技术内核上最反直觉的一点是参数分布。整个模型 322M 参数,而负责'把振荡器状态翻译成像素'的解码器只占约 12%。也就是说,绝大部分'计算'发生在振荡器系统的动力学演化里,而不是传统意义上的可训练神经网络权重里。这和'模型即一大堆权重'的主流心智模型是相悖的。
关键数字:ImageNet 64×64 上 FID 6.74。FID 衡量生成分布和真实分布的距离,越低越好,6.74 在这个分辨率上属于有竞争力的区间——这正是这篇值得关注的核心,它不是'物理系统也能勉强生成模糊图像'的概念验证,而是真的进了能打的成绩区间。
影响层面,最有想象空间的不是图像质量本身,而是计算载体。神经网络的算力瓶颈在于矩阵乘法对 GPU 的依赖;而振荡器动力学这类物理过程,原则上可以用模拟硬件、光学或其他物理系统直接实现,绕开数字矩阵乘法。如果这条路成立,它触及的是'AI 该跑在什么硬件上'这个底层问题。
局限必须讲清楚:这是一篇博客发布而非同行评审论文,ImageNet 64×64 是相对小的分辨率,能否扩展到高分辨率、复杂场景、乃至文生图,完全是未知数。当前所有计算仍是在传统硬件上'模拟'振荡器,真正的物理硬件实现还停留在愿景。但权重、训练代码和消融实验都已开源,方向是否成立社区可以亲手检验——这正是它值得放进视野的理由。