2026-06-25 · 📦 产品← 本期
Krea 2: SOTA open-weights 12B image model

先说为什么这条值得停下来看。文生图这两年的高分模型几乎都是闭源 API——你能调用,但拿不到权重,更别说在自己机器上微调或做后训练研究。Krea 2 的不同之处在于它是开源权重的基础模型,而且不是凑数级别:在 Artificial Analysis 的文生图榜单上进入前十,在独立实验室(非大厂)出品的模型中排到第二。对开放阵营来说,这是难得一次在排行榜上贴近第一梯队的开放底座。
它一次给了两个变体,分工很清楚。K2 Raw 是未经蒸馏的基座模型,定位是"给你拿去微调和做后训练研究"——保留完整的生成能力和可塑性,适合作为下游工作的起点。K2 Turbo 则是经过引导蒸馏和时间步蒸馏的版本,目标是少步数的快速生成;换句话说,一个偏"底座/可改",一个偏"开箱即用、出图快"。这种"基座 + 快版"双发的做法,正好覆盖了研究者和工程落地两类不同需求。
架构上,Krea 2 是一个扩散 Transformer(DiT)。这里解释一下几个技术锚点:DiT 指的是把扩散模型的去噪主干换成 Transformer,相比早期的 U-Net 卷积结构更易扩展;它采用单流(single-stream)的 Transformer 块,让文本 token 和图像 token 共享同一套注意力和 MLP 权重,而不是各走各的双流通路;注意力用的是分组查询注意力(GQA,多个查询头共享一组 KV,省显存省带宽)并配合门控 sigmoid 注意力。文本编码器用的是 Qwen 3 VL,并对其多层特征做聚合;自编码器侧同时用到了 Qwen Image VAE 与 FLUX 2 VAE。
训练是多阶段流水线:先做预训练(分辨率从 256px 逐级提到 512px、再到 1024px 的渐进式训练),然后是中训练、监督微调、偏好优化(用了一个自研的 STPO 变体),最后还接了一段基于多奖励 GRPO 的强化学习。其中低分辨率阶段用了 8-bit 训练,技术报告称带来约 15—20% 的训练速度提升;Turbo 的时间步蒸馏走的是轨迹分布匹配(TDM)路线。模型还附带了 prompt 扩写器和风格参考系统。
License 和可获取性是这条新闻的落点:权重和推理代码以"宽松协议"发布,并在 Hugging Face 与 GitHub 上做了开源放出。对做图像生成产品、想摆脱闭源 API 依赖的团队,以及想在一个高排名开放底座上继续研究的人,这是当下不多见的实在选项——你可以直接下载、自部署,甚至在 K2 Raw 上接着训。
诚实的保留:榜单名次(前十、独立实验室第二)来自 Artificial Analysis 这一第三方评测,是相对排名而非绝对画质保证,具体观感仍需自行验证。另外,标题里带的"12B"参数量这一点,技术报告页面本身并未展开说明参数规模与具体推理速度指标,宽松协议的确切条款也以官方发布为准。素材里没有给出的细节,这里不做推测。