欢迎访问本站,持续更新中…

Krea 2 开源 12B 图像模型:技术报告里的细节才最有趣

2026-06-25

我更关注 SWE-bench 而不是 HumanEval,同样地,在图像生成领域,我更关注技术报告里的训练细节而不是生成样张。

样张谁都能挑最好的几张,但模型能不能在现实场景下稳定出图——那是另一回事。

所以当 Krea AI 发布 Krea 2 的时候,我第一时间不是去网站刷生成示例,而是直接翻到了他们的技术报告。

12B 参数,开放权重。

这是 Krea 2 最亮眼的数字。12B 参数级别的文生图模型,权重完全开放。相比 Ideogram 4、Flux.2 Klein、Qwen-Image 这些最近活跃的开源模型,Krea 2 在参数规模上直接站到了第一梯队。

但参数数量只是故事的一半。

更关键的是 Krea 在训练基础设施上花了大量篇幅做记录——这在开源模型的技术报告里很少见。大多数团队只告诉你"我们用了多少数据、跑了多少步",但 Krea 把数据管线、训练调度、分布式策略都写出来了。

怎么说呢。这才是真正有意思的部分。

比如他们的训练流程:先训一个"Raw"版本(未蒸馏的完整 12B 模型),然后再蒸馏出一个"Turbo"版本。Raw 版本保证最精确的语义理解和对 prompt 的遵从度,Turbo 版本则优化了推理速度。

Krea 2 模型架构图,展示 Raw 12B 与 Turbo 12B 两路蒸馏流程

我原本以为 Turbo 就是单纯剪枝+量化压缩。后来发现不是——Krea 用了类似 progressive distillation 的方法,让 Turbo 模型学会模仿 Raw 模型的输出分布,而不是简单地砍参数。

这意味着什么?如果你用 LoRA 微调,Krea 官方建议在 Raw 版本上训练,然后把 LoRA 权重应用到 Turbo 版本上做推理。这样既保证了微调的精度,又享受了推理的速度。

嗯,有那味儿了。

Flux.2 Klein 社区之前搞过一个"turbo slider LoRA"——本质上就是拿蒸馏前后的权重差做一个 LoRA,让用户可以在推理时动态调节"遵从 prompt"和"生成质量"的平衡。Krea 2 的设计天然就支持这种玩法,因为 Raw 和 Turbo 的权重本身就是开源的。

社区的力量。这才是开放模型该有的生态。

Krea 的 HN 帖子里,创始人 mattnewton 还提到了一件事:发布时间线很有趣——在 Ideogram 4、Flux.2、Qwen-Image 密集发布的这一个月里,Krea 2 算是最新的一家。

竞争很激烈。

但 Krea 有自己的差异化:他们把训练基础设施写得很详细。大多数模型发布就贴个论文链接跑路,Krea 2 的技术报告包含了大量"我们试了这个配置不行、换了那个配置才成功"的真实实验记录。

举个具体例子:他们讨论了数据质量 vs 数据规模之间的权衡。在某个阶段,单纯加数据反而让模型变差了——因为低质量数据稀释了高质量信号的占比。他们不得不重新设计数据过滤管线,按照图像的美学质量、文本对齐度、内容多样性等多个维度做分层采样。

训练数据过滤管线流程图,多层级质量筛选到最终训练集

盯着屏幕愣了三秒。这玩意儿说起来简单,做起来是真的痛苦。我做过数据集清洗,知道这种事情有多恶心。

当然,Krea 2 也不是没有争议。

HN 上关于内容安全策略的讨论挺热烈的。Krea 对开源版本做了"alignment training"——说白了就是内容过滤,防止生成 NSFW 内容。有用户批评说这等于"阉割"了模型能力。Kouteiheika 一针见血:不做的话下一个新闻就是"Krea 因为生成违规内容被推上风口浪尖"。Grok 之前出过什么事,大家都记得。

安全对齐和模型能力的平衡,这个命题在图像生成领域比文本模型更难解。因为图像的"违规"边界比文本模糊得多——一张医学解剖图,在某些语境下是教育材料,在某些语境下就是暴力内容。

谁来做这个判断?目前没有好答案。

回到模型本身。Krea 2 在 GitHub(github.com/krea-ai/krea-2)上已经开源,支持 Hugging Face Diffusers、ComfyUI、Ostris、Fal 等多个推理框架。开发者可以用 LoRA 在自己的数据集上微调,或者直接用 Raw 版本做进一步的 RLHF 训练。

Krea 2 开源生态展示,Hugging Face 模型卡、ComfyUI 工作流和 GitHub 仓库

12B 的模型跑起来不算轻——至少需要 24GB 显存才能跑 Raw 版本的 FP16 推理。但 Turbo 版本经过蒸馏后,在 16GB 显存的消费级显卡上也能跑。

卡——死——了。不是模型卡,是我想到 16GB 显存现在都叫"消费级"了。2022 年我还在用 8GB 的 RTX 3080 呢。

不过这就是图像模型的现实。参数量在涨,质量在涨,硬件门槛也在涨。

从 Flux.1 到 Flux.2 到 Krea 2,十二个月时间,开源图像模型走完了过去闭源模型三年才走完的路。而且这次,权重是真的开放了——不是那种"开放但需要申请"的假开放,而是可以直接从 Hugging Face 下载的真开放。

谁在乎?反正我在乎。

关于维基框架

维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。