欢迎光临
我们一直在努力

一文读懂端侧文生图大模型MobileDiffusion的核心基础知识

写在前面

图片

欢迎大家关注Rocky的知乎:Rocky Ding AIGC算法工程师/开发工程师面试面经秘籍分享:WeThinkIn/Interview-for-Algorithm-Engineer欢迎大家Star~

AIGC时代的 《三年面试五年模拟》AI算法工程师/开发工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍

Rocky最新撰写AI Agent(AI智能体)的深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/33pJ0


大家好,我是Rocky。

核心导读

MobileDiffusion 这篇论文表面上是在讲一个更快的文生图模型,本质上是在回答一个更硬的问题:当生成式 AI 离开云端 GPU,真正进入手机、眼镜、车机、相机这类边缘设备时,模型设计到底要服从什么约束?

Rocky认为,这篇工作的价值不只是“0.2 秒在 iPhone 15 Pro 上生成一张 512×512 图片”这个结果,而是它把端侧生成拆成了两个可以被工程化处理的矛盾:第一,扩散模型的网络一次前向太重;第二,扩散采样需要多次前向。前者靠架构效率解决,后者靠一步采样解决。只有这两件事同时成立,端侧文生图才不再只是把大模型硬塞进手机,而是有机会变成一种新的本地实时交互能力。

在这里插入图片描述

图 1 是整篇论文的产品野心:文本生成、Canny 条件生成、风格 LoRA、局部重绘都在一步采样下完成。这里真正值得注意的不是样例是否已经达到最强云端模型的审美上限,而是同一个基座模型能否在端侧保持“快、轻、可扩展”。如果端侧生成只能做单一 demo,它的商业价值会很薄;如果它能承接插件、LoRA、inpainting 这些已有生态能力,它才可能进入真实工作流。

问题背景:作者到底想解决什么

扩散模型过去几年证明了一个事实:高质量图像生成可以被训练出来,但它通常以大参数量、多步采样、云端算力为代价。Stable Diffusion 这类 latent diffusion 模型已经比像素空间扩散高效很多,但在手机上仍然有两个硬障碍。

第一是网络结构。文生图 UNet 不只是卷积网络,它还包含大量 self-attention 和 cross-attention。注意力层在高分辨率 latent 上计算很贵,卷积残差块在高分辨率特征图上也贵。第二是采样过程。传统扩散模型不是一次出图,而是反复去噪;即使把几百步压到 20 步、8 步,在手机上仍然很难做到真正的即时交互。

这篇论文的目标不是做一个“稍微小一点的 Stable Diffusion”,而是把端侧文生图的系统目标前置:模型参数少于约 4 亿,FLOPs 控制在约 200G,采样最好只有一步,VAE 解码也不能成为瓶颈,同时还要保留对 ControlNet、T2I-Adapter、LoRA、inpainting 等下游模块的兼容性。

这就是这篇论文最有意思的地方:它没有把“移动端”当作部署后处理,而是把移动端预算写进模型设计本身。工具红利退潮以后,真正有价值的不是又做一个生成模型 demo,而是把生成模型变成一个可调度、可复用、可嵌入产品链路的系统资源。

核心思路:用一句主线串起来

MobileDiffusion 的主线可以概括为一句话:在 latent diffusion 框架内,重做一个面向端侧预算的高效 UNet 和轻量 VAE,再用经过重新审视的 UFOGen 式 adversarial fine-tuning 把采样压到一步,同时尽量保持原基座模型的下游插件兼容性。

这个主线包含三层含义。

第一,作者没有抛弃 latent diffusion。VAE 仍然把图像压到 latent 空间,文本编码仍然使用 CLIP-ViT/L14,核心生成网络仍然是带文本条件的扩散网络。也就是说,它不是另起炉灶,而是在已被验证的 Stable Diffusion 技术谱系里做系统减重。

第二,作者没有简单剪掉模块。他们认为真正的效率不是“越小越好”,而是把计算放在最划算的位置:低分辨率处保留更有价值的 transformer 表达,高分辨率处减少昂贵 self-attention,cross-attention 则因为文本条件仍然重要而尽量保留。

第三,一步采样不是孤立的加速技巧。论文真正关心的是,一步模型能不能继续使用原扩散基座上训练出来的插件和 LoRA。如果一步模型加速之后破坏了特征空间,那么速度再快也只是一个封闭模型;如果加速后仍能接住生态模块,它才有平台意义。

方法展开:沿着论文原始逻辑拆解

端侧友好的扩散架构:不是把模型砍小,而是重分配计算

论文第 3 节先处理架构效率。作者沿用 UViT 思路,用 UNet 逐步降低空间分辨率,再在更短的 token 序列上使用 transformer。这里的关键判断是:transformer 并不是绝对贵,贵的是在长序列、高分辨率上使用 transformer;如果把注意力计算放到低分辨率 bottleneck,单位计算的表达收益反而更高。

在这里插入图片描述

图 2 左侧说明整体 UNet 结构,右侧展示了高效 block。论文围绕 transformer 和 convolution 两类基础模块做了多项改造:把更多 transformer 层移到低分辨率瓶颈;在高分辨率处去掉 self-attention,但保留 cross-attention;共享 self-attention 的 key/value projection;把 GLU 里的 gelu 换成 swish;把 attention 的 softmax 通过微调替换为 relu;把 feed-forward expansion ratio 从 4 降到 3;卷积侧则用 separable convolution 和残差块裁剪降低计算。

这组设计背后的工程原则很清楚:端侧模型不是只看参数量,还要看算子对硬件是否友好。gelu 的近似里有三次项,softmax 涉及指数和归一化,二者在 float16、int8 或移动芯片上都可能不够友好。换成 swish、relu 不是为了追求论文上的“新颖激活函数”,而是为了让算子更贴近移动端硬件的吞吐路径。

论文用 Table 1 把 MobileDiffusion 与主流 latent diffusion 架构放在一起比较:

Models#Channels#ConvBlocks#(SA+CA)#Params(M)#GFLOPs
SD-XL (320, 640, 1280) 17 31+31 2600 710
SD-1.4/1.5 (320, 640, 1280, 1280) 22 16+16 862 392
SnapFusion (320, 640, 1280, 1280) 18 14+14 848 285
DiT XL/2 (1152) 0 28+0 675 525
MobileDiffusion (320, 640, 1024) 11 15+18 386 182

Table 1 的信息量很大。MobileDiffusion 的参数量约 386M,明显小于 SD-1.5 的 862M 和 SnapFusion 的 848M;GFLOPs 约 182,也低于 SnapFusion 的 285。更有意思的是,它并不是一味减少 attention。它的 SA+CA 是 15+18,cross-attention 数量甚至比 SD-1.5 更多。这说明作者的策略不是“去 transformer 化”,而是更精细地重排 self-attention、cross-attention 和卷积之间的预算。

如果把这一点抽象出来,它对端侧多模态模型也有启发:轻量化不是把所有贵模块平均剪掉,而是识别哪些模块对语义、布局、局部纹理分别有边际价值,然后在硬件约束下重新分配。

VAE 优化:端侧生成不能只盯 UNet

很多人谈扩散加速,只盯 denoiser。MobileDiffusion 的一个清醒之处在于:当采样步数被压缩到很少,VAE decoder 的延迟占比会突然变大。原来 50 步 UNet 前向时,decoder 只是尾部小开销;一旦变成一步生成,decoder 就可能变成系统瓶颈。

在这里插入图片描述

图 3 对比了输入、Stable Diffusion decoder、作者的 decoder 和蒸馏后的 decoder。论文选择

f

=

8

,

c

=

8

f=8, c=8

f=8,c=8 的 latent 设定,而不是 SD 常用的

f

=

8

,

c

=

4

f=8, c=4

f=8,c=4。这里有一个典型压缩权衡:通道更少意味着更强压缩、更低成本,但重建质量下降;通道更多则提升重建,但增加 latent 表达成本。作者选择

c

=

8

c=8

c=8,本质是在移动端成本与重建保真之间重新定点。

训练上,VAE 使用

L

2

L_2

L2 重建损失、KL 正则、感知损失和对抗损失;随后作者冻结 encoder,对轻量 decoder 做 400K iterations 训练,移除不必要的 KL 正则并降低 adversarial loss 权重。结果是 Table 4 中 decoder 延迟从 SD 1.5 的 285ms 降到 92ms。

Rocky认为,这个细节特别重要。端侧 AI 的瓶颈常常不是“最大模块”,而是系统链路中那个在新预算下突然暴露出来的模块。一步采样把 UNet 步数打下来了,VAE decoder 就从配角变成瓶颈。这也是端侧产品工程和云端 benchmark 思维最大的差别:云端模型看峰值能力,端侧系统看端到端延迟、内存、算子、热量和可复用性。

UFOGen 设计空间:一步采样不只要快,还要保住生态兼容

论文第 4 节转向采样效率。作者选择研究 UFOGen 这类 diffusion-GAN hybrid:用 adversarial fine-tuning 让已有扩散模型具备一步生成能力。

UFOGen 的训练目标可以写成:

min

θ

max

ϕ

E

q

(

x

0

)

q

(

x

t

1

x

0

)

,

p

θ

(

x

0

)

p

θ

(

x

t

1

x

0

)

[

log

D

ϕ

(

x

t

1

,

t

)

+

log

(

1

D

ϕ

(

x

t

1

,

t

)

)

+

λ

γ

t

x

0

x

0

2

]

\\min_\\theta \\max_\\phi \\mathbb{E}_{q(x_0)q(x_{t-1}|x_0),p_\\theta(x_0')p_\\theta(x_{t-1}'|x_0')} \\left[ \\log D_\\phi(x_{t-1},t)+ \\log(1-D_\\phi(x'_{t-1},t))+ \\lambda\\gamma_t\\lVert x_0-x_0'\\rVert^2 \\right]

θminϕmaxEq(x0)q(xt1x0),pθ(x0)pθ(xt1x0)[logDϕ(xt1,t)+log(1Dϕ(xt1,t))+λγtx0x02]

其中,

G

θ

G_\\theta

Gθ 是一步 generator,

D

ϕ

D_\\phi

Dϕ 是 discriminator。

x

0

x_0'

x0 是 generator 从带噪输入

x

t

x_t

xt 预测出的干净图像,

x

t

1

x'_{t-1}

xt1 则是把这个输出再前向加噪得到的样本。目标函数里的前两项是 adversarial loss,用来逼近真实分布、增加细节锐度;最后一项是 diffusion loss,用来稳定训练并约束模型不要偏离原扩散模型太远。

为什么这件事重要?因为单步扩散如果只做均方预测,本质上是在估计

E

[

x

0

x

t

]

\\mathbb{E}[x_0|x_t]

E[x0xt],容易得到偏平均、偏模糊的图像。对抗损失把输出从“平均答案”推向“更像真实图像的样本”。但如果只靠对抗目标,模型内部表示可能大幅漂移,原来基座模型上训练好的 LoRA、ControlNet、T2I-Adapter 就可能不再适配。

这就是论文的核心张力:一步生成要快,也要锐;要锐,又不能把基座特征空间破坏掉。速度、质量、生态兼容三者之间的平衡,才是这篇论文真正的技术难点。

作者还测试了两个替代重建项。第一个是 teacher distillation:

L

d

i

s

t

i

l

l

=

sg

(

G

t

e

a

c

h

e

r

(

x

t

,

t

)

)

x

0

2

\\mathcal{L}_{\\mathrm{distill}}= \\left\\lVert \\operatorname{sg}(G^{\\mathrm{teacher}}(x_t,t))-x_0' \\right\\rVert^2

Ldistill=

sg(Gteacher(xt,t))x0

2

第二个是 EMA distillation:

L

e

m

a

=

sg

(

G

θ

E

M

A

(

x

t

,

t

)

)

x

0

2

\\mathcal{L}_{\\mathrm{ema}}= \\left\\lVert \\operatorname{sg}(G_\\theta^{\\mathrm{EMA}}(x_t,t))-x_0' \\right\\rVert^2

Lema=

sg(GθEMA(xt,t))x0

2

从直觉看,distill loss 应该更能把一步模型拉回 teacher,EMA distill 则在保持原模型信息和允许模型自由调整之间做折中。Table 5 的 FID 也显示 distill loss 在纯文生图上略优。但论文后续发现,在下游 LoRA 和 adapter 应用上,原始 diffusion loss 反而更好。这提醒我们:一个指标上的最优,不一定是系统最优。对于要承载生态模块的端侧基座模型,兼容性有时比单点 FID 更重要。

ReLU attention 与移动端算子友好性:小改动背后的大约束

论文附录补充了 gelu 到 swish、softmax 到 relu 的细节。gelu 的近似形式是:

gelu

(

x

)

=

x

Φ

(

x

)

0.5

x

(

1

+

tanh

(

2

π

(

x

+

0.044715

x

3

)

)

)

\\operatorname{gelu}(x)=x\\cdot\\Phi(x) \\approx 0.5x\\left(1+\\tanh\\left(\\sqrt{\\frac{2}{\\pi}}(x+0.044715x^3)\\right)\\right)

gelu(x)=xΦ(x)0.5x(1+tanh(π2

(x+0.044715x3)))

swish 则是:

swish

(

x

)

=

x

sigmoid

(

x

)

\\operatorname{swish}(x)=x\\cdot\\operatorname{sigmoid}(x)

swish(x)=xsigmoid(x)

attention 中,softmax 需要指数和归一化,relu 则是点式激活。论文的经验是,不需要从零训练 relu attention 模型,只要从 softmax attention 预训练模型微调约 10K iterations,就可以得到视觉上接近的结果。

在这里插入图片描述

图 5 的作用不是证明 relu attention 永远等价于 softmax attention,而是说明在作者设置下,它可以用很小代价换取移动端效率。这类改动在学术叙事里可能不是最性感的部分,但在产品落地里非常真实:端侧模型最后拼的不是论文里单个 trick 的命名权,而是每个算子能否在设备上稳定、低延迟、低功耗地跑起来。

架构细节:MD 与 MD-Lite 的预算分层

附录 Table 6 给出了 MD 和 MD-Lite 的架构差异:

ModelsBlocksConvTransformer
MD Down-1 FullConv ×1
MD Down-2 FullConv ×1 CA
MD Down-3 SPConv ×2 (SA ×3 + CA ×3) ×2
MD Up-3 SPConv ×3 (SA ×3 + CA ×3) ×3
MD Up-2 FullConv ×2 CA ×2
MD Up-1 FullConv ×2
MD-Lite Down-1 FullConv ×1
MD-Lite Down-2 FullConv ×1 CA
MD-Lite Down-3 SPConv ×2 (SA ×3 + CA ×3) ×2
MD-Lite Up-3 SPConv ×3 (SA ×2 + CA ×2) ×3
MD-Lite Up-2 FullConv ×2 CA ×2
MD-Lite Up-1 FullConv ×2

MD 与 MD-Lite 的主要差异之一是 innermost channels:MD 为 1024,MD-Lite 为 896。这个表说明作者并不是只交付一个静态模型,而是在构造一条端侧预算曲线。对产品团队来说,这比单个模型更重要:不同设备、不同功耗、不同交互场景,需要的是能力档位,而不是一个永远固定的参数点。

应用兼容:端侧基座模型的真正门槛

论文第 5.4 节展示了插件、LoRA finetuning 和 inpainting。这里的关键声明是:这些条件生成模块是在预训练扩散模型上训练的,可以无重新训练地适配到一步模型上。

在这里插入图片描述

图 4 支撑的是论文最有平台意义的结论:MobileDiffusion 不是只能做 text-to-image 的封闭一步模型,而是可以承接已有的下游条件生成能力。Rocky认为,如果这点成立,它的意义就超出“更快生成一张图”。端侧生成模型会从一个功能点,变成一个本地多模态工作流节点:用户拍照、选风格、画线稿、局部修改、即时预览,都可以在本地闭环里发生。

当然,论文里的示例仍是视觉展示,不能直接等同于工业级可控性评估。真正落地还要看更多复杂条件、复杂 LoRA、长尾 prompt、多轮编辑和失败恢复。但作为研究路线,它已经把“端侧 + 一步 + 插件兼容”这三个关键词连起来了。

实验与证据:结果能支撑到什么程度

训练设置:成本不低,数据不完全开放

论文使用 1.5 亿 image-text pairs 的 proprietary dataset,其中 4000 万张图像分辨率超过 512×512。训练采用 AdamW,先在 256×256 分辨率以 batch size 4096 训练 0.75M steps,再在 512×512 以 batch size 2048 训练 0.25M steps。架构搜索阶段用 FID 和 CLIP 在 30K steps 时的结果筛选候选,约等于 32 块 16GB TPU 跑 4 小时;整体网络搜索消耗约 512 TPUs 持续 15 天。

这组数字给了我们两个判断。第一,MobileDiffusion 是端侧推理友好,不是训练便宜。第二,可复现性会受到 proprietary dataset 和大规模训练资源影响。论文证明了一条设计路线,但并没有把普通研究者复现同等模型的门槛降到很低。

量化指标:MobileDiffusion 的效率优势很明确

论文在 MS-COCO 2014 validation set 上做 zero-shot FID-30K,并使用 OpenCLIP-ViT/g14 计算 CLIP score。

ModelsSampling#StepsFID-30K↓CLIP↑#Params(B)#Data(B)
GigaGAN 1-step 1 9.09 0.9 0.98
LAFITE 1-step 1 26.94 0.23 0.003
DALL·E-2 DDPM 292 10.39 5.20 0.25
Imagen DDPM 256 7.27 3.60 0.45
SD DDIM 50 9.62 0.304 0.86 0.60
PIXART-α DPM 20 10.65 0.6 0.025
BK-SDM DDIM 50 16.54 0.50
SnapFusion Distilled 8 13.5 0.308 0.85
UFOGen 1-step 1 12.78 0.317 0.86 0.6
MobileDiffusion DDIM 50 8.65 0.325 0.39 0.15
MobileDiffusion 1-step 1 11.67 0.320 0.39 0.15

Table 2 里,MobileDiffusion 50-step DDIM 的 FID 为 8.65、CLIP 为 0.325;一步版本 FID 为 11.67、CLIP 为 0.320。和 SnapFusion 的 FID 13.5、UFOGen 的 12.78 相比,一步 MobileDiffusion 在论文设定下更好。同时它参数量只有 0.39B,数据量为 0.15B,明显小于许多云端大模型。

但这里也要谨慎:FID 和 CLIP 是必要证据,不是充分证据。FID 对分布质量敏感,但不直接测复杂文本遵循、局部可控性和真实用户偏好;CLIP score 能反映图文相关性,却可能偏向 CLIP 本身的表征空间。论文补充 HPS v2,是一个更接近人类偏好的指标,但仍然不是完整产品体验。

人类偏好:一步模型有质量损失,但不至于失控

ModelsAnim.ConceptPaintingPhotoAvg
SD-v2.0 (50 steps) 27.48 26.89 26.86 27.46 27.17
SD-v1.4 (50 steps) 27.26 26.61 26.66 27.27 26.95
MD (50 steps) 27.52 27.13 27.30 27.26 27.30
MD (1 step) 27.05 26.33 26.41 26.80 26.65

Table 3 显示,MD 50-step 的 HPS v2 平均分 27.30,高于 SD-v2.0 和 SD-v1.4;MD 1-step 平均分 26.65,低于 50-step,但仍在可比较区间内。这个结果说明一步采样确实有质量代价,尤其在 Concept、Painting 等类别上更明显,但没有把图像质量打崩。

Rocky认为,这类结果对产品判断很现实:端侧即时生成未必需要在所有场景胜过云端慢速模型。它的价值在于低延迟、本地化、交互频次、隐私和成本。如果一个能力在 0.2 秒内可用,它可以承载的交互形态和 7 秒生成完全不同。

端侧延迟:这才是论文最硬的系统证据

ModelsText EncoderDecoderUNetStepsOverall
SD 1.5 4 285 357 20 7429
SnapFusion 4 112 203 8 1740
UFOGen 4 285 357 1 646
MD-UFO 4 92 142 1 238

Table 4 是整篇论文最能说明系统价值的表。SD 1.5 在 iPhone 15 Pro 上整体约 7429ms;SnapFusion 约 1740ms;UFOGen 一步后约 646ms;MD-UFO 到 238ms。这里的下降不是一个 trick 带来的,而是文本编码器、decoder、UNet、采样步数四个环节一起压缩后的结果。

238ms 这个数字很关键。它接近人类视觉刺激平均反应时间的量级,意味着生成从“等待结果”转向“可交互反馈”。端侧 AI 一旦进入这个延迟区间,产品形态会变:用户不再是提交 prompt 后等待云端返回,而是在本地拖动、涂抹、换风格、试构图时即时看到反馈。

UFOGen 消融:FID 最优不等于生态最优

Reconstruction lossNo LoRALoRA
Diffusion loss 11.67 13.45
Distill loss 11.20 13.24
EMA distill loss 12.08 14.05

Table 5 从 FID 看,distill loss 最好:No LoRA 为 11.20,LoRA 为 13.24。但论文最终选择原始 diffusion loss,因为附录里的下游应用视觉比较显示,diffusion loss 在条件与风格忠实度上更好。

这是一处值得重点读的技术判断。很多研究会停在“哪个表格数字最好”,但端侧基座模型不是单项 benchmark 竞赛。它要兼容 LoRA、adapter、inpainting,就必须保留原扩散模型的内部特征结构。distill loss 在 FID 上好,可能未必在下游模块适配上最好。产品化 AI 系统里的最优,经常是多目标约束下的稳态最优,而不是单指标尖峰最优。

在这里插入图片描述

图 7 展示 LoRA 应用下不同训练设置的效果。它支撑论文的一个更细判断:对抗微调如果让模型内部表示过度偏移,风格 LoRA 的效果就会变得不稳定。Diffusion loss 虽然不是 FID 表格上的绝对第一,但更像一个“保持基座语义结构”的锚。

在这里插入图片描述

图 8 则从 adapter 条件生成角度补充同一件事。条件图、边缘、布局等控制模块需要模型对条件信号有稳定响应。如果一步模型为了锐度和速度丢掉条件一致性,端侧实时生成就会变成“快但不听话”。这对实际产品是不可接受的。

扩展样例与失败案例:能力边界同样重要

在这里插入图片描述

图 6 展示了更广泛 prompt 下的一步生成样例,用来说明 MobileDiffusion 在风格、想象力、复杂构图上并非只适配少量 teaser prompt。作为定性证据,它说明模型具备较广覆盖面;但它仍然是 curated visual examples,不能替代系统化长尾评测。

在这里插入图片描述

图 9 很值得保留。论文把失败归因为两类:不常见知识和数量理解。例如模型可能无法正确生成“方形蓝苹果挂在有圆形黄叶的树上”,也可能不能准确生成“十个红苹果”。作者认为这与 text encoder 能力限制有关,并指出类似现象也出现在 SD-1.5 和 SD-XL 中。

Rocky认为,失败案例反而让这篇论文更可信。端侧生成并没有绕过文生图的根本难题:语言理解、组合泛化、计数、长尾知识、精细空间关系。MobileDiffusion 解决的是端侧实时性与下游兼容性的系统问题,不是把所有生成难题一口气解决掉。

这篇工作的边界与可复现性

第一,训练数据不可完全复现。论文使用 proprietary dataset,虽然说明来自 public web,并给出规模、分辨率分布和训练策略,但外部研究者很难复刻同等数据质量与清洗流程。这意味着论文更像证明“路线有效”,而不是提供一个完全开放的 recipe。

第二,训练资源门槛不低。512 TPUs 持续 15 天用于网络搜索,对大多数团队并不轻。移动端推理便宜,不等于模型研发便宜。这一点对创业公司和工程团队尤其重要:端侧模型的商业成本需要同时计算训练成本、适配成本、设备测试成本和生态维护成本。

第三,评测覆盖仍不完整。FID、CLIP、HPS v2、延迟和定性图可以支撑论文主张,但还不足以完全证明产品级可控生成能力。真实落地还需要更系统的多轮编辑评测、插件兼容矩阵、LoRA 风格保持、低端设备性能、温控降频、内存峰值、量化后质量变化。

第四,一步采样的质量损失仍然存在。Table 3 已经显示 MD 1-step 在 HPS v2 上低于 MD 50-step;失败案例也显示文本理解和数量控制没有被根治。因此,MobileDiffusion 更适合被理解为“端侧实时生成基座的一条重要路线”,而不是“端侧全面替代云端大模型”的证据。

第五,生态兼容是经验性结论,还需要更大范围验证。论文展示了插件、LoRA、inpainting 的适配,但不同 LoRA、不同 ControlNet/T2I-Adapter、不同训练域和不同图像风格下,兼容性可能有差异。真正的平台化能力,需要大量第三方模块验证。

如果继续研究/落地,应该关注什么

对研究者来说,最值得继续做的是把“端侧预算”变成可学习、可搜索、可解释的设计空间。MobileDiffusion 做了大量手工与经验驱动的结构选择,下一步可以把硬件延迟、内存峰值、算子兼容性、量化误差纳入联合搜索目标,而不是只优化参数量和 FLOPs。

对算法工程团队来说,重点不是照抄某个模块,而是学习它的系统分解方法:先把端到端延迟拆成 text encoder、denoiser、decoder、采样步数;再找出在目标设备上真正占时的环节;最后在质量、速度、可控性之间做多目标优化。端侧模型的工程路线,必须从 profiling 开始,而不是从论文里的模型名开始。

对产品团队来说,MobileDiffusion 的意义在于把图像生成从“请求式工具”推向“实时交互组件”。0.2 秒级生成可以进入相机滤镜、草图生成、私密图像编辑、离线创作、AR 预览、儿童教育、车载可视化等场景。这里的产品关键不是生成一张更美的图,而是让用户在本地快速试错。

对创业者和投资人来说,要警惕把“端侧模型可跑”误读成“端侧产品有护城河”。模型会继续被压缩,系统能力会继续被基础设施吸收。长期护城河不在某个加速 trick,而在设备入口、用户工作流、私有数据、本地交互体验、内容生态和模型适配能力。

Rocky认为,MobileDiffusion 代表的是 AIGC 中场之后的一类新机会:不是继续堆云端大模型参数,而是把生成能力嵌进设备、工作流和实时交互里。工具不是护城河,判断才是护城河;端侧生成的机会,也不在“我也能生成图片”,而在“我能让生成能力在正确的场景里以正确的延迟出现”。

术语与概念速查

术语解释
Latent Diffusion 在压缩后的 latent 空间做扩散生成,而不是直接在像素空间生成,从而降低计算成本。
UNet 扩散模型中常用的 denoising 网络结构,通过下采样和上采样处理多尺度特征。
UViT 结合 UNet 多尺度结构与 Vision Transformer 表达能力的一类扩散网络设计思路。
Self-Attention 在图像 token 之间建模长程依赖的注意力机制,高分辨率下成本较高。
Cross-Attention 图像 token 对文本 token 做条件对齐的注意力机制,是文生图中注入 prompt 语义的关键模块。
FLOPs 浮点运算量,用于粗略衡量模型计算复杂度,但不等同于真实设备延迟。
VAE Decoder latent diffusion 中把 latent 解码回图像的模块,采样步数减少后会成为重要延迟来源。
UFOGen 一种通过 adversarial fine-tuning 让扩散模型实现一步生成的 diffusion-GAN hybrid 方法。
Diffusion Loss UFOGen 目标中的重建/扩散约束项,用于稳定训练并保持模型特征空间。
LoRA Low-Rank Adaptation,通过低秩增量参数适配模型,常用于风格、人设或特定能力微调。
T2I-Adapter / ControlNet 文生图控制模块,用边缘、深度、姿态等条件增强生成可控性。
FID Fréchet Inception Distance,用于衡量生成图像分布与真实图像分布的差异,越低越好。
CLIP Score 用 CLIP 表征衡量图像与文本匹配程度,越高通常表示图文相关性越强。
HPS v2 Human Preference Score v2,面向人类偏好的文生图评测指标。

拓展思考:值得继续扩展研究与思考的创新点

第一,把端侧生成从“轻量模型”推进到“端侧生成操作系统”。如果模型能稳定支持 LoRA、adapter、inpainting、局部编辑、图像理解反馈,那么手机上的生成能力就不只是一个 app 功能,而可能成为本地内容生产的基础层。

第二,把硬件指标纳入模型训练目标。未来端侧生成不应只报告 Params、FLOPs 和单设备 latency,还应该报告算子分布、量化敏感性、内存峰值、温控下长时间运行表现、不同芯片后端差异。AI 模型会越来越像系统软件,而不是单纯的神经网络权重。

第三,研究一步模型的特征空间保持机制。MobileDiffusion 的经验显示,FID 最好的 reconstruction loss 不一定最适合下游模块。未来可以更系统地度量一步微调前后模型内部表示的偏移,以及这种偏移如何影响 LoRA、ControlNet、T2I-Adapter 的兼容性。

第四,建立端侧可控生成评测。真实端侧应用关心的不只是图像好不好看,还包括是否听从局部条件、是否能保持身份/风格一致、是否能多轮编辑、失败后是否可恢复、用户是否能在低延迟反馈里形成创作闭环。

第五,把隐私和本地数据纳入产品设计。端侧生成的长期价值可能不只是省云端成本,而是让用户的照片、草稿、私密 prompt、个人风格模型留在本地。未来真正有护城河的端侧 AIGC 产品,可能不是模型最强,而是最懂本地上下文、最贴近用户工作流、最能在隐私边界内持续学习。

最后回到这篇论文的本质:MobileDiffusion 不是终点,它更像一个信号。AIGC 的下一阶段,不会只有云端大模型继续变大,也会有一条路线把生成能力压进端侧设备,把高延迟的“生成结果”变成低延迟的“生成交互”。谁能理解这种技术范式变化背后的产品和商业后果,谁才真正读懂了这篇论文。

推荐阅读

Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法,开发,竞赛,科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)

1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2. 深入浅出完整解析扩散模型DDPM、DDIM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

和Rocky一起学习探究扩散模型的本质原理与和核心基础知识,同时不断跟进扩散模型的最新发展。Rocky在本文中对扩散模型的本质做了全面系统的梳理与讲解:深入浅出完整解析扩散模型DDPM、DDIM、SDE、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

3. 深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

https://zhuanlan.zhihu.com/p/1975174691049189562

4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

5. 深入浅出完整解析DeepSeek系列核心基础知识

深入浅出完整解析DeepSeek系列核心基础知识

6、Sora等AI视频大模型的核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用AI视频大模型,从0到1训练自己的AI视频大模型,AI视频大模型性能测评,AI视频领域未来发展等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Sora等AI视频大模型文章地址:深入浅出完整解析Sora、Wan2.1、AnimateDiff、CogVideoX等AI视频大模型核心基础知识

7、Stable Diffusion 3和FLUX.1核心原理,核心基础知识,网络结构,从0到1搭建使用Stable Diffusion 3和FLUX.1进行AI绘画,从0到1上手使用Stable Diffusion 3和FLUX.1训练自己的AI绘画模型,Stable Diffusion 3和FLUX.1性能优化等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion 3和FLUX.1文章地址:深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

8、Stable Diffusion XL核心基础知识,网络结构,从0到1搭建使用Stable Diffusion XL进行AI绘画,从0到1上手使用Stable Diffusion XL训练自己的AI绘画模型,AI绘画领域的未来发展等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion XL文章地址:深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

9、Stable Diffusion 1.x-2.x核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用Stable Diffusion进行AI绘画,从0到1上手使用Stable Diffusion训练自己的AI绘画模型,Stable Diffusion性能优化等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion文章地址:深入浅出完整解析Stable Diffusion(SD)核心基础知识

10、ControlNet核心基础知识,核心网络结构,从0到1使用ControlNet进行AI绘画,从0到1训练自己的ControlNet模型,从0到1上手构建ControlNet商业变现应用等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

ControlNet文章地址:深入浅出完整解析ControlNet核心基础知识

11、LoRA系列模型核心原理,核心基础知识,从0到1使用LoRA模型进行AI绘画,从0到1上手训练自己的LoRA模型,LoRA变体模型介绍,优质LoRA推荐等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

LoRA文章地址:深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

12、深入浅出完整解析AIGC时代Transformer核心基础知识

在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:

Transformer文章地址:深入浅出完整解析AIGC时代Transformer核心基础知识

13、最全面的AIGC面经《手把手教你成为AIGC算法工程师,斩获AIGC算法offer!(2024年版)》文章正式发布!

码字不易,欢迎大家多多点赞:

AIGC面经文章地址:手把手教你成为AIGC算法工程师,斩获AIGC算法offer!

14、50万字大汇总《“三年面试五年模拟”之算法工程师的求职面试“独孤九剑”秘籍》文章正式发布!

码字不易,欢迎大家多多点赞:

算法工程师三年面试五年模拟文章地址:https://zhuanlan.zhihu.com/p/545374303

《三年面试五年模拟》github项目地址(希望大家能多多star):https://github.com/WeThinkIn/Interview-for-Algorithm-Engineer

15、Stable Diffusion WebUI、ComfyUI、Fooocus三大主流AI绘画框架核心知识,从0到1搭建AI绘画框架,从0到1使用AI绘画框架的保姆级教程,深入浅出介绍AI绘画框架的各模块功能,深入浅出介绍AI绘画框架的高阶用法等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

AI绘画框架文章地址:深入浅出完整解析主流AI绘画框架(ComfyUI、Stable Diffusion WebUI、Fooocus)核心基础知识

16、GAN网络核心基础知识,网络架构,GAN经典变体模型,经典应用场景,GAN在AIGC时代的商业应用等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

GAN网络文章地址:https://zhuanlan.zhihu.com/p/663157306

17. AI算法工程师的《三年面试五年模拟》求职秘籍

AIGC时代的算法工程师的求职面试秘籍(持续更新中)

18. AIGC产业的深度思考与分析

2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。

Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。

那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:

深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

赞(0)
未经允许不得转载:171主机测评 » 一文读懂端侧文生图大模型MobileDiffusion的核心基础知识
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址