NeurIPS 2024 | 浙大/微信/清华提出：彻底解决扩散模型反演问题

科技 2024-11-02 23:59 上海

点击下方卡片，关注“CVer”公众号

AI/CV重磅干货，第一时间送达
点击进入—>【Mamba/多模态/扩散】交流群

添加微信号：CVer2233，小助手会拉你进群！
扫描下方二维码，加入CVer学术星球！可以获得最新顶会/顶刊上的论文idea和CV从入门到精通资料，及最前沿应用！发论文/搞科研/涨薪，强烈推荐！

转载自：机器之心

本篇论文已经被NeurIPS 2024接收。第一作者王方懿康是微信视觉团队实习生，同时也是浙江大学一年级硕士研究生。共同一作是微信高级研究员Hubery。通讯作者是浙江大学助理教授张超。其他作者包括来自清华大学的董玥江，来自浙江大学的朱胡旻昊，赵涵斌助理教授和钱徽教授，以及微信基础视觉和视觉生成技术负责人李琛。

随着扩散生成模型的发展，人工智能步入了属于 AIGC 的新纪元。扩散生成模型可以对初始高斯噪声进行逐步去噪而得到高质量的采样。当前，许多应用都涉及扩散模型的反演，即找到一个生成样本对应的初始噪声。当前的采样器不能兼顾反演的准确性和采样的质量。

为彻底解决这一问题，微信视觉团队与浙江大学和清华大学联手提出了基于双向显式线性多步法的扩散模型精确反演采样器（BELM）这一通用算法，并通过截断误差分析确定了最优的 BELM 采样器系数。此方法在确保精确反演的同时还提升了生成样本的质量，在图像与视频的编辑、插值等下游任务中有广泛的应用前景。这一研究成果已被 NeurIPS 2024 会议接收。

当前，扩散模型在图像生成、文字生成、音频生成等多个领域得到了广泛应用，表现出了卓越的性能。扩散模型的反演操作，即找到一个生成样本对应的初始噪声，对若干下游任务起到关键的作用。传统的 DDIM 反演会造成严重的不一致问题，即原始图片加噪再去噪的结果与原图相差甚远。

近期，研究者们提出了多种启发式的精确反演采样器来解决 DDIM 反演的不一致问题。然而，这些启发式的精确反演采样器的理论特性尚不明确，且采样质量常常不尽如人意，这在一定程度上限制了它们的应用。

为此，本研究引入了一种通用的精确反演采样器范式 —— 双向显式线性多步（BELM）采样器，该范式包含了上文提到的启发式精确反演采样器。该团队在 BELM 范式内系统地研究了局部截断误差（LTE），发现现有的精确反演采样器的 LTE 并非最优。

因此，研究团队通过 LTE 最小化方法提出了最优的 BELM（Optimal-BELM，O-BELM）采样器。实验表明，O-BELM 采样器在实现精确反演的同时，也提升了采样的质量。

论文题目：BELM: Bidirectional Explicit Linear Multi-step Sampler for Exact Inversion in Diffusion Models
论文链接：https://arxiv.org/abs/2410.07273
项目地址：https://github.com/zituitui/BELM

背景：DDIM 反演造成的不一致问题

由于 DDIM 的正向过程和反演过程使用的迭代式并不相同，所以 DDIM 的反演重构样本与初始的样本存在较大差别。

实际使用中，DDIM 的反演有显著的不一致问题：

现有精确反演方法

Null-text-inversion

以 Null-tex-inversion 为代表的方法对 unconditional 占位符进行 fine-tune，以达到精确反演。

问题：这类方法局限于 text-classifier-free-guidance 场景下的扩散模型；需要额外训练，低效。

EDICT

EDICT 是基于 DDIM 的启发式算法，借鉴了可逆网络的做法，有两个相互糅合的采样链。

其逆过程如下，精确可逆：

问题：需要两倍计算量；超参数 p 不鲁棒，导致采样质量不可控。

BDIA

BDIA 改进了 EDICT，使用 x_i 的速度，x_i 和 x_{i+1} 的位置，通过下述公式实现精确可逆：

问题：超参数 gamma 不鲁棒，导致采样质量不佳。

EDICT 和 BDIA 参数的不鲁棒：

EDICT 和 BDIA 超参数的意义不明，没有理论指导如何调整，导致不同情形下超参数的选择差别巨大。使用起来极为不便。

双向显式线性多步法（BELM）框架

思路起源：DDIM 的正向过程（由蓝线表示）与反演过程（由红线表示）是两种不同的关系，这导致了 DDIM 的反演不准确。如果强制正过程与反过程使用相同关系，又会引入隐式方法，大大增加计算复杂度。如果多引入一个点，不用隐式方法也可逆（由绿线表示）。

该论文中的算法，正向和反演过程都服从相同的关系，因此能够精确反演。具体来说，为了系统地设计这种采样器，首先要将扩散模型的采样过程建模为一个 IVP（Initial Value Problem，初值问题）：

以下是 IVP 的一般形式，这实际上是一个变步长变公式线性多步方法（VSVFM）：

为了避免隐式方法的复杂计算，上式需要在正向和反向都是显式的，该团队称这一性质为双向显性（bidirectional explicit）。

代入双向显性条件，可以得到一般的 k 步 BELM 采样器：

最简单的形式是 k=2，称为 2-BELM，其表达式如下：

据此很容易证明，一个满足双向显性性质的线性多步法采样器拥有精确反演性质：

研究团队还发现，前文提到的 EDICT 和 BDIA 都是 BELM 框架的特例：

这也解释了 EDICT 和 BDIA 能够精确反演的原因。

最优双向显式线性多步（O-BELM）采样器

研究团队在推导 BELM 框架暂时没有给出具体的系数选择，而启发式的系数选择（如 EDICT 和 BDIA）会造成采样质量的退化。因此，他们提出使用局部截断误差（LTE）来获取最优系数。

首先分析 BELM 的局部截断误差：

通过对局部截断误差的最小化，我们得到了最优的 BELM 系数，我们称此系数下的 BELM 采样器为最优 BELM（O-BELM）：

O-BELM 的正向过程表达式如下：

O-BELM 的反演过程表达式如下：

此外，研究团队还证明了 O-BELM 满足稳定性和全局收敛性：

至此，可以对比几种不同反演采样器的性质：

可见，O-BELM 是第一种在严格的理论保证下兼顾精确反演性质和采样质量的采样器。

实验

重建实验（验证 O-BELM 精确反演性质）

latent 空间上的 O-BELM 的重建误差为 0，这表明 O-BELM 具有精确反演的性质：

采样实验（验证 O-BELM 的高质量采样性质）

不论在无条件生成还是条件生成中，O-BELM 都表现出了高于 DDIM，EDICT 和 BDIA 的采样质量：

下游任务 —— 图像编辑

图像编辑实验体现了：

1. 由于 DDIM 不具有精确反演性质，编辑的结果中存在不一致问题（红色框）；

2. 由于 EDICT 和 BDIA 具有较大的采样误差，编辑的结果出现了不真实区域（黄色框）；

3.O-BELM 在保持图像一致的条件下完成了高质量的编辑。

由于 O-BELM 是一个采样方法，因此可以无缝地与 controlNet 结合，编辑效果也优于其他方法：

下游任务 —— 图像插值

由于 O-BELM 精确地建立了噪声和生成样本的对应关系，这个关系是 probability flow ODE 的近似，因此 O-BELM 也使得图像插值更符合人的直觉：

结语

本研究提出的双向显式线性多步法采样器从理论上分析并彻底解决了现有扩散生成模型中的反演问题，进一步拓宽了扩散模型在计算机视觉领域的能力边界。在图像和视频的编辑任务上有巨大的应用前景。

何恺明在MIT授课的课件PPT下载

在CVer公众号后台回复：何恺明，即可下载本课程的所有566页课件PPT！赶紧学起来！
ECCV 2024 论文和代码下载
在CVer公众号后台回复：ECCV2024，即可下载ECCV 2024论文和代码开源的论文合集

CVPR 2024 论文和代码下载

在CVer公众号后台回复：CVPR2024，即可下载CVPR 2024论文和代码开源的论文合集

Mamba、多模态和扩散模型交流群成立

扫描下方二维码，或者添加微信号：CVer2233，即可添加CVer小助手微信，便可申请加入CVer-Mamba、多模态学习或者扩散模型微信交流群。另外其他垂直方向已涵盖：目标检测、图像分割、目标跟踪、人脸检测&识别、OCR、姿态估计、超分辨率、SLAM、医疗影像、Re-ID、GAN、NAS、深度估计、自动驾驶、强化学习、车道线检测、模型剪枝&压缩、去噪、去雾、去雨、风格迁移、遥感图像、行为识别、视频理解、图像融合、图像检索、论文投稿&交流、PyTorch、TensorFlow和Transformer、NeRF、3DGS、Mamba等。

一定要备注：研究方向+地点+学校/公司+昵称（如Mamba、多模态学习或者扩散模型+上海+上交+卡卡），根据格式备注，可更快被通过且邀请进群


▲扫码或加微信号: CVer2233，进交流群

CVer计算机视觉（知识星球）来了！想要了解最新最快最好的CV/DL/AI论文速递、优质实战项目、AI行业前沿、从入门到精通学习教程等资料，欢迎扫描下方二维码，加入CVer计算机视觉（知识星球），已汇集上万人！

▲扫码加入星球学习

▲点击上方卡片，关注CVer公众号
整理不易，请赞和在看

http://mp.weixin.qq.com/s?__biz=MzUxNjcxMjQxNg==&mid=2247610416&idx=2&sn=c08c6c5b8c374deaec3d44192696f2d0

CVer

一个专注于计算机视觉方向的公众号。分享计算机视觉、深度学习、人工智能、自动驾驶和高校等高质量内容。

最新文章

炼丹神器来了！ Kaggle大神强推！

ECCV 2024 | CityGaussian：VR/AR时代的城市重建新标杆

Nature子刊！ViTaM：全新的视觉 - 触觉联合记录和追踪系统

AAAI 2025 开奖倒计时！CVPR 2025、ICLR 2025 投稿微信群来了！

最大的Mamba和遥感微信群成立！

大学“一级教授”和“四级教授”的区别有多大？

中央发文：不合格博士生，退出！

顶刊TPAMI 2024！白翔团队提出：局部场景文字检索任务和新方法

仅仅一天，Gemini就夺回了GPT-4o拿走的头名！

AAAI 2025 即将开奖！附CVPR 2025、ICLR 2025 投稿微信群！

异常检测和缺陷检测微信群成立！

教育部公布：2025年考研人数，再降50万！

16岁中学生获正高职称，后续来了

可以封神了！原来找论文idea这么简单

NeurIPS 2024 Oral | NeuroClips：揭秘从脑信号重建高保真流畅视频

ICLR 2025 改分啦！ICLR 2025和CVPR 2025投稿微信群成立！

DeepSeek团队新作JanusFlow：1.3B大模型统一视觉理解和生成

年仅42岁！一高校青年教师病逝……

面试小米，惨不忍睹。。。

NeurIPS 2024 | 收敛加快8倍，准确率提升超30%！华科大提出MoE Jetpack框架

ACM MM 2024 | S2TD-Face：基于素描输入的精细3D人脸重建方法

CVPR 2025、ICLR 2025和AAAI 2025投稿微信群来了！

扩散模型和多模态微信群成立！

重磅！2024年全球高被引科学家名单出炉！

YOLO跌落神坛？新一代目标检测器有新突破

NeurIPS 2024 | Coupled Mamba：通过耦合SSM增强多模态融合

MMRel：多模态大模型时代的评测物体间关系理解新基准

ICASSP 2025 出分了！投稿群成立！附CVPR 、AAAI 2025交流群！

医学图像微信群来了！

本科生一作、研究生二作、教授母亲三作，浙大奖学金获得者论文被质疑，高校回应！

又一篇AI顶会！这个idea“简直杀疯了 ” ...

NeurIPS 2024 | 浙江大学提出SINE：通用分割新模型

哈佛大学 & MIT 招收实习生

ICASSP 2025 投稿交流群成立！

最大ReID和目标跟踪微信群来了！

巨星陨落！北京大学发讣告

超越YOLOv8还不够！这些目标检测开源项目又上新了

顶刊TPAMI 2024！清华黄高团队提出：高效图像识别的统一动态网络

重磅！CVPR 2025、ICLR 2025和AAAI 2025投稿微信群成立！

快加入！最大的目标检测和图像分割微信群来了！

打破纪录！中国科学家让薛定谔的猫活了23分钟

这6个岗位，大厂抢疯了！！

NeurIPS 2024 | CMU提出RLT：加速视频Transformer新方法

中国团队斩获EMNLP 2024最佳论文奖！主办方：明年苏州见！

ICLR 2025 开始Rebuttal！AAAI 2025和CVPR 2025投稿微信群成立！

多模态和扩散模型微信群来了！

“16岁中学生获正高职称”，后续来了

月薪49k！字节跳动校招开奖！

LeCun团队新作DINO-WM：预训练视觉特征的世界模型，超强规划能力！

又一OpenAI研究员离职！不相信OpenAI能造福世界，AGI使命无比困难

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉

NeurIPS 2024 | 浙大/微信/清华提出：彻底解决扩散模型反演问题

点击下方卡片，关注“CVer”公众号

AI/CV重磅干货，第一时间送达点击进入—>【Mamba/多模态/扩散】交流群

添加微信号：CVer2233，小助手会拉你进群！扫描下方二维码，加入CVer学术星球！可以获得最新顶会/顶刊上的论文idea和CV从入门到精通资料，及最前沿应用！发论文/搞科研/涨薪，强烈推荐！

何恺明在MIT授课的课件PPT下载

ECCV 2024 论文和代码下载

CVPR 2024 论文和代码下载

AI/CV重磅干货，第一时间送达
点击进入—>【Mamba/多模态/扩散】交流群

添加微信号：CVer2233，小助手会拉你进群！
扫描下方二维码，加入CVer学术星球！可以获得最新顶会/顶刊上的论文idea和CV从入门到精通资料，及最前沿应用！发论文/搞科研/涨薪，强烈推荐！