Github 4.8k Stars! | CodeFormer: 地表最强AI马赛克去除神器! (附实战教程)

科技科技 2024-09-16 15:30 浙江

点击蓝字

关注我们

关注并星标

从此不迷路

计算机视觉研究院

公众号ID｜计算机视觉研究院

学习群｜扫码在主页获取加入方式

项目地址：https://shangchenzhou.com/projects/CodeFormer/#method

先来一组效果图：

转换前：

转换后：

计算机视觉研究院专栏

Column of Computer Vision Institute

模糊的脸恢复是一个高度不适定的问题，通常需要辅助指导来：1）改进从退化输入到期望输出的映射，或者2）补充输入中丢失的高质量细节。

PART/1

概述

模糊的脸恢复是一个高度不适定的问题，通常需要辅助指导来：1）改进从退化输入到期望输出的映射，或者2）补充输入中丢失的高质量细节。在今天分享中，我们证明了在小proxy空间中学习的离散码本先验通过将人脸盲恢复作为代码预测任务，大大降低了恢复映射的不确定性和模糊性，同时为生成高质量人脸提供了丰富的视觉原子。在这种范式下，我们提出了一种基于Transformer的预测网络，称为CodeFormer，用于对低质量人脸的全局组成和上下文进行建模，以进行代码预测，从而即使在输入严重退化的情况下，也能够发现与目标人脸非常接近的自然人脸。为了增强对不同退化的适应性，我们还提出了一个可控的特征转换模块，该模块允许在保真度和质量之间进行灵活的权衡。得益于富有表现力的码本先验和全局建模，CodeFormer在质量和保真度方面都优于现有技术，表现出对退化的超强鲁棒性。在合成和真实世界数据集上的大量实验结果验证了我们方法的有效性。

PART/2

概述

各种先验已被用于缓解该问题的不适定性，包括几何先验、参考先验和生成先验。尽管观察到纹理和细节有所改善，但这些方法往往对退化敏感度高或先前的表现力有限。这些先验为人脸恢复提供了不足的指导，因此它们的网络本质上依赖于通常高度破坏的LQ输入图像的信息。结果，LQ-HQ映射不确定性仍然存在，并且输出质量由于输入图像的劣化而劣化。最近，基于生成先验，一些方法通过迭代潜在优化或直接潜在编码将退化的人脸投影到连续的无限空间中。尽管输出非常真实，但在严重退化的情况下，很难找到准确的潜在矢量，导致低保真度结果（下图（d）段）。为了提高保真度，在这类方法中通常需要编码器和解码器之间的跳过连接，如下图所示。然而，当输入严重退化时，这种设计同时会在结果中引入伪影，如下图（e）所示。

PART/3

新框架新方法

(a) 我们首先学习一个离散码本和解码器，通过自重构学习来存储人脸图像的高质量视觉部分。(b) 在固定码本和解码器的基础上，我们引入了一个Transformer模块用于码序列预测，对低质量输入的全局人脸组成进行建模。此外，一个可控的特征变换模块用于控制从LQ编码器到解码器的信息流。请注意，这种连接是可选的，可以在输入严重退化时禁用，以避免不利影响，并且可以调整标量权重w以在质量和保真度之间进行权衡。

PART/4

实验及可视化

END

转载请联系本公众号获得授权

计算机视觉研究院学习群等你加入！

ABOUT

计算机视觉研究院

计算机视觉研究院主要涉及深度学习领域，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”。研究院会针对不同领域分享实践过程，让大家真正体会摆脱理论的真实场景，培养爱动手编程爱动脑思考的习惯！

往期推荐

🔗

http://mp.weixin.qq.com/s?__biz=MzU0NTAyNTQ1OQ==&mid=2247538418&idx=1&sn=850e5af75c720ba3da3a7246de96b06b

计算机视觉研究院

计算机视觉研究院主要涉及AI研究和落地实践，主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架，提供论文一键下载，并分享实战项目。研究院主要着重”技术研究“和“实践落地”！

最新文章

今年顶会这情况。。。大家提前做准备吧！

取代Mamba，超越Transformer！扩展LSTM到数十亿参数

Drone-YOLO：一种有效的无人机图像目标检测

“计算机视觉研究院”商务合作

再见阿里，你好字节！

纯干货：Box Size置信度偏差会损害目标检测器（附源代码）

PE-YOLO：解决黑夜中的目标检测难点

245个目标检测开源项目合集，建议收藏！

YoloV：视频中目标实时检测依然很棒（附源代码下载）

利用先进技术保家卫国：深度学习进行小目标检测（适合初学者入门）

大型视觉语言模型OMG-LLaVA：图像级、目标级和像素级的推理和理解任务统一

PE-YOLO：解决黑夜中的目标检测难点

NeurIPS 2024 | 真实世界复杂任务，全新基准GTA助力大模型工具调用能力评测

人脸识别精度提升 | 基于Transformer的人脸识别（附源码）

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

FP-DETR：通过完全预训练提升transformer目标检测器

3D大模型助力，15分钟即可训练高质量、个性化的数字人模型，代码已开放

顶会新方向！全新多模态大模型统一分割框架

微软新出框架：Transformer扩展到10亿token（附代码下载）

Drone-YOLO：一种有效的无人机图像目标检测

26申博时间规划！别再按老套路来了，没用

“计算机视觉研究院”商务合作

一文读懂模型的可解释性（附代码）

首个快速知识蒸馏的视觉框架：ResNet50 80.1%精度，训练加速30%

劲爆！YOLOv6又快又准的目标检测框架开源啦（附源代码下载）

今天面试了一个字节女生，当场想给她offer

三区idea最后发了顶会！

特别小的目标检测识别（附论文下载）

基于Transformer的跨模态3D点云目标检测SOTA！易复现！

NeurIPS 2024 | 消除多对多问题，清华提出大规模细粒度视频片段标注新范式VERIFIED

“计算机视觉研究院”商务合作

机场项目：解决飞行物空间大小/纵横比、速度、遮挡等问题引起的实时目标检测问题

不需要标注了？看自监督学习框架如何助力目标检测

RestoreDet：低分辨率图像中目标检测

目标检测创新：一种基于区域的半监督方法，部分标签即可（附原论文下载）

又快又准，即插即用！清华8比特量化Attention，两倍加速于FlashAttention2，各端到端任务均不掉点！

MIT韩松团队长上下文LLM推理高效框架DuoAttention：单GPU实现330万Token上下文推理

50K*16薪，进字节了！

YOLO-S：小目标检测的轻量级、精确的类YOLO网络

“计算机视觉研究院”商务合作

RestoreDet：低分辨率图像中目标检测

CVPR’24｜PanoOcc基于相机的3D全景分割最强SOTA！

利用先进技术保家卫国：深度学习进行小目标检测（适合初学者入门）

245个目标检测开源项目合集，建议收藏！

“计算机视觉研究院”商务合作

完爆YOLO家族？新一代目标检测器又有新突破！

NeurIPS 2024 Oral | 小参数，大作为！揭秘非对称 LoRA 架构的高效性能

YOLO-SLD：一种改进的注意机制YOLO车牌检测

“计算机视觉研究院”商务合作

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉