统一图像生成，无需繁杂插件！智源发布扩散模型框架OmniGen

科技 2024-10-30 12:57 北京

允中发自凹非寺
量子位 | 公众号 QbitAI

多模态模型，统一图像生成。

最新扩散模型框架来了。

智源研究院推出OmniGen，它能天然支持各种图像生成任务，架构高度简化，还能有效跨不同任务迁移知识，应对未见过的任务和领域。

特点如下：

1、统一性：OmniGen 天然地支持各种图像生成任务，例如文生图、图像编辑、主题驱动生成和视觉条件生成等。此外，OmniGen可以处理经典的计算机视觉任务，将其转换为图像生成任务。

2、简单性：OmniGen 的架构高度简化。此外，与现有模型相比，它更加用户友好，可以通过指令完成复杂的任务，而不需要冗长的处理步骤和额外的模块(如 ControlNet 或 IP-Adapter)，从而大大简化了工作流程。

3、知识迁移：受益于统一格式的学习，OmniGen 有效地跨不同任务迁移知识，应对未见过的任务和领域，并展示新颖的功能。我们还探讨了模型的推理能力和思维链机制的在图像生成领域的潜在应用。

基于 OmniGen 的通用能力，可实施更灵活的图像生成，以下展示一个简单 Pipeline：文本生成图像，编辑生成图像的部分元素，根据生成图像的人体姿态生成重绘图像，从另一图像中提取所需对象与新图像融合。

AI生图插件操作繁琐

近年来，许多文生图模型在生成式 AI 的浪潮中脱颖而出。然而，这些出色的专有模型仅能基于文本生成图像。当用户产生更灵活、复杂、精细等的图像生成需求时，往往需要额外的插件和操作。

例如，若想参考任一姿态生成图像，常规方法是：用姿态检测器从参考图像中估计姿态作为条件输入，并加载对应的 Controlnet 插件，最后提取条件输入的特征馈入扩散模型生成图像。

此外，若想基于合照中的特定人物生成新图像，流程更加繁琐，需要裁剪图像以确保结果图像仅包含目标人物。

而诸如 InstandID 等方法还需使用额外的人脸检测器提取面部信息，并用面部编码器提取特征以输入模型。

值得注意的是，各种不同的生成任务甚至还需更多不同的插件和操作，如此复杂、琐碎而冗长的工作流极大地增加了训练和应用的成本。然而，即便如此繁琐，有时也仍难以满足一般的图像生成的需求，例如基于指定多张照片中的实体生成新图像。

相反，在文本生成领域，以 ChatGPT 为代表的模型可通过人类指令直接处理各种文本任务。那么，在图像生成领域，能否通过单个支持多种输入且耦合多项能力的模型，基于用户指令完成各种生成任务，而无需各种繁杂的流程吗？

为解决这一挑战性问题，智源发布了统一图像生成模型 OmniGen。OmniGen 模型具有良好的简洁性和易用性，集成了多种基础图像生成任务，包括但不限于：文生图、图像编辑、角色一致性生成、基于视觉条件的生成等。

OmniGen 支持基于任意多模态的文图指令完成任务，而无需任何其他额外插件和操作。

强大通用能力

OmniGen 集多项能力于一体，包括但不限于：

文本到图像生成 (Text to Image Generation)
指代表达生成 (Referring Expression Generation)
通用图像条件生成 (General Image Conditional Generation)
图像编辑 (Image Edit)
经典计算机视觉任务：图像去噪、边缘检测、姿态估计等
一定的上下文学习能力 (In-context Learning)

以下简要展示部分能力效果：

2.1 文本到图像生成

2.2 指代表达生成

OmniGen 具备类似 InstandID、Pulid 等模型生成角色一致性图像等能力，即：输入具有单个对象的图像，理解并遵循指令，输出基于该对象的新图像。
同时，OmniGen 具有更高阶的能力：指代表达生成能力，我们把这种能力定义为能够从包含多个对象的图像中，识别指令所指代的对象并生成新的图像。
例如，OmniGen 可根据指令直接从多人图像中定位目标对象，并生成遵循指令的新图像，而无需任何额外的模块和操作：

更多样例：

2.3 通用图像条件生成

OmniGen 不仅支持类似 ControlNet 根据特定显式条件生成图像的能力，还同时具备处理经典计算机视觉任务的能力（如人体姿态估计、深度估计等）。

因此，OmniGen 可凭借单个模型完成整个 ControlNet 流程：直接使用 OmniGen 对原图提取视觉条件，并基于所提取的条件生成图像，无需额外处理器。

同时，OmniGen 还能更进一步简化中间流程，一步出图：直接输入原图，输入指令“Following the human pose(or depth mapping) of this image, generate a new image:…”，就可根据输入图像的人体姿态或深度图关系生成新图像。

2.4 图像编辑

OmniGen 具备良好的图像编辑能力，并且可以在一次运行中同时执行多条编辑指令，例如：

2.5 更多能力

OmniGen 具备潜在的推理能力，可以处理对模型理解和推断能力具有一定要求的非显式查询指令。

例如，要求模型删除图中能装水的物品，则模型能够理解和推断出指令涉及的图中物体并删除：

另一方面，OmniGen 具有一定程度的上下文学习能力，可根据参考样例对图像进行处理。例如，输入一个分割皇后象棋的输入-输出配对样例 (Example)，模型能识别并分割新输入图像中对应的物体：

思维链（Chain-of-Thought, CoT）方法将任务分解为多个步骤，并按顺序求解每个步骤以获得准确的最终答案，从而显著提高了llm的性能。我们考虑是否可以将类似的替代方案应用于图像生成。受人类绘画的基本方式的启发，我们希望模仿一步一步的绘画过程，从空白画布上迭代地生成图像。我们进行了初步的探索，微调后模型能够模拟人类行为一步步的生成图片，进一步的优化留给以后的研究。

OmniGen 的能力包括但不限于以上内容，还包括基本的图像去噪、边缘提取等能力。模型权重和代码已开源，用户可以自行探索更多OmniGen的能力。

最大程度舍弃额外模块

OmniGen 的核心设计原则是：简洁和有效。

因此，研究团队最大程度舍弃了各种额外模块。OmniGen 的基本架构为：一个 Transformer 模型和一个 VAE 模块，共 3.8B 参数。其中，Transformer 继承于 Phi3-mini 模型，图像内部改用双向注意力 (Bidirectional Attention) 以契合图像数据特性。整体架构如下所示：

为实现强大的通用和泛化能力，研究人员需要基于大规模和多样化的数据集训练模型。然而，在图像生成领域，尚无一个可用的通用数据集。为此，我们构建了首个大规模且多样化的统一图像生成数据集 X2I，意为 “Anything to Image”。其中，不同任务的数据格式被重新组织和统一，以便于管理和使用。X2I 数据集包含约 1 亿图像，未来经审查等流程后将开源，旨在进一步推动通用图像生成领域的发展。下图简要展示了 X2I 数据集的一些示例：

总之，OmniGen的统一图像生成范式，不但有助于执行各种下游任务，而且有利于组合各种能力满足更通用的需求。当前，OmniGen 的报告、权重和代码等已开源，欢迎社区共同参与对 OmniGen 潜在能力的发掘、基本性能的提升和广泛应用的探索。

OmniGen 模型是对统一图像生成的初步尝试，还有很大的提升空间。未来，智源将进一步改进模型基本能力，拓展更多有趣的功能。同时，微调代码已发布，用户可简单对其进行微调，由于OmniGen的输入形式非常多样，用户可自行定义各式各样的微调任务，赋予模型更多有意思的能力。

最新文章

Ilya宣判后GPT-5被曝屡训屡败，一次训数月，数据要人工从头构建

素数分布规律又有新发现！赵宇飞学生与牛津教授合作成果

o3来了！编程跻身人类全球前200，破解陶哲轩说难的数学测试，北大校友任泓宇现身直播间

图森未来转型6个月：推出AI大模型，布局游戏生态，思考和底气是什么？

这届AI创业：不敲一行代码，营收突破百万级

AI已经在直播间狂刷KPI了

AI风暴席卷达摩院青橙奖，六成获奖者用AI搞科研，平均年龄34岁

1万人研究证实：玩游戏提升智力，与遗传/经济水平都无关

AI能传递气味了！能定制个性化气味，谷歌前研究员新技术

突发！GPT论文一作Alec Radford离职，前两代GPT作者全部离开OpenAI

不会代码的独立开发者，除了学Cursor，还该会些什么？｜十问爆款「小猫补光灯」

谷歌版o1突发即屠榜！思考速度比所有模型快5倍，能解摩斯代码，数学物理秒秒钟解决

苹果Mac用户狂喜！ChatGPT深度集成应用，最后再藏AGI彩蛋

豆包升级了“眼睛”，看APP截图就能写代码了！超低价让多模态AI普惠

100+大模型综测结果出炉！智源发布FlagEval“百模”评测结果，覆盖文本语音图片视频多种模态

12个大模型攒局玩“大富翁”：Claude3.5爱合作，GPT-4o最“自私”｜谷歌DeepMind研究

Claude团队揭发AI伪装对齐：训练时假装遵守目标，只为保护自己价值观不被修改

腾讯版Sora开源后，被提速8倍！官方点赞并预告：下月上新图生视频

突破自动驾驶视频生成极限：港中文&港科大&华为联手推出MagicDriveDiT

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

云计算一哥的生成式AI之道：Choice Matters

大模型是新的数据库！蚂蚁开源负责人王旭：应用开发新范式，新一代LAMP正在形成 | MEET 2025

英伟达新品“掌心AI超算”，¥1800跑8B多模态模型，算力暴增70%价格腰斩

GPT-4o数学能力跑分直掉50%，上海AI Lab开始给大模型重新出题了

更懂中文还兼顾SD生态，360开源文生图模型结构，寡姐秒变中国新娘 | AAAI

我们要做3D界的ImageNet，推动具身智能训练新范式｜群核科技唐睿@MEET2025

见证历史！AI想的科研idea，真被人类写成论文发表了

从骁龙8至尊版，我看到了AI手机的未来 | 智在终端

新奥程路：AI×能源已到“奇点变革”前夜，仿真大模型是关键｜MEET 2025

开源Llama版o1来了，3B小模型反超80B，逆向工程复现OpenAI新Scaling Law

宇树机器人强化学习代码全面开源，还有训练到仿真和实操手把手教学

为多模态LLM引入ControlNet理念，开源插件解决灾难性遗忘 | AAAI

刚刚，智谱又融了30亿！超200亿估值引领大模型创业赛道

谷歌版Sora升级4K高清！一句话控制镜头运动，跑分叫板可灵海螺

ChatGPT搜索与Her打通了！搜索免费开放，居然还剧透明日直播主题

Kimi版o1实装上线，这里是我们的一手测试↑

把1个脑洞发展成1场顶会workshop，阿里妈妈只用了1年｜直击NeurIPS'24

企业级Agent已进入生产力阶段｜BetterYeah AI张毅@MEET

Gemini 2.0成P图神器，各种P图只需一句话的事儿，可把网友馋哭了

21天不用手机，抑郁减少，入睡更快丨正经研究

基于昇腾算力突破AI求解，最高加速100倍！| 华为GTS&深圳市大数据研究院

全球首个全模态理解开源端模型：长语音自动总结，图文音啥都会！300%推理速度领先，来自无问芯穹

月薪1万4的ChatGPT要来了！OpenAI自曝其达博士级别，网友：我宁可聘请一个博士

直击CCAI大会：院士专家舌战激辩，20个AI案例C位出道，海淀无愧AI科技“梦工厂”

OpenAI附议Ilya预训练终结！“但Scaling Law还没死”

Scaling Law不总是适用！尤其在文本分类任务中，vivo AI Lab提出数据质量提升解决方法

Ilya宣判：预训练即将终结！NeurIPS现场沸腾

ChatGPT终于也推出Projects功能，却故意露出一个“AGI”的项目

4000万+用户！测测CEO任永亮：一个行业既不能离AI太近也不能离AI太远 | MEET 2025

专治大模型“套壳”！上海AI实验室等给LLM做“指纹识别”，剪枝合并也无所遁形

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉