首页时事民生政务教育文化科技财富体娱健康情感

旅行百科职场楼市企业乐活学术汽车时尚创业美食幽默美体文摘

字节版Sora火爆24小时，同名论文再次被热议

科技 2024-09-25 18:53 北京

来源| 量子位

“不需要再等OpenAI的鸽王Sora了”。‍

字节版Sora终于来了，这一次还憋了个大的——

一口气推出Seaweed和PixelDance两款豆包视频模型，支持文生/图生视频，时长可达10s。

以PixelDance为例，其最大特色在于多主体交互，一致性多镜头生成。

啥意思？？——直接来看几个官方demo。

First kill，现在手上有这样一张原图：

若使用当前大多视频模型，一般只能进行到“摘墨镜”这个环节；而PixelDance能解锁时序性多拍动作指令。（摘完墨镜还能站起来，并走向雕像）

还有类似电视剧的飙戏名场面（多个主体），各自眼神、动作，一整个拿捏。

Double kill，饱受吐槽的PPT动画有新解了。PixelDance拥有变焦、环绕、平摇、缩放、目标跟随等多镜头话语言能力。

提示词：一名亚洲男子带着护目镜游泳，身后是另一名穿潜水服的男子

关键来了，在一致性方面，PixelDance号称能10秒讲述完整故事。

说人话就是，在一句提示词内，实现多个镜头切换，同时保持主体、风格和氛围的一致性。

提示词：一个女孩儿从汽车上下来，远处是夕阳

另外，PixelDance支持多种风格比例。（说你呢Runway）

提示词：水墨风格的鸟，比例16:9

小结一下，字节版Sora这次主打多主体交互、酷炫运镜、一致性多镜头以及多风格比例。

发布会一结束，网友们的期待值也是拉满了，嗷嗷待哺内测资格！

与此同时，字节研究团队一篇PixelDance同名论文，也被扒了出来，再次引发热议。‍‍‍

背后论文揭示「PixelDance」原型‍‍

字节团队此前入选CVPR 2024的论文，就提出了名为一种PixelDance的模型。‍

先划重点，团队采用的方法可以概括为：

基于潜在扩散模型，结合视频片段的首帧和尾帧图像指令与文本指令进行视频生成，并有效利用公开视频数据进行训练。

首先，团队采用广泛使用的2D UNet作为扩散模型，该模型由一系列空间下采样层和一系列空间上采样层构建，并插入了跳跃连接。

具体来说，它由两个基本模块构建，即2D卷积模块和2D注意力模块。

通过插入时间层将2D UNet 扩展为3D变体，其中在2D卷积层之后插入1D时间卷积层，2D注意力层之后插入1D时间注意力层。

模型可以通过图像和视频联合训练，在空间维度上保持高保真生成能力。

不过对于图像输入，1D时间操作被禁用。团队在所有时间注意力层中使用双向自注意力。

其次是指令注入。具体来说，PixelDance基于<文本，首帧，尾帧>指令。

文本指令源于使用详细的文本注释以精确描述视频的帧和动作

首帧图像指令描述了视频片段的主要场景

尾帧图像指令（在训练和推理过程中可选使用）描绘了视频片段的结尾，并提供了额外的控制

这里要插一句，与文本指令相比，图像指令更加直接且易于获取——使用真实视频帧作为训练中的图像指令。

据了解，文本指令由预训练的文本编码器编码，并通过交叉注意力融入扩散模型。

图像指令由预训练的VAE编码器编码，并与受扰的视频潜变量或高斯噪声一起作为扩散模型的输入。

在训练过程中，团队使用（真实的）首帧指令来强制模型严格遵循该指令，从而保持连续视频片段之间的一致性。

当然了，PixelDance独特之处在于使用尾帧指令的方式。

简单说，团队有意避免让模型完全复制尾帧指令，因为在推理过程中提供一个完美的尾帧是很困难的，模型应该能够处理用户提供的粗略草稿，并作为指导。

为了实现这一点，团队开发了三项技术：

1、在训练过程中，尾帧指令是从视频片段的最后三帧（真实的）中随机选择的。

2、向指令中引入了噪声，以减少对指令的依赖性并提高模型的鲁棒性。

3、在训练中以一定概率（例如 25%）随机丢弃尾帧指令。

相应地，团队提出了一种简单但有效的推理策略。

概括起来就是，在前τ次去噪步骤中，利用尾帧指令引导视频生成朝向期望的结束状态。

在剩余的步骤中，指令被丢弃，允许模型生成时间上更连贯的视频。

通过调整τ，可以控制尾帧指令对生成结果的影响。

接下来，团队在WebVid-10M数据集上训练了视频扩散模型，该数据集包含大约1000万个短视频片段——

平均时长为18秒，分辨率通常为336 × 596，且每个视频都附有与视频内容松散相关的文本描述。

不过WebVid-10M存在一个问题，即所有视频上都带有水印，这导致生成的视频中也会包含水印。

因此，团队将训练数据扩展为另外自收集的50万个无水印视频片段，它们包含真实世界的实体，如人类、动物、物体和风景，并附有粗粒度的文本描述。

尽管这一额外数据集只占了很小比例，但团队惊讶地发现：

将该数据集与WebVid-10M结合训练后，如果图像指令没有水印，PixelDance就能够生成无水印的视频。

最终，PixelDance在视频-文本数据集和图像-文本数据集上进行联合训练。

对于视频数据，从每个视频中随机采样16个连续帧，每秒4帧。

此外，按照之前的工作，采用LAION-400M作为图像-文本数据集；每8次训练迭代使用一次图像-文本数据。

自论文发布之后，到产品上线这段时间具体又做了哪些改进，目前还不得而知。

由于刚发布，目前只能简单看到官方提及：

感兴趣的话可以亲自上手试一试来感受一下，目前豆包视频模型已在火山引擎开启企业用户的邀请测试；个人用户可在字节旗下的即梦AI申请内测。

官方声称，未来将逐步开放给所有用户。

那么，你期待这次的字节版sora吗？

想知道字节版sora和快手可灵、Runway这些国内外视频模型对比如何吗？

（企业版）火山引擎官网申请测试：
https://console.volcengine.com/

（个人版）即梦AI申请内测传送门：

https://bytedance.larkoffice.com/share/base/form/shrcnTPmPPxn9j6bw2AH3kdP6Fd

参考链接：
[1]https://mp.weixin.qq.com/s/pA9W7R7rSq66r-DB5o65Sg

http://mp.weixin.qq.com/s?__biz=MzkyMDU5OTAyNg==&mid=2247490857&idx=2&sn=53e52dac5e6f7c75685d4e92bbd1f436

围绕生成式AI技术的交流社区，与开发者和合作伙伴共同探究有深度的生成式AI技术前沿洞见、技术迭代、案例解析、方法和实践，助力企业的数字化转型

最新文章

中美之外，谁还能在AI竞争中占领制高点？迪拜与新加坡的契机

Blackwell与FP4精度：AI量化浪潮中推动端侧发展的“双子星”

OpenAI：AGI共5层，我们现在在第2层

吴恩达：《State of AI report》展现2024的主要趋势和突破（二）

OpenAI 推出了 Canvas 和 SearchGPT

英伟达 GPU 架构：演进与模型推理速度的深度关联

吴恩达：《State of AI report》展现2024的主要趋势和突破（一）

模型剪枝，如何把模型的使用成本降下来？

AI Agent智能数字员工解决案例

MemoRAG：重新定义长期记忆的AI问答模型

从Pre-training Scaling Law到Inference Scaling Law：OpenAI O1模型引领新范式

探秘AIPC软件：云端和本地如何奏响混合乐章

RAG测评关键指标

字节版Sora火爆24小时，同名论文再次被热议

李沐：如果有什么事这一辈子总要试下的，就趁早

曝英特尔被抢投50亿美元！高通求购关口，老伙计火线救场

黑神话热潮，能引发GPU狂欢的才是杀手级应用

o1核心作者MIT演讲：激励AI自我学习，比试图教会AI每一项任务更重要

数据先行 -- Scale AI如何通过AI数据服务成为独角兽

OpenAI重金押注，机器人NEO世界模型登场！机器人迎来ChatGPT时刻？

解析 Llama-Factory：从微调到推理的架构

OpenAI o1模型问世，五级AGI再突破！推理极限超博士，清北复旦华人立功

RAG领域出现技术创新，或将引领AI搜索重大变革？

OpenAI神秘模型「草莓」两周内上线？数学推理暴涨，月收费200刀已有人付费

使用 LlamaIndex 进行 CRAG 开发用来强化检索增强生成

苹果华为新机同日上市，靠谱剧透都在这里了

LLM如何结合知识图谱进行RAG

Windows率先本地文生图，互联iPhone秒传图片，最新AI PC来了！

Blackwell视角揭秘：生成式AI挑战如何重塑GPU芯片的未来版图

大厂不想你有 AI 女友

商汤SenseNova 5.5大模型的应用实践

又有AI创始人卖身大厂！带走25%员工留下空壳，为吴恩达第一位博士生

AI驱动的智能运维：行业案例与挑战解析

超越GPT-4o！阿里发布最强开源多模态模型Qwen2-VL，支持实时视频对话

给RAG开药方：亚马逊发布RAGChecker，专治AI回答不准

GPT-5降临，代号猎户座？OpenAI疑用草莓训练，数学推理暴涨超越所有模型

为什么AI PC需要NPU？

Transformer作者预警：只卖模型玩不过OpenAI！

大模型时代，传统程序员还需要写代码吗？

谷歌搜索引擎全面揭秘！近百份文档泄露，博主爆肝数周逆向工程

AI模型“减肥”风潮：量化究竟带来了什么？

比红杉还猛！7个月投资8家AI公司，智谱为什么投得这么凶？

100%结构化输出——OpenAI新功能大幅增强工具调用

ChatGPT成8岁娃「导师」，外国家长们慌了！

AI模型训练中的双剑侠dd：GPU和CPU的分工

全球首个AI科学家诞生！论文写稿与审稿一起拿下，实现全自动开放式科学发现

Relevance AI：打造一个AI智能体营销团队

谷歌版Her抢跑！一键召唤Gemini，全球52亿终端被颠覆

以小搏大：Salesforce 十亿参数模型表现超过ChatGPT

AI搜索向左，搜索 OG 向右

分类

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉