谷歌版Sora升级4K高清！一句话控制镜头运动，跑分叫板可灵海螺

科技 2024-12-17 03:39 北京

白小交衡小宇发自凹非寺
量子位 | 公众号 QbitAI

OpenAI直播划水的一天，谷歌版Sora迎来了它的2.0——

Veo 2，根据文本或图像生成更为高质量的视频。

从官方介绍中看，此次主要有三个方面的升级。

比如分辨率能达到4K。

能够理解有关镜头控制的Prompt。

更注重现实物理世界与人类表情的理解和展示。

在官方账号底下，大家都对这些效果表示了惊叹：

我真的想谷歌输掉比赛，但是谷歌没有输。

另外，图像生成模型Imagen 3也有进一步的改进。

谷歌版Sora2.0：重新定义质量和控制

质量和控制，是此次视频模型升级的关键词。

除了显而易见的清晰度的提升——最高可达4K分辨率，它能够忠实地遵循简单和复杂的指令Prompt，并令人信服地模拟现实世界的物理以及各种视觉风格。

具体体现在它的真实感和保真度上，比如细节、伪影减少等方面都有显著改进。

还有高级的运动功能，基于对物理学的理解，能够更高精度的表示运动。

还能准确地遵循各种镜头控制类的Prompt，比如拍摄风格、角度、动作以及所有这些的组合。

那么接下来直观地感受一下效果。

Prompt：特写镜头聚焦于一位女 DJ 的脸部，她美丽、浓密的黑色卷发勾勒出她的五官，她完全沉浸在音乐中。她闭上双眼，沉浸在节奏中，嘴角挂着一丝微笑。当她随着节拍点头和摇摆时，相机捕捉到了她头部的细微动作，她的身体本能地随着耳机中传出的音乐而做出反应，传到人群中。浅景深使背景变得模糊。她被鲜艳的霓虹色包围着。特写镜头强调了她迷人的气质以及音乐传递和超越的力量。

还有是这种集体的蜂群也能刻画出来。

Prompt：镜头轻轻飘过一排排粉刷过的木制蜂箱，嗡嗡作响的蜜蜂在画面中进进出出。镜头落在站在画面中央的优雅农民身上，他洁白的养蜂服在金色的午后阳光下闪闪发光。他举起一罐蜂蜜，稍微倾斜以捕捉光线。在他身后，高大的向日葵在微风中有节奏地摇曳，花瓣在温暖的阳光下闪闪发光。镜头向上倾斜，露出一座复古的农舍，百叶窗是薄荷绿色的，摇曳的树木在墙上投下斑驳的阴影。用 35 毫米镜头在柯达 Portra 400 胶片上拍摄，金色的光线在农民的手套、果酱罐和蜂箱的风化木材上形成了丰富的纹理。

还可以切换镜头，从近景到远景，而在镜头之下，不管是蜂蜜还是咖啡的泡沫细节都有精确地刻画。

Prompt：太阳在一盘摆放整齐的早餐场景后缓缓升起。浓稠的金色枫糖浆以慢动作倒在松软的煎饼上，每一块煎饼都散发出柔软温暖的蒸汽云。特写镜头中，脆培根发出嘶嘶声，金色油脂的细小余烬在空中飞舞。咖啡以顺滑的旋转动作倒入水晶般透明的杯子中，杯子里充满了深棕色的咖啡油层。场景结束时，相机俯冲到新鲜切好的橙子上，以令人惊叹的微距细节展示出它明亮多汁的果肉。

那么在根据人类对其性能的评估中，Veo 2 的表现优于其他领先的视频生成模型

在Meta基准数据集 MovieGenBench上，人类参与者观看了1003个提示和响应的视频。

结果显示，跟市面上的主流视频生成模型相比，Veo2.0在整体偏好、Prompt指令准确遵循方面都表现最佳。

值得一提的是，这里除了Sora，国产模型可灵、MiniMax都上桌了。

所有的比较都在720P分辨率下进行，Veo 采样时长为 8 秒，VideoGen 采样时长为 10 秒，其他型号采样时长为 5 秒。我们向评分者展示完整视频时长。

最后，他们表示，创建逼真、动态或复杂的视频，并在复杂场景或复杂运动的场景中保持完全一致性仍然是一项挑战。他们将继续开发和改进这些领域的性能。

图像模型Imagen 3也增强了

除此之外，还增强了他们的图像生成模型Imagen 3。

可以生成更多样化的艺术风格，如现实主义、梦幻、肖像画等等。

生成的图像会更忠实于Prompt，哪怕这个Prompt有多么地离谱。（Doge）

而从各种生成的图像来看，视觉效果也比之前更明亮，构图也更加平衡。

好了，感兴趣的朋友可戳下方链接了解更多详情。

参考链接：
[1]https://deepmind.google/technologies/veo/veo-2/
[2]https://x.com/GoogleDeepMind/status/1868703624714395907
[3]https://deepmind.google/technologies/imagen-3/

— 完 —

点这里👇关注我，记得标星哦～

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~

量子位

追踪人工智能新趋势，关注科技行业新突破

最新文章

Ilya宣判后GPT-5被曝屡训屡败，一次训数月，数据要人工从头构建

素数分布规律又有新发现！赵宇飞学生与牛津教授合作成果

o3来了！编程跻身人类全球前200，破解陶哲轩说难的数学测试，北大校友任泓宇现身直播间

图森未来转型6个月：推出AI大模型，布局游戏生态，思考和底气是什么？

这届AI创业：不敲一行代码，营收突破百万级

AI已经在直播间狂刷KPI了

AI风暴席卷达摩院青橙奖，六成获奖者用AI搞科研，平均年龄34岁

1万人研究证实：玩游戏提升智力，与遗传/经济水平都无关

AI能传递气味了！能定制个性化气味，谷歌前研究员新技术

突发！GPT论文一作Alec Radford离职，前两代GPT作者全部离开OpenAI

不会代码的独立开发者，除了学Cursor，还该会些什么？｜十问爆款「小猫补光灯」

谷歌版o1突发即屠榜！思考速度比所有模型快5倍，能解摩斯代码，数学物理秒秒钟解决

苹果Mac用户狂喜！ChatGPT深度集成应用，最后再藏AGI彩蛋

豆包升级了“眼睛”，看APP截图就能写代码了！超低价让多模态AI普惠

100+大模型综测结果出炉！智源发布FlagEval“百模”评测结果，覆盖文本语音图片视频多种模态

12个大模型攒局玩“大富翁”：Claude3.5爱合作，GPT-4o最“自私”｜谷歌DeepMind研究

Claude团队揭发AI伪装对齐：训练时假装遵守目标，只为保护自己价值观不被修改

腾讯版Sora开源后，被提速8倍！官方点赞并预告：下月上新图生视频

突破自动驾驶视频生成极限：港中文&港科大&华为联手推出MagicDriveDiT

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

云计算一哥的生成式AI之道：Choice Matters

大模型是新的数据库！蚂蚁开源负责人王旭：应用开发新范式，新一代LAMP正在形成 | MEET 2025

英伟达新品“掌心AI超算”，¥1800跑8B多模态模型，算力暴增70%价格腰斩

GPT-4o数学能力跑分直掉50%，上海AI Lab开始给大模型重新出题了

更懂中文还兼顾SD生态，360开源文生图模型结构，寡姐秒变中国新娘 | AAAI

我们要做3D界的ImageNet，推动具身智能训练新范式｜群核科技唐睿@MEET2025

见证历史！AI想的科研idea，真被人类写成论文发表了

从骁龙8至尊版，我看到了AI手机的未来 | 智在终端

新奥程路：AI×能源已到“奇点变革”前夜，仿真大模型是关键｜MEET 2025

开源Llama版o1来了，3B小模型反超80B，逆向工程复现OpenAI新Scaling Law

宇树机器人强化学习代码全面开源，还有训练到仿真和实操手把手教学

为多模态LLM引入ControlNet理念，开源插件解决灾难性遗忘 | AAAI

刚刚，智谱又融了30亿！超200亿估值引领大模型创业赛道

谷歌版Sora升级4K高清！一句话控制镜头运动，跑分叫板可灵海螺

ChatGPT搜索与Her打通了！搜索免费开放，居然还剧透明日直播主题

Kimi版o1实装上线，这里是我们的一手测试↑

把1个脑洞发展成1场顶会workshop，阿里妈妈只用了1年｜直击NeurIPS'24

企业级Agent已进入生产力阶段｜BetterYeah AI张毅@MEET

Gemini 2.0成P图神器，各种P图只需一句话的事儿，可把网友馋哭了

21天不用手机，抑郁减少，入睡更快丨正经研究

基于昇腾算力突破AI求解，最高加速100倍！| 华为GTS&深圳市大数据研究院

全球首个全模态理解开源端模型：长语音自动总结，图文音啥都会！300%推理速度领先，来自无问芯穹

月薪1万4的ChatGPT要来了！OpenAI自曝其达博士级别，网友：我宁可聘请一个博士

直击CCAI大会：院士专家舌战激辩，20个AI案例C位出道，海淀无愧AI科技“梦工厂”

OpenAI附议Ilya预训练终结！“但Scaling Law还没死”

Scaling Law不总是适用！尤其在文本分类任务中，vivo AI Lab提出数据质量提升解决方法

Ilya宣判：预训练即将终结！NeurIPS现场沸腾

ChatGPT终于也推出Projects功能，却故意露出一个“AGI”的项目

4000万+用户！测测CEO任永亮：一个行业既不能离AI太近也不能离AI太远 | MEET 2025

专治大模型“套壳”！上海AI实验室等给LLM做“指纹识别”，剪枝合并也无所遁形

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉

谷歌版Sora升级4K高清！一句话控制镜头运动，跑分叫板可灵海螺

白小交 衡小宇 发自 凹非寺量子位 | 公众号 QbitAI

谷歌版Sora2.0：重新定义质量和控制

图像模型Imagen 3也增强了

白小交衡小宇发自凹非寺
量子位 | 公众号 QbitAI