首页时事民生政务教育文化科技财富体娱健康情感

旅行百科职场楼市企业乐活学术汽车时尚创业美食幽默美体文摘

字节最新单图视频驱动成果X-Portrait 2：一键生成相同表情神态，效果逼真

科技 2024-11-06 18:02 重庆

单图视频驱动技术为创作富有表现力、逼真的角色动画和视频片段提供了一种成本极低且高效的方法：只需一张静态照片和一段驱动视频即可生成高质量、电影级的视频。

字节跳动智能创作团队近期推出最新单图视频驱动技术X-Portrait 2，基于前一代的X-Portrait研究成果，将人像驱动的表现力提升到了一个全新的高度。

该模型不仅能保留原图的ID，还能准确捕捉并逼真迁移从细微到夸张的表情和情绪，呈现高度真实的效果，大幅简化了现有动作捕捉、角色动画和内容创作流程。

项目网页：https://byteaigc.github.io/X-Portrait2/

整体方案

不同于以往依赖人脸关键点检测的单图驱动方法，X-Portrait 2构建了一个最先进的表情编码器模型，通过一种创新的端到端自监督训练框架，能够从大量人像视频中自学习ID无关的运动隐式表征。

进一步将这个编码器与强大的生成式扩散模型相结合，即可生成流畅且富有表现力的视频。

经过在大规模高质量表情视频上的训练，X-Portrait 2在运动表现力和ID保持性方面显著优于先前技术。

算法能够从驱动视频中提取不同颗粒度的表情特征（如挑眉、咬唇、吐舌、皱眉），并有效迁移到扩散模型，实现精准的表情动作控制，进而能实现驱动视频中人物情感的高保真迁移。

外观与运动解耦

在训练表情编码器时，为了让编码器关注驱动视频中与表情相关的信息，X-Portrait 2较好地实现了外观和运动的解耦。

通过为模型设计过滤层，编码器能有效过滤运动表征中的ID相关信号，使得即使ID图片与驱动视频中的形象和风格差异较大，模型仍可实现跨ID、跨风格的动作迁移，涵盖写实人像和卡通图像。

这使得X-Portrait 2能高度适应各种各样的应用场景，包括现实世界中的叙事创作、角色动画、虚拟形象以及视觉特效等。

技术对比

与前一代X-Portrait以及最近发布的 Runyway Act-One 等业界领先的方法相比，X-Portrait 2能够如实表现快速的头部动作、细微的表情变化以及强烈的个人情感，这些方面对于高质量的内容创作（比如动画和电影制作）至关重要。

安全说明

此工作仅以学术研究为目的，会严格规范模型的应用，防止恶意利用。文中使用的图片/视频，如有侵权，请联系作者及时删除。

字节跳动技术团队

字节跳动的技术实践分享

最新文章

NeurIPS 2024 | 从单图到3D：HumanSplat 基于Gaussian Splatting实现高保真人体3D生成

NDSS 2025｜抖音集团安全研究团队提出机密沙箱内存管理方案WAVEN

ABCoder 在大模型编程领域的探索

来战！「豆包 MarsCode 算法竞技赛」第二期开赛，丰厚奖金等你来拿

豆包视觉理解模型正式发布，通用模型能力全面对齐GPT-4o！

豆包MarsCode AI编程云课堂回顾｜「入门开发者系列」

Kitex/Hertz 助力大模型：三周年重要特性回顾

北京大学-字节跳动“豆包大模型系统软件联合实验室”成立，聚焦AI系统软件关键问题

直播预约｜字节跳动豆包大模型团队 NeurIPS 2024 中选论文精讲

火山引擎veImageX助力谱时智能云深耕照片直播赛道

见证无限可能！火山引擎冬季 Force 大会开发者论坛来袭

首次覆盖超 11 类真实编程场景！豆包大模型团队开源代码大模型全新基准

参与AI 红人共创计划，拿万元现金大奖！每日投票抽奖！

深度揭秘“快稳省”背后的数仓硬核技术

来战！激发你的编程潜力，挑战极限！豆包 MarsCode 算法竞技赛火热来袭！

APMPlus 发布 HarmonyOS NEXT 鸿蒙系统 App 性能监控

更快、更稳、更优，揭秘火山引擎全站加速 DCDN 规模容器化最佳实践

初级开发者系列｜AI编程云课堂课程预告来啦！

大幅降低数据科学门槛！豆包大模型团队开源AutoKaggle，端到端解决数据处理

QCon演讲实录|赵彦奇：HTTPDNS 边缘下沉，性能、成本和稳定性之间的取舍与思考

字节跳动基于 Ray 的大规模多模态数据处理框架

无文本编码器仍能媲美CLIP！豆包大模型团队首创SuperClass模型

首度揭示！个性化视频技术——短视频体验的秘密！

又稳又快！基于ByteHouse ELT构建高性能离/在线一体化数仓

【请领取打卡礼】刷题不停，Offer可期！豆包MarsCode & 掘金 AI 刷题功能再次升级！

「会说话」的 AI ，扣子智能语音 OpenAPI 开启内测申请

火山引擎论文入选国际会议ACM IMC'24｜一种面向大规模视频点播系统的算法实验平台

火山引擎多媒体实验室VR全链路处理传输显示方案ResVR入选ACM Multimedia 2024最佳论文提名

创新实践：基于边缘智能+扣子的智能取物机器人解决方案

QCon演讲实录|徐广治：边缘云原生操作系统的设计与思考

一句话轻松 P 图！字节跳动图像编辑模型SeedEdit发布，产品端可体验

直播预约｜豆包MarsCode校园发布会即将上线！万元大奖，玩法多多先睹为快

视频生成模型能否“理解”物理规律？豆包大模型团队公布系统性实验结论

字节最新单图视频驱动成果X-Portrait 2：一键生成相同表情神态，效果逼真

抖音集团也在用的数仓「降本」利器

BlockFramework —— 客户端模块化业务开发框架

超低延迟多路径传输：技术演进与大规模业务实践

最高提升20倍吞吐量！豆包大模型团队发布全新 RLHF 框架，现已开源！

AI 代码编程助手真的有用吗

万圣节，一起 Cozeplay ！ iPhone 16 Pro Max、Switch、扣子周边等500份“糖果”掉落！

单元化架构在字节跳动的落地实践

技术专题27期 | 后端Java技术创意冠军角逐赛

【万字干货】保姆级AI编程基础入门，看这篇就够了！

豆包MarsCode Agent 登顶 SWE-bench Lite 评测集

1024 码上奇妙夜｜开发者专属，万元“豪”礼，宠爱满满！

揭秘云数仓ByteHouse四大「降本」硬招

1024限时加码｜豆包MarCode小助手给合伙人送礼啦！

扣子上新！文生播客、客服、陪伴、教育…官方带你抄作业！

一文教会你轻松上手豆包MarsCode 编程助手！（文末送AirPods 4啦）

1024，火山引擎开发者社区给你精彩！

分类

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉