StableIdentity:可插入图像/视频/3D生成,单张图即可变成超人,可直接与ControlNet配合使用

目录

前言

相关链接

论文解读

一、摘要

二、方法​编辑

三、应用

语境重构

风格化

图像/视频/3D模型


前言

        随着扩散模型的发展,定制化生成任务受到广泛关注。StableIdentity旨在为文本到图像模型注入新的主题(如身份),并在对齐输入文本提示的同时,生成在不同语境下主题一致的图像。例如,用户可以上传自己的照片以获得有趣的图片,如 "穿着超人服装"。定制生成的成功可以促进许多应用,如个性化肖像照片虚拟试穿和艺术设计。该方法可以直接与ControlNet等基于Stable Diffusion的即插即用的模块配合使用,甚至可以将学习到的身份插入现成的视频/3D生成的模型中,而无需进行微调即可产生出色的效果。

相关链接

        project page:https://qinghew.github.io/StableIdentity/

        paper:https://arxiv.org/abs/2401.15975

        github:https://github.com/qinghew/StableIdentity(代码即将开源)

论文解读

StableIdentity: Inserting Anybody into Anywhere at First Sight

Qinghe Wang1, Xu Jia*1, Xiaomin Li1, Taiqing Li1, Liqian Ma2, Yunzhi Zhuge1, Huchuan Lu1

1Dalian University of Technology, 2ZMO AI Inc. * Corresponding Author

图片

        给定单个输入图像,所提出的StableIdentity可以在各种上下文中生成各种自定义图像,可以将学习到的身份与ControlNet结合起来,甚至注入到视频(ModelScopeT2V)和3D (LucidDreamer)生成中.比如去掉占位符v1*v2*,来让提示词更加简洁。

图片

一、摘要

        大型预训练文本到图像模型的最新进展显示了高质量以人为中心的生成能力,然而,定制人脸身份仍然是一个棘手的问题。现有方法无法确保稳定的身份保持和灵活的编辑性,即使在训练过程中每个主题有多张图像。StableIdentity允许仅使用一张人脸图像进行身份一致的重新语境化。使用具有身份先验的人脸编码器来编码输入的人脸,然后将人脸表示放入一个具有可编辑先验的空间中,该空间由名人的名字构建。通过结合身份先验和可编辑性先验,学习到的身份可以被注入到各种上下文的任何地方。

        StableIdentity还设计了一个掩蔽的两阶段扩散损失来提高输入人脸的像素级感知,并保持生成的多样性。实验表明该方法优于以前的定制方法。此外,学习到的身份可以灵活地与ControlNet等现成模块结合使用。这是第一个直接将从单个图像中学习到的身份注入视频/3D生成中而无需微调的人。因此StableIdentity对统一图像、视频和3D定制生成模型很有启发性。

二、方法

        StableIdentity的概述:给定一张人脸图像,首先使用FR-ViT编码器和mlp来捕获身份表示,然后将其嵌入到构建的人物嵌入空间中,以掌握身份一致的可编辑性。

三、应用

语境重构

        使用建议的StableIdentity在各种上下文(包括装饰、动作、属性)下为不同身份(包括各种种族)生成结果。

图片

风格化

        额外的定制结果与StableIdentity不同的艺术风格。

图片

图像/视频/3D模型

        1. 姿势控制的定制图像生成(StableIdentity & ControlNet)和零拍摄身份驱动的定制视频生成(StableIdentity & ModelScopeT2V)。

图片

图片

        2. Zero-shot身份驱动的定制3D生成(StableIdentity & luciddream)。在这里,用"v1*v2*"作为输入提示,以显示所学身份的3D重建。

图片

图片

        3. 更多的图像/视频/3D定制生成结果名人照片作为输入。

图片

图片

图片

        感谢你看到这里,也欢迎关注下方我的公众号,这是一个有趣有AI的AIGC公众号:关注AI、深度学习、计算机视觉、AIGC、Stable Diffusion等相关技术,欢迎一起交流学习~