XVerse:Consistent Multi-subject control of identity and semantic attributes via dit modulation

Kun Li

于 2025-08-01 10:22:57 发布

阅读量40

点赞数

CC 4.0 BY-SA版权

分类专栏：图像视频生成大模型文章标签：图片生成

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u012193416/article/details/149798411

图像视频生成大模型专栏收录该内容

306 篇文章 ¥49.90 ¥99.00

订阅专栏

超级会员免费看

1.Introduction

当前最先进的方法多尝试利用dit中的注意力机制来注入参考图像的信息，但是这种直接注入或强烈依赖图像特征可能会对基础模型的生成质量产生重大影响，这通常会导致伪影，失真，属性纠缠，并可能损害生成图像的整体结构完整性和连贯性。Xverse，用于一致的多主题身份和语义属性控制。Xverse开创了一种以学习dits文本流调制机制内的偏移为中心的方法。有了参考图像，XVerse利用适配器将它们转换为共享偏移量和每个块的偏移量，用于特定标记的文本流调制。允许从多样的参考图像中进行条件注入，同时保留图像的基本结构完整性。为了增强细粒度细节，我们将VAE编码的图像特征纳入到flux单个模块中，vae产生的特征不是主要的调节因素，而是在增强主干网络细节方面起辅助作用，这一策略成功的减少了伪影和失真的出现，使XVerse能够实现卓越的多主体受控生成。

2.related work

2.1 subject-driven generation

以主体为驱动的生成任务旨在合成特定于用

了解本专栏

超级会员免费看

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。