news 2026/4/18 9:49:44

顶刊TPAMI!字节联合中科大重磅打造文本到图像定制化生成新范式!

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
顶刊TPAMI!字节联合中科大重磅打造文本到图像定制化生成新范式!

论文链接:https://ieeexplore.ieee.org/abstract/document/11206511
代码链接:https://github.com/bytedance/RealCustom
项目链接:https://corleone-huang.github.io/RealCustom_plus_plus/
Hugging Face: https://huggingface.co/bytedance-research/RealCustom

亮点直击

  • 突破传统方法存在的主体一致性和文本可控性之间的权衡取舍问题,创新性地将参考图主体表征为真实文本单词,通过解耦文本和参考图的影响区域,同时实现高度主体一致性和文本可控性;

  • 曾作为即梦线上主体保持生成算法广泛应用;

研究动机

现有范式将主体表示为一个伪词(例如),并将其与文本结合用于生成。伪词本身存在固有冲突(即,会导致其他真实词语偏离其原有语义)和纠缠(即,影响范围与文本有重叠),从而产生了双最优悖论:主体相似性与文本可控性之间存在权衡。

我们提出RealCustom++ 的真词定制化生成新范式,首先将主体表示为真实词语(例如主体的超类别词),在引导分支中生成引导图像,并获得主体引导掩码。随后,在生成分支中,主体仅在掩码范围内发挥影响,而其他区域则完全由文本控制,从而同时实现了高主体相似性和文本可控性。

方法优势

  • 生成图像的主体区域与参考图高度一致,非主体区域则完全不受参考图影响,实现主体保持的一致性和文本可控性的协同统一。

  • 高度灵活:通过在推理阶段选择不同的单词,我们方法实现了灵活通用的任意层次的主体/主体群的精准保持生成。

技术方案

RealCustom++ 采用了一种全新的“训练-推理”解耦框架,拜托了对主体保持的配对数据依赖:
(1)在训练阶段,RealCustom++学习视觉条件与文本中所有真实词语之间的通用对齐关系。具体实现包括:通过跨层跨尺度投影器(CCP)提取细粒度且鲁棒的主体表征,以及通过课程式训练策略(CTR) 平滑且高效地注入主体表征。
(2)在推理阶段,RealCustom++提出了由自适应掩码引导(AMG)机制连接的双分支架构。其中,引导分支生成主体引导掩码,生成分支则利用该掩码,仅在与主体相关的区域内定制生成特定真实词语。

效果对比

我们在单主体保持和多主体保持效果上都显著超越了SOTA方法。

结论

本文提出了RealCustom++这一创新定制范式,首次通过真实词汇无冲突地表征主体,实现了主体相似性与文本可控性的精准解耦。该范式通过训练-推理解耦框架内的渐进式定制过程,将目标真实词汇从通用概念逐步细化为具体主体。RealCustom++采用跨层跨尺度投影器与渐进式课程训练策略,实现了鲁棒的特征提取及姿态与尺寸的多样性。在推理阶段,自适应掩码指导技术能准确定制目标真实词汇,同时有效保留主体无关区域。我们进一步通过多真实词汇定制算法将RealCustom++扩展至多主体场景。大量实验表明,该方法在单主体与多主体的实时开放域定制任务中,在主体相似性与文本可控性方面均达到了最先进的性能水平。

参考文献

[1] RealCustom++: Representing Images as Real Textual Word for Real-Time Customization

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/4/17 20:00:54

GPT-SoVITS模型灰度发布策略:逐步上线新版本降低风险

GPT-SoVITS模型灰度发布策略:逐步上线新版本降低风险 在语音合成技术正加速渗透进智能客服、虚拟主播和有声内容创作的今天,一个仅需1分钟语音即可克隆音色的开源模型——GPT-SoVITS,正在开发者社区掀起波澜。它让高质量语音生成不再依赖数小…

作者头像 李华
网站建设 2026/4/18 4:04:55

react 之服务端渲染(SSR)

目录 前言一、React SSR 的概念二、React SSR 的核心原理1、服务端渲染 React 组件2、将 HTML 注入模板返回给浏览器3、客户端 hydration 三、React SSR 的典型流程1、完整 React SSR 渲染流程2、面试必会:简述 React SSR 渲染流程(⭐️⭐️⭐️&#xf…

作者头像 李华
网站建设 2026/4/18 3:57:45

18、Windows Store 应用开发:布局调整与系统集成

Windows Store 应用开发:布局调整与系统集成 1. CSS 媒体查询与视图状态处理 1.1 灵活容器与字体大小调整 在 Windows 8 应用开发中,灵活容器是核心的 CSS 技术,像 GridView、ListView 和 SemanticZoom 等组件都基于此。若要增大所有子元素的字体大小,可打开 default.c…

作者头像 李华
网站建设 2026/4/18 3:58:34

广汽集团副总经理郑衡因个人身体原因辞职

雷递网 乐天 12月24日广汽集团今日宣布,董事会于今日收到公司副总经理郑衡送达的《辞职函》,由于个人身体原因,其申请辞去公司副总经理职务,辞职后不再担任公司任何职务。广汽集团称,郑衡的《辞职函》自送达董事会之日…

作者头像 李华
网站建设 2026/4/18 4:01:07

SpringBoot+Vue 协同过滤算法黔醉酒业白酒销售系统平台完整项目源码+SQL脚本+接口文档【Java Web毕设】

摘要 随着互联网技术的快速发展,电子商务已成为现代商业的重要组成部分,白酒行业作为传统消费品行业,亟需通过数字化手段提升销售效率和服务质量。黔醉酒业作为区域性白酒品牌,面临市场竞争加剧、消费者需求多样化等问题&#xff…

作者头像 李华
网站建设 2026/4/18 7:25:39

企业级协同过滤算法黔醉酒业白酒销售系统管理系统源码|SpringBoot+Vue+MyBatis架构+MySQL数据库【完整版】

💡实话实说:有自己的项目库存,不需要找别人拿货再加价,所以能给到超低价格。摘要 随着互联网技术的快速发展,白酒行业的销售模式逐渐从传统线下转向线上化与智能化。黔醉酒业作为区域性白酒品牌,亟需通过数…

作者头像 李华