文生图Scaling新变量,被字节Seed团队发现了
摘要
文生图模型一直在扩展模型、数据和算力,但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长...
文生图模型一直在扩展模型、数据和算力,但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长度,Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。
基于这一发现,团队提出 Structured Prompt,并从 Diffusability 与 Promptability 两侧共同提升文本条件,最终在复杂组合、推理和世界知识生成任务上取得显著提升。

论文 Figure 1|自然语言长度很快饱和;结构化条件持续增加图像信息,并沿统一关系降低扩散训练损失。
过去几年,文生图模型的进步几乎沿着一条熟悉的路线展开:更大的模型、更多的数据,以及更高的训练算力。
但文生图与语言模型之间存在一个容易被忽略的差异。语言模型可以直接从文本序列中进行自监督学习;文生图模型则依赖图像与 Caption 的配对,学习 “什么样的文字对应什么样的视觉内容”。图像中可能包含大量物体、属性、位置、动作和关系,但只有被 Caption 准确描述并清晰绑定的部分,才能作为文本条件监督传递给模型。
于是,一个基础问题出现了:除了继续扩大模型、数据和算力,我们能否通过增加 Caption 所携带的图像信息,让生成模型学得更好?
在这项新工作中,ByteDance Seed 团队研究了这一问题。核心结论可以概括为一句话:
真正随文本条件扩展的,不是 Caption 的 token 数量,而是其中可被模型利用的图像信息。

- 论文标题: Scaling Properties of Text Conditioning in Visual Generation
- 作者: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan 机构: ByteDance Seed
- 论文:https://arxiv.org/abs/2607.29679
- 项目主页:https://heheyas.github.io/context-scaling
- 代码:https://github.com/heheyas/context-scaling
- 模型:https://huggingface.co/collections/heheyas/context-scaling
- 在线 Demo:https://heheyas-context-scaling.hf.space/
- Hugging Face Paper:https://huggingface.co/papers/2607.29679
Prompt 变长了,
为什么模型没有变强?
一个直觉做法,是把训练 Caption 或用户 Prompt 写得更长、更详细。更多 token 看起来应该意味着更多监督,也应该帮助模型生成更复杂的图像。
实验却给出了不同答案。在多种现有开源文生图系统上,自然语言 Prompt 随长度增加很快饱和,最终输出甚至低于各自最短 Prompt 的表现。即使专门在同一套长文本 Caption 上训练扩散模型,收益也十分有限。
为了把这个现象看得更清楚,团队设计了一个固定骨干网络的图像重建实验。对于同一张参考图像,团队从同一份完整标注出发,生成四个详细程度逐渐增加的自然语言 Caption,再使用相同的 Qwen-Image 模型和随机种子尝试还原该图像。这些 Caption 描述相同的实体和关系,后续版本主要通过补充和展开自然语言表达来增加长度。
令人意外的是,Caption 虽然显著变长,图像重建质量却几乎不再提高。新增的 prose 更多是在解释、改写或连接已经出现的内容,并没有持续增加新的、可稳定使用的视觉变量。

论文 Figure 3|固定骨干重建实验:NL Caption 继续变长后重建趋于饱和,逐步恢复 SP 字段则持续改善。
这说明,Caption 长度只是一个很弱的代理变量。一个文本可以写得很长,却仍然没有清楚说明:某个属性属于哪个物体、两个物体是什么关系、各自位于哪里,以及它们在画面中的前后层次。
如何衡量 Caption 里真正的图像信息?
如果 token 数量不足以衡量监督强弱,就需要直接测量 Caption 中与图像绑定的信息。为此,团队从已有工作中改造了两个互补指标:Grounded Perplexity Gain(GPG)和 Effective Detailness(ED)。
GPG:图像让 Caption 变得 “更可预测” 多少。
GPG 是一个需要读取模型 token 概率的白盒指标。对于同一句 Caption,团队分别让一个冻结的视觉语言模型看到和看不到配对图像,并计算图像出现后 Caption 内容 token 的对数似然提升。若 Caption 中包含大量与该图像紧密绑定的信息,看到图像应当显著提高模型对这些 token 的预测能力。
ED:Caption 覆盖了多少可靠的图像属性。
ED 是一个不依赖 token 概率的黑盒语义指标。它分别从图像和 Caption 中提取带有实体上下文的属性,再计算 Caption 属性的准确率与图像属性的召回率。最终采用更重视准确率的 F0.5,对 Caption 中没有图像依据的描述施加更强惩罚。
两个指标从不同角度刻画同一个问题:GPG 关注图像与文本之间的统计依赖,ED 关注 Caption 是否准确覆盖了可验证的视觉内容。

论文 Figure 6|GPG 与 ED 的定义及测量趋势。
Caption 信息量可以预测扩散模型的训练损失
接下来,团队固定图像、模型架构、初始化方式、优化配置和训练预算,只改变训练 Caption。整个实验包含 15 种 Caption 配置:三个不同长度的自然语言版本、六个逐步恢复字段的 Structured Prompt 版本,以及六个空间表达或字段遮蔽变体。每种配置都从同一个 BAGEL continued-training checkpoint 出发,独立训练一个扩散模型。
结果显示,自然语言 Caption 的 token 数与训练结果并不存在统一关系;但当横轴换成 Caption 信息量后,不同格式和详细程度的配置落在了高度规律的曲线上:
- 收敛后的 diffusion loss 与 GPG 近似呈线性关系,Pearson r = -0.984;
- 收敛后的 diffusion loss 与 ED 呈幂律趋势,log-log 空间中的 Pearson r = -0.971;
- GPG 与 ED 对不同 Caption 配置的排序也高度一致,Spearman ρ = 0.96。
团队将其称为 text conditioning 的 scaling properties。它不是一个对所有模型都成立的理论定律,而是在固定架构与训练 recipe 下得到的经验标定。但它带来了两个直接价值。
第一,它把 Caption 信息量从一个模糊的 “数据质量” 概念,变成了可以控制和测量的训练变量:在模型、图像和算力不变时,信息量能够预测模型最终达到的训练损失。
第二,完成一次标定后,可以在同一训练 recipe 下先用 GPG 或 ED 比较候选 Caption 方案,再决定是否投入昂贵的扩散模型训练。对未参与拟合的六个 Caption 变体,两个指标仍能较准确地预测其收敛损失。

论文 Figure 7|在固定训练 recipe 下,收敛损失随 Caption 信息量呈现稳定关系。
Structured Prompt:
让信息不仅更多,而且更容易被模型使用
前面的实验揭示了一个关键点:仅仅增加自然语言 prose 并不够,新增信息还需要以稳定、明确的方式组织起来。
因此,团队提出 Structured Prompt(SP),用结构化 JSON 表示一张图像中的视觉变量。它包含三个层次:
- 全局层:画面意图、场景、氛围、风格、光照和摄影信息;
- 元素层:每个主体的身份、属性、动作、位置、可选深度和局部摄影信息;
- 关系层:不同元素之间的位置、遮挡、交互和语义关系。
与自由文本相比,SP 的关键不只是 “JSON” 这一外观,而是让不同视觉变量进入稳定的命名字段,减少属性归属、空间关系和对象绑定上的歧义。在固定骨干重建实验中,随着 SP 字段逐步恢复,重建质量持续提高;在完整训练 sweep 中,字段覆盖增加也同步提高 GPG、ED,并降低收敛后的 diffusion loss。

论文 Figure 5|Structured Prompt 将全局、元素级和跨元素视觉变量组织到命名字段中。
为了在大规模训练数据上生成完整 SP,团队构建了一套 image-to-SP 标注流水线。通用 VLM 负责全局语义和局部内容,Sapiens 补充人体姿态证据,DepthAnything V2 提供相对深度,SAM 2.1 提供掩码与遮挡线索,最后再由 VLM 将这些信息统一整理为一致的完整 SP。

论文 Figure 8|VLM 与姿态、深度、分割专家共同构建完整 Structured Prompt。
团队将一个 Caption 表示能够向扩散模型暴露并组织图像监督的能力称为 Diffusability。SP 提升的正是这一侧:在不改变扩散模型架构的情况下,让模型从文本条件中学到更多、更明确的视觉变量。
Promptability:
有了好的结构,还需要 LLM 把它填好
训练时可以从配对图像中提取完整 SP,但实际生成时只有用户的一句话,没有参考图像或 oracle 标注。系统还需要一个 LLM prompter,把用户请求扩展成详细、连贯、且不违反原始约束的 SP。
团队把这种从用户请求实例化结构化条件的能力称为 Promptability。端到端生成质量取决于两侧共同作用:
Generation Quality = Diffusability × Promptability
这里的乘号是一种组织视角,而不是拟合得到的数学乘法公式:Diffusability 描述扩散模型能够从 Caption 表示中学到什么,Promptability 描述 LLM 在推理时能否真正填出高质量的 Caption 实例。

论文 Figure 4|Structured Prompt 连接标注、测量、diffuser 训练、prompter 训练与最终生成。
首先,团队固定 SP schema 和 Qwen-Image diffuser,只替换零样本 LLM prompter。随着 Qwen3.5 从 0.8B 扩展到 397B,thinking 模式下的 GenEval++ 从 46.4% 提升到 86.8%。除最小模型容易在思考过程中重复并无法输出有效 JSON 外,chain-of-thought 在其他尺度上都带来进一步提升。这说明,通用 LLM 的模型能力和推理能力,可以通过 Caption 接口直接转化为更好的图像生成结果。
但零样本 LLM 仍然倾向于生成信息不足、构图较简单的 SP。为进一步提高 Promptability,团队采用三阶段训练:
SFT 学习扩散模型所期望的 SP 内容分布,而不只是 JSON 格式;
Cold-start 从带有配对图像的 privileged reasoning traces 中蒸馏 “如何仅根据用户请求推导 SP”;
RFT 在 prompter 自己生成并渲染的 rollout 上继续优化,由 verifier 筛选高置信轨迹,再通过 image-conditioned teacher 的 on-policy self-distillation 提供稠密 token 监督。
消融实验表明,三阶段承担不同作用:SFT 带来最大的单阶段结构提升,cold-start 加强从用户请求到 SP 的推导,而 verifier-gated OPSD 在 prompter 自身分布上取得最强结果。

论文 Figure 9|固定 schema 与 diffuser 后,生成质量随 LLM prompter 尺度和 reasoning mode 提升。

论文 Figure 10|SFT、cold-start 与 verifier-gated RFT 三阶段 prompter 训练。
结构化表示,
也让生成过程更容易迭代修正
SP 的字段化表示还有一个自然优势:当生成图像出现错误时,系统可以定位并修改相应的对象、属性、关系或布局字段,而不是重新改写整段自然语言 Prompt。
基于此,团队构建了 refine-render-judge 循环。每一轮中,prompter 根据用户请求和历史反馈生成或修订 SP,固定 diffuser 渲染图像,在线 judge 再针对 Prompt 遵循、结构和视觉质量给出 PASS/FAIL 与具体问题。若失败,下一轮只需围绕相关字段进行调整。
实验显示,增加迭代预算能够继续提高结构、对齐和 GSB 表现;但有效推理长度并不长。对于训练后的 prompter,即使允许最多 8 轮,平均也只使用 2.31 轮;从 Tmax = 4 增加到 8,收益已经很小。这表明,文生图确实受益于迭代纠错,但在当前设置下并不需要很长的 prompt-side reasoning trajectory:修复主要规格错误后,额外轮次会迅速饱和。

论文 Figure 14|Refine-render-judge 的 agentic 推理循环。

论文 Figure 15|循环能够修正对象拆分、关系和整体布局问题。
同一套 Qwen-Image,
结构化接口带来了多大提升?
最终系统由 SP-trained diffuser 与训练后的 LLM prompter 组成。它在几乎所有报告指标上领先所比较的开源权重模型,并在大多数评测上达到或超过所比较的闭源系统,优势在组合、推理和世界知识任务上尤其明显。
更关键的是 matched control。为了排除 “只是多训练了一些” 的解释,团队使用完全相同的 Qwen-Image 架构、训练图像、训练阶段和预算,额外训练了一套始终使用自由自然语言 Caption 的系统。结果如下:

论文 Table 2|与代表性文生图系统的完整对比。截图保留论文中的评测定义、加粗与脚注。
Matched NL 的额外训练确实带来了一些提升,但远不足以复现 SP 系统的结果。这说明,收益不能简单归因于更大的 backbone 或更多训练,而与 prompter 和 diffuser 之间所使用的结构化 Caption 接口密切相关。

论文 Figure 11|复杂空间关系、数量和属性绑定的定性对比。
下一步不只是 scale 模型,
也要 scale 条件本身
这项工作的出发点很简单:对于文生图模型,Caption 不是无关紧要的元数据,而是图像内容进入文本条件学习的主要接口。
当 Caption 只是变长时,新增 token 可能只是改写和铺陈;当图像信息被准确提取、清晰绑定并稳定组织时,同一个生成模型才能从中学习更多。GPG 和 ED 让这种信息成为可测量的变量,Structured Prompt 提高 Diffusability,LLM scaling、post-training 和短程 agentic refinement 则提高 Promptability。
因此,文生图的下一步 scaling 不应只关注 “负责渲染的模型有多大”,还应关注:
传递给模型的文本条件,究竟携带了多少它真正能够学习和使用的图像信息?
评论 (10)
Promptability和Diffusability这俩概念挺重要,文生图得两边一起抓才能出好结果。
ByteDance Seed团队这研究厉害,把Caption信息量变成能控制测量的变量,后续训练能省不少事。
以后文生图可不能只盯着模型规模了,还得考虑文本条件里的图像信息,方向找对了。
团队用的那些指标来衡量Caption信息,挺科学的,能更好地分析模型训练情况。
这研究把文生图里很多容易忽略的细节都研究透了,对行业发展有挺大推动作用
结构化表示能让生成过程纠错更方便,这是真有实用性,研究没白做。
三阶段训练提高Promptability这方法不错,后续可以试试更多类似的优化手段。
实验结果很明显,结构化接口确实能提升文生图效果,不是多训练就能解决的事儿。
单纯让Caption变长没啥用,字节团队发现得组织好信息,用Structured Prompt能提升模型效果,这思路挺新颖。
搞半天原来Caption长度不是关键,得看里面和图像绑定的信息,这研究有点东西。