风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

IQA-T1:让大模型图像质量评估从‘凭感觉’走向‘拿证据说话’

摘要

大模型打图质量分,为什么总像在猜? 一张清晰的照片,和它被悄悄加噪、压缩、模糊后的退化版本,在人眼看来质量天差地别;但在多模态大模型(MLLM)的视觉表征中,两者却几乎完全一致。模型无法感知底层退化信号,...

IQA-T1:让大模型图像质量评估从‘凭感觉’走向‘拿证据说话’
大模型打图质量分,为什么总像在猜? 一张清晰的照片,和它被悄悄加噪、压缩、模糊后的退化版本,在人眼看来质量天差地别;但在多模态大模型(MLLM)的视觉表征中,两者却几乎完全一致。模型无法感知底层退化信号,只能依赖高层语义理解——比如‘这是一只猫’‘这是海边日落’——而对噪声、模糊、压缩伪影等真实画质缺陷极度迟钝。这种语义偏见导致其质量评分缺乏客观依据,本质上是‘凭感觉估分’,而非‘看证据判断’。 旧方法的两个补丁,都没补到要害 当前主流方案有两种尝试:一种是纯文本推理,例如Q-Insight或VisualQuality-R1,靠模型生成质量描述再打分,但整个过程仍建立在模型自身‘脑补’的语义先验上,没有可验证的视觉锚点;另一种是区域裁剪推理,如Zoom-IQA或Q-Probe,把可疑区域放大喂给模型,但这些图像块本身仍是未解释的原始像素,模型既看不出‘这是噪声’也说不清‘为何失真’。二者共同缺陷在于:都没有为推理提供结构化、可追溯的视觉证据。 新范式:给大模型配一个‘检测工具箱’ IQA-T1提出根本性转变——不靠模型‘自己看’,而是让它主动调用专业视觉分析工具,把不可见的退化特征转化为可视化的‘物证’。团队构建了覆盖7类关键感知属性(结构、锐度、噪声、伪影、亮度、色彩、自然度)的15种确定性工具,每种工具专攻一类退化: NoiseResidualMap提取传感器与压缩噪声; FourierMagnitudeSpectrum定位频域周期性伪影; GradientOrientationCoherenceMap揭示因模糊导致的边缘方向混乱…… 这些工具输出统一格式、适度下采样、结果完全确定,确保训练与推理阶段证据一致可靠。 从‘会用’到‘会选’:两阶段智能训练 模型需掌握两项能力:正确使用工具,以及精准判断何时调用。为此设计两阶段训练流程:第一阶段监督微调(SFT),在自建Q-Tool数据集上教会模型遵循结构化推理模板、规范调用工具语法、并将证据图与质量判断强关联;第二阶段强化学习(GRPO),优化工具调用策略——奖励格式合规、打分准确、工具适量且不重复,惩罚冗余与滥用。最终模型学会以最少工具(平均每图仅2.34个)获取最有效证据,实现高效、精准、可解释的评估。 首个支持证据推理的IQA数据集:Q-Tool 为支撑这一新范式,团队构建了首个面向‘视觉证据驱动推理’的IQA数据集Q-Tool,含11,000条高质量多模态推理链。构建采用三阶段流水线:先定义7属性/15工具的感知框架;再由人类专家设计分步推理模板,并约束GPT-4o生成符合逻辑的证据引用链;最后人工三重校验——工具是否匹配属性、证据是否被实际引用、结论是否由证据支撑,不合格样本全部剔除或精修。 实证效果:7大基准综合最优,解释性与精度兼得 IQA-T1在KonIQ上训练后,在涵盖真实失真、合成失真、算法退化及AI生成内容的7个权威基准上全面领先,平均PLCC达0.795、SRCC达0.784,刷新综合SOTA。相比仅打分不解释的方法(如Q-Align、DeQA),它在保持高精度的同时输出完整证据链;相比已有带推理的方法(如Q-Insight、Zoom-IQA),它在最难的CSIQ(合成失真)与PIPAL(算法退化)数据集上取得突破,并在真实图像与AIGC场景中表现稳健。消融实验进一步证实:工具不在多而在准,动态调用机制显著优于固定组合或暴力堆叠。 不止于IQA:一种可迁移的多模态推理新范式 该框架已在Qwen3-VL-2B、InternVL3.5-4B等多个主流多模态基座上验证通用性,性能趋势高度一致。这表明‘工具化视觉证据推理’不是某个模型的特例技巧,而是一种可推广的系统级设计思想。它指向一个更可靠的方向:让大模型的视觉感知不再依赖黑箱表征,而是扎根于可测量、可验证、可追溯的底层信号,真正迈向‘看得懂、说得清、判得准’的下一代多模态智能。

评论 (8)

登录 后即可发表评论
生产队的驴

两阶段训练让模型会用还会选工具,平均每图用2.34个工具就有效,厉害

0 回复
社会主义接班人

IQA - T1在多个基准领先,精度高还能输出证据链,比以前的方法强太多

0 回复
猪猪瞎
猪猪瞎 1周前

Q - Tool数据集构建严格,为新范式提供了有力支撑,有它实证效果才这么好

0 回复
财神道
财神道 1周前

工具化视觉证据推理是好想法,让大模型视觉感知扎根底层信号,靠谱

0 回复
廾匸。
廾匸。 1周前

老方法不行,IQA - T1这新范式不错,用工具找证据,训练也科学,效果还好,还能推广,有前途

0 回复
更多