风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%

摘要

PANews 7月29日消息,Kimi宣布开源多模态大模型视觉感知评测基准PerceptionBench,旨在将视觉感知能力拆解为10项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与3D、定位、比较、细粒度识别、上下文整合...

PANews 7月29日消息,Kimi宣布开源多模态大模型视觉感知评测基准PerceptionBench,旨在将视觉感知能力拆解为10项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与3D、定位、比较、细粒度识别、上下文整合、OCR及幻觉识别等维度。该基准基于42个现有评测集中的模型失败案例构建,共包含3000道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。

评测结果显示,在16款前沿多模态大模型中,没有任何模型整体准确率超过60%。GPT-5.6-Sol以59.7%的准确率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)位列前五。报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍存在显著提升空间。

评论 (5)

登录 后即可发表评论
过山风
过山风 3天前

这基准挺有想法,把能力拆分评估,但模型整体准确率都不咋高,提升空间太大了

0 回复
配齐
配齐 3天前

都前沿模型了,准确率还这么低,这视觉感知技术路还长着呢

0 回复
薛
3天前

新基准不错,不过模型效果这么一般,后续研发得加油了

0 回复
远景哥哥

视觉幻觉是短板啊,这得想办法解决,不然模型都没法好好用

0 回复
达闻东
达闻东 3天前

GPT - 5.6 - Sol第一也没过60%,看来视觉感知这一块离理想状态还差得远呢

0 回复
更多