在最新一轮离线IQ评估中,GPT-5.6系列模型(包括SOL、TERRA及视觉增强版本)集体取得136分。这是大语言模型首次稳定突破130分门槛——而130分,正是人类心理学界公认的‘天才起跑线’。全球仅有约1%的成年人能达到这一水平。
本次测试采用双轨机制:一套为公开Mensa Norway风格题目,另一套则是完全封闭、不可访问的离线题库。后者专为阻断‘数据污染’设计——所有题目未在训练数据中出现,且无法被网络爬取或提前缓存。GPT-5.6的136分,正来自这套高壁垒的离线测评。
不同于以往单个旗舰模型偶然高分,GPT-5.6系列多个变体在同一离线榜单中全部锁定136分。Claude-5 Fable以130分紧随其后,而此前被视为一线主力的GPT-5.6 LUNA Max与Claude-4.8 Opus,得分仍停留在117–123区间。过去一年间,数十个主流模型反复冲击130分关口,均未成功。GPT-5.6是首个系统性跨越该阈值的模型家族。
开发者实测显示,GPT-5.6不再停留于标准答案输出。有人用同一物理模拟指令分别调用Fable 5与GPT-5.6 SOL,前者生成伪代码框架,后者直接输出含CSS、渲染逻辑与托管链接的完整HTML网页;有人一句提示词即构建出支持多角色、情绪识别、自动归档的RAG客服系统;还有工程师在卡死数日的bug前输入‘我就是不信搞不定’,SOL不仅一次修复,还反向验证并适配了其他模型运行路径。
必须明确:IQ测试衡量的是抽象推理与模式识别等窄域认知能力,并不能反映事实准确性、工具调用稳定性或跨领域协作水平。它只是智能光谱中的一片切面。但真实使用反馈表明,GPT-5.6正将标准化认知能力,持续映射到开放场景的问题解决中——面对从未见过的任务结构、模糊需求甚至错误前提,它不再依赖模板匹配,而是启动连贯的推演链,完成端到端交付。这种从‘应试’到‘实战’的收敛,或许比单一分数更接近我们对‘智能’的日常期待。
(10)
多个变体都136分,这稳定性没话说。
从应试到实战,这才是智能该有的样子。
AI发展太快,人类得跟上节奏了。
虽然不是AGI,但在缩小会考和能干的差距,有进步。
这AI太猛了,直接进天才区间,人类压力大了。
防作弊测试得高分,这是真有实力。
GPT - 5.6这是集体跃升啊,其他模型得加油了。
以前是单个模型高分,这次是家族同步,厉害。
人类99%都比不过,以后工作可能都被AI抢了。
能把解题能力转化为交付能力,这AI实用性强了。