Codex Radar 实时 IQ 快照怎么看?GPT-5.5 与 GPT-5.6 系列 Sol、Terra、Luna 的差异一次讲清
从这张 Codex Radar 实时 IQ 快照来看,数据时间是 2026 年 7 月 31 日,核心是在对比 OpenAI 的 GPT-5.5,以及它的升级版 GPT-5.6 系列,也就是 Sol、Terra、Luna 三个模型。整张图的信息并不复杂,但如果只盯着一个综合分,很容易看偏。真正有价值的地方,在于同时看 综合 IQ、完成题目数量、不同思考档位、耗时和价格。
一、这张 Codex Radar 快照到底在比什么?先把统计口径看明白
来源内容里已经给出说明:图中标注的 IQ 计算方式,是 每个任务按有效结果通过率乘以 150;而 耗时和价格,则是这些结果样本的 均值。这意味着,图里的 IQ 不是抽象印象分,而是根据测试任务结果折算出来的指标。
同时,几个模型的测试题量也不完全一样。比如 GPT-5.5 是在 224 道测试里完成了 127 道,而 Sol、Terra、Luna 都是在 672 道测试里分别完成各自题目数量。也就是说,读这类图时,不能只拿一个数字孤立判断,而要把 测试规模和完成数量一起看。
二、GPT-5.5 表现如何?为什么说它不差,但档位选择明显少
GPT-5.5 的 综合 IQ 是 85,在 224 道测试里完成了 127 道。它只有两个思考档位:xhigh 和 high。这一点很关键,因为档位少,意味着使用时可调空间也更少。
1、GPT-5.5 的上限表现怎么样?
它的最高 xhigh 档,可以达到 90 的 IQ,但代价是要花 23 分钟,价格为 5.83 美元。这说明 GPT-5.5 不是没有能力,而是它在这组对比里,已经显出一种比较明确的边界:能打,但上限没有冲到最高梯队。
2、GPT-5.5 的核心特点是什么?
如果只按来源内容总结,GPT-5.5 的特点很直接:综合 IQ 不低,最高档位也有 90,但思考档位只有两档,灵活性不如 GPT-5.6 系列。它不是最贵,也不是最强,更像是一个能力稳定但扩展性一般的对照组选手。
三、Sol 为什么被称为 GPT-5.6 旗舰?它强在什么地方
Sol 是 GPT-5.6 的旗舰。从来源内容看,这个定位并不是空喊,因为它在多个指标上都站在最前面。
1、Sol 的综合能力有多强?
Sol 综合 IQ 为 89,在 672 道测试里完成了 398 道。单看综合 IQ,它已经超过了 GPT-5.5;单看完成数量,它也是四个模型里很有分量的一档。
2、Sol 的档位为什么最值得注意?
Sol 的思考档位最全,拥有 low、medium、high、xhigh、max、ultra 六个档位。这意味着它不仅能冲高上限,也能在不同使用场景里调节成本和速度。
3、Sol 的上限表现是不是四个模型里最高?
是的。来源内容明确提到,Sol 最高的 max 档,IQ 能到 103,需要 32 分钟,价格是 9.18 美元。这几个数字放在一起看,结论就很清楚了:Sol 的 IQ 上限最高,但也最贵。
因此,Sol 的定位非常明确:它是追求能力上限的人会优先看的模型。不过代价也同样明确,时间更长,价格更高。
四、Terra 为什么说性价比突出?它的反差点在哪里
Terra 的数据很有意思,因为它不是那种一眼看过去全面领先的模型,但细看会发现,它在某些高思考场景里非常能打。
1、Terra 的综合分数高不高?
Terra 综合 IQ 是 73,在 672 道测试里完成了 327 道。这个综合分不算高,至少从总分上看,它明显落后于 Sol,也低于 GPT-5.5。
2、为什么 Terra 的 ultra 档反而值得重点看?
来源内容里最关键的一句是:Terra 的 ultra 档 IQ 有 98,反而比 Sol 的 ultra 档 94 还高。这意味着,如果只看 ultra 长思考模式,Terra 并不是 Sol 的跟随者,反而在这个档位上压过了 Sol。
3、Terra 为什么综合 IQ 没被拉高?
问题出在低档位。来源内容明确说,它的 low 档只有 44,把整体平均分拉低了。也就是说,Terra 不是整体均衡型模型,它更像是一个 高档位有亮点、低档位拖后腿 的选手。
所以,总结 Terra 最准确的说法不是“全面强”,而是:在 ultra 长思考模式下,性价比很突出。这也是来源内容给出的总体判断。
五、Luna 为什么最便宜?便宜背后牺牲了什么
Luna 的定位非常鲜明,就是 便宜。但它的便宜,并不是没有代价的便宜。
1、Luna 的综合表现处在什么水平?
Luna 综合 IQ 为 55,在 672 道测试里完成了 321 道。从综合分看,它是四个模型里最低的一档。
2、Luna 便宜到什么程度?
它的 max 档 能拿到 92 的 IQ,而价格只要 2.33 美元。单看这个数字,确实会让人觉得它非常有吸引力,因为价格明显低。
3、Luna 的问题为什么不能忽略?
来源内容已经说得很直白:它的 low 档 IQ 只有 7,基本不可用。这句话的分量很重,因为它说明 Luna 的低档位不是“弱一点”,而是已经到了基本不可用的程度。于是它的定位也就很清楚了:最便宜,但低档位牺牲太大。
六、四个模型放在一起看,应该怎么理解它们的差别?
1、谁是旗舰?
Sol 是名副其实的旗舰。它的综合 IQ 高,完成题目数量多,档位最全,而且 IQ 上限最高。缺点也很明确,就是 最贵。
2、谁的长思考模式更有性价比?
Terra 的 ultra 长思考模式性价比很突出。虽然综合分不算高,但它在 ultra 档打出了 98 的 IQ,这一点很有竞争力。
3、谁适合只看低价?
Luna 最便宜。如果只看价格,它确实很显眼;但如果考虑低档位可用性,它的问题也最突出,因为 low 档 IQ 只有 7。
4、GPT-5.5 处在什么位置?
GPT-5.5 像一个稳健但不够丰富的参照项。综合 IQ 85 不低,最高能到 90,但只有 xhigh 和 high 两个档位,在灵活性和上限上,都被 GPT-5.6 旗舰 Sol 拉开了差距。
七、看这类模型对比图,最容易忽略的重点是什么?
最容易忽略的一点,就是 综合 IQ 不等于单档位上限。比如 Terra 的综合 IQ 只有 73,但它的 ultra 档 IQ 却有 98;Luna 综合 IQ 55,看起来不高,但它的 max 档也能到 92。反过来,低档位一旦太差,也会明显拖累整体判断,Terra 和 Luna 都是这样。
所以,读这种图时,不能只问“谁总分最高”,还要继续问:它最强的档位在哪里?最低档位有没有明显短板?为了更高 IQ,要付出多少时间和价格? 只有把这些问题放在一起,结论才不会失真。
八、结论怎么落地?这张图给出的判断已经很清楚
按照来源内容的结论,四个模型可以概括为三句话:
Sol:旗舰定位明确,IQ 上限最高,但价格也最高。
Terra:ultra 长思考模式很有性价比,不过低档位明显拖后腿。
Luna:最便宜,但低档位牺牲太大,整体可用性要打问号。
GPT-5.5:综合表现不差,但档位少,上限和灵活性都不如 GPT-5.6 旗舰。
我认为:看模型,最怕只看一个总分就下结论。总分像门面,档位、耗时、价格,才像进屋之后真正摸到的桌椅冷暖。这张图里,Sol 是堂堂正正的强,Terra 是藏着锋芒的强,Luna 是省钱省得太狠,GPT-5.5 则像旧日稳兵,尚能一战,却已看见后来者的影子。若只贪便宜,容易吃亏;若只看上限,也难免多花代价。真正有用的判断,还是要把能力、时间和成本一起掂量。
#AI模型评测
© 版权声明
文章版权归作者所有,未经允许请勿转载。
