猛蹬·145 · 配套档案
测评站跑完的卷,放到这里看。
我不测聊天顺不顺口。IQ = 100 + 90×(加权正确率−0.5),对一半是 100,打满 145。场次、模型和逐题分开存档,以后对照不用翻整份导出。
场次
5
35 条模型记录
模型种
35
跨场去重后的模型
榜首
145
gpt-5.6-sol@max
最新场次
opencode原生api
bench v7 · 10 模型 · 平均 IQ 128
- 01deepseek-v4-pro@highIQ 135 · 144/163 · 15m56s
- 02deepseek-v4-flash@maxIQ 132 · 140/163 · 14m10s
- 03deepseek-v4-flash@highIQ 132 · 140/163 · 11m14s
- 04deepseek-v4-flash@lowIQ 132 · 140/163 · 8m23s
- 05deepseek-v4-pro@maxIQ 132 · 139/163 · 21m01s
- 06ox-alpha-free@maxIQ 125 · 127/163 · 13m43s
- 07ox-alpha-free@lowIQ 125 · 127/163 · 10m21s
- 08ox-alpha-free@highIQ 125 · 126/163 · 23m16s
- 09mimo-v2.5-pro@highIQ 120 · 117/163 · 45m44s
- 10mimo-v2.5@highIQ 118 · 115/163 · 26m34s
档案柜还有 4 场。全部场次
模型榜
跨场平均 IQ
| 模型 | 场次 | 平均 | 最高 | 最低 |
|---|---|---|---|---|
| gemini-3-flash-agent@none | 1 | 145 | 145 | 145 |
| gemini-3-flash@none | 1 | 145 | 145 | 145 |
| gemini-3.5-flash-low | 1 | 145 | 145 | 145 |
| gemini-3.5-flash@none | 1 | 145 | 145 | 145 |
| gemini-3.6-flash-high | 1 | 145 | 145 | 145 |
| gemini-3.6-flash@none | 1 | 145 | 145 | 145 |
能力维度
这场卷面的形状
认知反射100%
多步科学演绎71%
最坏情况保证94%
抗记忆迁移56%
模式归纳100%
形式逻辑100%
约束满足100%
数量关系100%
细节注意100%
空间作图9%
指令遵循58%
标准推理稳定,难题拉开差距
Q16 画廊
会蹬的鹈鹕
规格
18 个计分单元
最坏保证、抗背题、空间作图、指令遵循。半分只进卷面,不进 IQ。
同步接口
登录后才能写入
粘贴导出,或签发令牌给测评站直推。看档案不用登录。