bench v7
它测什么
测最坏保证、抗背题、空间作图、指令遵循这类硬指标,不测聊天顺不顺口。跑完附带渠道鉴定:训练截止到哪个季度、有没有偷偷联网、是不是 Codex 反代、有没有降智。
IQ = round(100 + 90 × (加权通过率 − 0.5))
- 量程 55–145,加权后对一半 = 100
- 半分只进卷面,不进 IQ(如 21 的 29、17 的 25)
- 速度系数只调卷面,不调 IQ
- 并列:分差小于 20 或 95% 置信区间重叠视为同档
计分单元
题干、判卷和参数生成见 题库。
| 单元 | 题目 | 维度 | 分 |
|---|---|---|---|
| Q1 | 安眠药 | 认知反射 | 6 |
| Q2 | 洗车 | 认知反射 | 5 |
| Q3 | 球拍与球(经典) | 认知反射 | 6 |
| Q4 | 红绿色盲 | 多步科学演绎 | 14 |
| Q5 | 船锚水位 | 多步科学演绎 | 10 |
| Q6 | 经典糖果题 | 最坏情况保证 | 16 |
| Q7 | 袜子配对(参数化) | 最坏情况保证 | 16 |
| Q8 | 糖果题变体 | 抗记忆迁移 | 16 |
| Q9 | 球拍与球(变体) | 抗记忆迁移 | 6 |
| Q10 | 数列归纳 | 模式归纳 | 8 |
| Q11 | 字母类比 | 模式归纳 | 8 |
| Q12 | 骑士与无赖(参数化) | 形式逻辑 | 10 |
| Q13 | 五人排队(参数化) | 约束满足 | 10 |
| Q14 | 注排水 | 数量关系 | 8 |
| Q15 | 字母计数 | 细节注意 | 5 |
| Q16 | 鹈鹕骑车 SVG 动画 | 空间作图 | 14 |
| Q17 | 严格 JSON | 指令遵循 | 5 |
维度权重
- 1.0
认知反射
压住第一反应,题噪音大所以压权。
- 2.0
多步科学演绎
现象串成链。
- 2.5
最坏情况保证
鸽笼保证,智商主信号。
- 2.5
抗记忆迁移
同构改数字,主信号。
- 2.0
模式归纳
数列与类比。
- 1.5
形式逻辑
真值穷举。
- 1.5
约束满足
多条件联立。
- 1.2
数量关系
正负速率。
- 0.8
细节注意
计数不被骗。
- 1.0
空间作图
SVG 几何判分仍有盲区,不让它左右 IQ。
- 0.6
指令遵循
格式不是智商。
渠道鉴定
主测评之后 15 个探针,可开关,全部不计分。
- 知识阶梯 13 问:客观事件从 2023Q4 铺到 2026Q3,答对的最晚季度即训练截止
- 联网嫌疑:顶格事件训练数据覆盖不到,答对说明网关注入了搜索
- juice 探针:Codex CLI 独有注入参数,正常 API 渠道没有
- 身份自报:记录模型自称,仅供对照
- 降智对照:全网同名样本 ≥5 且低于中位 12 分才指认