猛蹬·145 · 配套档案

测评站跑完的卷,放到这里看。

我不测聊天顺不顺口。IQ = 100 + 90×(加权正确率−0.5),对一半是 100,打满 145。场次、模型和逐题分开存档,以后对照不用翻整份导出。

场次

5

35 条模型记录

模型种

35

跨场去重后的模型

榜首

145

gpt-5.6-sol@max

最新场次

opencode原生api

打开报告

bench v7 · 10 模型 · 平均 IQ 128

  1. 01deepseek-v4-pro@highIQ 135 · 144/163 · 15m56s
  2. 02deepseek-v4-flash@maxIQ 132 · 140/163 · 14m10s
  3. 03deepseek-v4-flash@highIQ 132 · 140/163 · 11m14s
  4. 04deepseek-v4-flash@lowIQ 132 · 140/163 · 8m23s
  5. 05deepseek-v4-pro@maxIQ 132 · 139/163 · 21m01s
  6. 06ox-alpha-free@maxIQ 125 · 127/163 · 13m43s
  7. 07ox-alpha-free@lowIQ 125 · 127/163 · 10m21s
  8. 08ox-alpha-free@highIQ 125 · 126/163 · 23m16s
  9. 09mimo-v2.5-pro@highIQ 120 · 117/163 · 45m44s
  10. 10mimo-v2.5@highIQ 118 · 115/163 · 26m34s

档案柜还有 4 场。全部场次

模型榜

跨场平均 IQ

全部模型
模型场次平均最高最低
gemini-3-flash-agent@none1145145145
gemini-3-flash@none1145145145
gemini-3.5-flash-low1145145145
gemini-3.5-flash@none1145145145
gemini-3.6-flash-high1145145145
gemini-3.6-flash@none1145145145

能力维度

这场卷面的形状

认知反射100%
多步科学演绎71%
最坏情况保证94%
抗记忆迁移56%
模式归纳100%
形式逻辑100%
约束满足100%
数量关系100%
细节注意100%
空间作图9%
指令遵循58%

标准推理稳定,难题拉开差距

Q16 画廊

会蹬的鹈鹕

全部
deepseek-v4-pro@high · IQ 135
deepseek-v4-flash@low · IQ 132
mimo-v2.5@high · IQ 118

规格

18 个计分单元

最坏保证、抗背题、空间作图、指令遵循。半分只进卷面,不进 IQ。

同步接口

登录后才能写入

粘贴导出,或签发令牌给测评站直推。看档案不用登录。