用 2390 道有标准答案的题(英文为主,另有 300 道中文对照),按 TypeSafe 官方文档自己给出的标准,逐条检验 JEV 的准确率、概率校准、一致性、速度和价格。同一批题同时交给 GPT-4.1-mini,以及 OpenAI 最新的 GPT-5.6 Sol / Terra / Luna 做对照。
和 OpenAI 最新的 GPT-5.6 比:是/否题和 Sol、Terra 打平,多选题低约 5 个点,计数明显不如;但它最不容易"自信地答错",速度快 3 倍,成本低 5–88 倍。详见下一节。
一句话:准确率跟最新大模型基本打平,但更稳、更快、便宜得多;需要"想一想"的题(计数、77 选 1 的细分类)明显不如会推理的大模型。
7 个公开数据集的准确率 vs 跑完 2390 题的花费
横轴是对数刻度,越往左越便宜;越往上越准。
另外用 Claude Opus 5 试跑了 20 道题:成功的 17 道对了 15 道,单题成本约 $0.0044(全量估算约 $10.6,是 JEV 的 200 多倍),中位延迟约 2.7 秒,并且在网关上遇到限流。因为样本太小,没有放进上面的对比。
| 说法 | 来源 | 实测 | 判定 |
|---|---|---|---|
| 概率经过校准(说 80% 的事,大约 80% 会发生) | 官方文档 | 是/否题 ECE 0.048,和 GPT-5.6 Sol(0.043)、Terra(0.051)同一水平,好于 Luna(0.105);而且 JEV 偏保守,"自信地答错"最少。多选题 ECE 0.124,和 Sol 一样都过度自信 | 部分属实 |
| 极其一致:相似输入给出相近输出 | 官方文档 | 换问法 60 题 0 次翻转(Sol 1、Terra 3、Luna 9);正反问法 120 对只有 1 对自相矛盾(Sol 5、Terra 6、Luna 11)。五个模型里最稳 | 属实 |
| 输出确定,可以当强类型对象直接调用 | 推文 | 同一题重复 5 次,判断从没翻转,概率最大差 0.09。不是逐位相同(12/30 题完全一致),但 Terra、Luna 会把同一题答反(最大差 0.81、0.98) | 接近,但不是逐位确定 |
| 延迟 0.1 秒以内,能放进 60 FPS 游戏循环 | 推文 | 服务端中位 248ms、最快 189ms,40 次顺序调用 0 次低于 100ms;全程中位 456ms | 不属实 |
| 比语言模型快 100 倍 / 194 倍 | 推文 / 官方博客 | 一次只问一题:比 GPT-5.6 快约 3–3.6 倍(456ms 对 1.3–1.7 秒),比 GPT-4.1-mini 快约 2 倍。一次塞 50 题时摊到每题约 5ms,才有数量级差距 | 打包问才成立 |
| 输入每 10 亿 token 42 美元,输出免费 | 官方文档 | 1,154,813 个输入 token 计费 $0.0485,费率一致。但同样的内容,JEV 计入的 token 数约是 GPT 的 2 倍 | 属实 |
| 比语言模型便宜 445 倍 | 官方博客 | 跑完同样 2390 题:比 Sol 便宜 88 倍,比 Terra 便宜 45 倍,比 Luna 和 GPT-4.1-mini 只便宜约 5 倍 | 看和谁比,445 倍未复现 |
| 彻底根除幻觉 | 推文 | 标准数据集上有 36 次"信心 ≥ 90% 却答错"(Sol 84、Terra 88、Luna 140、GPT-4.1-mini 142),最少但不是零。没有答案的问题,五个模型都 40/40 回答"未提及" | 夸大 |
| 中文不如英文 | 官方文档自己承认 | XNLI 同一批 150 题:英文 79.3% → 全中文 68.7%。但 GPT-5.6 三个版本也掉了 13–16 个点,JEV 的降幅反而更小 | 属实,但不是 JEV 独有 |
是/否题上 JEV 和 GPT-5.6 Sol、Terra 基本打平。GPT 显著领先的地方:Banking77(77 个意图里选 1 个),三个 GPT-5.6 都比 JEV 高约 10 个点;BoolQ 上 Terra 高 3.5 个点。JEV 显著领先的地方:RTE(高于 Terra、Luna)、TruthfulQA(高于 Luna、GPT-4.1-mini)、SST-2(高于 GPT-4.1-mini)。另外,JEV 答错的 151 题里,有 88 题 Sol 也错在同一个答案上,不少是题目标签本身有争议。
▲ 表示该模型显著高于 JEV,▼ 表示显著低于 JEV(配对自助法,95% 置信区间不跨 0);没有标记的差距都在统计误差以内。
每张小图是一个模型。横轴是模型给出的把握,纵轴是这一档里实际答对的比例。点越贴近虚线,概率越可信;点在虚线下方说明过度自信。点的大小表示这一档的题数。GPT 系列的"概率"是让它自己报的数字。
是/否题 · 800 题
多选题 · 400 题
| 模型 | 题型 | 准确率 | 平均把握 | ECE | Brier | 信心 ≥ 90% 却答错 |
|---|
ECE(期望校准误差)和 Brier 分数都是越低越好。几个 GPT 模型平均报 94–96% 的把握,是/否题上"自信地答错"是 JEV 的 6–15 倍;JEV 平均只报 88% 的把握,略偏保守,准确率却不低。注意:把两种题型混在一起算,JEV 的 ECE 会低到 0.017,因为两边正好抵消,所以这里分开报告。
官方推荐用 confidence 决定"自动执行 / 转人工"。下表是 400 道多选题按各模型自己报的把握分三档:
| 模型 | ≥ 0.9 占比 | ≥ 0.9 准确率 | 0.7–0.9 占比 | 0.7–0.9 准确率 | < 0.7 占比 | < 0.7 准确率 |
|---|
五个模型的最高档准确率在 79–90% 之间,JEV 最高(90%),而且只把 68% 的题放进最高档,剩下 20% 明确标成"没把握"(这一档准确率 43%),正好是该转人工的题。GPT 模型把 81–87% 的题都放进最高档,标成没把握的不到 5%,能分出去的题很少。
官方自己列了 9 类会出错的情况。下面的标准答案全部由代码算出,不靠人工标注。"困难版"是在基础版全部答对之后补的:数字更大、日期只差 1–3 天且中美格式混用、三跳推理、数长列表。
官方的缺陷清单写得比实际更保守,数学、日期、多跳推理 JEV 都在 87% 以上,基本和会推理的 GPT-5.6 同一水平。真正的短板是计数:它会顺着题目里给的数字答"是",基础版答错的 14 道全是这种情况。会推理的 Sol 能逐个数,计数题对了 97%。对抗性内容上,JEV 和 Sol 各只被骗 1 次,Luna 被骗 63 次。
这是 JEV 最突出的地方,六项全部最好(其中"判断翻转"和 Sol 并列)。GPT-5.6 Terra 和 Luna 默认会先推理再回答,每次的推理路径不同,所以同一道题问 5 遍可能给出相反的答案:Luna 在 30 题里翻了 3 题,概率最大相差 0.98。JEV 的概率也不是逐位相同,但波动最大只有 0.09。
JEV 换成中文掉了约 11 个点,GPT-5.6 三个版本掉得更多(13–16 个点),只有不推理的 GPT-4.1-mini 掉得少(7 个点)。所以"中文弱"并不是 JEV 独有的问题,这套中文题本身就更难(XNLI 的中文是从英文翻译来的)。真正要注意的是:中文题上所有模型"自信地答错"的次数都明显变多,JEV 相对最少。
JEV 一次调用可以问很多道题,GPT 那样一次只答一道的模型没有这个能力,所以这一项只有 JEV 的数据:
| 一次调用的题数 | 服务端耗时(中位) | 摊到每题 | 全程耗时(中位) | 与单独问的判断翻转 |
|---|
只问一道题时,JEV 比 GPT-5.6 快 3 倍左右,更关键的是尾部稳:最慢 1% 的请求 JEV 不到 0.8 秒,GPT-5.6 要 6–7.6 秒。打包问时,50 道题一次问完的耗时和问 1 道差不多,答案也基本一致(50 题里翻了 2 题);但一次塞 100 题时,全程耗时波动很大(1.0 秒、4.1 秒、8.2 秒)。