评测与研究

jev-1.13-mini-benchmark

@alperenerol1PythonMIT更新于 2026-09-19

TypeSafe 的 jev-1.13 结构化决策模型在标注支持分诊任务上的小型基准测试,包括选择、评分、一致性、成本和经验总结。

英文原文

Mini benchmark of TypeSafe's jev-1.13 structured decision model (OpenRouter Decisions API) on labeled support-triage: noul/choice/score, consistency, cost, lessons learned

alperenerol/jev-1.13-mini-benchmark

它在哪儿调用了 Jev

MODEL = "typesafe/jev-1.13"

run_bench.py:21

链接指向我们抓取当天的那个 commit,行号是准的。

这个项目没法在这儿跑

它的 question 组合是运行时拼出来的,或者代码里没有直接写出来,所以没法原样搬过来。源码链接在上面,可以自己去看。

同类的其他项目