评测与研究

jev-eval

@4esv1Python更新于 2026-09-19

在你自己的标注分类数据上,评测 TypeSafe Jev 与任意 OpenRouter 模型的准确率、校准度、延迟和成本。

英文原文

Benchmark TypeSafe Jev against any OpenRouter model on your own labelled classification data: accuracy, calibration, latency, cost

4esv/jev-eval

它在哪儿调用了 Jev

JEV_URL = "https://api.typesafe.ai/v1/systemone"

evaljev/runners.py:15

链接指向我们抓取当天的那个 commit,行号是准的。

这个项目没法在这儿跑

它的 question 组合是运行时拼出来的,或者代码里没有直接写出来,所以没法原样搬过来。源码链接在上面,可以自己去看。

同类的其他项目