评测与研究
使用 Jev 作为评估工具。
Using Jev as an evaluator.
JUDGES = ("jev", "gpt_luna", "gpt_terra", "claude_sonnet")src/evals/judge_reliability.py:12
链接指向我们抓取当天的那个 commit,行号是准的。
下面是从这个项目源码里原样取出来的 question 组合。
取自 src/evals/judges/system_one.py:32
does_pass是/否Does the final answer pass?
import { experimental_evaluate as evaluate } from 'ai';
const { answers } = await evaluate({
model: 'typesafe-ai/jev',
state,
questions: {
does_pass: { type: 'boolean', instructions: 'Does the final answer pass?' },
},
});