← 回到项目库 评测与研究
jev-harness @Astro-Han ★ 4 Python Apache-2.0 更新于 2026-09-20
一个编码 agent,通过 Jev 过滤所有工具结果,并用 A/B 测试衡量 pass@1 和成本与未过滤对照组的差异。
英文原文 A coding agent that filters every tool result through Jev before the model sees it, with an A/B harness measuring pass@1 and cost against the unfiltered control
Astro-Han/jev-harness ↗
它在哪儿调用了 Jev self.model = os.environ.get("JEV_MODEL", "typesafe-ai/jev")jev_agent.py:145
链接指向我们抓取当天的那个 commit,行号是准的。
这个项目没法在这儿跑 它的 question 组合是运行时拼出来的,或者代码里没有直接写出来,所以没法原样搬过来。源码链接在上面,可以自己去看。
同类的其他项目 jev-playground ▶ — 这是一个用于通过 MoonBit 访问 TypeSafe AI 的 System One 模型 Jev 的测试平台。 jev-as-a-judge ▶ — 使用 Jev 作为评估工具。 eutrya ▶ — Jev 原生 AI 安全工具,支持自主研究、多 agent 群体、持久追踪板和长时 agent 工作流,CLI 优先,开源,适用于授权安全研究。 typesafe-local ▶ — 受TypeSafe Ai启发,向本地LLM提问,获得校准概率而非文本,输出结构化结果,无需生成或解析,支持MLX和Apple Silicon。 jev-mcp ▶ — 将 JEV 连接到 MCP 客户端,使用共享数据集和可测量准确率对比其判断与通用 LLM 的表现。 omp-jev ▶ — TypeSafe Jev 路由,用于 Oh My Pi,支持可选的 checkpoint 编排器和可编辑的 XDG 配置,需 Bun 1.3.14 和 OMP 18.2.3。 jev-chat ▶ — 基于类型化 Jev 决策的聊天机器人,采用层级推测解码处理 System One 概率。 jev-browse ▶ — jev-browse 是一个非官方项目,与 TypeSafe 或 Vercel 无关。