Jev 与 LLM-as-a-Judge 对比评测:成本、延迟与判断分歧

Comet 在 Opik 内置助手 Ollie 的 1,000 条真实生产轮次上对比 Jev 与 gpt-4o-mini,两者判断一致率为 89.7%。每 1,000 条记录的评估成本分别为 $0.0285 和 $0.0993,p50 延迟分别为 253 ms 和 958 ms;103 条分歧中,64.1% 的 Jev 概率落在 0.3–0.7 区间。

阅读原文

返回首页