Arize AI 决策模型评测:比较 Jev、Kev、Liquid d1 等模型的准确率、成本与措辞敏感性

Arize AI 对 8 个决策模型开展幻觉检测、LLM 评估和智能体路由测试,领先模型准确率接近,但延迟、成本、部署方式及措辞敏感性存在差异。测试采用 RAGTruth 的 2,675 条数据、13 套 Phoenix 评估中的 655 个标注案例及 52 个路由决策,Jev 与 Kev 在路由任务中分别答对 49 和 48 个,按评测规则打平,本地与云端延迟不可直接比较。

阅读原文

返回首页