Arize AI 对 8 个决策模型开展幻觉检测、LLM 评估和智能体路由测试,领先模型准确率接近,但延迟、成本、部署方式及措辞敏感性存在差异。测试采用 RAGTruth 的 2,675 条数据、13 套 Phoenix 评估中的 655 个标注案例及 52 个路由决策,Jev 与 Kev 在路由任务中分别答对 49 和 48 个,按评测规则打平,本地与云端延迟不可直接比较。
阅读原文