LangSmith、Arize AX 与 Kitaru 都支持智能体测试,核心区别是基于数据集运行实验,还是利用历史工具结果回放生产会话。ZenML 的比较将 LangSmith 侧重于完整评估工具链、Arize AX 侧重于生产追踪与完整智能体实验、Kitaru 侧重于真实代码回放和逐会话回归比较,后者需要可运行的智能体代码与明确的工具策略。
阅读原文