Amazon 公开 SOP-Bench,使用领域专家编写的 12 项业务规程和超过 2,000 个任务,评估 AI 智能体执行真实业务流程的能力。研究以两种基线智能体测试 11 个前沿模型,发现推理型智能体搭配 Claude 4.5 系列的得分低于搭配 Claude 4 系列,且在一项视频标注规程中,为所需的 6 个工具加入 20 个干扰工具后,成功率接近减半。
阅读原文