Microsoft Research 的 Jennifer Neville 在访谈中指出,多轮对话和长流程评估能揭示传统基准未覆盖的 AI 失败模式。团队将单轮完整指令拆为多轮澄清后发现模型表现显著下降,反复编辑文档的工作流也可能因错误累积而丢失语义内容。她建议在对话混乱时重新开启对话并一次给出完整需求,在实际工作中保留人工监督与核验。
阅读原文