AWS 开源 awslabs/Agent-EvalKit:在 Claude Code、Kiro CLI 或 Kilo Code 内通过 /evalkit.plan、/evalkit.report 等斜杠命令跑评测。六阶段覆盖计划、造数、OpenTelemetry 追踪、执行、打分与代码关联修复;旅行研究 demo 显示 Response Quality 83.9%、Tool Parameter Accuracy 64.5%、Faithfulness 32.3%,漂亮回复仍可能在空工具结果上编造温度与汇率。配套 AWS ML 博客说明系统化评测方法。

核心要点速览 (Key Takeaways)

  • 开源:awslabs/Agent-EvalKit,支持 Claude Code / Kiro / Kilo 斜杠命令。
  • 流程:plan → data → OTel traces → run → score → code-linked fixes。
  • 洞察:demo Faithfulness 仅 32.3%,空工具结果仍会编造事实。
ADSponsored