自动化测试平台如何评估Skill和Agent的性能?

作者:自动化测试平台   发布时间:2026-08-05

一、Skill(工具 / 技能)评估

Skill 是原子能力,重点测单次调用质量

正确性:入参能否返回准确结果

稳定性:异常参数、并发、超时场景容错

性能:响应时延、调用失败率

规范:输出格式统一、无数据缺失

一句话:工具能不能稳定给出正确结果。

二、Agent(智能体)评估

Agent 负责思考、调度 Skill 完成复杂任务

任务成功率:能否最终完成用户目标

决策能力:选对 Skill、调用顺序合理、减少无效调用

自愈鲁棒性:工具出错时能否调整,避免死循环

效率:轮次多少、Token 消耗、整体耗时

输出质量:幻觉、信息整合效果

一句话:智能体会不会合理使用工具,闭环完成复杂任务。

三、关键原则

先单独评估 Skill,确认底座可靠;再评估 Agent。

Agent 效果差,有可能是 Skill 不准,也可能是 Agent 规划决策有问题。


本文内容不用于商业目的,如涉及知识产权问题,请权利人联系SPASVO小编(021-60725088-8054),我们将立即处理,马上删除。



沪ICP备07036474号-4 |

沪公网安备 31010702003220号

2015-2026 版权所有 上海泽众软件科技有限公司 Shanghai ZeZhong Software Co.,Ltd.