添加客服微信
400 035 7887
一、Skill(工具 / 技能)评估
Skill 是原子能力,重点测单次调用质量
正确性:入参能否返回准确结果
稳定性:异常参数、并发、超时场景容错
性能:响应时延、调用失败率
规范:输出格式统一、无数据缺失
一句话:工具能不能稳定给出正确结果。
二、Agent(智能体)评估
Agent 负责思考、调度 Skill 完成复杂任务
任务成功率:能否最终完成用户目标
决策能力:选对 Skill、调用顺序合理、减少无效调用
自愈鲁棒性:工具出错时能否调整,避免死循环
效率:轮次多少、Token 消耗、整体耗时
输出质量:幻觉、信息整合效果
一句话:智能体会不会合理使用工具,闭环完成复杂任务。
三、关键原则
先单独评估 Skill,确认底座可靠;再评估 Agent。
Agent 效果差,有可能是 Skill 不准,也可能是 Agent 规划决策有问题。
本文内容不用于商业目的,如涉及知识产权问题,请权利人联系SPASVO小编(021-60725088-8054),我们将立即处理,马上删除。