直接答案
评估 AI 智能体项目应至少覆盖六个维度:业务价值、输入数据、工具与权限、任务评测、成本与延迟、上线后的责任归属。先建立代表真实场景的评测集和失败分类,再决定是否开放更多工具或自动执行权限。
六维项目评分卡
| 维度 | 需要回答的问题 |
|---|---|
| 业务价值 | 当前频率、耗时、错误成本和期望结果是什么? |
| 数据条件 | 数据是否合法可用、是否完整、多久更新一次? |
| 工具权限 | 智能体能读取什么、写入什么,哪些动作必须确认? |
| 任务评测 | 什么算正确,严重错误如何分级,样本是否代表真实流量? |
| 成本与延迟 | 单任务成本、峰值并发、超时和降级方案是什么? |
| 运营责任 | 谁看日志、处理异常、更新知识和批准版本? |
先建立评测集,再优化提示词
评测集应包含正常任务、边界情况、缺失信息、冲突信息、恶意输入和工具失败。每个样本都要有可判断的期望结果或评分规则。
先保存基线,再修改模型、提示、知识库或工具。每次变更都用同一批核心样本回归,才能判断改动是否真的提高了质量。
权限应从最小范围开始
读取和写入权限要分开;查看草稿和直接发布也要分开。对付款、删除、对外发送、客户承诺等高影响动作,默认保留人工确认。连续失败达到阈值时应停止继续调用,防止错误被自动放大。
用阶段门作出上线决定
建议将结论分为继续试验、有限上线和暂缓三类。只有当关键任务指标达标、严重失败可控、成本可接受、负责人明确且回退经过验证时,才进入有限上线。
常见问题
只看回答准确率够吗?
不够。还要看工具调用、权限越界、严重错误、成本、延迟、人工接管和业务结果。
评测集需要多少样本?
没有固定数量;应优先覆盖真实高频任务和高风险边界,并随着线上失败持续补充。
智能体什么时候可以自动执行?
当动作可逆、权限最小化、监控和回退可用且有限上线证明稳定后,再逐步提高自动化程度。
参考来源与延伸阅读
- OpenAI Evals guide
关于持续评测、测试数据和评价方法的官方指南。
- NIST Generative AI Profile
生成式 AI 风险识别与管理资料。