您的人工智能代理是否已准备好投入生产环境?
您发布它时,仅使用了一个包含五个示例的评估集,而这些示例都是您已经确认有效的演示案例。两周后,生产环境中充满了各种故障,而这五个示例都无法捕捉到这些问题。于是您修补了提示词,演示案例虽然仍然通过,但您并不清楚自己是解决了一类问题,还是仅仅修复了那一个特定的截图场景。
这正是本系列文章开篇提出的问题。在第一部分中,我们指出,“生产就绪”是您在构建之前就需要定义的标准。评估集是衡量这一标准的方法,其价值甚至高于它所评分的提示词。
为何评估集比任何其他内容都更持久
模型会不断变化。您可能会更换模型、重写系统提示词、添加工具,或者为了降低成本而切换服务提供商。这些操作中的任何一项都可能悄无声息地破坏原本正常的行为。唯一能告诉您是否出现回归问题的就是评估集。它能在每次重写中幸存下来,因为它独立于构建方式,编码了“正常工作”的含义。竞争对手可以在一个下午内复制您的提示词,但他们无法复制两年来积累的失败案例记忆。
基于真实失败而非臆想失败来构建评估集
大多数评估集之所以薄弱,是因为它们是在项目初期凭借想象编写的,而那时您对代理如何失败的了解最少。请反过来做。
- 将每一次事故转化为永久案例。当代理在实际环境中发生故障时,直到该确切故障被纳入评估集之前,修复工作都不算完成。如果您修复了一个错误却未进行测试,那么这个错误将会再次被发布。
- 侧重于导致不合格的失败模式。第一部分曾要求您指明哪些失败模式是不可接受的。您的评估集应重点关注这些模式。信任的建立或丧失皆在于此。
- 包含平淡无奇的中间情况。如果百分之八十的真实流量都是常规操作,那么一个全由极端案例组成的评估集衡量的是一项无人执行的任务。请匹配现实世界的分布情况。
评估行为,而非精确字符串
人工智能代理具有非确定性,因此要求输出完全一致字符串的黄金测试会出现不稳定现象,而您最终会开始忽略它。开放式评估框架允许您断言您所关心的属性:它是否拒绝了不安全请求、调用了正确的工具、保持在预算范围内、避免编造策略。一个您学会忽略的评估集比没有评估集更糟糕,因为它消耗注意力却提供虚假的安慰。
如果这听起来像是在策划优质的测试数据,那事实确实如此。评估集是用于判断的测试数据,其昂贵之处与任何逼真测试数据相同:即确定什么是优质案例。只需进行一次这样的思考并将其记录下来,未来每次更换模型都会带来回报。
第三部分将此引入可靠性领域:一旦您可以衡量代理,该如何衡量一个不会两次给出相同答案的系统。
您的提示词是一次性的;您的评估集才是资产。
免责声明:本文内容来自互联网,该文观点不代表本站观点。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容,请到页面底部单击反馈,一经查实,本站将立刻删除。