询问智能体其确信程度,它会乐意告诉你。“置信度:0.92。”这看起来像一个概率。它在仪表板上显示得很美观。团队将其嵌入路由逻辑中:高置信度则自动批准;低置信度则转交人工处理。这给人一种严谨的感觉。
但这并不严谨。自我报告的置信度分数相当于智能体给自己的作业打分,这是生产环境中基于智能体的系统中最具诱惑力的虚假信号之一。如果你依据它来设置关卡,就等于在相信被告对自己不在场证明的评价。
这个数字究竟从何而来
当大型语言模型输出 confidence: 0.92 时,这个数字并非经过校准的后验概率。它是另一个令牌序列,由生成你所质疑答案的同一次前向传播过程产生。它与所描述的输出来自同一基础。如果模型幻觉出了一个文件路径,那么发明该路径的相同权重也会欣然赋予其 0.9 的置信度,因为从内部来看,自信的捏造与自信的事实是无法区分的。
这不是一个可以通过提示词工程(例如“诚实地表达你的不确定性”)来解决的问题。你可以改变分布情况,但无法将模型的自我报告转化为独立的证据,因为循环中没有独立的基本事实。评分者和被评分者是同一个网络。
独立性轴线的实际应用
这正是为什么我们在 agent-eval 构建评估体系时,会根据独立性轴线(从独立到易被篡改)而非成本轴线(从廉价到昂贵)对证据进行分级。分为三个层级:
- 第一层级 — 智能体无法伪造的外部可观察证明。 超文本标记语言对象解析成功。文件存在于磁盘上。代码编译通过。测试通过。调用在超时时间内返回。输出非空。这些都无法被自信的模型伪造,因为你是在检验现实,而非征求观点。
- 第二层级 — 针对智能体未编写的基线的统计信号。 输出与实际任务之间的嵌入相似度。长度和重复性检查。差异比较是否确实改变了任何内容。由于基线并非由智能体编写,因此它无法操纵比较结果。
- 第三层级 — 模型即裁判。 一种基于共同基础的 opinion(观点)。它仅是一种信号,绝非定论。
自我报告的置信度分数甚至达不到第三层级。第三层级至少让一个 separate (独立的)模型检查产物。而自我置信度是被评判的模型在同一过程中评判自己——具有最大的循环性。它属于该轴线上最易被篡改的一端。
由此得出的两个事实
第一层级和第二层级是实时关卡。 它们是确定性的,几乎免费且快速,因此可以位于关键路径上,在不良运行发布之前将其拦截。第三层级仅限离线使用:受配额限制、速度慢、非确定性。裁判模型无法满足你的延迟预算。而自我报告的置信度,尽管看起来足够廉价以用作关卡依据,但其易被篡改性使得依据它设置关卡比不设关卡更糟糕——因为它给你提供了虚假的安全感。
一个模型评判另一个模型的推理是循环论证。 第一层级和第二层级可以应用于智能体的执行轨迹。第三层级则不能——如果你让裁判模型对推理步骤进行评分,裁判和被评判者共享同一基础,且不存在独立的基本事实。因此,第三层级只能检查被评判智能体未参与编写的产物。自我置信度比任何其他情况都更严重地违反了这一规则:它是关于推理的主张,却由推理者亲自撰写。
替代方案
不要根据智能体对自身的看法进行路由。应依据不
免责声明:本文内容来自互联网,该文观点不代表本站观点。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容,请到页面底部单击反馈,一经查实,本站将立刻删除。