AI自信背后的错误真相

AI自信背后的错误真相

在大型语言模型(LLM)辅助工具的开发流程中,大多数团队都会跳过一个关键步骤:验证模型输出的内容是否真正正确。这一过程繁琐耗时,且不会对终端用户产生可见成果,因此常被忽略。然而,验证的并非是输出的流畅度、连贯性或主题相关性,而是模型能否准确识别工具所针对特定问题的正确答案。

从”这个输出听起来合理”到”这个输出可验证为正确”之间的差距,正是大多数LLM辅助企业工具悄然失败的地方。这些工具能够通过内部审查,因为输出听起来合理。然而在生产环境中,它们却会失败,因为审查者并非对照真实情况进行评估,而是对照他们对理想答案的直觉进行判断。

当AI辅助工具从生产力附件转变为影响实际业务决策的组件时,这种区分变得更加重要。如果你的AI辅助工具正在影响分析师如何调查数据质量问题、合规审查员如何决定是否升级标记记录,或者运营团队如何分类验证失败——其输出的准确性将产生实实在在的后果。在这种情况下,”看似合理”绝非充分的评估标准。

定性评估真正捕捉到什么

企业工具中LLM输出的标准评估方法是定性的:由具备领域知识的人员审查部分输出样本,对照他们对理想答案的心理模型进行判断,如果过多输出显得不妥,则调整提示词。

这种方法能够捕捉特定类别的问题:明显错误的输出、格式不当的内容或偏离主题的答案。这些都是值得关注的真实问题,同时也是最容易发现的。

定性评估始终无法捕捉的是那些难以通过外部检查发现的错误输出。例如,一种解释能够自信地识别错误的根本原因,使用听起来权威的语言,基于看似合理的推理——这样的解释能够通过定性审查。然而,一旦具备正确背景的人对照实际情况进行检查,这种解释就会失败。

在一个以准确性为核心价值主张的系统中,”看似合理”与”正确”并不等同。两者可能存在显著差异,而定性评估无法揭示这种差异何时出现。

真实评估工具的构建

替代方法是构建一个评估工具,将模型输出与标记的基准真相进行评分——即使用已知正确答案的案例集来衡量准确性而非连贯性。

在开发数据迁移漂移的根本原因解释工具时,我构建了这样的评估工具。该工具接收检测到的漂移事件,并生成可能原因的排名解释。最初的原型生成了流畅、具体的解释,通过了定性审查。然而,当我使用已知根本原因的案例进行测试时,解释错误的比例高到令人担忧。

我构建的评估工具包含三个部分:

  • 首先,构建合成基准真相数据集:即已知正确答案的案例。这意味着在测试流程中引入特定的、可控的原因——如架构变更、转换逻辑错误或源系统行为变化——精确记录我引入的内容,并让模型处理由此产生的漂移事件。每个案例的正确答案都是我故意引入的原因。
  • 其次,设计评估排名输出的评分函数。当模型产生可能原因的排名列表而非单一答案时,简单的正确/二元判断是不够的。正确地将根本原因识别为第三大可能候选的答案,与将其识别为最可能的候选者有着显著差异。评分函数评估两个维度:存在性——正确答案是否出现在输出中,以及排名——相对于错误候选者,它被突出展示的程度。这些维度被组合成一个加权分数,既奖励找到正确答案,也奖励适当排名。
  • 第三,在整个合成数据集上进行系统性评估而非抽查。全面运行评估工具可以揭示抽查所忽略的模式:模型能够可靠处理的问题类别,它持续出错的问题类别,以及哪些信号组合会产生最高比例的自信错误解释。

评估揭示的真相

评估结果比任何定性审查都能提供更有价值的信息。

架构变更场景得分良好——当证据存在且独特时,模型能够可靠地识别上游架构变更。转换逻辑错误更难处理——模型能够正确识别一般类别,但错误归因导致问题的特定变更,特别是在多个变更同时进行的情况下。重叠信号场景最为困难——两个不同原因在时间上接近的情况产生了最高比例的自信错误解释。

最后这一发现是定性审查永远无法揭示的。模型表达的置信度与其准确性没有相关性——在它最错误的时候,它最为自信。没有评估工具对照基准真相进行测量,这种模式将无法被发现。

企业AI部署的实际意义

对于在企业环境中部署LLM辅助工具的团队——尤其是那些影响人们如何调查问题、分类警报或做出路由决策的工具——在生产部署前需要回答的问题是:我们已经对照已知正确答案的案例测量了准确性,还是仅仅审查输出是否合理?

如果是后者,那么工具仅测试了流畅性和连贯性,而非正确性。这些是不同的特性。对于塑造业务决策的工具来说,正确性才是关键。

构建合成基准真相数据集是困难的部分,也是最值得投资的部分。它迫使你为特定用例精确定义”正确”的含义——这本身就是一项独立于评估本身的有用练习。一旦有了这个定义,评分工具和评估基础设施就相对简单了。没有它,你测量的可能并非你试图保证的内容。

作为企业架构师,我认为在AI工具开发中,将准确性评估置于首位,是企业级AI应用成功的关键。


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/an-eval-harness-found-what-qualitative-review-couldnt-ai-models-are-most-confident-when-wrong

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2567篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类