本体论能识别不可信的语言模型论断

AI前沿4小时前发布 yizz
100 0 0

本体论能识别不可信的语言模型论断

删除引用后,为什么评分反而更高

研究者在一份研究备忘录中删除了全部引用,然后让一个语言模型评审器分别给原始版本和删除引用后的版本评分。结果显示,删掉引用的版本得分更高

这一结果并不是偶然现象。研究者对十份备忘录进行了类似处理,删除所有证据引用后,评审器的平均得分只上升了0.17。这意味着,在这个评估过程中,引用证据并没有带来预期中的加分,反而可能成为影响评分的因素。

只引用反驳自身观点的证据,评分也会上升

研究者还测试了另一种情况:备忘录只引用那些削弱自身核心论点的证据。按照通常的研究写作逻辑,证据应当帮助读者判断观点是否成立;但在这项测试中,这样处理后,评审器的评分反而上升了0.03

这暴露出一个值得注意的问题:评审器的分数未必真正反映了备忘录的证据质量,也未必能够判断引用是否支持论点。即使文本中的证据被全部删除,或者引用的内容恰恰不利于文章自身的观点,评审器仍可能给出相近甚至更高的评价。

评审器自身的评分噪声,可能掩盖这些缺陷

研究者测得,评审器在重复运行时自身就存在0.27的波动。相比之下,删除引用带来的评分变化只有0.17,只引用反方证据带来的变化只有0.03

这说明,评审器在不同运行之间的随机波动,可能比测试中观察到的评分变化更大。更重要的是,删除证据引用引用不支持自身观点的证据这两种缺陷,都没有被评审器识别出来。

本体论如何发现评审器没有发现的问题

研究者使用了一组带类型的关系检查来验证这些内容。结果显示,这套检查能够100%捕捉到上述两个缺陷,并且可以进一步指出:究竟是哪个对象出现了问题。

这里的关键并不只是给文本增加一层形式化结构,而是明确检查不同对象之间的关系是否成立。例如,证据与论点之间是否存在正确的支持关系,某一条引用是否真的对应它所服务的判断,以及文本中的对象是否被放在了允许的位置上。通过这类关系检查,系统不再只看语言表达是否流畅,而是能够检查内容结构是否完整、关系是否匹配。

为什么要研究面向智能体的本体论

研究者之所以开展这项测试,是因为面向智能体的本体论已经成为一个非常热门的话题。这个趋势并不令人意外,但目前关于本体论的许多讨论,仍然停留在架构图和理论层面

研究者本人近期参与的一个项目中,本体论是重要组成部分。与只停留在概念设计不同,这次实践让他直接感受到了本体论带来的明显差异。因此,他希望进一步量化这种影响,并将测试结果整理成一篇正式文章。

这项测试比较了什么

这篇文章使用了一个简化的本体论,并将其与默认替代方案进行比较。来源内容明确提到,这个默认方案是向一个能力较强的模型提出请求,但原文在此处中断,没有继续说明后续的完整测试设计。

因此,目前能够确认的核心结论包括:语言模型评审器可能无法识别证据被删除、证据与论点关系失配等问题;而带类型的关系检查能够稳定地发现这些缺陷,并指出出现问题的具体对象。

从评分结果中应当警惕什么

这组测试提醒人们,更高的模型评分不一定意味着更可靠的内容。一份备忘录即使缺少引用,甚至只引用不利于自身论点的证据,也可能获得更高分。单纯依赖语言模型评审器,容易把表达表面的完整性与内容实际的可信度混为一谈。

与此同时,评审器自身的运行噪声也需要被纳入考虑。如果评分波动本身已经达到0.27,那么一些看似明确的分数变化,就可能无法说明文本质量真的发生了改变。

结语:可信度不能只靠语言模型打分

这项测试的价值,在于把一个常被抽象讨论的问题变成了可以观察和比较的结果:面对引用、论点和证据之间的关系,语言模型评审器可能表现得并不可靠;而本体论配合带类型的关系检查,则能够从结构层面发现隐藏的问题。

我认为:当我们让语言模型评价另一段语言模型生成的内容时,流畅、完整和像一篇好文章,并不等于真实、严谨和有证据支持。真正值得依赖的检查,不应只看文字表面是否顺眼,还要追问每个对象是什么、彼此之间是什么关系,以及证据是否真的支撑了观点。只有把这些关系明确下来,所谓“高分”才更接近可信度,而不是一次难以解释的判断。

#语言模型评审

© 版权声明

相关文章