Baseten携手Hugging Face与Goodfire AI,推动开放权重模型安全标准建设

AI前沿58分钟前发布 yizz
229 0 0

三家公司为何联合推进开放权重模型安全基础设施?

周三,Baseten宣布推出一项新的安全基础设施标准,并联合旗下研究部门Base LabsHugging Face以及Goodfire AI,共同建设面向开放权重模型的安全评估与监控基础设施。

这项合作的重点,是为开放权重模型建立更加系统的安全机制,包括模型训练过程中的安全方法、模型部署后的监控能力,以及能够公开透明运行的评估体系。

开放权重模型面临哪些安全争议?

此次合作正值业界围绕开放权重模型安全性展开讨论之际。开放权重模型的参数可以被研究者、开发者和其他使用者获取,因此具备更高的可见性与可修改性。但与此同时,模型原本设置的安全防护措施也可能被移除,从而带来新的风险。

材料提到,一种被称为“abliteration”的技术正在引发关注。通过这种不断发展的方法,模型的安全防护机制可能被移除,使原本受到限制的模型产生更危险的行为。

目前已有多少模型受到相关技术影响?

这一问题的规模并不小。作为开放源代码人工智能模型的托管平台,Hugging Face目前列出了超过6000个经过“abliteration”处理的模型

这一数量说明,开放模型的安全问题并不是个别案例,而是需要通过评估、监控和训练机制共同应对的系统性问题。仅仅在模型发布后再增加安全措施,可能难以及时覆盖模型被修改、重新部署或改变用途后产生的风险。

Base Labs将如何建设开放模型安全标准?

Base Labs是Baseten在今年早些时候成立的研究部门。按照规划,该部门将负责开发并发布适用于开放模型的训练与监控方法,为后续建立安全标准提供基础。

Baseten希望,未来形成的安全标准能够具备透明性,并且直接融入模型的训练与部署流程,而不是等模型完成开发、上线之后,再以附加措施的方式补充安全机制。

换句话说,这套思路强调从模型诞生之初就考虑安全问题:在训练阶段建立相应方法,在部署阶段进行持续监控,并通过公开的评估方式帮助外界了解模型的行为表现。

Baseten如何看待“开放”与人工智能安全的关系?

Baseten表示:“我们相信,开放性是人工智能安全的一项优势。”

该公司认为,开放能够让更多人观察模型的行为,从而增加对模型运行方式的了解。材料显示,Baseten将进一步强调开放所带来的可见性,并将其视为推进人工智能安全的一种方式。

不过,原始材料中的相关引述在此处未完整呈现,因此无法对该观点作出超出来源内容的延伸解读。

这项合作可能带来什么影响?

从目前公布的信息看,Baseten、Base Labs、Hugging Face和Goodfire AI的合作,主要围绕三项工作展开:第一,开发开放模型的安全训练方法;第二,建立模型安全评估基础设施;第三,构建模型部署后的监控机制。

其核心方向,是把安全能力从“发布后的补充措施”转变为模型训练与部署流程中的组成部分。对于开放权重模型而言,这种方式有助于让安全评估与模型本身同步推进。

但材料目前只披露了合作方向与基本目标,尚未提供具体标准的技术细节,也没有说明相关基础设施的发布时间、适用模型范围或实际评估流程。

结语:开放能否真正成为安全优势?

开放权重模型让更多人能够观察和使用人工智能模型,也让模型更容易被修改和重新部署。它既带来了更高的可见性,也带来了安全防护被移除的风险。此次合作试图解决的,正是如何在开放环境中建立持续、透明并贯穿模型生命周期的安全机制。

我认为:安全若只停留在模型发布之后,往往像门上临时贴着的一张告示,风一吹就可能失去作用;真正可靠的安全,应当从训练开始,经过评估,再延伸到部署与监控之中。开放不是天然安全,也不是天然危险,关键在于人们是否愿意把看得见的模型,交给一套同样看得见、守得住的标准。

#Abliteration

© 版权声明

相关文章