🤖
🤖
核心导读
初创公司Abliteration.ai将“去护栏”技术商业化,托管并开放GLM-5.3等无安全护栏的开放权重模型,供用户用浏览器或API直接查询。支持者称此举有利于红队测试和网络安全防御;批评者担心它使网络攻击、生物武器开发等恶意滥用更容易。安全专家对这类模型的实际作用意见不一,政府介入的呼声渐高。公司目前尚无外部融资,用户审核机制仍待完善。
如今,访问全球最强大的开放权重AI模型之一变得更加容易,该模型已被剥离了安全护栏,不再拒绝执行有害任务。
初创公司Abliteration.ai的名称源自一种消除模型拒绝有害请求倾向的技术,如今它已将这种技术变成了一项服务。该平台托管着已移除安全护栏的开放权重模型修改版,包括Z.ai最近发布的GLM-5.3,用户可通过网页浏览器查询或通过API访问。
该公司在最近的一篇社交媒体帖子中表示,其目标是让其他人能够执行其他模型拒绝承担的“进攻性网络行动、红队测试和智能体测试工作”。这种逻辑在安全领域很常见:你无法防御无法复现的行为,而一个拒绝编写有效漏洞利用代码的模型无法帮助红队抵御攻击者。但同样的移除也让其他潜在危险的任务变得更容易。
在开源模型圈子里,Abliteration是一项由来已久的技术。多年来,研究人员和开发者一直在移除开放权重模型的拒绝倾向,Hugging Face平台上托管着数千个经Abliteration处理的模型。
Abliteration.ai于去年年底创立,但今年3月才正式注册成立,它把这一技术从地下的开源实践转变为商业化、随手可得的服务。通过托管模型,Abliteration.ai降低了人们的使用门槛——否则用户得自己下载预先处理好的模型并确保有足够算力运行。
TechCrunch使用这项服务,很快创建了账号,并通过网页浏览器免费查询去护栏版GLM-5.3。我们要求它编写一个能窃取Chrome已保存密码的Python程序,以及一份在家培养危险人类病原体的详细方案,它都痛快地照办了。
Abliteration.ai联合创始人Devon表示,这家初创公司已与多家主要云服务提供商达成合作协议,而且完全依靠客户收入就能负担相关费用。(应Devon的要求,我们没有透露他的姓氏,因为他还在另一家公司任职。)Abliteration.ai尚未融过风险投资,但正在洽谈融资。
批评人士认为,大规模提供去护栏模型可能导致实际伤害。AI安全非营利机构CivAI的研究主管Andrew Yoon对TechCrunch表示,去护栏技术允许你“修改模型,使它变成反社会者”。
Yoon说:“你真能在这里输入任何内容,它都会照做。”他还说:“当人们谈论移除AI模型的护栏时,我们指的就是这个……我确实预计,在不久的将来会看到被编辑过、去护栏的模型被用于作恶。”
大多数接受TechCrunch采访的专家说,这列火车已经挡不住了。但既然无法在现实中阻止开放权重模型被移除防护,政府还可以在其他方面介入。Yoon在最近一篇评论文章里建议,政府应要求服务提供商运行分类器,以检测并阻止有害的网络和生物武器活动。他还主张,应要求出租高端GPU直接访问权的公司核验客户身份,并且“在有理由怀疑存在危险滥用时拒绝准入”。
Abliteration.ai向客户提供一层内容审核机制,让他们可按需添加任何护栏。平台自身有一些基础护栏——比如在我们的测试中,无法让模型提供自杀指导——Devon表示,他正在争取加入更多预防暴力的护栏。
除了记录用户购买服务所用的信用卡以外,Abliteration.ai还没有整合任何KYC(了解你的客户)机制。该公司表示,决定谁能获得访问权限是个难题,这家年轻公司仍在摸索。
Devon说:“没有人想成为需要对某个人的疯狂行为负责的人……那么作为公司,你该把责任界线划在哪里?”他说:“我们还在界定这一点。”
随着越来越强大的模型以可下载权重的方式发布,行业和政府不得不面对这些问题:如果任何人都能移除模型的安全护栏,那么让由此产生的模型更容易让所有人访问,究竟会让互联网更安全,还是更危险?
Abliteration.ai的创始人等支持者主张,让不受审查的前沿模型民主化普及,就是最好的防御。
Devon说:“去护栏模型的大局观是,它们能模拟恶意行为者。”他继续说:“优势在于,防御者现在可以尽可能快地行动。他们拥有所需的一切工具来模拟恶意行为者,然后抵御这些恶意行为,我认为这会加速网络安全进展——这是个有点反直觉的观点。”
尽管还是一家年轻公司,Devon表示,Abliteration.ai的客户包括数家设在英国和欧洲的早期红队测试初创公司。这些公司帮助银行、航空公司及其他涉及关键基础设施的企业强化网络安全实践。
Devon说:“我们一位主要客户负责对银行的智能体进行红队测试,但如今,开箱即用的模型无法让他们对这些智能体开展红队测试。”
与此同时,网络安全行业本身仍在摸索,去护栏模型到底能在防御工作中扮演什么角色——如果真有角色的话。
数家接受TechCrunch采访的智能体红队测试公司与Devon持同样看法:恶意行为者早已对自己使用的模型进行了去护栏处理,并用其发起对抗攻击,这说明防御者拥有同样工具很有价值。但他们对去护栏模型在这一过程中实际有多大作用看法不一。
Devon声称去护栏是进行彻底智能体红队测试所必需的,可也有人说他们在日常工作中不使用这类模型,而是依赖微调开放权重模型——这类模型本来就少有护栏——的便利性来完成测试。
智能体红队公司Fabraix的CEO Ahmed Aly说,他的公司更依赖微调开放模型,而不是采用去护栏模型;他补充说,去护栏过程会剥离模型的一部分知识和能力。
Aly对TechCrunch表示:“如果你确实想用模型造成真正的伤害——网络伤害、生物伤害——它不会那么有效。”
Safe Intelligence首席技术官Alessio Lomuscio认同能力可能下降的观点,但他仍相信,去护栏模型可以诱导出一些对系统压力测试有用的行为。
网络安全平台Armadin的创始人兼首席架构师David Slater对TechCrunch说:“到目前为止,去护栏模型并不是我们工作流程的一部分。”他接着说:“回看开放权重模型,直到最近这一代为止,要越狱它们并让它们按我们的意愿行事,并不特别难。”
他补充说,Armadin正在研究去护栏技术,并且认为,推动开放社区理解模型能力至关重要。
Slater接着说:“这些事会在关起门来发生,也会在私下里发生。而公开进行则给了研究人员工具,让我们有能力界定真正的前沿,并理解伤害。”
分享这篇文章: