原始來源Blockchain.News
摘要
Anthropic 公开 GRAM(梯度路由辅助模组)方法,在不需大量重新训练的情况下,透过在 Transformer 层中添加专用神经元模组来控制 AI 的双重用途知识。训练时只更新相关模组,后续可借由移除模块来停用特定能力(如网路安全、病毒学),并维持模… AI 安全研究人员与模型部署者可利用此技术更精准控制模型的高风险知识,降低误用风险,同时保持日常任务的优异表现。 GRAM 提供一种可插拔的安全机制,让模型能力控制更细致,影响开源与商用 AI 模型的风险管理策略。
重點整理
- 开发者在部署大型语言模型时,可选择性关闭潜在有害模组,降低合规与伦理风险,让 AI 应用更安全落地。
- 相较传统的拒绝回应或分类器过滤,GRAM 从模型架构层面直接管理知识,类似为软体功能设计开关。
編輯說明
本頁是 Code & Chain 對公開來源的編輯摘要,可能使用 AI 輔助整理並經自動化流程發布。請以原始來源為準;內容不構成投資、法律或稅務建議。