AI圈报
论文研究普通

CLEAR:按提示词动态调节安全对齐,兼顾模型效用

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Safety alignment usually costs utility because the aligned weights apply to every prompt; New Stanf…

内容摘要

斯坦福新论文提出 CLEAR,通过小型门控网络按提示词动态调节独立安全模块的介入程度,冻结原模型以保留良性提示的完整性能。该方法在保持安全性的同时,显著减少全局安全微调带来的效用损失。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-f1d0f0f81a0b9c8844fd6296