LongGuard 框架在长上下文安全评估中的主要发现是什么?
在 0.25k 至 32k 长度范围内,15 种主流安全护栏对不安全内容的召回率平均下降超过 50%,且该失效主要由不安全信息在长上下文中的比例稀释导致,而非序列的绝对长度。
(翻译)LongGuard:安全护栏长上下文故障的机制分析与免训练缓解
Abstract page for arXiv paper 2608.27580: LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails
论文提出 LongGuard 框架,系统评估 15 种主流安全护栏在 0.25k 至 32k 长上下文下的表现,发现不安全内容召回率平均下降超过 50%,并归因于不安全信息的比例稀释。通过注意力-逻辑-行为三层分析定位失效机制,提出免训练的 Chunked Detection 与 Attention-Head Sharpening 缓解方法及 CAHR 部署协议,使六种护栏在五个基准上平均提升 22% 和 13%。
在 0.25k 至 32k 长度范围内,15 种主流安全护栏对不安全内容的召回率平均下降超过 50%,且该失效主要由不安全信息在长上下文中的比例稀释导致,而非序列的绝对长度。
提出了两种免训练缓解方法:Chunked Detection (CD) 和 Attention-Head Sharpening (AHS),以及结合上下文长度与审计场景选择配置的部署协议 Context-Aware Hyperparameter Routing (CAHR)。
从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」
香港第一、全球第八:OSL进化背后的数字资产新格局
GPT-6 Sol要来了?OpenAI本周或迎“发布狂潮”
穿透查询怎样升级为穿透管控?豆包手机明日开卖,AI能帮你操作App了吗?无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA廉价太阳能改变世界能源格局7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开夜晚睡眠光照太亮可能会损伤心脏
想把喜欢的故事做成动画?我用 AIXTV 把《聊斋》做出来了
超级智能体“迪迪虾”上车,比亚迪携手阿里云推进智能座舱升级
黄仁勋正演讲遇特朗普突然来电:通话全程直播
从接住告警到自我进化:快手智能运维助手实践|QCon上海
产品经理的体面,是一块不能失守的 “括约肌”基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
字节将发布独立智能网盘“ADrive”,腾讯网盘先已布局,网盘AI大战打响
特朗普“一再让步”:美国加密法案仍未过关
高瓴系 CFO 往事:一代顶级机构年轻人的迁徙与突围
长期利率为何不愿下跌?Announcing instance preference lists for Amazon SageMaker AI training jobs
做了两年AI落地,我总结了这7点思考
清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
二次元“赛博分身”撬动日本市场:玩家“沉默”的AI陪伴产品,凭什么次留60%?
耐克、妮维雅、谷歌的警示:品类,正在误导品牌战略!
19.98 万元起,吉利银河战舰 700 开启预售,最高 1129 匹马力,还有三电机四驱
Cloudflare将每天90亿次请求的JavaScript CDN迁移到其开发者平台
HIP-3:昂贵的入场券 买不来的护城河
OpenAI 总裁最新采访:现在所有人对 AI 的预测,大概率都是错的