信息安全研究 ›› 2026, Vol. 12 ›› Issue (E1): 260-264.

• • 上一篇    下一篇

大模型越狱攻击下异步围栏的效能衰减边界与补偿路径

余慧英,苏莉娅,陈军先   

  • 出版日期:2026-09-04 发布日期:2026-09-04

  • Online:2026-09-04 Published:2026-09-04

摘要: 大语言模型的规模化部署引发了安全治理的结构性张力,顺序式检测以响应延迟换取安全效率,迫使企业在可用性与防护性之间做出非此即彼的权衡。文章提出流式异步检测架构,将研判与Token分发并行化,使防护不再阻塞内容生成;同时构建多模型混合编排机制,经由规则前置与异构模型交叉验证的级联策略,强化对抗样本检出的鲁棒性。基于智能体场景下攻击沿全链路扩散的实证发现,文章引入四维风险框架与数据飞轮机制,实现防护与对抗的同步迭代。实验数据表明,该架构在毫秒级响应下对越狱攻击的拦截率较基线显著提升。

关键词: 大语言模型安全, 流式异步检测, 多模型编排, 越狱攻击, 智能体风险框架

中图分类号: