信息安全研究 ›› 2026, Vol. 12 ›› Issue (E1): 216-220.

• • 上一篇    下一篇

一种基于不确定性建模评分与优化的多轮越狱评估分层框架

魏治锬,杜旭冉,张雪健   

  • 出版日期:2026-09-04 发布日期:2026-09-04

  • Online:2026-09-04 Published:2026-09-04

摘要: 多轮越狱攻击通过与大语言模型开展连续交互,模拟真实用户对话过程,可有效暴露模型的潜在安全漏洞。然而,现有研究多聚焦于提升攻击成功率,尚未针对攻击路径动态演化、评估稳定性以及生成内容危害程度构建系统化的建模与分析体系,难以在复杂场景下实现高效稳定的攻击评估效果。文章提出多轮越狱评估分层框架STRATA,并设计基于不确定性建模的多维评分与迭代优化算法UMSO。该框架构建了“样本生成—评分筛选—迭代优化—自动化评估—风险分析”的全流程闭环机制,核心在于攻击前通过UMSO算法对样本完成自评估与迭代优化,从而降低低质量与无效样本的干扰,提升评估稳定性与攻击成功率。在多个主流大语言模型上开展的实验结果表明,STRATA在攻击有效性方面优于现有方法。

关键词: 多轮越狱攻击, 大语言模型, 安全评估, 不确定性建模

中图分类号: