科技与AI

CAISI分析大规模红队竞赛数据:十三个前沿模型均被找到有效劫持攻击

CAISI于3月23日发布智能体劫持红队竞赛数据分析

美国国家标准与技术研究院下属的人工智能标准与创新中心在2026年3月23日发布智能体劫持红队竞赛数据分析。竞赛累计收到超过25万次攻击尝试,参赛者超过400人,覆盖13个前沿模型。分析显示,全部受测模型都至少被发现一次成功攻击,但脆弱程度差异明显,与模型能力没有一致相关关系。部分通用攻击还可跨模型和场景迁移,针对更稳健模型开发的攻击可迁移至较弱模型,反向迁移则不成立。

智能体接入工具和计算机操作后,劫持攻击成为部署风险,官方机构的大规模竞赛数据提供了跨模型证据。

对部署智能体的企业而言,静态安全基准不能覆盖全部风险,需要结合持续对抗测试并关注攻击跨模型迁移带来的暴露。

后续关注

关注该中心是否公布可复用的智能体劫持评测方法或数据集,以及各实验室在后续模型版本中的防护改进。

信息来源

  1. NIST Artificial Intelligence官方原始材料 · en · 2026年3月23日发布

GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。