科技与AI今日必读

美英AI安全机构联合评估Kimi K3网络攻防能力

CAISI与UK AISI初评Kimi K3网络攻防:ExploitBench得分32%,明显低于美国前沿模型。

美国AI标准与创新中心(CAISI)与英国AI安全研究所(UK AISI)在7月23日发布对Kimi K3网络攻防能力的初步联合评估。Kimi K3由中国公司月之暗面(Moonshot AI)于7月16日发布。评估采用卡内基梅隆大学的公开基准ExploitBench,围绕V8 JavaScript引擎中的41个近期漏洞,衡量模型沿“软件利用阶梯”推进的能力。结果显示,Kimi K3得分32%,高于GLM-5.2的24%,但明显低于美国前沿模型;在全部41个样本中,它均未能生成实现任意代码执行的利用(0/41,而领先模型平均为20/41)。在名为“The Last Ones”的网络靶场模拟中,它推进到第17步(满分32步),领先美国模型平均为28.5步,且在10次尝试中仅完成1次。两家机构强调这只是基于少量公开与私有基准的初步评估:测试环境缺少主动防御方、不对触发安全告警设置惩罚,并包含现实中通常不存在的预设攻击路径。

随着开放权重模型能力提升,各国安全机构开始系统评估它们被用于网络攻击的风险。公开、可比的基准让不同模型的攻防能力有了参照,也显示该模型目前在生成可用漏洞利用上的实际水平仍然有限;同时评估方提醒,实验室环境与真实攻防差距很大,结论不宜过度外推。

AI模型开发者、网络安全防御团队和监管机构最直接相关;此类评估结果可能影响模型的开放发布策略、企业采用时的风险评估,以及围绕前沿模型能力披露与出口管理的政策讨论。

后续关注

关注CAISI与UK AISI是否发布完整评估报告与方法细节、是否将评估扩展到更多模型和攻防任务,以及Moonshot AI等开发方对结果的回应和后续版本的能力变化。

信息来源

  1. NIST/CAISI|UK AISI与CAISI对Kimi K3网络能力的初步评估官方原始材料 · 英文 · 2026年7月23日发布

GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。