科技与AI
NIST下属CAISI评估DeepSeek V4 Pro:能力落后前沿约八个月,成本效率占优
CAISI于5月1日发布DeepSeek V4 Pro能力与成本评估结果
美国国家标准与技术研究院下属的人工智能标准与创新中心在2026年5月1日发布DeepSeek V4 Pro评估。CAISI认为该模型的能力比前沿水平落后约八个月,但仍是其迄今测试过的能力最强的中国模型。评估覆盖五个领域和九项基准,并指出开发方技术报告与额外非公开基准的结果存在差距。在七项成本比较基准中,该模型有五项比同等能力的美国模型更经济。相对GPT-5.4 mini,其价格区间从便宜53%到贵41%。
这是官方测评机构对中国模型给出的量化定位,把能力差距与单位成本纳入同一比较框架。
对采购方而言,模型选型需要联合评估能力与成本;对开发方而言,额外基准揭示了自报成绩可能未覆盖的能力差异。
后续关注
关注该机构后续是否披露非公开基准的方法细节,以及对更新版本模型的复测结果。
信息来源
GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。