OpenAI GPT-6 Astra 评测数据反复调整:AI 评估的“刷分”困境
TREE NEWS 报道, OpenAI 已正式发布 GPT-6 Astra,号称“目前全球最智能、且对齐程度最高的模型”。然而,该公司随后多次修改评测页面数据,部分指标出现明显变化。内部“幻觉率”最初公布为 4.2%,后调整至 2%,又恢复至 4.2%;Anthropic 的 Fable 5.1 在 FrontierMath Tier 4 的成绩从 87.8% 下调至 78%,再恢复至 83%;Astra 在 ARC-AGI-3 上的成绩也从发布前的 98.6% 提升至 99.99%。
行业分析:“刷分”现象与信任危机
这种反复调整凸显了 AI 行业长期存在的“Benchmaxxing”现象——通过调整测试条件和运行方式,人为提高基准测试成绩。OpenAI 回应称,调整旨在让评测更准确,并归因于模型检查点、工具配置、推理等级等差异。然而,这种解释在竞争激烈的市场中显得苍白,尤其当分数变动幅度高达 2% 时。
对于加密货币和去中心化 AI 网络而言,这是一个警示。基准测试是 AI 可信度的基石,但在新兴的代币化 AI 生态中,模型性能直接关联投资决策和智能合约执行。若评测数据可随意更改,将严重损害链上应用的可靠性。去中心化的评估协议,通过链上可验证的指标,或许能提供不可篡改的解决方案。
前瞻视角:链上验证或成未来
随着 AI 模型复杂度提升,性能声明与实际表现之间的鸿沟可能扩大。加密社区应推动透明、去中心化的基准验证机制。例如,去中心化计算或数据市场可集成链上评估预言机,提供防篡改的性能数据。这不仅增强模型可信度,还能保护用户和投资者免受“刷分”炒作的影响。
OpenAI 的调整,无论有意无意,都凸显了第三方审计和标准化评估的必要性。未来,区块链验证或将成为 AI 部署的默认要求,尤其是在金融或 DeFi 等高敏场景中。



