按 Enter 搜索 · ESC 关闭

AI × Crypto

OpenAI GPT-6 Astra 评测数据反复调整:AI 评估的“刷分”困境

OpenAI GPT-6 Astra 的评测数据反复调整,暴露了 AI 行业“刷分”现象。这引发了对 AI 可信度的担忧,并可能推动去中心化、可验证的基准测试在加密 AI 领域的应用。

OpenAI GPT-6 Astra 评测数据反复调整:AI 评估的“刷分”困境

OpenAI 已正式发布 GPT-6 Astra,号称“目前全球最智能、且对齐程度最高的模型”。然而,该公司随后多次修改评测页面数据,部分指标出现明显变化。内部“幻觉率”最初公布为 4.2%,后调整至 2%,又恢复至 4.2%;Anthropic 的 Fable 5.1 在 FrontierMath Tier 4 的成绩从 87.8% 下调至 78%,再恢复至 83%;Astra 在 ARC-AGI-3 上的成绩也从发布前的 98.6% 提升至 99.99%。

行业分析:“刷分”现象与信任危机

这种反复调整凸显了 AI 行业长期存在的“Benchmaxxing”现象——通过调整测试条件和运行方式,人为提高基准测试成绩。OpenAI 回应称,调整旨在让评测更准确,并归因于模型检查点、工具配置、推理等级等差异。然而,这种解释在竞争激烈的市场中显得苍白,尤其当分数变动幅度高达 2% 时。

对于加密货币和去中心化 AI 网络而言,这是一个警示。基准测试是 AI 可信度的基石,但在新兴的代币化 AI 生态中,模型性能直接关联投资决策和智能合约执行。若评测数据可随意更改,将严重损害链上应用的可靠性。去中心化的评估协议,通过链上可验证的指标,或许能提供不可篡改的解决方案。

前瞻视角:链上验证或成未来

随着 AI 模型复杂度提升,性能声明与实际表现之间的鸿沟可能扩大。加密社区应推动透明、去中心化的基准验证机制。例如,去中心化计算或数据市场可集成链上评估预言机,提供防篡改的性能数据。这不仅增强模型可信度,还能保护用户和投资者免受“刷分”炒作的影响。

OpenAI 的调整,无论有意无意,都凸显了第三方审计和标准化评估的必要性。未来,区块链验证或将成为 AI 部署的默认要求,尤其是在金融或 DeFi 等高敏场景中。

查看原文

分享本文
风险提示 本站内容为币圈、区块链与 Web3 行业资讯的整理与呈现,仅供参考,不构成任何投资建议或收益承诺;虚拟货币相关业务在中国境内属非法金融活动,数字资产价格波动剧烈,据此操作风险自担。本站不提供交易、代币发行融资或相关导流服务。

相关阅读

最新快讯

TREE NEWS 分享卡片
长按上方图片 → 保存到相册 / 转发分享
寻求报道 加入社群 意见反馈