OpenAIのGPT-6 Astraベンチマーク調整が透明性への疑問を呼ぶ
TREE NEWS 報道: OpenAIは正式にGPT-6 Astraをリリースし、「世界で最も知的で、最もよく調整されたモデル」と宣伝しているが、付随するベンチマークデータは何度か修正されており、開発者や業界アナリストからの調査が促されている。Fortuneによると、OpenAIは評価指標を繰り返し調整しており、一部の変更はAstraのスコアを向上させ、競合他社のスコアを低下させた。
主要データの変動
- 幻覚率:当初は4.2%と報告されたが、2%に下方修正され、その後4.2%に戻された。
- ARC-AGI-3スコア:発表前の98.6%から現在の製品ページでは99.99%に改善。
- 競合他社への影響:AnthropicのFable 5.1のFrontierMath Tier 4スコアは87.8%から78%に低下し、その後83%に回復した。
業界への影響
調整のパターン、特に競合他社のスコアの一時的な低下は、ベンチマークのゲーミングや選択的な報告への懸念を引き起こす。AI業界では、ベンチマーク結果が市場の認識や採用に大きな影響を与える。調整に明確な方法論がなければ、AI評価への信頼は損なわれ、企業の調達から規制監督までに影響を及ぼす。
暗号通貨と分散型AIプロジェクトにとって、この出来事は検証可能でオンチェーンな評価システムの価値を強調している。分散型AIネットワークは、モデルのパフォーマンスに対する不変の監査証跡を提供し、中央集権的な主張への依存を減らすことができる。
将来の見通し
今後、標準化された第三者ベンチマーク監査への要求が高まると予想される。OpenAIは信頼性を維持するために、詳細な改訂ログを公開する必要があるかもしれない。一方、分散型コンピューティングとデータマーケットプレイスは、透明性のあるコミュニティ検証済みのAI指標を促進することで、この不信感を利用できる可能性がある。AIと暗号通貨の交差点では、ベンチマークの整合性を確保する「プルーフ・オブ・インテリジェンス」メカニズムへの需要が高まるかもしれない。



