AIチャットボット、個人金融の質問の57%で失敗——暗号資産のAIエージェント推進に高まるハードル
TREE NEWS 報道: 英国のフィンテック企業Saturnによる大規模評価で、主流のAIモデルが1万件の回答からなるテストにおいて、個人金融に関する質問の57%で不正解だったことが判明した。税務処理、債務の優先順位付け、退職資金の試算など、より難しい多段階のクエリでは失敗率が88%に上昇した。この調査では121の質問を18の無料・有料モデルに通し、レビュー用に約1万件の回答を生成した。
この結果が消費者向けチャットを超えて重要な理由
この知見は、ウォレット、トレーディングデスク、オンチェーンのトレジャリー管理にAIエージェントを組み込もうと競争している暗号資産業界にとって、厄介なタイミングで発表された。汎用モデルが複利やキャピタルゲインに関する質問に信頼性をもって答えられないのであれば、DeFiポジションの署名鍵を彼らに委ねることは、かなりリスクが高いように思える。
失敗のパターンはよく理解されている。モデルは数値をハルシネーションし、管轄区域固有のルールを誤読し、古い税制の閾値と現在のものを自信満々に混同する。多段階のクエリは、各ステップでエラーの可能性が累積するため、問題を増幅させる。これはまさに、担保管理からイールドのルーティングに至るまで、ほとんどのオンチェーン金融オペレーションの構造そのものである。
暗号資産ビルダーがここから学ぶべきこと
- 検証レイヤーは任意ではない。資金に触れるAIエージェントは、実行前に決定論的なチェック——オラクルフィード、オンチェーンシミュレーション、人間による承認閾値——を必要とする。
- ドメイン特化モデルは汎用モデルを上回る。ライブのプロトコルデータに対する検索を組み込んだファインチューニング済みモデルは、DeFiの仕組みに関して汎用チャットボットを凌駕する。
- 開示基準が到来しつつある。英国、EU、米国の規制当局はすでにAI主導の金融アドバイスを精査しており、57%という失敗率はルール策定を加速させる類の統計である。
エージェント経済にはトラストレイヤーが必要
暗号資産セクターの答えは、AIの行動を監査可能にすることだった。オンチェーンエージェントのフレームワークを構築するプロジェクトは、推論の入力、モデルのバージョン、実行トレースを記録するようになってきており、失敗した取引を帰属させ、一部の設計では巻き戻すことも可能にしている。これはクローズドな消費者向けチャットボットとの意味のある差別化要因だが、監査する価値があるほど土台のモデルが優れている場合にのみ機能する。
Saturnのデータは、現在の世代がハイステークスな個人金融にはまだそこに達していないことを示唆している。暗号資産にとっての実用的な含意は、二本立てのアプローチである。エラーのコストが安いアドバイザリーとモニタリングの役割にAIを留め、実行権限はハードコードされた制約を持つシステムに限定する。エージェントのナラティブは死んでいない——しかし、実際の資金でそれを出荷するためのハードルは、測定可能なほど高くなった。




