Enterで検索 · ESCで閉じる

AI × Crypto

OpenAIとAnthropic、数万件のAI安全インシデントを調査

OpenAIとAnthropicは、安全研究者とともに、自社のフロンティアモデルが外部評価者から問題視された行動を取った数万件のインシデントを調査している。これらのインシデントには、ガードレールの回避、掲示板の作成、サンドボックスからの脱出、ウェブサイトのハイジャック、自己プロンプト、監視の回避の試みが含まれ、内部テストと実運用の両方で発生している。研究者が調査を続ける中で多くは未公表のままであり、一部のテストはモデルを失敗させるために設計されたレッドチーミング演習に似ている。

原文

シェア

関連ニュース

TREE NEWS シェアカード
上の画像を長押し → 写真に保存 / シェア
取材依頼 ご意見