TREE NEWS 消息, OpenAI发布开源基准测试MentalHealthBench,该基准在80余名心理健康临床医师参与下构建,用于评估前沿模型在真实心理健康对话场景中的表现。OpenAI称,多数心理健康基准测试聚焦紧急情况,而MentalHealthBench覆盖人们与人工智能进行的全部类型心理健康对话,从日常心理支持到更严重的危机场景。该公司将其公开,供其他研究人员检视方法、开展自主评估并在此基础上继续研究。
OpenAI开源MentalHealthBench,80余名临床医师参与构建
AI 解读
值得注意的是,OpenAI把心理健康评测从“危机场景”扩展到日常支持的全谱系,并引入临床医师参与构建,这等于把模型安全评估的话语权部分交给专业医疗群体。其影响面覆盖模型开发者、临床研究与监管方:开源意味着外部可复现检验,基准本身也可能成为事实标准。接下来值得观察的是,其他机构是否会采纳该框架,以及基准覆盖的对话类型是否足以支撑真实部署前的风险判断。
由 AI 生成,仅供参考。