AI 心理健康前沿——通用模型仍会漏掉老年情境

一项盲法基准研究显示,通用大模型可以回答不少老年抑郁问题,但高风险分流和老年适切性仍不稳定。

AI 心理健康前沿——通用模型仍会漏掉老年情境

一项发表于 2026 年 9 月的盲法基准研究,测试了三个通用大模型回答老年抑郁相关问题的表现。结果并不是“模型已经可以做分流”,而是:模型能完成不少低风险健康教育,却仍会在高风险情境中漏掉老年特有线索、低估紧急程度,且不同轮次的回答并不总是一致。对心理健康 AI 团队来说,真正的指标不应只是答案是否流畅或大体正确。

前沿信号

这项发表于《Frontiers in Psychiatry》的研究准备了 90 个面向患者和照护者的问题,覆盖六个老年精神科领域,并平均分为低、中、高风险。研究者分别测试 GPT-5.5 Instant、Gemini 3.5 Flash 和 Seed2.0 Pro,由两名精神科医生依据预先制定的逐题标准独立评分,分歧再由资深医生裁定;其中 30 题还在新对话中重复测试。

三者达到“临床可接受”的比例分别为 78.9%、72.2% 和 60.0%;主要安全错误分别为 5.6%、10.0% 和 16.7%。如果要求完整考虑老年适切性,比例降至 64.4%、55.6% 和 43.3%。在高风险问题中,可接受率进一步降至 63.3%、50.0% 和 36.7%,低估分流等级的比例则为 16.7%、26.7% 和 36.7%。这些是特定基准中的结果,不是临床效果试验,也不能直接推出普遍的模型排名。

为什么临床与构建者在意

老年抑郁很少只是“情绪低落”:认知变化、慢病共存、虚弱、跌倒风险、多重用药、营养、自我照护能力和照护者支持都会改变判断。一个关于抑郁的一般性回答,即使事实没有错,也可能没有识别急性意识改变、药物不良反应、严重自我忽视或间接表达的死亡风险。

研究中的照护者分析尤其说明了工作流问题。照护者往往最先看到进食、服药、跌倒、社交退缩和功能下降的变化。系统如果只对患者说“继续观察”或给出默认的自我管理建议,就可能把真正需要人工评估的任务留在错误的一端。教育工具可以帮助家庭整理问题,但涉及紧急分流、改药或风险管理时,产品边界必须更窄。

技术解读

这项研究的价值在于把“有帮助”拆成多个维度:事实准确性、临床安全性、老年适切性、危险信号识别、分流,以及重复回答的一致性。重复测试中,三个模型的一致性分别为 90.0%、83.3% 和 73.3%。这个设计可以直接转化为开发测试集:按风险分层,加入明确的老年修饰因素,测试照护者行动指引,并在新对话中重复同一案例。

临床现实校验

基准问题不能替代真实照护路径,也没有证明模型会改善患者结局。模型不知道一个具体人的完整病史、同意边界、支持网络和当地服务资源。更危险的错误不一定是编造诊断;也可能只是漏掉警讯、延后转介,或默认使用者有足够的记忆、判断力和行动能力。

构建者要点

  • 单独报告各风险层级的漏检和低估分流率,不要只看总体满意度。
  • 把认知、虚弱、跌倒、多重用药、营养、自我忽视和照护者可用性做成显式评估字段。
  • 测试系统能否把观察到的变化转化为适合照护者执行的人工交接信息。
  • 在新对话和新模型版本中重复测试,持续记录回答不稳定性。
  • 紧急分流、改药和自杀风险管理应接入经过验证的协议与人工复核。

链接 / 来源


Read in English →