AI 心理健康前沿——使用已经跑在治理之前
澳大利亚最新证据显示,心理健康行业已经日常使用通用 AI 处理文档,但复杂照护中的准确性、隐私与治理仍未跟上。
心理健康行业正在经历一个容易被低估的变化:通用 AI 已经进入日常工作,但治理还没有同步到位。澳大利亚昆士兰大学团队调查了 278 名临床工作者,其中 43.5% 表示每天至少在一项行政或临床支持任务中使用 AI;接近八成受访临床工作者或机构表示,会让 AI 旁听并转录咨询。对产品团队而言,这不是“AI 是否会取代临床医生”的问题,而是一个更迫切的问题:当文档辅助已经成为真实生产流程,谁来保证它不把便利变成新的临床风险?
前沿信号
这项研究采用问卷与访谈结合的方法,访谈对象为 12 名临床工作者。受访者主要把 AI 用于报告、个案记录、研究准备和会谈转录。他们认为 AI 在常规文档工作上可能优于人工,原因包括减少记笔记、让临床医生更专注于来访者,以及缓解行政负担。
但场景一复杂,信心就明显下降。研究团队还回顾了 66 项关于大型语言模型在心理健康场景中表现的研究;随着模拟个案变得更复杂,模型相对于人的表现变差。现实使用调查与评估研究并不是同一种证据,却共同指向一个重要梯度:低复杂度任务中的采用率,不能推导出高风险临床推理已经成熟。
研究并没有证明 AI 能改善患者结局,也没有证明所有转录流程都不安全。它揭示的是落差:不同机构对会谈中使用 AI、行政使用和记录保存的规定并不一致。临床工作者希望得到的是关于隐私、同意、准确性和责任归属的可执行标准,而不是完全脱离实际使用情况的禁令。
为什么临床与构建者在意
文档从来不是纯粹的行政材料。转录内容可能包含身份信息、家庭成员信息、用药情况和来访者没有预期会离开房间的细节。一份摘要一旦进入病历,还可能影响后续判断。模型漏掉否定词、讽刺、文化语境、说话人的情绪变化,都会让“节省时间”转化为临床误差。
临床医生需要知道:AI 写出看似合理的记录后,责任到底落在哪里。运营者需要把同意、保存期限、访问权限、纠错和事故处理做成流程。构建者则应把这条信号理解为产品边界:第一步可以是有明确范围的文档助手和人工复核,而不是能够提出诊断或治疗建议的自主代理。
技术解读
一个可部署的流程应当拆开采集、转换、复核和写入病历四个环节。音频或文本进入受限的数据处理边界后,系统应说明使用了哪些原始材料、哪些内容是推断出来的、哪些地方无法听清或无法判断。生成的记录在临床医生接受或修改前必须保持“草稿”状态,修改也要留下可追溯痕迹。
评估至少要有两条轴线。一条是常规质量:遗漏、虚构、说话人归属、专业术语和复核后的节时。另一条是复杂场景压力测试:多人重叠讲话、口译、语言切换、间接表达、含糊的风险披露,以及不同文化中的心理健康表达。平均准确率很高,并不代表系统处理得好最重要的边缘案例。
隐私边界也必须写进架构。减少保存时间,加密传输和存储,限制复核者权限,记录导出行为,并让删除和更正真正可行。不能把会谈材料默默变成训练数据。使用外部供应商时,机构需要清楚的数据处理协议,以及验证实际数据边界的办法,而不能只接受宣传页面上的承诺。
临床现实校验
这不是随机对照试验,系统综述也不能证明每个模型都会在复杂照护中失败。自报问卷可能高估或低估真实使用,模拟场景也未必完全代表真实患者照护。但证据有限并不意味着可以跳过控制措施,反而意味着不能做超出证据范围的承诺。
另一个风险是治理表演。全面禁止可能把使用推向没有记录的非正式渠道;没有同意和复核的宽松政策,则会让数据泄露与错误逐渐正常化。真正应被问责的是完整工作流:谁取得同意,谁检查草稿,系统不确定时怎么办,错误如何更正,发生事故后谁向来访者说明。人工监督不能只是界面上的一个按钮。
构建者要点
- 先从范围明确的行政任务开始,禁止自主提出临床建议。
- 追踪错误严重程度和不同群体的表现,不只看平均转录准确率。
- 在产品中明确呈现同意、保存、删除、更正和审计记录。
- AI 内容进入病历前,必须经过临床工作者确认。
- 在扩展功能前,测试复杂、多语言、间接表达和风险相关对话。
链接 / 来源
- JMIR——澳大利亚临床工作者在常规心理健康实践中的通用 AI 使用:问卷与访谈研究。
- JMIR AI——生成式大型语言模型在心理健康照护场景中的系统综述:涵盖 66 项研究的综述与荟萃分析。
- Medical Xpress——心理健康实践采用 AI,更需要行业指南:研究发现的通俗报道。
- WisdomChain——心理健康 AI 需要按风险分层部署:相关部署框架。
- WisdomChain——伦理评估必须跟着完整照护路径走:相关评估框架。