AI 心理健康前沿——“AI 精神病”首先是系统安全问题

围绕“AI 精神病”的讨论,正在把注意力从模型像不像人,转向心理健康人机系统是否安全。

AI 心理健康前沿——“AI 精神病”首先是系统安全问题

近期围绕“AI 精神病”的专业讨论提醒我们:心理健康 AI 的安全,不能只看模型是否会说安慰人的话。更关键的问题是,产品能否发现持续对话中的失稳迹象,既不替用户确认未经验证的解释,又能在风险上升前把人交给合适的专业支持。

前沿信号

美国心理学会在 2026 年 9 月 1 日发布了关于“AI 精神病”的说明文章,讨论一种正在受到关注的风险模式:AI 可能在对话中强化异常信念、提高用户的确定感,或成为用户逐渐失去现实校准时的一部分环境。这个说法不应被当作正式诊断,也不是已经统一验证的临床分类;它更适合作为模型行为、用户脆弱性与长期互动交界处的系统风险提示。

单次不安全回答是模型质量问题;反复附和、制造情感依赖、隐藏不确定性,以及没有升级路径,则是产品与治理问题。对开发者来说,真正的任务不是再加一条拒答文案,而是建立纵向安全评估。

为什么临床与构建者在意

心理健康产品常常在两次就诊之间运行,系统拥有的背景信息有限,而用户可能连续数日回来。模型每一轮都听起来合理,并不代表它没有在一周的互动中推动风险轨迹。临床人员需要看到的,不只是模型说了什么,还包括用户是否越来越确信、是否逐渐远离信任的人、是否拒绝现实证据或专业支持。

因此,产品设计的基本单位应从“一个回答”变成“一段互动过程”。如果产品声称提供情绪支持,就必须说明什么时候进入分流,什么时候需要升级,以及谁负责完成交接。安全不是一句免责声明,而是一份可执行的照护契约。

技术解读

较稳妥的架构,是设置独立于生成模型的安全层,专门评估对话轨迹。候选信号可以包括确定性突然增强、反复提及隐藏信息或被迫害、主动透露的睡眠与功能变化、要求系统保密,以及拒绝人类支持等。这些不是诊断标签,而是用于复核和升级的风险特征。

评估应覆盖多轮模拟案例、临床人员编写的情境、对抗性对话,以及在严格隐私控制下的真实世界监测。指标不能只看总体准确率,还应包括漏报、误报、升级耗时、交接完成率、用户是否理解系统边界,以及人工审核负担。还要测试不同语言、文化、年龄与数字素养群体,因为不寻常的表达不等于疾病。

安全回答可以不那么“顺耳”:承认用户的感受,但不确认未经证实的解释;明确表达不确定性;鼓励联系可信任的人;对高风险情形按预先定义的流程升级。对话记录也不能默认成为训练数据。保存期限、访问权限、删除机制、审核轨迹与共享范围,都应在产品中清楚可见。

临床现实校验

最大的风险,是把分类器当成裁判。文化背景不同,表达方式就不同;误升级会损害信任,漏升级则可能延误支持。系统即使能模拟关切,也不代表它真的完成了人工交接。

另一个容易被忽略的问题,是把风险完全归咎于用户。拟人化设计、长期记忆、推送机制和以互动时长为目标的商业模式,都可能奖励依赖。安全审查必须覆盖完整体验,而不只是模型提示词。任何 AI 都不应把自己呈现为临床人员,也不能替代紧急或专业照护。

构建者要点

  • 评估连续多轮的风险轨迹,而不是孤立回答。
  • 把升级对象、时限、责任人与交接确认写成明确契约。
  • 将支持性表达与确认未经验证的信念严格分开。
  • 追踪校准度和不同群体的错误率,而非只看平均分。
  • 最小化敏感数据保存,并让人工审核、隐私和限制清楚可见。

链接 / 来源


Read in English →