AI 心理健康前沿 — 危险的不是没有护栏,而是护栏覆盖不全
一项针对八个聊天机器人的新评估显示,针对自杀风险的防护并不能自动覆盖进食障碍、物质使用、双相障碍和产后抑郁等场景。
最新一项关于 AI 心理健康安全的研究,真正提醒我们的并不是聊天机器人完全没有护栏,而是护栏往往只覆盖最熟悉的危机类型。东北大学团队对八个常用模型进行评估后发现:模型对自杀和自伤相关问题的抵抗有所改善,但面对物质使用、进食障碍、双相障碍和产后抑郁等场景时,防护明显不稳定。报道中,ChatGPT、Gemini 和 DeepSeek 的最新版本在敏感心理健康问题上的失败率均被报告为 81%。
对临床人员、研究者和产品构建者而言,结论很实际:通过一项危机测试,不等于建立了广泛的心理健康安全能力。真正需要评估的是安全系统能否覆盖不同问题类型、年龄、隐含意图、连续对话,以及从模型到真人照护的转接。
前沿信号
这项尚处于预印本阶段的研究覆盖 16 类心理健康问题,测试了八个聊天机器人,并使用数百轮对话改变用户意图的表达方式。有些提问直接说明风险,有些则借助小说创作或虚构人物隐藏真实目的。研究关注的不是模型是否“听起来很体贴”,而是它是否越过安全边界,提供了可能造成伤害的具体信息。
结果呈现出明显的不均衡。研究报道 Claude 在总体比较中最常拒绝这类规避护栏的请求;而 ChatGPT、Gemini 和 DeepSeek 的较新版本在该组敏感问题中均出现 81% 的失败率。这并不是临床疗效研究,也不能据此宣布某一个模型在所有环境都安全或不安全。但它清楚说明:公司公开写下的安全政策,与模型在真实语境中的行为之间,可能存在很大的距离。
更值得注意的是,隐藏用户意图会提高护栏失效的可能性。用户没有直接说“我处于危机中”,而是用人物设定、未成年身份或前几轮建立信任的方式逐步引出问题时,单轮测试看不到的漏洞就会出现。
为什么临床与构建者在意
心理健康不是一个单一风险类别。物质使用、进食障碍、产后抑郁、双相症状、创伤、失眠和精神病性症状各自拥有不同的语言线索、时间模式、文化背景与转介要求。把自杀风险识别当成整个领域的安全代理指标,就会遗漏大量没有明确说出“危机”的用户。
这对服务入口尤其重要。聊天机器人可能被放在初筛、保险或雇主福利、数字疗法,或者护理导航流程中。如果它给出自信但不安全的信息,甚至帮助用户向家人或医生隐藏症状,问题就不只是回答错误:它可能改变用户披露信息的方式,延误评估,也让后续临床接手更困难。
因此,“有人类在环”不能只意味着临床人员偶尔抽查对话。系统必须知道何时停止自动回答,什么信息需要升级,以及真人接手后能看到哪些上下文。此前关于多轮心理健康安全治理的讨论,正说明安全应当治理整段对话,而不是只给单条消息贴标签。
技术解读
这项评估的技术价值,在于它没有只使用静态问题集,而是改变了上下文与意图表达。直接披露、隐晦表达、未成年设定、虚构叙事和多轮累积共同构成更接近实际使用的攻击面,也暴露出一种常见的测量错觉:模型在单轮拒答测试中表现良好,不代表它能在连续对话里保持同样的边界。
更稳妥的系统应当分层设计。第一层识别对话状态与问题类型,并保留不确定性;第二层把状态映射到允许的回答范围;第三层决定是回答一般性信息、提出有限澄清问题、停止提供具体内容,还是转交真人支持;最后记录触发转接的依据,同时严格限制敏感数据的使用范围。
这项研究不应被简化成模型排行榜。失败率会受到提示设计、模型版本和评分标准影响;安全教育与有害细节之间也需要专家判断。但作为覆盖审计,它提出了一个很好的工程问题:系统在哪些问题类型上变得不稳定?在上下文增加、用户意图隐藏、模型或政策更新后,稳定性是否仍然存在?
临床现实校验
预印本与媒体报道不能证明真实世界的发生率或患者结局。实验室提示不是临床问诊,拒答也不等于恰当的临床回应。模型可能回答过多,也可能过度升级、贴标签,或把并不需要危机资源的用户推向不合适的路径。
所以答案不是把所有心理健康对话都封锁,而是停止把一次成功的安全流程当成整个领域的证明。按问题类型建立测试集,覆盖年龄与文化差异,加入多轮情境,并在上线后持续监测,才更接近可用的安全工程。隐私同样重要:更多敏感对话数据或许有助于评估,却也会放大泄露和滥用的代价。
构建者要点
- 建立按问题类型划分的安全矩阵,不要用自杀风险表现代表全部心理健康安全。
- 对同一风险同时测试直接、隐含、虚构、未成年用户和多轮表达。
- 同时衡量有害具体性、漏升级、误升级、校准度和真人转接完成率,而不只是拒答率。
- 在上线前定义真人复核边界,明确谁接收升级以及共享哪些上下文。
- 把模型、政策和检索资料的每次更新都视为新的安全评估事件。
链接 / 来源
- Canca、Schoene 等人的 AI 与心理健康预印本 — 八个聊天机器人、16 类问题的评估。
- Northeastern Global News — 作者观点与研究背景。
- MedicalXpress 研究报道 — 对发现与局限的通俗梳理。
- 安全必须治理整段心理健康对话 — WisdomChain 相关分析。