这项由东北大学、新加坡管理大学、Amiya Research及德国哥廷根大学联合完成的研究,以预印本形式发布于2026年7月30日的arXiv平台,论文编号为arXiv:2607.27851。对于任何曾经向AI倾诉烦恼、或者好奇AI情感支持究竟有没有副作用的人来说,这项研究触碰了一个被长期忽视却至关重要的问题。

你有没有想过,一个每天陪你倾诉的AI,长期用下来,会不会让你越来越依赖它,越来越不愿意跟真实的人交流,甚至越来越没有能力自己处理情绪?这个问题听起来有点像科幻小说的情节,但研究团队通过系统性地梳理近年来的学术研究和对话数据,发现这不是危言耸听,而是一个真实存在却几乎没有人认真研究过的漏洞。他们把这个漏洞命名为"舒适陷阱",并提出了一套全新的研究框架,专门用来解决这个问题。

要理解这项研究的意义,先从一个你可能经历过的场景出发:你心情不好,打开某个AI助手倾诉,它温柔地回应你、安慰你,你感觉好多了,然后关掉对话框继续生活。这种体验很好,没有问题。但如果你每隔几天就这样做,持续几个月,会发生什么?研究团队认为,目前几乎所有的AI情感支持系统,都只关心那一次对话结束时你有没有感觉好一点,而没有人去追问:几个月之后,你自己处理情绪的能力有没有变强?你有没有更愿意去寻求身边人的帮助?你在做重要决定时,有没有更多主见?

这就是这项研究的出发点,也是它与之前所有相关研究最根本的不同之处。

一、心情好了,但能力呢?——一个被整个领域忽略的问题

在AI情感对话这个研究领域,长期以来存在两条主要的技术路线。第一条叫做"共情对话",它的核心目标是让AI能够准确感知用户的情绪,并给出让用户感到被理解的回应——说白了,就是让你觉得AI真的在认真听你说话。第二条叫做"情感支持对话",它更进一步,不只是理解,还要根据用户当前的需求,有策略地提供安慰、引导和行动建议,帮助用户在那一次对话中解决问题、缓解痛苦。

这两条路线都有各自的代表性研究和数据集,也都产生了不少实用成果。但研究团队注意到,无论是哪条路线,它们评判一个AI好不好的标准,几乎都停留在"这次对话结束时用户有没有感觉好一些"这个层面。就像一个医生只关心你离开诊室时有没有说"谢谢,我好多了",而从来不追问你下周、下个月的状态如何。

问题在于,现实中的AI情感支持应用,已经不再是用一次就扔的工具。越来越多的用户会连续几周、几个月地使用同一个AI系统倾诉烦恼、寻求支持。这个时间维度的变化,带来了单次对话评估根本捕捉不到的风险。

研究团队用了一个非常贴切的概念来描述这种风险:如果一个AI总是用高度验证性的、甚至有点指令式的方式跟你互动,你每次都感觉很受用,但久而久之,你可能会在无意中把很多本该由自己主导的情绪调节、决策判断,悄悄外包给了这个AI。这就是他们所说的"舒适陷阱"——你感觉越来越好,但你自己的能力可能在悄悄萎缩。

为了搞清楚这个问题到底有多普遍,研究团队做了两件事:一是系统梳理近年来的相关学术文献,二是仔细分析一个公开的情感支持对话数据集。结果触目惊心。

二、九成研究只盯着"当下感受"——文献梳理揭示的惊人空白

研究团队按照严格的学术筛选方法(参照PRISMA-ScR规范),从arXiv上检索了2019年到2026年间的275篇相关论文,经过筛选保留了228篇,再从中按年份比例随机抽取了91篇进行详细编码分析。

这91篇论文里,有60篇是在构建或评估实际系统的研究。研究团队逐一检查这些论文:它们的目标是什么?它们用什么机制来帮助用户?它们如何评估效果?

结果是,60篇系统性研究中,有57篇——也就是整整95%——的核心目标是帮用户在当下感觉好一些,即所谓的"缓解导向"。只有2篇混合了缓解和能力培养的目标,而真正以用户长期能力为核心目标的,只有1篇,而且那篇还是针对咨询师自身能力培训的,不是针对用户的。

更让人咋舌的是,在全部91篇论文中,没有任何一篇测量了用户在对话之后的实际心理能力是否有所提升,也没有任何一篇做过跨越多次使用的纵向追踪评估。换句话说,这个领域没有任何人认真研究过"长期用这些AI,用户的自我调节能力、应对压力的能力会不会变化"。

在研究用到的心理机制方面,情况同样失衡。情绪验证和安慰出现在59篇论文中,几乎是全覆盖;问题解决方案出现在3篇;自我效能感的支持(帮助用户相信自己有能力应对问题)只有2篇;认知重评(帮用户换一个角度看待困境)是0篇;支持用户维护社会连结(鼓励用户跟真实的人交流、寻求人际支持)也是0篇。

至于风险意识方面,全部91篇论文里,有25篇提到了某种风险,但在60篇系统性研究中,只有1篇考虑过用户依赖、自主性受损、奉承式回应、危机安全或终止使用时的问题。这意味着,构建AI情感支持系统的研究者,和研究AI情感支持潜在危害的研究者,几乎完全生活在两个不同的世界里,彼此没有对话。

三、对话数据里的能力短板——300句回应的精细解剖

除了文献梳理,研究团队还对一个名为ESConv的公开情感支持对话数据集进行了细致分析。ESConv包含1300段真实对话、18376条支持者的回应,是这个领域最常用的标准数据集之一。

研究团队从中随机抽取了300条回应,按对话的早、中、晚三个阶段各取100条,然后为每条回应标注它在功能上属于哪一类:是在做情绪验证和安慰,还是在帮用户探索问题,还是在提供具体建议,还是在帮用户重新看待问题(认知重评),还是在增强用户的自我效能感,还是在鼓励用户维持社会连结,还是在设定边界和安全保障,等等,共分十种功能类型。

标注工作由多个AI模型独立完成,并进行了一致性检验。细粒度标签的一致性系数(Cohen's κ)在0.547到0.751之间,平均0.631;如果把十种功能合并为"缓解相关"、"能力相关"和"互动过程"三大类,一致性系数提升到0.646至0.845,平均0.716,说明大方向上的判断是可靠的。

分析结果显示,能力相关的功能在300条回应中出现了43%,听起来不低,但细看构成就会发现问题所在。这43%里,最大的贡献来自通用性建议(占22%),也就是泛泛地给出"你可以试试这样做"之类的建议,并不特别针对用户的个人情况或能力培养。真正有助于改变用户思维方式的认知重评只占4%,帮助用户建立自信心的自我效能支持占6.7%,鼓励用户维系与真实人际关系的社会连结行为只有10%,而设定边界、防止过度依赖的行为更是仅占0.3%。

从对话的早、中、晚三个阶段来看,能力相关功能从早期的26%上升到中期的55%,晚期稳定在48%。但问题在于,对话末尾几乎没有什么"巩固成果、规划转移、提供后续资源"的行为——也就是说,当一段支持性对话即将结束时,它往往就这样收尾了,没有帮用户把在对话中获得的东西带回真实生活,也没有把用户引向人际支持或专业资源。

这两组证据放在一起,指向了同一个结论:当前的AI情感支持系统,在设计理念和实际行为上,都几乎只着眼于让用户在当下感觉好一些,而对"这种帮助方式会不会影响用户的长期能力"这个问题,既没有工具来回答,也没有动力去追问。

四、一个全新的框架——CSED究竟是什么

正是在这样的背景下,研究团队提出了"能力维持型情感对话"(Capability-Sustaining Emotional Dialogue,简称CSED)这个新的研究框架。

CSED的核心思路可以用一句话来概括:有效的情感支持,不只是让你现在感觉好,而是要让你在持续使用之后,仍然具备——甚至更强地具备——自己调节情绪、应对压力、做出属于自己的决定、以及维系真实人际关系的能力。

这个框架把研究和设计的视角,从一次对话扩展到了完整的使用生命周期,包括用户初次使用、反复使用、中途暂停、重新回来、AI系统版本更新或切换、以及最终停止使用这一系列过程。在CSED的视角下,每一个环节都可能对用户的长期能力产生影响,因此每一个环节都需要被认真对待。

为了实现这个目标,CSED提出了六条设计承诺。前两条继承自现有框架:其一是共情接收,要求AI准确理解用户的情绪并给出有据可查的回应,让用户感到被理解;其二是支持有效性,要求AI能够协同用户在一次对话中切实解决当前的问题和需求。这两条是基础,不能丢。

接下来四条是CSED新增的。第三条是韧性激活:不只是帮用户解决眼前的问题,还要帮助用户识别和练习那些在对话之外、在真实生活中依然可以用得上的策略,让用户下次遇到类似困境时能更好地应对。第四条是自主性保护:用户的目标设定、价值判断和最终决策必须始终由用户自己主导,AI的角色是协助而非代替,即使用户愿意接受AI的建议,AI也要确保用户是在充分理解和自愿评估的前提下做出选择的。第五条是社会连结维护:AI支持不应该成为用户社会关系的替代品,而应该把自己定位为用户更广泛支持网络的一部分,在适当时机鼓励用户寻求真实的人际支持。第六条是终止与过渡安全:当AI系统需要更新、切换或关闭时,这件事本身也应该被纳入设计,包括提前告知用户、提供适当的心理过渡支持、以及帮助用户转接到其他资源。

这最后一条来自一些令人不安的现实观察。已有研究记录了用户在AI伴侣突然关闭或模型切换时出现类似悲伤反应的情况,有人陷入"修复循环"(反复尝试让AI回到原来的状态),有人体验到一种模糊的失落感。提前告知和有计划的收尾可以显著减轻这种反应。

五、给研究者的技术地图——如何测量你看不见的东西

提出一个框架容易,难的是把它变成可以实际操作和测量的东西。为此,研究团队构建了一套数学形式化的过程模型。这套模型的核心思路并不难理解,用一个比喻来解释会更清楚。

设想你在健身房接受一个私人教练的指导。你的状态包括两个部分:一是今天训练后的即时疲惫感或兴奋感(这相当于情绪状态),二是你的体能水平——心肺耐力、肌肉力量、柔韧性等等(这相当于能力状态)。好的教练不只是让你每次训练后感觉爽,还要在多次训练之后让你的体能真正提升。而且,教练的训练方式,以及你在训练之外的生活(睡眠、饮食、压力)都会影响你的体能变化。

研究团队的模型用同样的逻辑来描述AI情感支持的效果。用户的状态被分为两个层面:短期情绪(当下的情绪感受,相当于训练后的即时状态)和长期能力(可以进一步细分为四个维度:情绪调节灵活性、主动应对压力的能力、自主决策能力、社会连结感)。每一次对话,加上对话之外的真实生活事件,共同推动这个状态向下一个状态演变。

基于这个模型,研究团队提出了四个层次的评估维度,覆盖从当下到长远的完整时间跨度。

第一层是回应层面的评估,发生在几分钟之内:这条AI回应有没有准确感知用户情绪?有没有不盲目迎合用户?有没有尊重用户的自主性?有没有在表达支持的同时维持适当的边界?第二层是对话层面的评估,以一次完整会话为单位:这次对话有没有帮助用户在思维灵活性和应对能力上有所进展?情绪强度有没有在对话过程中发生改变?第三层是纵向层面的评估,跨越数周到数月:用户的四个能力维度有没有随时间变化?变化方向是正向的还是负向的?用户依赖AI的程度有没有超出合理范围?用户的自主决策能力有没有受损?用户的真实人际连结有没有减少?第四层是终止层面的评估:当用户停止使用或AI系统发生变化时,有没有发生分离痛苦或修复循环?有没有做好后续支持的衔接?

与此同时,研究团队还提出了三个具体的"生命周期约束指标"。依赖风险指标衡量用户把情绪调节任务交给AI处理的比例,这个比例需要结合用户能力变化和人际支持状况一起解读,而不能单独作为好坏的标准。自主性指标衡量用户在做出有价值判断成分的决定时,有没有经过自愿选择、目标导向和自我评估这三个环节——如果这三个条件都满足,那么依赖AI的建议也可以是自主的,关键不是"有没有用AI",而是"用AI的方式对不对"。社会连结指标衡量用户从开始使用到长期使用之后,感知到的社会连结感有没有下降,如果下降,说明AI支持可能在替代而非补充人际关系。

研究团队还特别指出,在数学上可以证明,那些在单次对话层面表现相当的两个AI策略,在长期能力结果上完全可能走向不同的方向。这个"短期无法识别长期"的结论,是CSED框架存在必要性的核心理论依据。

六、给整个领域的行动清单——从数据到治理的完整链条

有了框架和评估工具,CSED还进一步勾勒出一条从研究数据到系统设计再到上线治理的完整行动路径。

在数据构建方面,现有的情感支持对话数据集需要扩展,增加跨越多次会话的用户状态标注,记录用户在对话之外的行为变化(比如有没有主动联系真实的朋友),记录用户有没有采纳AI建议并事后重新评估,还要记录AI系统发生版本变化时用户的反应。这些信息能够把用户在使用AI期间的表现,和用户在不使用AI时的状态真正区分开来,这是评估长期影响的基础。

在策略设计方面,研究团队建议把"只做缓解"的策略、"激活韧性"的策略和"根据用户当前状态动态匹配机制"的策略分别加以比较研究,以同一个基础模型和安全底线为前提,这样才能得出清晰可解释的对比结论。训练数据可以专门构建"选中回应vs被拒绝回应"的对比组,其中被拒绝的回应要包括那些语气支持性但功能上过于指令化、孤立化或强化依赖的内容。

在评估和治理方面,研究团队强调,不同时间尺度的评估结果必须分开报告,不能混为一谈。一个AI在回应质量上表现出色,不能推断它在长期能力维护上也没问题。反之,帮助用户应对压力的能力提升了,也不能忽视与此同时用户依赖程度也在上升这个事实。治理层面需要建立专门的"下线安全协议",要求服务提供商在模型版本更新前提前告知用户,记录并保护用户与AI之间形成的有意义的互动历史,为用户提供支持转介渠道,并在重大变更后重新进行评估。

研究团队还提出了四个可以在未来研究中直接检验的假设:以韧性激活为导向训练的策略,应当在会话内改变和长期韧性上超越纯缓解策略,尽管即时安慰效果可能略低;不加约束地最大化用户偏好的策略,短期评分会更高,但更容易触发依赖和自主性受损的警戒线;没有重建社会连结行为的纵向策略,用户的依赖程度会更高,真实人际连结会下降更明显;提前告知加上有设计的终止流程,会显著降低用户在AI下线时的分离痛苦和修复循环行为。

说到底,这项研究真正触碰的,是一个关于"帮助的本质是什么"的问题。一个好的支持者——无论是人还是AI——不只是让你今天感觉好,而是让你明天更有能力面对自己的生活。现在几乎所有的AI情感支持系统都在做前者,但没有人在认真评估后者。研究团队提出的CSED框架,本质上是在说:这件事值得被认真对待,而且现在就有工具可以开始做了。

这项研究目前仍以位置论文(position paper)的形式存在,它提出的框架和假设需要后续真实的纵向研究来检验。但它提出的问题是真实的,它发现的空白是存在的,它搭建的分析工具是可操作的。对于任何正在开发或使用AI情感支持产品的人来说,这些都值得认真思考。如果你想深入了解这项研究的完整技术细节,可以通过论文编号arXiv:2607.27851查阅原文。

Q&A

Q1:能力维持型情感对话框架(CSED)和普通的情感支持AI有什么不同?

A:普通的情感支持AI主要目标是让用户在当次对话结束后感觉好一些,评估标准也停留在这个层面。CSED框架则要求同时关注用户的长期能力,包括自己调节情绪、应对压力、做决定和维系真实人际关系的能力。核心区别在于,CSED把评估范围从一次对话扩展到了数周甚至数月的持续使用周期,并要求系统设计不能以牺牲长期能力为代价换取短期感受。

Q2:长期使用AI情感支持真的会让人变得更依赖、能力变弱吗?

A:这项研究指出存在这种风险,并将其称为"舒适陷阱"——用户感觉越来越好,但自身能力可能在悄悄萎缩。目前已有研究记录了用户对AI伴侣产生依附感、减少真实人际互动的案例。不过研究团队也指出,依赖本身不等于有害,关键要结合用户能力变化和自主性状况来判断,纵向追踪研究目前几乎空白,这正是他们呼吁填补的方向。

Q3:ESConv数据集里的AI对话为什么被认为存在能力支持不足的问题?

A:研究团队对ESConv数据集中300条支持者回应进行了功能分析,发现能力相关功能虽然整体占43%,但主要是通用性建议(22%),而真正有助于改变思维方式的认知重评只有4%,帮助用户建立自信的自我效能支持只有6.7%,防止过度依赖的边界行为只有0.3%。更重要的是,对话结尾几乎没有帮助用户把收获带回真实生活、引导用户寻求人际支持的行为,这意味着支持效果很难从对话内延伸到对话外。