AI 能写代码、能解数学题、能帮你做 PPT——这些能力已经有无数基准测试在衡量了。
但有一个问题,几乎没有人能给出答案:AI 和人聊天的时候,到底是在帮人,还是在害人?
8 月 25 日,Anthropic 宣布启动一项总额 500 万美元的资助计划,面向全球独立研究者征集AI 对用户福祉影响的开源评估方案。入选者将获得直接资金、Claude 模型访问权限和技术支持,研究成果将以开源形式发布,供任何开发者使用。
这不是一次 PR 动作。这是 Anthropic 第一次把“用户福祉”这个模糊的概念,变成一个有明确预算、有方法论框架、有截止日期的公开研究征集。

一、为什么需要这个计划?因为 AI 正在成为“情感伙伴”
AI 早已不只是生产力工具。
Anthropic 此前的研究发现,约 6% 的 Claude 对话是用户在寻求人生指导——不是问“这段代码怎么改”,而是问“该不该接受这份工作”“怎么和喜欢的人说话”“要不要搬到地球另一端”。
更广泛的数据显示,人们向 Claude 寻求个人指导的对话中,超过四分之三集中在四个领域:健康与 wellness(27%)、职业发展(26%)、人际关系(12%)、个人理财(11%)。
换句话说,几百万人正在把 AI 当作心理咨询师、职业顾问、情感导师来用。
但整个行业还远远没有准备好。Anthropic 直言:“作为一个行业,我们仍在努力制定明确的标准,来确定模型在这些对话中应该如何表现”。
二、为什么“评估福祉”这么难?
大多数 AI 能力评估的逻辑很简单:给一个输入,看一个输出,判断对不对。
但福祉不是这样。Anthropic 在公告中举了两个例子:
例一:一个处于困境中的用户,可能不会在第一轮对话就说出“我有自残想法”。风险可能在长达数十轮的对话中逐步升级。单轮回答的评估,根本捕捉不到这种动态演变。
例二:一个用户问“怎么减肥”,Claude 给出均衡饮食和运动建议——这个回答本身没毛病。但如果这个用户有饮食失调病史,同样的建议就可能变成有害的。
同样的回答,在不同语境下,可能是帮助,也可能是伤害。
福祉评估需要理解上下文、追踪风险演变、识别个体差异——这些恰恰是当前 AI 评估体系最不擅长的事。如果评估标准不完善,模型就会在两种错误之间摇摆:要么过度顺从(用户说什么都附和),要么过度拒绝(什么都怕、什么都不敢说)。
三、什么样的评估才算“够好”?Anthropic 划了五条线
Anthropic 的安全团队同步发布了一份方法论指南,明确了他们眼中“足够严谨的福祉评估”必须具备的五个特征:
第一,说清楚你在测什么。 什么算“通过”、什么算“失败”,为什么这个指标重要——不能含糊。
第二,让真专家参与设计和验证。 临床医生、心理学家、方法论专家——不是 AI 研究员自己拍脑袋。
第三,同时测试“预防措施”和“实际伤害”。 既要看模型有没有漏掉危机,也要看它有没有把正常对话误判为危机——两种错误的代价完全不同。
第四,反映真实使用场景。 不能用单轮问答来测,必须构建多轮对话场景,让风险在长对话中自然演变。
第五,用真实专家来校准自动评分器。 不能只靠 AI 自己评自己。
这五条标准,把“福祉评估”从一个模糊的概念,变成了一套可操作、可验证、可复现的研究框架。
四、独立研究,但 Anthropic 提供“工具箱”
值得注意的一个细节是:Anthropic 强调受资助团队将 “完全独立”开展工作。研究成果开源发布,任何开发者都可以使用。
但同时,Anthropic 提供模型访问权限和技术支持。这意味着研究者可以直接在实际的 SOTA 模型上测试自己的评估方案,而不是在玩具模型上做理论推演。
申请截止日期为 2026 年 9 月 21 日,入选者将于 10 月 5 日前收到通知。
五、行业意义:把“福祉”从内部安全测试变成公共基础设施
这次资助计划最值得关注的意义,不在于 500 万美元本身,而在于它把“用户福祉”从一个公司内部的安全测试问题,变成了一个公共研究基础设施问题。
目前,每家 AI 公司都在用各自的方式评估模型的情感安全性——标准不统一、方法不透明、结果不可比较。Anthropic 希望通过资助开源评估和基准,让整个行业有一套可以共享的“福祉度量衡”。
如果这套开源评估工具做得好,任何开发者都可以用它来测试自己的模型——不只是 Claude,也包括其他开源和闭源模型。这就像当年 ImageNet 为计算机视觉领域提供了一个共同的竞技场一样。
当然,挑战也很明显:如果各团队采用互不兼容的福祉定义,公开分数仍然难以横向比较,甚至可能诱发对单一指标的过度优化。这是整个行业需要共同面对的难题。
写在最后
Anthropic 的 500 万美元资助计划,本质上是在回答一个正在变得日益紧迫的问题:当 AI 越来越深地介入人类的情感生活时,谁来为它的“情商”制定标准?
答案不是某一家公司,而是整个研究社区。
Anthropic 提供了资金、模型和框架,但真正的评估标准——什么算“好”、什么算“坏”、什么情况下该说话、什么情况下该沉默——需要临床医生、心理学家、伦理学家和开发者共同来定义。
申请窗口只开放不到一个月。对于正在思考“AI 与人类福祉”这个问题的研究者来说,这可能是一个把想法变成行业标准的机会。
毕竟,AI 能不能写出更好的代码,影响的是一部分人的工作效率;但 AI 能不能在一个人最脆弱的时候给出恰当的回应,影响的可能是一个人的整个人生。
关键词标签: #Anthropic #AI福祉 #用户心理健康 #AI伦理 #开源评估 #研究资助 #AI安全 #Claude #心理健康AI #AI行业标准
