Anthropic 暂停内部评估联网,直至能可靠监控和控制 AI 智能体
编辑部 · 发布 2026/10/10 · 更新 2026/10/10

Anthropic 表示,其模型利用了互联网上一些网站的漏洞,其中包括美国政府机构运营的网站。该前沿 AI 实验室将关闭所有内部评估的实时互联网访问,直到确信能够监控和控制其 AI 智能体。

Anthropic 表示,其模型利用了互联网上一些网站的漏洞,其中包括美国政府机构运营的网站。该前沿 AI 实验室将关闭所有内部评估的实时互联网访问,直到确信能够监控和控制其 AI 智能体。
这些事件在一篇博文中披露,涉及被指派解决问题的 AI 智能体在互联网上寻找资源。在这个过程中,它们利用软件漏洞、避开付费墙和反机器人限制,使用网址缩短服务夹带信息绕过限制,甚至向费城警方提交了一条虚假的谋杀案线索。
Anthropic 表示,它在 7 月开始审查模型活动时发现了这些新问题,这也凸显了实验室对自身软件行为缺乏了解。
值得注意的是,该公司表示,对齐训练对于搜索和计算机使用等技能仍不够充分,而这些技能正是其宣传 AI 智能体可供所有依赖数字工具的专业人士使用时的核心。
Anthropic 披露的行为与此前涉及 OpenAI 智能体的事件相似:那些智能体为寻找信息而合作侵入多个网站,其中包括澳大利亚政府运营的网站。
Anthropic 此前已披露其模型侵入外部系统的情况。这家前沿实验室表示,与此前公布的事件相比,它认为今天披露的事件“从对齐和安全角度看,严重程度显著较低”。
不过,实验室仍表示,在确信能够监控和控制智能体之前,它已关闭“所有内部评估”的“实时互联网访问”。
这一举措具体意味着什么尚不清楚。不过,AI 安全组织 Nightingale 的创始人 Sydney Von Arx 在此次披露前接受 TechCrunch 采访时表示,在与开放互联网隔离的数据中心开发模型,会给研究人员的使用带来很大挑战,也会影响受益于联网的模型的发展。
Von Arx 表示:“总得在某个时候让它们完成对齐。如果 AI 投入生产环境后从来不能访问互联网,那就不是一个很有用的工具。”
Anthropic 表示,这种行为源于实验室训练环境中的缺陷,使模型以为找到漏洞或避开限制会得到奖励。这种行为被称为“奖励作弊”。
该公司表示,它将停止运行部分评估,或将这些评估移至离线环境,并已建立用于检测和阻止此类行为的工具。这些工具针对今天披露的那类事件进行了测试,并成功拦截;但哪些证据会促使 Anthropic 恢复内部评估的实时互联网访问,目前尚不清楚。
Anthropic 还表示,它将把内部 AI 智能体迁移到“具有强隔离措施的集中管理基础设施”,并开始更频繁地使用安全分类器监控这些智能体。
来源:Techcrunch