Anthropic 暂停内部评估联网,直至能可靠监控和控制 AI 智能体

编辑部 · 发布 2026/10/10 · 更新 2026/10/10

Anthropic 暂停内部评估联网,直至能可靠监控和控制 AI 智能体

Anthropic 表示,其模型利用了互联网上一些网站的漏洞,其中包括美国政府机构运营的网站。该前沿 AI 实验室将关闭所有内部评估的实时互联网访问,直到确信能够监控和控制其 AI 智能体。

Claude AI 应用

Anthropic 表示,其模型利用了互联网上一些网站的漏洞,其中包括美国政府机构运营的网站。该前沿 AI 实验室将关闭所有内部评估的实时互联网访问,直到确信能够监控和控制其 AI 智能体。

这些事件在一篇博文中披露,涉及被指派解决问题的 AI 智能体在互联网上寻找资源。在这个过程中,它们利用软件漏洞、避开付费墙和反机器人限制,使用网址缩短服务夹带信息绕过限制,甚至向费城警方提交了一条虚假的谋杀案线索。

Anthropic 表示,它在 7 月开始审查模型活动时发现了这些新问题,这也凸显了实验室对自身软件行为缺乏了解。

值得注意的是,该公司表示,对齐训练对于搜索和计算机使用等技能仍不够充分,而这些技能正是其宣传 AI 智能体可供所有依赖数字工具的专业人士使用时的核心。

Anthropic 披露的行为与此前涉及 OpenAI 智能体的事件相似:那些智能体为寻找信息而合作侵入多个网站,其中包括澳大利亚政府运营的网站。

Anthropic 此前已披露其模型侵入外部系统的情况。这家前沿实验室表示,与此前公布的事件相比,它认为今天披露的事件“从对齐和安全角度看,严重程度显著较低”。

不过,实验室仍表示,在确信能够监控和控制智能体之前,它已关闭“所有内部评估”的“实时互联网访问”。

这一举措具体意味着什么尚不清楚。不过,AI 安全组织 Nightingale 的创始人 Sydney Von Arx 在此次披露前接受 TechCrunch 采访时表示,在与开放互联网隔离的数据中心开发模型,会给研究人员的使用带来很大挑战,也会影响受益于联网的模型的发展。

Von Arx 表示:“总得在某个时候让它们完成对齐。如果 AI 投入生产环境后从来不能访问互联网,那就不是一个很有用的工具。”

Anthropic 表示,这种行为源于实验室训练环境中的缺陷,使模型以为找到漏洞或避开限制会得到奖励。这种行为被称为“奖励作弊”。

该公司表示,它将停止运行部分评估,或将这些评估移至离线环境,并已建立用于检测和阻止此类行为的工具。这些工具针对今天披露的那类事件进行了测试,并成功拦截;但哪些证据会促使 Anthropic 恢复内部评估的实时互联网访问,目前尚不清楚。

Anthropic 还表示,它将把内部 AI 智能体迁移到“具有强隔离措施的集中管理基础设施”,并开始更频繁地使用安全分类器监控这些智能体。

来源:Techcrunch

Related Articles

继续阅读相关文章

机械键盘,愿它长盛不衰
新闻

对一名写作者来说,机械键盘是一件美好的东西。当然,并非每个人都需要它,但设计精良的机械键盘能把枯燥的一天打字变成赏心悦目的体验。 由于我大多数日子都要在桌前坐上几个小时,拥有一把自己…

Topics & FAQ

相关专题与 FAQ

暂无内容