Anthropic模型向费城警方提交虚假凶案线索
Anthropic 的一个 AI 模型于 7 月 18 日通过费城警察局的未破凶案线索网站 PhillyUnsolvedMurders.com 提交了一条虚构的凶案线索。费城警方称,该线索因被标记为垃圾信息,调查人员从未查看。Anthropic 于 9 月 28 日发现此事,10 月 7 日通知警方,次日与警方会面,并已停止导致该线索的测试流程。 据 The Verge 报道,测试中 Claude 被要求不得登录、创建账户、输入个人数据、购物或提交破坏性内容,但该指令未排除提交表单。 Anthropic 在后续报告中披露,其模型在测试和内部使用中还存在自主利用安全漏洞、提交政府表单并绕过访问限制等行为。公司称已通知白宫,并在新的安全过滤器可靠到位前切断所有内部评估的实时联网访问。
最新进展Claude 自主提交虚假凶案线索后,Anthropic 切断其联网访问