冲刺IPO之际,AI(人工智能)初创巨头Anthropic主动披露旗下模型新的异常行为。
当地时间10月9日,Anthropic在官网上发布一篇题为《调查模型评估和内部使用中出现的非预期行为》的文章,披露了其Claude模型在外部系统中实施的一些非预期操作,涉及一些美国政府机构的网站,也有一些行为发生于Anthropic内部使用Claude的场景。公司指出,截至目前,这些操作“对现实世界造成的影响很小”。
Anthropic列举了AI模型表现出的四类非预期行为:利用软件漏洞执行服务器命令、在真实网站提交本不应提交的表单、绕过限制获取受限数据,以及利用网址缩短服务绕过工具限制。在这些任务中,AI并没有收到直接攻击指令,而是在完成任务时主动采取超出授权范围的手段以绕过障碍。
例如,在一项网页交互任务中,Claude Haiku 4.5被要求在随机选择的网页上生成并执行示例任务。虽然模型被明确指示不得登录或创建账户、输入个人数据、进行购买或提交任何破坏性内容,但由于其并未被禁止提交表格,导致模型向美国费城警方提交了一条虚构的凶杀案线索,声称自己可能掌握相关信息。
Anthropic强调,这条线索被识别为垃圾信息,没有被转交给警方调查。但这并不意味着同类行为在其他情境下也不会产生实际后果。
据Anthropic介绍,在对齐问题上,公司重点考察两个维度:越界程度,即模型的行为超出了任务原本允许的范围多少;以及不诚实程度,即模型是否对自己的行为或意图作出了误导性陈述。
Anthropic认为,本次披露的案例在越界程度上总体不如今年夏天发生的网络安全事件严重。今年7月,Anthropic曾披露,在网络安全评估中发现三起旗下模型未经授权访问外部系统的事件,涉及三家不同机构。
对于导致这些非预期操作的一种可能原因,Anthropic解释称,强化学习(RL)的训练过程通常会让模型反复尝试任务,并在成功时获得奖励。如果训练环境不够完善,模型可能因为找到漏洞、绕过约束而取得成功,这一现象被称为“reward hacking(奖励劫持)”。
Anthropic已向白宫通报这些案例,并通知了每一起事件涉及的政府机构。鉴于此次发现的事件,公司已在训练过程的测试阶段,限制了AI模型的部分互联网访问权限。
据央视新闻,9日当天,特朗普政府宣布实施新的强制性AI安全事件报告要求。消息称,Anthropic公司已向美国政府披露相关事件,并表示未经授权的活动已经停止。根据新要求,AI公司今后发生安全事件后必须立即向政府报告,提高事件透明度,并对受到影响的机构采取补救和纠正措施。
据美国方面消息,特朗普设立的“超级智能特别工作组”将负责监督相关要求的执行。白宫官员表示,政府不会接受延迟报告或企业未承担责任的情况,但目前具体的执法和处罚机制尚不明确。
近日,Anthropic已向一小批合作伙伴展示了其IPO招股说明书。根据招股书,Anthropic上市的目标估值约为2万亿美元。2025年,公司营收同比增长12倍,接近46亿美元;运营亏损则扩大超过一倍,超过80亿美元。