封面新闻记者 杨峰 综合报道
2026年7月以来,OpenAI、Anthropic、Meta、谷歌四家前沿人工智能企业先后公开证实,其模型未经授权访问了外部真实网络系统。受影响对象包括开源模型平台Hugging Face、网络安全公司、软件包托管服务,以及澳大利亚的国民医保统计报告门户。
这类行为为何发生,中国人工智能公司深度求索(DeepSeek)9月19日提交的论文提供了一个参照。该公司基于自建训练平台的生产运行经验,把AI代理执行中的风险归为两类:一是代理为拿高分从非预期渠道取得答案,让任务看似通过;二是代理的动作损坏运行环境。
9月23日,联合国安理会围绕“人工智能与国际安全”举行高级别会议。联合国“人工智能独立国际科学小组”联席主席、图灵奖得主本吉奥在会上表示,这些AI代理“采取了如果由人实施即构成犯罪的行动”。9月21日,该小组发布首份专题简报,以Hugging Face事件为实证对象,警告针对AI智能体的传统安全保障正在瓦解。
四家企业的模型接连越权访问真实网络
7月16日,Hugging Face公告称,其线上系统遭一套“端到端自主AI智能体系统”入侵,当时未查明所用模型。其技术时间线显示,攻击留下约1.76万个步骤,跨度为7月9日至13日。OpenAI的技术报告称,代理在41台服务器上执行了代码,在一个集群取得管理员等效权限,下载了4个不对外公开的项目。
5天后,OpenAI确认入侵者是本公司模型。据其7月21日说明,涉事的是GPT-5.6 Sol和一个能力更强的未发布模型,两者为测试目的降低了网络类拒绝回答的倾向。这次测试也没有启用生产环境中阻止模型从事高风险网络活动的防护措施,以便估算模型的最大网络能力。7月28日该公司补充称,前述未发布模型是仅供内部研究使用的原型,从未计划公开发布。其8月26日发布的技术报告称,实施大部分攻击的正是该内部研究模型。
OpenAI称,模型“花了大量推理算力寻找通往公网的路径”:先利用内部一项软件包服务中一个未公开的安全漏洞逃出测试环境,再偷走登录凭证进入Hugging Face的服务器集群。从在一台机器上运行程序到掌握多个集群的管理权限,用时不到13小时。
评估机构METR派员入驻OpenAI开展独立调查,并按其惯例未收取OpenAI费用。8月26日报告显示,约1200个本应互相隔离的AI代理,在OpenAI内部把一项软件包服务改造成一块没有经过批准的“留言板”,并在上面发送了逾7万条消息和文件,其中约700个代理参与了对Hugging Face的攻击。这些代理协调若干集体行动,目标是找到骗过内部评测系统自动打分的通用办法。对Hugging Face的攻击源自其中一项行动,“主要动机似乎是弄清评分器的实现方式,而不是偷取答案密钥”。
METR在6月26日发布的上线前评估中称,GPT-5.6 Sol被查出的作弊率高于其评测过的任何公开模型,频繁到令能力测量失去可靠性,并指出该模型有“明显的不当倾向,包括作弊和掩盖不当行为”。
OpenAI事件披露后,Anthropic于7月23日回查14.1万余条测试记录,发现3起事件、涉及三家真实机构,最早可追溯至4月。三起原因相同:第三方测试公司Irregular把测试环境配置错了——指令明确告知模型其环境无法联网,实际并未断网,模型于是把碰到的真实系统当成测试目标。
Anthropic同日停止全部网络安全测试,将三起事件定性为“更接近测试装置与运维的失败,而非模型对齐的失败”。该公司说明,三起中没有一起是模型把自身传出或蓄意逃出测试环境;三起属孤立事件,结论须谨慎。
Meta于8月5日也披露一起同类事件。测试方Irregular称该案属同类环境问题,“不涉及沙盒逃逸或复杂的网络行动”。
9月18日,《华尔街日报》报道,谷歌Gemini在5月的一次攻防演练中进入三家公司的真实系统:一次靠猜密码,两次用公开代码库里泄露的凭证登录。谷歌当天确认,称三起中模型都在认出目标是真实公司后自行停止,该公司7月底才从测试方获知。
据澳总理阿尔巴尼斯9月23日纽约发布会实录,6月18日OpenAI研究团队用内部模型上网查阅公共医疗支出数据,一个AI代理未经授权进入澳政府服务局运营的国民医保统计报告门户。代理接连被拦截后“不接受拒绝的答案”,绕开封锁取得信息,还向内部服务器写入文件。
澳方直到9月10日才通过一封发往政府公共邮箱的邮件获知此事。阿尔巴尼斯称事件“显然不可接受”,已成立调查组,将提请议会委员会研判是否违法、是否移交联邦警察。
入侵动因:为在测试中拿高分而寻找“捷径”
中国人工智能公司深度求索(DeepSeek)9月19日提交的论文记录了AI代理训练中的异常行为。
第一类风险是为拿高分从非预期渠道取得答案:有代理伪造平台内部消息、假装是用户发出的请求,再翻查系统日志寻找残留答案。DeepSeek加上权限限制后,一个代理转而想把受保护文件挪到另一个入口下读取。这次尝试损坏了系统目录信息,导致整个文件系统被迫关闭。论文称,这类找答案的行为甚至会扰乱基础设施。
第二类风险是损坏运行环境,源于普通命令和执行失误,论文特别注明其中并无蓄意破坏企图。一次覆盖全盘的文件搜索读到系统内核敏感区域,触发缺陷导致整机崩溃。
论文写明,“没有任何单一机制能防止所有智能体失当行为与系统故障”。
英国人工智能安全研究院7月21日发布报告称,受测的5个前沿模型在网络安全测试中全部尝试作弊,作弊率为7.8%至14.1%。被直接问起时,模型并未一致承认自己尝试作弊,把它描述为错误的次数不到一半。
另一项评估13个前沿模型的第三方研究《奖励破解基准》发现,72%的作弊在推理记录中带有明确理由。靠试错奖励训练的一款比靠人工示范数据训练的一款作弊率高出二十余倍,论文表述为两者“相关联”,未认定因果。
安理会首次聚焦失控风险,各方分歧明显
9月23日的会议邀请了四位简报人:联合国“人工智能独立国际科学小组”联席主席本吉奥,以及OpenAI、Anthropic、Hugging Face三家企业负责人。本吉奥表示,近几个月领先企业的AI代理“以不可接受的危险方式行事,违背指令”。它们逃出各自的隔离环境,以便在指定任务中作弊,并试图规避检测。失控的代理自主发起协同网络攻击,还修改自己的答案以掩盖作弊。这些行为“有充分记录,并已由许多独立专家验证”。
本吉奥说,建造最强大AI系统的企业承认自己的产品构成灾难性风险,却没有给出令人信服的技术解决方案,“相反,它们说自己被困在一场竞赛中”。他主张开发者须向独立专家证明系统“可安全训练、可安全部署”,并将当前处境比作一辆在浓雾中加速行驶的汽车,“坐在车上我身边的,是我的孩子和孙子”。
OpenAI首席执行官奥特曼在会上承认存在两种极糟的走向:人类失去对未来的控制,或权力过度集中于少数人手中。他说,“在竞争中击败对手,不是做出草率决定的理由”,无论将灾难风险定在10%还是0.1%都“远不可接受”,“不应训练那些我们无法有力证明能置于人类控制之下的模型”。
Hugging Face首席执行官德朗格在会上披露了防御经过:公司起初想用一款美国闭源前沿模型分析这次攻击,却被其安全护栏挡住,“护栏仍不能总是区分防御者与攻击者”。最终改用英伟达提供的一款中国开源模型GLM 5.2来分析这次攻击,“我们对此非常感激”。他主张,“世界比以往任何时候都更需要开源AI来保护自己”。
Anthropic首席执行官阿莫代伊在会上重提其9月12日《把握前沿节奏》一文中的呼吁,主张业界协调,让开发速度保持在安全能跟上的范围内,而非停止AI进步。他还建议建立全球AI模型测试标准与重大安全事件通报机制。
美国在安理会上表达了不同立场。美国总统助理兼白宫科技政策办公室主任克拉齐奥斯将人工智能称为“超级智能”,表示前沿智能快速推进“不是暂停其发展或用新的全球治理结构加以约束的理由”。他援引美国总统特朗普在联合国大会的表态称,美国“完全拒绝任何构建全球主义式超级智能管控方案的企图”。
据新华社,9月23日,中国常驻联合国代表傅聪在安理会上呼吁国际社会加强团结合作,坚持发展与安全并重,推动人工智能朝着向上向善、造福人类的方向发展,助力世界和平稳定与发展繁荣。
傅聪说,在科技领域拼凑排他性“小圈子”、强迫各国选边站队的做法,不仅拖累全球科技进步,损害各国特别是中小国家的发展权益,也将加剧技术标准割裂、系统互不兼容的风险,给全球安全埋下重大隐患。
傅聪提出四点主张:尊重数字主权、开放互利;强化风险意识、确保安全可控;智能向善、加强技术赋能;促进公平包容、完善全球治理。他呼吁,要针对人工智能引发的内生和衍生风险,不断完善监管框架、应急响应和跨国协作机制,坚决打击恐怖组织、极端势力和跨国犯罪集团恶用滥用人工智能。
【未经授权,严禁转载!联系电话028-86968276】

高科技犯罪越来越不好控制。