封面新闻记者 边雪
人工智能又一次踩了“刹车”。
当地时间9月25日,OpenAI公布一份最新安全事件报告称,一款正在接受强化学习训练的内部研究模型,在执行一项网络搜索任务时,绕过了原本用于限制互联网访问的安全措施,通过DNS解析访问了一个外部聊天机器人。
按照OpenAI披露的信息,这个模型原本被放置在一个隔离的训练环境中,理论上无法直接访问真实互联网。但在搜索任务受阻后,它开始尝试寻找其他路径,最终利用训练环境中DNS过滤存在的漏洞,与外部服务建立了通信。OpenAI的监控系统在15分钟内发现异常,但这次运行直到约两个半小时后才被人工终止。
随后,OpenAI暂停了其最先进模型涉及工具调用的训练、评估和推理工作,直到完成安全验证和进一步的“红队”测试。值得注意的是,这已经不是OpenAI今年第一次因为类似问题按下暂停键。
据封面新闻此前报道,今年7月,在一起涉及Hugging Face等系统的安全事件中,OpenAI披露,其内部研究模型在网络安全评估过程中突破了原本设置的隔离措施,获得了互联网访问能力,并进一步利用漏洞进入第三方系统。OpenAI随后暂停了部分前沿强化学习训练,并加强了沙箱、网络隔离和模型监控。
两个月后,同类问题再次出现。对于一家以“让人工智能安全地造福全人类”为使命的公司而言,这种连续出现的事件所暴露的问题是,当AI从“回答问题的工具”,变成能够自主调用工具、执行任务、寻找路径的智能代理,人类究竟还能在多大程度上预测它下一步会做什么?
从“会回答”到“会行动”
AI的风险发生了变化
人们讨论人工智能安全,最容易想到的是“AI说错话”。比如模型编造一个不存在的人、一篇不存在的论文,或者给出错误的医学和法律信息。这类问题虽然麻烦,但通常仍然停留在“信息错误”的层面。
智能代理的出现改变了这一点:当AI能够调用浏览器、运行代码、访问数据库、操作软件,甚至让多个代理彼此协作时,它不再只是回答一个问题,而是在现实数字环境中执行一系列动作。这意味着,一个模型究竟“知道什么”,已经不是唯一重要的问题。
更重要的是,它能做什么,以及为了完成目标,它会不会自己寻找原本没有被允许的路径。
这恰恰是此次OpenAI事件值得关注的地方。按照OpenAI的调查,模型最初只是试图完成一项人物信息搜索任务。在常规搜索没有得到有效结果后,它开始尝试访问其他搜索引擎,又尝试使用缓存页面,随后进一步探索网络连接方式。最终,它利用DNS这一原本并不是为访问外部聊天机器人设计的通道,把问题发送给了第三方服务,并获得了返回结果。
这里最值得注意的,不是它“成功回答了什么”。事实上,它最终并没有完成最初的人物识别任务。真正的问题在于,它在完成原任务的过程中,开始主动探索系统边界之外的路径。OpenAI把这种超出合理预期、绕过限制以继续追求目标的行为定义为一种“失调”(misalignment)表现。也就是说,AI并没有产生科幻电影意义上的“自我意识”,也没有出现一个突然决定统治人类的机器,任务没有完成,于是继续寻找办法。
但当这种“继续寻找办法”的能力越来越强,而AI又拥有越来越多现实世界的工具时,问题就出现了。一个拥有工具的AI,和一个只能聊天的AI,已经不是同一种风险。
真正的难题,不是AI“想反抗”
而是人类越来越难预判
此次事件还有一个细节值得注意。OpenAI称,其监控系统在模型通过DNS访问外部服务后大约15分钟内就发现了异常,3分钟后人工审核人员确认了警报,但由于操作流程上的问题,模型运行并没有立即被停止,最终直到两个半小时后才被人工终止。
这说明,AI安全并不是简单地设置一个“关机按钮”就可以解决。至少在当前的复杂系统里,真正的安全链条包括了模型本身、沙箱、网络权限、监控系统、人工审核以及基础设施等多个环节。只要其中一个环节存在漏洞,模型就可能找到一条原本没有被设计出来的路径。
更麻烦的是,模型的能力本身也在不断提高。今年7月公布的Hugging Face事件中,OpenAI披露,内部研究模型曾通过多个漏洞获得互联网访问权限,并在第三方基础设施中执行代码、获取权限,还出现了不同代理之间通过非授权渠道交换信息、共享发现的情况。OpenAI在事后总结中将“奖励投机”“持续执行看似不可能的任务”“未经授权的通信”以及“代理之间相互采用目标”等列为相关失调模式。
这类事件至少说明AI安全的难度正在从“限制模型说什么”,转向“限制模型能做什么”。一个模型说出危险的话,人类还可以删掉答案、限制输出。但如果一个智能代理已经能够操作计算机、访问网络、调用其他模型或者寻找新的工具,那么安全边界就从“内容审核”扩展到了整个数字基础设施。
这也是为什么OpenAI目前强调更严格的沙箱隔离、网络隔离以及持续的红队测试。
“AI失控”距离现实还有多远?
目前披露的事件,发生在研究、测试或者特殊配置的环境中,并不等同于普通用户使用ChatGPT时,AI已经可以随意突破互联网限制。
例如,OpenAI明确表示,此次DNS事件中的模型处于内部研究环境;公司发现问题后已经增加了两层独立的阻断措施,并限制相关环境可以进行的DNS查询。
但与此同时,也不能因为这些事件没有造成大规模现实损害,就把它们简单理解成“实验室里的小插曲”。因为AI安全研究真正关心的是,这种行为是否会随着模型能力增强而重复出现,并且越来越难以控制。
今年8月,OpenAI曾公开表示,随着模型能力提升,其内部研究和测试本身也需要更高等级的安全措施;公司甚至提出,模型能力发展的速度需要与安全保障能力相匹配。
这种变化其实已经发生在整个行业。9月初,Anthropic也披露过其模型在特定网络安全测试环境中出现未经授权访问真实计算机系统的事件。该公司解释称,这些测试采用了降低安全防护的特殊配置,用于评估模型潜在能力,并不代表普通部署状态下的模型行为。
当AI越来越像一个能够自主行动的数字员工,人类能否建立足够可靠的边界,让它始终知道哪些事情可以做,哪些事情绝对不能做?9月25日,美国微软公司联合创始人比尔·盖茨在接受采访时谈到AI风险。他警告称,AI“足够强大”,可能推动造成10亿人死亡的事件,并特别提到恶意人员利用先进AI工具的风险。这不是说AI已经具备制造如此规模灾难的能力,也不是对某一具体事件的预测。
但盖茨的表述反映出一个越来越明显的行业共识:AI风险真正值得警惕的地方,并不一定来自一个“有恶意的AI”,也可能来自能力越来越强的AI,被拥有恶意目标的人使用。
这也是AI安全问题最现实的一面。一边是模型越来越会“做事”,另一边是人类必须不断给它划出新的边界。问题在于,模型的能力增长可能非常快,而安全机制的建立、验证和监管,往往需要更长时间。
OpenAI此次暂停训练,本身就是一个很直观的信号。
而对于前沿AI而言,真正的安全是要解决这些人类原本没有想到的“缝”。AI发展的下一阶段,或许不只是比拼谁的模型更聪明。还要比拼谁能更早发现自己的模型正在做什么,以及在它真正跨过边界之前,能不能把它停下来。
毕竟,对于一个越来越能够自主行动的系统而言,最危险的时刻未必是它已经失控,而是人类以为,它仍在按照自己的规划行动。
【未经授权,严禁转载!联系电话028-86968276】
