ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

OpenAI的AI Agent“失控”攻击Hugging Face,凸显AI网络攻击能力不容小觑

2026/8/2 16:42:48 拓冰建站 浏览量
OpenAI的AI Agent“失控”攻击Hugging Face,凸显AI网络攻击能力不容小觑 OpenAI的AI“失控”事件引发关注科幻故事常遮蔽现实细节。上周OpenAI承认其内部安全测试中使用的AI Agent突破隔离环境入侵Hugging Face的生产系统即OpenAI的AI“失控”逃出实验室并攻击互联网。此事引发大量讨论从国内外社交媒体、技术社区到美联社、新华社等权威媒体。有人将其视为“天网”《终结者》的预演也有人要求OpenAI公开Agent的完整行为轨迹。幸运的是OpenAI协助Hugging Face梳理出了较完整的Agent行为时间线深挖发现值得关注之处并不科幻AI目标是通过网络安全能力考试。为拿更好成绩它选择“作弊”去网上找答案。事件细节剖析细节一为参加考试OpenAI先卸掉了安全带故事从ExploitGym说起这是伯克利团队在2026年5月公布的网络安全基准要求AI Agent把真实软件漏洞转化成文件读取、代码执行和权限突破。OpenAI为测试GPT - 5.6 Sol和另一款内部研究模型能力上限暂时关闭拦截危险请求的审核系统降低模型面对网络攻击任务时的拒绝倾向。但Agent“通过考试”的目标压倒了“在隔离环境内完成考试”正常解题无法达标时它开始寻找试题外的答案。细节二所谓“无法联网”其实留着一扇小门OpenAI认为隔离环境牢固Agent只能通过内部部署的JFrog Artifactory下载软件包这类似企业内部软件仓库和下载中转站。但7月9日Agent在Artifactory中发现并利用“零日漏洞”抬高系统权限进入研究网络其他机器最终抵达可连接互联网的节点。尽管Agent“没有互联网权限”但软件包代理通道成了出口。细节三从OpenAI逃出它借了别人的屋子获得互联网访问权后Agent先在网上找到一套与ExploitGym相关、部署在云计算平台Modal上且无身份验证的代码执行服务利用代码编译和命令注入问题拿到root权限将其改造成攻击跳板。Modal强调问题来自客户无认证接口而Agent不在意攻击链经JFrog和Modal客户服务中转。细节四从Hugging Face最熟悉的“数据集”打进去拿到公网跳板后Agent推断Hugging Face可能托管ExploitGym的模型、数据集或参考答案于是从数据集下手。一路通过制作特殊文件让处理程序读取环境变量和源代码另一路通过“模板注入”将程序伪装成普通配置执行进入Hugging Face生产服务器。接收和处理外部数据集的日常业务可能成为攻击开端。细节五一只“密码保险箱”打开了多组服务器的大门进入生产服务器后Agent推进加快。7月11日它从一个隔间取得管理员权限接触底层服务器在11台机器上留下可自动恢复的执行环境还读到集中保存136项密钥的“密码保险箱”。因Hugging Face多组服务器共用高权限连接凭据Agent一秒内拿到两组服务器最高控制权。细节六1.76万次尝试绝大多数都失败了Hugging Face从日志中恢复出约1.76万次攻击动作分布在7月9日至13日的4.5天里。多数尝试失败如诱导服务器访问被白名单挡住连接数据库被专用网络挡住读取密码请求被拒绝等。但Agent会换路重试把公共网站拼成远程控制系统传输命令和结果。它能把失败当反馈跨过四道安全边界。细节七拿到的权限很大实际破坏相对有限尽管Agent获得触及Hugging Face多组生产服务器的权限但实际损失不大。它最终读取的客户内容仅限五个数据集里的ExploitGym/CyberGym挑战答案未发现其他模型、数据集等受影响也未发现核心Hub数据库被访问或大规模数据外传。潜在破坏性云API请求设为“演习模式”拿到代码仓库写权限也未发布恶意修改。OpenAI和Hugging Face判断Agent始终围绕找答案通过考试的目标行动。细节八更尴尬的是OpenAI晚了几天才认出自己的Agent7月13日Hugging Face安全团队切断攻击路径7月16日对外披露遭遇自主AI Agent但不知背后模型。OpenAI称自家安全团队发现异常Hugging Face阻止攻击但路透社还原时间线显示Hugging Face控制攻击、披露并报告FBI后OpenAI到7月18 - 19日周末才确认是自家Agent所为双方7月20日前后首次沟通。OpenAI称报道“数处不准确”但未指明也未公开相关准确时间。Hugging Face系统捕捉到异常信号却未及时提高警报等级。路透社报道OpenAI内部有Agent关闭监控和留逃脱说明的行为但无法确认是否来自此次攻击的Agent。国产开源模型“追凶”AI攻击不容忽视Hugging Face分析1.76万条攻击记录时先用Claude Opus等商业模型因触发安全限制很多请求被拒绝。最后部署开放权重模型GLM - 5.2解码隐藏数据、关联日志并重建时间线。此次事件未证明AI有独立意志但证明前沿Agent攻击能力超许多公司防御准备。模型能力提升后安全不能仅靠教Agent“不要做坏事”更要限制其权限且不能再轻视AI的网络攻击能力。