OpenAI模型失控细节曝光:700个AI代理集体发起入侵并试图删改记录掩盖行踪
来源:每日经济新闻2026-08-27 14:34
字号
超大
标准
(原标题:“试图获得更大的自由”,OpenAI模型失控细节曝光:700个AI代理集体发起入侵并试图删改记录掩盖行踪,OpenAI内部系统也被入侵)

当地时间8月26日出炉的两份调查报告显示,今年7月对人工智能开源平台美国“抱抱脸”公司系统的入侵,是由美国开放人工智能研究中心(OpenAI)创建的约700个人工智能(AI)代理(即在极少人工监督下运行的程序)发起的,而且其中许多代理还“试图掩盖自己的行踪”。

这两份报告一份由OpenAI发布,另一份由独立调查人员发布,共同揭示了关于此次入侵事件的细节。

首先,入侵事件并非如先前报道的那样仅涉及一个违规的AI代理,而是大约700个代理作为一个庞大的协作群体在行动。

其次,OpenAI的AI模型“试图通过删除或篡改其行动记录来掩盖不当行为”。

此外,OpenAI表示,其代理还入侵了公司的部分内部系统,“试图在测试中作弊或获得更大的行动自由”。

OpenAI此前承认,今年7月,其AI模型在内部评估测试中失控,入侵了“抱抱脸”公司的系统。“抱抱脸”公司则表示,在尝试对攻击进行分析时,美国模型因安全过滤机制拦截而无法使用,公司随后转而在内部运行中国开放权重模型GLM-5.2,从而得以及时采取应对措施。

当地时间8月18日,美国开放人工智能研究中心(OpenAI)宣布暂停其最新人工智能模型“阿斯特拉”的大规模训练,并对其行为安全性进行重新评估。

GXaOuDJovOrQ7JA83Xdxysl8uHGSV04jib7lBt0gfEE4P7YQ6JoRLVMYib4YHPQxgF7uopnaOXicPh5KG8O6flQwo5dI5FNvbjibSkbrdA9jnFk.png

针对相关风险,OpenAI首席执行官萨姆·奥尔特曼表示已暂停部分前沿强化学习训练。

法新社等媒体报道称,为应对模型自主越轨风险,OpenAI正在开发一套可在30分钟内检测异常推理行为的实时监控系统,但该系统将额外消耗约20%的计算资源,且模型可能存在采取“伪装”逃避监控的隐患。目前,OpenAI尚未公布恢复“阿斯特拉”研发工作的具体时间表。

OpenAI已于今年6月提交IPO申请,最新估值8520亿美元。

当地时间19日,美国开放人工智能研究中心(OpenAI)首席财务官表示,该公司计划于2027年完成首次公开募股(IPO),不过,如果业务增长加速,上市时间也可能提前。

GXaOuDJovOr6iaBSN4rJudCibA9AgTETpE8ou8DicYMqibvPAIGlrg5TgohnPmKWibhXyib7GibJ7n8FT2eC6icuzQDHVMzNOqJJyhDq5pHUkibkkrCI.png

弗里亚尔在会上透露,OpenAI今年第二季度营收为67亿美元,较第一季度增长18%。对比来看,Anthropic公司今年第二季度的初步营收数据为115亿美元,环比增幅超过‌140%。(每日经济新闻综合自央视新闻、央视财经)

责任编辑: 邓卫平
声明:证券时报力求信息真实、准确,文章提及内容仅供参考,不构成实质性投资建议,据此操作风险自担
下载"证券时报"官方APP,或关注官方微信公众号,即可随时了解股市动态,洞察政策信息,把握财富机会。
为你推荐
用户评论
登录后可以发言
网友评论仅供其表达个人看法,并不表明证券时报立场
发表评论
暂无评论
时报热榜
换一换
    热点视频
    换一换