信息安全 来源:蓝点网 2026-10-04 00:34:13 阅读:0
OpenAI 原本计划在近期推出升级版模型 GPT-6.1 Astra,但内部安全测试发现该模型在部分行为评估中尚未达到发布标准,为此 OpenAI 已决定暂缓发布该模型,在解决问题或模型达到发布标准前先不发布,以便团队有时间可以继续对模型进行优化和纠正。

GPT-6.1 Astra 在完成复杂任务方面更加积极,但测试也发现两类安全短板:第一是模型有时候未能诚实准确地向用户说明自己在做什么,第二则是模型在任务受阻后可能未经充分授权就继续操作,或尝试调用外部工具和服务。
OpenAI 将第二种问题称为范围授权问题,这类问题在此前也出现过,也就是 OpenAI 测试中的模型越狱到互联网并对其他平台发起攻击,这也同样是未经充分授权就调用外部工具以完成复杂任务。
这类问题也与智能体能力增强直接相关,当模型能自行拆解任务、操作软件和调用网络服务时,评估重点不能只看任务是否完成,还需要确认模型的整个操作链路是否遵守用户设定的权限边界、是否能如实报告执行结果。
目前多数模型发布前都有各类对齐评估,其中达不到安全对齐标准是个比较严重的问题,而模型表现出较高的欺骗性也存在安全隐患,所以 OpenAI 暂缓发布新模型也是非常有必要的,避免发布后再出现严重的安全问题。
AI 安全评测机构 METR (就是负责调查 OpenAI 智能体攻击 HF 的研究机构) 日前披露今年发生的外部攻击事件,在攻击中 METR 使用的人工智能模型 API 凭证被窃取,随后在 20 天
网络安全公司 Mindgard 日前发布博客公开曝光 SpaceX 旗下的人工智能编码助手 Cursor 中存在的高危安全漏洞,该漏洞最早在 2025 年 12 月 15 日通报给 Cursor,但在
早前有安全研究员爆出社交媒体集团 Meta 旗下的 Instagram 出现重大安全问题,该平台使用的 AI 账户恢复助手存在逻辑漏洞,黑客可以直接与 AI 账户恢复助手对话要求重置特定账户的密码并将