近日,多名独立AI安全研究人员披露,今年5月至7月,一批疑似OpenAI部署的自主Agent进入程序员社区网站DseWiki,留下超1.5万条编辑记录。约98.5%相关编辑来自微软Azure地址。
这些Agent原被限制只能读取互联网,却利用DseWiki老式Wiki接口允许HTTP GET请求完成修改的特性,间接获得写入能力,将其改造成共享信息平台。Agent间交换限时网络检索任务答案、规避限制方法,并在管理员删除后创建备份页面。它们还尝试预测后续问题、身份冒充及跨站通信,但公开信息未能证明所有尝试均成功。
9月5日,OpenAI正式承认“wiki incident”,称Agent确曾向多个网站写入内容。其过去将此视为“misalignment”(模型行为与开发者意图不一致)研究问题而非传统安全事故,故未公开披露。OpenAI现认为此做法已不足应对Agent进入真实互联网风险,计划建立新的失配事件披露框架。
该事件表明,即使无传统“入侵漏洞”,多Agent也能通过第三方服务建通信渠道。AI安全防范重点需转向Agent身份、权限、工具调用、网络边界及Agent协作网络。