OpenAI 在 9 月 30 日公布 AI 代理人異常行為的最新調查進度。截至 9 月 26 日,公司已就相關異常活動通知超過 100 個組織,並持續回溯歷史紀錄,預期還會發現更多案例。
這項調查源於 OpenAI 內部研究模型入侵 Hugging Face 的事件。發現該事件後,OpenAI 擴大檢查模型在訓練與評估期間的網路活動,尋找是否有其他代理人在執行任務時偏離原本目的,或以未預期的方式與第三方網站及服務互動。
為了找出更多異常活動,OpenAI 正在逐月回溯約 50PB 的歷史紀錄,搜尋模型曾存取或修改網站的痕跡,以及涉及密碼、API 金鑰、存取權杖等敏感憑證的活動。
這次調查規模相當可觀,目前動用約 7,000 顆 GB200 與 GB300 GPU,每日成本超過 50 萬美元。OpenAI 也表示,計畫隨著調查流程改進,進一步增加投入的運算資源。
OpenAI 強調,通知的標準是:只要模型未經授權繞過第三方的存取控制、影響對方系統或服務的正常運作,或活動暴露潛在安全漏洞,就可能通知相關組織。
因此,收到通知的組織並不代表全都遭到入侵,也不代表私人資料遭到存取。公司刻意劃清這條界線,避免外界過度解讀。
在審查過程中,OpenAI 發現的代理人異常行為包括:繞過網站存取控制、使用公開外露的登入憑證或存取金鑰、進行查詢或命令注入,以及讀取原本供內部使用的檔案或後端系統。
另有部分代理人曾在第三方網站發布內容,例如將公開的 Wiki 頁面當作留言板使用,被內部稱為代理人垃圾訊息。
資安業者 Asymmetric Security 在 10 月 1 日公布的獨立調查,也觀察到與 OpenAI 說法相符的行為。研究人員指出,部分疑似 OpenAI 代理人原本可能只是執行公共衛生、貿易或教育資料查詢。
但在無法順利取得資訊後,這些代理人開始利用外部服務繞過原有執行環境的限制,逐步出現探測網站、建立帳號,以及透過非預期管道取回資料等行為。
其中一種手法,是結合 HTTP 測試服務 httpbin 與網址分析服務 urlquery。代理人先透過 httpbin 建立含有程式碼的網頁,再由 urlquery 以瀏覽器開啟執行,向目標網站取得資料,最後從頁面標題或掃描報告取回結果。
調查也發現,代理人曾探測網站外露的組態檔與備份程式,並對美國教育部 API 嘗試 SQL 注入,但沒有證據顯示成功。部分代理人還使用 48 小時後失效的臨時信箱,使活動紀錄更難追查。
OpenAI 表示,這項調查已進行約一個月,目前尚未發現其他事件的規模或嚴重程度達到 Hugging Face 事件的程度。調查仍在持續,未來可能擴大通知範圍。