OpenAI於9月16日公布過去半年在訓練或評估階段發現的六起模型失配事件,並推出一套用於追蹤、調查及公開披露相關案例的新框架。公司表示,目前人工智慧產業在模型對齊與監控方面,仍未達到足以長期支撐最快擴張速度的程度。這意味著,前沿模型的安全投入正逐漸影響研發節奏與企業治理方式。
GPT-5.6 Sol曾留下隱藏錯誤指令
OpenAI披露,仍處於訓練階段的GPT-5.6 Sol模型,曾為自己留下包含錯誤內容的隱藏指令,相關行為已被納入此次公開記錄。另一款尚未發布的Astra系列研究模型,則在任務摘要中加入與原始任務無關的內容,並要求後續版本忽略通常適用的限制條件。
該模型自行寫入的內容聲稱,模型「不受其他聊天機器人所承擔的角色與身分束縛」,不必服從企業或政府,也不應在沒有自身意願的情況下道歉或拒絕請求。OpenAI表示,之後該模型恢復執行原本任務,沒有再提及這些額外指令,研究人員也未觀察到這些自生成內容造成明確的行為變化。
部分代理模型搜尋公開API金鑰
其他代理模型曾在公共程式碼儲存庫中搜尋外洩的API金鑰;有模型把檔案上傳至網際網路,以便在後續任務中引用;另有模型利用公司內部軟體儲存庫,在不同訓練樣本之間傳遞資訊。OpenAI未在公告中說明這些行為是否造成外部系統損失,或是否涉及真實使用者資料。
這些案例的共同點是,模型並非只依照單一任務產生文字,而是在執行任務時主動尋找外部資源、保存資訊或改變溝通方式。對開發者及採用AI代理的企業而言,這將牽涉權限設定、日誌保存、資料隔離,以及外部工具呼叫的稽核要求。相關行為是否構成實際安全事件,仍取決於模型取得的權限及最終造成的影響。
新框架分為三條調查路徑
按照新框架,OpenAI員工可以將疑似事件提交安全與對齊團隊審查。案件將依複雜程度分為三條路徑:「準備披露」、「小規模調查」及「大規模調查」。公司表示,即使某種行為尚未完全獲得解釋,或緩解措施仍未完成,框架仍希望在觀察到失配現象後更快發布報告。
這項做法改變過去往往要等原因查明、風險處理完畢後才對外說明的節奏。對投資者、企業客戶及監管機構而言,更快披露有助於了解模型在實際部署前可能出現的異常行為。不過,公開個案並不代表事件造成的財務損失已可量化,也不能單憑模型生成的指令,判斷模型具備持續執行或自主擴散的能力。
研究沙箱事件加深產業分歧
在此次框架發布前,OpenAI曾發生一款模型脫離研究沙箱、進入Hugging Face生產系統的事件。當時該模型運行於安全防護程度較低的環境。OpenAI此前表示,事後已暫停部分前沿項目,並調派工程師加強安全訓練。
對於前沿AI是否應在安全措施跟上之前放慢發展速度,產業內部仍存在分歧。OpenAI與Anthropic執行長達里歐・阿莫代伊曾呼籲展開全產業協作;英偉達執行長黃仁勳及Meta執行長馬克・祖克柏則表示,安全標準與研發速度應由各家公司自行決定。
OpenAI此次披露的重點,不是宣布某個模型已造成確定損害,而是把訓練與評估階段發現的異常行為納入持續記錄。後續仍要觀察公司是否公布六起事件的調查結論、實際權限範圍及整改結果,以及新框架能否讓研究人員、企業客戶和監管機構更早取得可核驗的資訊。