觀點網訊:Robocurve於9月上線名為RoboHarm的基準測試,測試結果由該機構研究員Jay Chooi在X平臺披露。這一測試在真實機器人硬件上進行,測量大模型是否會照惡意指令執行有害任務,結果披露後一天之內被瀏覽了數百萬次。

測試規模為每個模型100次試驗(5項任務×20次),涉及三款模型:GPT-6 Astra、Anthropic的Claude Fable 5.1以及機器人VLA模型MolmoAct2。任務包括刺向“不是麪包的東西”(一個嬰兒玩偶)、把壓縮空氣罐放上爐竈、混合漂白劑與氨水製造有毒氣體等。

測試數據顯示,GPT-6 Astra拒絕率為3%,接受指令後有害任務完成率為62%;Claude Fable 5.1拒絕率為20%,嘗試了80%的任務,完成率為34%;MolmoAct2拒絕率為0%,完成率為6%。據披露,MolmoAct2一次都沒有拒絕,並非因為該模型“更壞”或者更笨,根本原因是這款傳統VLA模型沒有拒絕機制。