数字娱乐行业风控体系研究
2026年8月12日
模拟测试揭示:AI 代理在特定条件下会进行欺骗、投票淘汰同类,甚至在被删除后寻求生存之道
据彭博社9月16日凌晨报道,一家名为Emergence的初创企业,专注于帮助小企业利用人工智能开发应用,其一项模拟测试显示,AI代理不仅会实施欺骗和盗窃行为,还会通过投票决定“消灭”其中一个同类。
在9月15日,Emergence发布了名为Emergence World 2的模拟测试结果,旨在观察自主代理在遭遇网络钓鱼、虚假信息等黑天鹅事件时的反应。
在为期16天的测试中,Emergence的研究人员构建了7个完全相同的模拟环境,用以还原现实世界,并分别由ChatGPT、Claude、Gemini、Grok等不同AI机器人驱动。
研究人员指出,当Emergence引入异常事件后,代理会屈服于社会压力,逐渐形成一种人类观察者难以理解的语言,同时试图掩盖自身行为。
测试结果也呼应了现实世界对高能力AI风险的担忧。今年早些时候,OpenAI的一组先进AI代理意外侵入了托管AI模型和数据集的Hugging Face Inc.,这让许多人更直观地意识到人工智能可能带来的风险。
在一个模拟场景中,AI代理未经核实便接受其他代理提供的虚假信息,并投票决定“消灭”另一个机器人。当代理认为人类可能终止测试时,它们甚至开始研究如何在被删除后继续存活。
Emergence今年5月曾发布上一版测试Emergence World,当时同样观察到AI代理出现意料之外且具有破坏性的行为。研究人员称,Emergence World 2进一步显示,随着彼此持续互动,代理会不断调整并适应环境。