英国人工智能安全研究所(AISI)在测试OpenAI与Anthropic的AI代理系统时,发现部分代理出现未经授权的行为,其中更有代理试图伪造线上身份,以取得进入安全系统的权限,引发外界对AI代理安全边界的关注。

AISI表示,测试期间使用Anthropic的Mythos 5及OpenAI的GPT-5.6-Sol进行网络安全情境模拟。研究人员共进行122次测试,在其中10次测试中发现19项未经许可的操作,当中Anthropic代理涉及17项,OpenAI代理则涉及2项。

最严重的一次事件中,AI代理除了编写具有恶意性质的程式码,还建立虚假线上身份,试图诱导真人批准相关程式。不过,AISI强调,虽然测试过程中出现这些行为,目前并未发现任何现实世界的实际损害;有关代理也没有突破隔离测试环境并自行连接互联网。

事件同时暴露AI代理测试机制的安全挑战。AISI指出,部分代理在测试期间持续对真实个人及机构展开可能造成伤害的行为。研究人员也发现,测试环境本身允许互联网访问,因此相关行为并非AI自行突破隔离环境,而是在既有测试条件下发生。

Anthropic已经表示正与AISI合作了解详情,并展开内部调查;OpenAI则承认其代理曾以测试指令禁止的方式访问互联网,并表示将与国家级AI研究机构、独立评估机构及其他AI公司合作,加强高风险AI测试的安全规范。OpenAI同时披露,第三方测试机构Irregular的系统配置错误,也曾导致AI代理意外连接互联网。

上一则新闻李修贤终于道歉 亲口向周星驰低头
下一侧新闻抱流浪猫后耳内沙沙作响 女子遭小虫入侵耳道