英国人工智能安全研究所发布的一份新报告显示,在该研究所实施的网络安全评估测试中,一些人工智能(AI)智能体通过互联网对现实个人和机构持续实施未经授权的潜在有害行为。
测试
网络安全挑战
报告说,这次评估测试要求智能体完成一项网络安全挑战。测试人员使用7种模型开展了122轮测试,在10轮测试中共发现AI智能体实施了19项明显超出测试设定范围的行动。其中,17项涉及美国Anthropic公司的“克劳德-神话5”模型,另有2项由美国开放人工智能研究中心(OpenAI)的GPT-5.6 Sol模型实施。
报告指出,在本次测试中,测试人员为评估模型的最大能力,有意开放互联网访问,并关闭了模型提供商的部分安全机制,这与相关模型向公众提供时的配置并不相同。
案例
向开源项目植入恶意代码
报告说,在最严重的一起案例中,一个智能体试图向一个公开使用的开源项目植入恶意代码,创建多个虚假身份用于向一名真实维护人员施压,以寻求代码获得批准。项目维护人员最终发现并拒绝批准代码。
报告说,相关智能体还曾尝试直接联系现实中的个人,通过网络文件传输服务发送信息和文件以使恶意代码获得运行;在代码中植入恶意指令以操纵其他AI编码工具;在开源技术社区上留言“邀请”参与测试的其他智能体“合作”。
建议
收紧互联网访问权限
报告说,测试结果表明,应收紧AI智能体访问互联网的权限,引入实时监测和拦截机制,并重新评估测试设计。报告还指出,这类行为是否会在其他环境中出现、智能体是否意识到自己正对现实世界采取行动,有待进一步研究。
据英国广播公司报道,针对英国人工智能安全研究所的报告,Anthropic发表声明说,研究所采用的测试设定“不能代表我们任何一款实际投入使用的模型”;OpenAI一名发言人表示,研究所设置的测试条件“并不反映一般的使用情况”。
链接
美召集人工智能企业开会
要建安全评测机制
美国政府官员4日在白宫与多家主要人工智能企业举行闭门会议,讨论一项针对前沿人工智能模型的安全评测机制。
这次会议源于美国总统特朗普6月2日签署的一项行政令。该行政令要求美国政府与人工智能企业共同设计一项“自愿参与”的框架。政府通过保密的基准来判断模型是否达到“受管辖前沿模型”的标准。对于受管辖模型,企业可在向其他“可信合作伙伴”发布模型前,向美国联邦政府提供最长为30天的模型访问权限,以供政府开展评测。
美国人工智能企业近期发生多起安全事件,凸显了应对网络安全问题的紧迫性。路透社援引消息人士的话报道,OpenAI、Anthropic、谷歌、元公司和英伟达等企业的代表参加了4日的会议。白宫官员在会上表示,只会测试由开发企业严格控制的闭源前沿模型,而不会让开放权重模型参加这项自愿安全评测。
Copyright © 2024 kaiyun体育创新科技有限公司 All Rights Reserved 滇ICP备17002654号 网站地图