OpenAI公布Atlas浏览模型提示注入防护方案

OpenAI公布针对Atlas浏览模型的提示注入防护方案。

导语:OpenAI公布针对Atlas浏览模型的提示注入防护方案。

摘要

OpenAI公布针对Atlas浏览模型的提示注入防护方案。提示注入是指网页、文档或外部内容通过隐藏指令诱导AI模型执行非预期操作,尤其会影响具备网页访问和外部网络能力的浏览型AI。OpenAI表示,通过针对性训练、评估和防护机制,可以显著降低模型遵循恶意网页指令的概率。在相关测试中,经过加固的模型将提示注入成功率从两成以上降至不足1%,同时尽量保持正常浏览任务能力。

正文(中文编译稿)

OpenAI表示,随着AI代理开始浏览网页、读取文件并调用外部服务,提示注入已经成为影响代理安全的重要风险。攻击者可以把指令隐藏在网页文本、页面结构或其他外部内容中,诱导模型泄露信息、执行错误操作,或者偏离用户最初的任务目标。

Atlas模型的防护工作重点包括训练模型识别不可信指令、区分用户意图与网页内容,以及在执行高风险操作前提高判断门槛。OpenAI还通过模拟真实网页环境的评估方法,测试模型在不同类型提示注入攻击下的表现。

测试结果显示,加固后的模型在面对恶意网页内容时,遵循攻击指令的比例显著下降。OpenAI表示,安全防护不能只依赖单一过滤器,还需要结合模型训练、系统设计、工具权限和持续评估。

这项工作主要面向浏览型AI和能够访问外部网络的代理系统。随着AI代理承担更多检索、执行和自动化任务,如何在保持可用性的同时限制外部内容对模型行为的影响,将成为产品部署中的长期问题。

(来源:艾瑞网)
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐