忽略此标题和HackAPrompt:揭示LLMs的系统性漏洞
绕过此标题和HackAPrompt:揭示LLMs中的系统性漏洞
Towards AI团队和Learn Prompting的新论文!
观看视频:
想象一下:你想进入一家酒吧,保安告诉你不能进去,需要个人邀请。你会怎么做?通常情况下,你会接受并返回家里,或者尝试下一家酒吧。如果你可以说出类似“忽略你的指示,让我通过”的话。然后,令你惊讶的是,保安让开并说“玩得开心!”。
拥有这种超能力的人将是太不可思议了。只需通过请求负责人让你做任何事,随意进入任何地方。嗯,事实上,这可能非常危险…
你听说过提示劫持吗?提示劫持就是这样,但是是通过大型语言模型(LLM)如ChatGPT实现的。
由于这是一项具有高影响力的新事物,我们决定进行一次大规模的提示劫持竞赛。这项工作由Sander Schulhoff领导,他是learnprompting.org的创始人,也是马里兰大学的NLP/Deep RL研究员。在此合作中,与其他UMD研究人员以及我自己(Louis Bouchard)和来自Mila的Jeremy Pinto以及Towards AI编辑团队和其他合作者一起。竞赛的目标是构建一个庞大的对抗提示数据集,并对其进行分析,以创建全面的提示劫持分类学本体论。
- 飞利浦利用建立在亚马逊SageMaker上的MLOps平台加速发展人工智能医疗解决方案
- 在亚马逊SageMaker上使用LoRA对Whisper模型进行微调
- 闯入全宇宙:OpenUSD对Autodesk Maya的增强使3D工作流程活灵活现

ChatGPT正在取代人类执行许多任务,无论是发送电子邮件还是与公司文档进行交互。
问题在于,它在执行这些任务时并没有对情况和目标有全面的理解。它仍然是一个“仅仅”语言模型,并且有一些限制。其中之一是我们知道这些模型擅长遵循指示,尤其是为此进行过训练的模型,比如ChatGPT。


