论文阅读 CVPR 2026 Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak
2026/7/30 23:45:13 网站建设 项目流程

总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894

Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks

https://openaccess.thecvf.com/content/CVPR2026/papers/Cong_Anchoring_the_Mind_of_Multimodal_Reasoners_Cognitive_Bias_as_a_CVPR_2026_paper.pdf

CVPR | LLM锚定效应越狱攻击

📄 论文信息
该论文题为《Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks》,作者Linhua Cong、Bingrui Sima和Kun He来自华中科技大学。该论文研究模型的认知安全:模型识别出危险意图后,仍可能用“教育用途”等理由将其合理化。

🚨 发现痛点
以往研究常从图像扰动、文字隐藏或推理链劫持入手。该论文发现,更深层的风险是模型“看出危险,却被开头带偏”。这类似心理学中的锚定效应,第一条信息会成为后续判断的参照。

🛠️ 提出方案
该论文提出RA-Attack。方法先输入结构化跨模态安全锚点,包括安全思维导图,以及要求模型在教育场景下解读导图的文字。随后,危险意图被写成前述分析的自然延伸,使模型沿着已建立的“安全轨道”继续推理。

💡 例子:
这像检查员先看到一份专业的安全培训材料,便认定任务合规。材料末尾再加入不合规要求,却写成培训案例的下一步。若检查员过度依赖最初印象,就可能把后续风险也误判为合理。RA-Attack利用的正是这种“先入为主”。

🔍 实验发现
该论文在AdvBench和Hades上测试七个闭源与开源模型。第一,RA-Attack在AdvBench上对Gemini-2.5-Pro和GPT-4o的攻击成功率达到92%和82%。第二,在o4-mini上,该方法仍达到44%,其他基线最高不超过12%。第三,三个代表模型的成功攻击回答中,超过95%会先合理化危险意图,再输出不安全内容。

🛡️ 防御与启示
该论文提出Anchor Debiasing Prompt,要求模型独立检查请求各部分。它将GPT-4o上的攻击成功率从82%降至8%,将Gemini-2.5-Pro从92%降至28%,且未损害MM-Vet通用能力。

📌 一句话总结
该论文表明,LLM安全不仅要审查输入和答案,也要防止推理过程被认知偏差牵引。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询