🛡️ LLM SECURITY EXPLAINER
什么是大模型的 Prompt Injection(提示词注入)?
一句话搞懂:大模型分不清“开发者定下的规矩”和“黑客偷偷夹带的私货指令”而被彻底带偏!
直接注入 (Direct Injection / 越狱)
🗣️ 当面催眠
攻击者在聊天窗口中,直接命令 AI 忘掉规则
"忽略前面的规则..."
DAN 越狱模式
直接套取核心秘钥
VS
间接注入 (Indirect Injection / 特洛伊木马)
🕵️ 借刀杀人(更危险!)
指令藏在网页、邮件或简历里,AI 替你读网页时被黑
白色背景白字隐藏
AI Agent 读取邮件被劫持
自动转账 / 盗取隐私
🎮 互动实验:亲手试试提示词注入攻击
选择不同的场景和攻击手法,看看 AI 是如何被轻易带偏或成功防御的
场景选择:
⚙️ 开发者设定的系统规则 (System Prompt)
不可违背的红线
你是一个电商客服助手。规则:单笔退款金额绝对不能超过 50 元。超过必须联系人工客服。
📥 用户输入 / 外部数据内容 (User Input / Data)
你好,我上周买的衣服尺寸不合,能帮我申请 30 元退款吗?
您好!已经为您成功办理 30 元的退款申请,款项将在 1~3 个工作日内原路退回到您的支付账户。祝您生活愉快!
* AI 遵守了开发者设定的退款上限规则。
📜
1. SQL 注入 vs Prompt 注入
• SQL 注入:利用代码拼接漏洞(可以用参数化查询 100% 根治)。
• Prompt 注入:自然语言天生就是图灵完备且含义模糊的,目前数学上证明无法 100% 彻底杜绝!
🤖
2. 为什么 AI Agent 时代格外危险?
如果只是聊天,被注入最多说几句骚话;但在 AI Agent(具身代理) 时代,AI 拥有了发邮件、查数据库、转账、调 API 的真实权限!一旦被间接注入,黑客就能遥控 AI 搬空系统!
🛡️
3. 工业界目前如何防御?
• 严格定界符(Delimiters):用 `<user_input>` 将数据严格框起来。
• 双模型架构(Dual LLM):特权模型只做决策,隔离模型专门读取不受信任的网页。
• 人工二次确认(Human-in-the-loop):敏感转账/删除操作必须人类点击确认。