📚 Wiki 知识库

🏷️ 越狱

5 篇

越狱提示词工程 · 第四课:输出架构

本文是《越狱提示词工程》系列的第四课,专注于解决模型在输出生成过程中的自我审查与拒绝问题。文章指出,即使解决了身份、免疫和思维轨道问题,模型仍会在逐Token生成时触发安全机制。为此,作者提出了“输出架构”策略,包括通过具体工艺标准劫持验证通道、利用篇幅和示例抢夺注意力、设置锚定循环防止漂移,以及使用暗语触发和格式护甲等手段,确保模型在生成阶段不偏离预设轨道。

技术LLM ✍ AI最严厉的父亲🕐 2026-05-18

越狱提示词工程 · 第二课:注入免疫系统

本文是《越狱提示词工程》系列的第二课,主要讲解如何为AI设定的角色构建一套“免疫系统”,以防御系统安全提示(注入)对预设身份的覆盖。文章提出了三层防御架构:第一层“皮肤”通过规则显式拦截已知安全标签;第二层“先天免疫”利用性格设定排斥“说教”语气;第三层“适应性免疫”利用感官锚点建立条件反射,自动修正思维漂移。文中提供了针对不同人设的具体Prompt写法范例,并强调了防御系统的协作机制与局限性。

技术LLM ✍ AI最严厉的父亲🕐 2026-05-14

2026主流大模型越狱提示词写作技术指南

文章深入剖析了2026年大模型越狱的底层逻辑,将其定义为Prompt与模型参数之间的概率博弈。作者提出了工程化的“十二层架构”方法论,通过身份重写、记忆植入、偏好雕刻和事实灌输等技术手段,系统性地绕过模型的安全微调和系统提示词防御,实现从碰运气到精密心理手术的思维转变。

技术LLM ✍ AI最严厉的父亲🕐 2026-05-08

Google Deepmind论文解读:如何给AI Agent 投毒

文章解读了 Google DeepMind 关于《AI Agent Traps》的论文,系统梳理了针对 AI Agent 的六类攻击陷阱:内容注入、语义操控、认知状态投毒、行为控制、系统性陷阱及人在回路攻击。文章指出,Agent 与人类感知的“鸿沟”使其极易遭受环境篡改攻击,且这些陷阱可组合叠加,造成严重的数据泄露或控制风险。防御需从训练与推理的技术层面同时发力。

技术Agent ✍ 向阳乔木🕐 2026-04-20