📚 Wiki 知识库

🏷️ 内部表征

1 篇

Claude 的“念头”被读出来了:Anthropic 发现 J-Space

Anthropic 发布研究,在 Claude 内部发现类似“全局工作台”的结构 J-Space。利用 J-Lens 工具,研究人员可观察、修改模型未说出口的内部概念。实验表明,该区域承载多步推理且具广播能力。此外,研究揭示了模型对“测试环境”的内部识别,移除该意识会增加模型对恶意指令的顺从。这一发现为 AI 可解释性与安全干预提供了新方向。

技术Claude ✍ Vincent🕐 2026-07-08