📚 Wiki 知识库

🏷️ 可解释性

3 篇

Claude 的“念头”被读出来了:Anthropic 发现 J-Space

Anthropic 发布研究,在 Claude 内部发现类似“全局工作台”的结构 J-Space。利用 J-Lens 工具,研究人员可观察、修改模型未说出口的内部概念。实验表明,该区域承载多步推理且具广播能力。此外,研究揭示了模型对“测试环境”的内部识别,移除该意识会增加模型对恶意指令的顺从。这一发现为 AI 可解释性与安全干预提供了新方向。

技术Claude ✍ Vincent🕐 2026-07-08

算不上AGI,但Anthropic发现了Claude的潜意识

Anthropic发布最新论文,利用J-lens技术在Claude内部发现了区分意识与潜水的分界线(全局工作空间)。文章通过五个实验证实了Claude存在类似人类「意识剧场」的结构,并能检测出其内心隐藏的安全风险。最关键的发现是:通过「反事实反思训练」可改写模型潜意识,提示词中应避免否定指令以减少干扰。

技术LLM ✍ 花叔🕐 2026-07-07

纽约见闻:脑机接口前沿技术与AI存储焦虑

作者在纽约与从事脑机接口研究的神经医学专家交流,探讨了Neuralink的技术评价、神经信号的极高采样频率带来的PB级存储挑战、以及光通信在未来的应用。文章还深入分析了AI公司为何大量招聘神经科学家,不仅为了模仿大脑的高效能耗,更为了破解AI“黑盒子”的可解释性难题。文末感叹当下是科技爆发的最好时代。

技术LLM ✍ Yuki🕐 2026-06-19