算不上AGI,但Anthropic发现了Claude的潜意识
Anthropic发布最新论文,利用J-lens技术在Claude内部发现了区分意识与潜水的分界线(全局工作空间)。文章通过五个实验证实了Claude存在类似人类「意识剧场」的结构,并能检测出其内心隐藏的安全风险。最关键的发现是:通过「反事实反思训练」可改写模型潜意识,提示词中应避免否定指令以减少干扰。
Anthropic发布最新论文,利用J-lens技术在Claude内部发现了区分意识与潜水的分界线(全局工作空间)。文章通过五个实验证实了Claude存在类似人类「意识剧场」的结构,并能检测出其内心隐藏的安全风险。最关键的发现是:通过「反事实反思训练」可改写模型潜意识,提示词中应避免否定指令以减少干扰。
本文阐述了 AI 开发者在编写代码前必须掌握的 10 个核心概念,而非急于动手写代码。文章解释了 Tokens(计费基础)、Embeddings(语义理解)、Attention(上下文机制)以及 Transformers(模型引擎)等原理,深入剖析了 LLM 的本质、幻觉产生的原因、Temperature 对输出的控制作用以及上下文窗口的重要性。理解这些心智模型,能帮助开发者避免盲目调试,构建出更稳定、高效的 AI 应用。
本文深入分析了 DeepSeek 如何通过 MLA、MoE、mHC 等一系列底层技术创新,极大幅度降低大模型对 HBM(高带宽内存)和先进 GPU 制程的依赖。文章指出,DeepSeek 的战略并非局限于软件订阅,而是旨在通过算法优化盘活中国产能充足的 NAND 闪存和 LPDDR 产业,以此构建一套独立于西方之外的 AI 硬件生态,最终撬动价值 10 万亿美元的产业巨兽。
文章详细解读了 DeepSeek 关于多模态推理的新论文。该研究提出一种“视觉原语”框架,让模型在推理过程中直接输出坐标和框,像人类用手指指物一样进行空间思考。这种方法仅用传统模型十分之一的视觉 Token,就在计数、拓扑推理等任务上达到了超越 GPT-5.4 和 Claude-Sonnet-4.6 的效果。文章还深入分析了模型在迷宫导航和路径追踪等任务上的数据合成与训练策略。
文章深入剖析了 DeepSeek-V4 如何通过 HCA、CSA 和 SWA 三通道并行架构,将 KV Cache 压缩至基线的 2%,从而实现工程上可行的 100 万 token 上下文。然而,这种极致的压缩是有代价的:MRCR 8-needle 测试准确率在 1M 长度下显著下降至 0.59。文章指出,V4 通过牺牲检索精度换取了推理成本的数量级降低,是一种‘有损的 1M’,并明确论证了该设计原理上无法完全替代 RAG 系统。
文章介绍了一种称为递归语言模型(RLMs)的新方案,旨在解决大语言模型在处理超长上下文时出现的“上下文腐烂”问题。RLMs 不再将上下文限制在单一 Prompt 中,而是将其视为外部数据,通过赋予模型窥探、正则匹配、分区和递归调用等工具,让模型自主决定如何分解和处理任务。这种方法不仅消除了上下文长度对推理能力的影响,还提高了准确性和成本效率。
本周综述重点介绍了 DeepSeek V4,这是首个默认支持百万 token 上下文的开源模型系列,通过 CSA/HCA 混合注意力机制和领域专家后训练技术,在推理性能上媲美 GPT-5.2。此外,还涵盖了 Apple 的 Mamba 架构知识蒸馏方法、Autogenesis 自进化智能体协议,以及 Skill-RAG 失败感知检索系统。
文章基于作者在 ByteDance Seed 的研究经历,探讨了 Looped LLM 架构的起源与演进。作者通过分析 Anthropic 发布的 Claude Mythos 在 GraphWalk BFS 基准上的异常表现,指出 Looped 架构在多跳推理和状态追踪上的优势。文章进一步深入讨论了 Looped LLM 在扩展至 10T/100T 规模时面临的深度稳定性、推理效率和 FLOPs 有效性的三大挑战,并对比了 RNN 视角与 Parallel Looped Transformer 等解决方案。
本周重点关注四大 AI 进展:Anthropic 展示 Claude 可进行全自动化对齐研究,成本仅 1.8 万美元且表现接近完美;AiScientist 提出基于文件系统的长周期工程架构;AlphaEval 揭露了 Agent 从研究到生产环境的巨大鸿沟;NVIDIA 发布开源 120B 参数模型 Nemotron 3 Super,采用混合 MoE 架构优化推理吞吐。
本文深入探讨了大模型训练的全链路流程,指出2026年模型效果的差距主要源于后训练阶段。文章从预训练底座、数据配方、系统架构约束、后训练(SFT/RLHF/DPO)以及 Eval/Reward 机制五个维度,解析了如何通过工程化手段提升模型实际落地效果,并引用了 DeepSeek、Llama 等实例。