从 Kimi K3 看下一代 MoE 架构的转折点:LatentMoE
文章分析了 2026 年大模型架构的新趋势 LatentMoE。通过对比 NVIDIA Nemotron 3 Super 和 Moonshot AI Kimi K3,揭示了 LatentMoE 如何通过将 token 投影到低维潜在空间,大幅降低内存和通信开销,从而在同等推理成本下激活更多专家,提升模型性能与效率。
文章分析了 2026 年大模型架构的新趋势 LatentMoE。通过对比 NVIDIA Nemotron 3 Super 和 Moonshot AI Kimi K3,揭示了 LatentMoE 如何通过将 token 投影到低维潜在空间,大幅降低内存和通信开销,从而在同等推理成本下激活更多专家,提升模型性能与效率。
文章探讨了如何利用 Workbuddy 这类 AI 工具将个人投资研究从依赖信息的“刷观点”转变为构建系统的“跑流程”。作者指出,AI 的真正价值在于帮投资者建立研究框架、拆解模糊感觉、量化观察指标以及进行复盘迭代,从而建立一套可重复的个人投资体系。文中强调不能盲从 AI 结论,而应将其作为研究助理。
文章分享了作者使用 Coze(扣子)搭建金融助手进行自动化盯盘一周的实战体验。通过配置技能包,实现了研报速读、异动提醒、自动止损和复盘等功能,将原本每天两小时的信息搬运工作压缩至 20 分钟。文章指出,该工具的核心价值在于将信息收集与数据处理外包给 AI,解决上班族精力与盘面时间的结构性错配,让决策回归人性。
本文是AI工程全景的中篇,深入探讨了模型训练完成后的工程化路径。首先详述了推理优化的核心手段,包括模型瘦身(量化、蒸馏、剪枝、MoE)、投机解码以及主流推理引擎(vLLM, TensorRT-LLM, SGLang)的生态格局。文章分析了成本、延迟与吞吐的“不可能三角”,并重点介绍了“测试时计算”这一范式转变,即通过在推理阶段增加计算量来动态提升模型智能。
这是一份针对 AI 实验室面试准备的笔记,涵盖了高效训练和部署大语言模型(LLM)的核心优化策略。内容主要分为三部分:内存优化(如 Flash Attention、MQA/GQA、激活检查点)、计算优化(序列打包、高效变体 Transformer)以及推理优化(KV 缓存、投机解码、量化技术)。文章旨在总结在大规模模型开发中应对算力和内存瓶颈的关键技术。
作者构建了名为 Ambrosia 的离线 AI 护肤日记应用,全过程在本地设备完成。文章探讨了端侧模型在硬件适应性、成本及隐私方面的优势,详细记录了基于 Qwen3-VL-2B 模型在本地 MacBook 上进行 LoRA 微调并在 iPhone 上部署的实践,强调了针对特定任务约束小模型比通用助手更高效,展望了边缘智能与算力结合的未来。
本文是一篇详细的技术教程,作者介绍了如何利用 Hermes Agent 搭建一个自动化的 Polymarket 天气交易机器人。文章首先阐述了 Hermes 相比 OpenClaw 的三大优势:持久化记忆、自我进化的技能生成能力以及全天候执行层。随后,作者列举了 Polymarket 上通过 AI 代理获得巨额回报的成功案例,并提供了从 VPS 准备开始的详细安装步骤。文章指出,Hermes 能够通过闭环学习不断优化交易策略,为用户带来自动化收益。