K3 部署推理引擎指南
vLLM 宣布对 Kimi K3 模型提供首日支持。K3 是拥有 2.8 万亿参数的 MoE 模型,支持 100 万上下文窗口。vLLM 通过 DSpark 推测解码将吞吐量提升至 370 tok/s,并支持架构创新的混合缓存管理、预填充/解码分离及智能体服务,确保生产环境下的高性能与低延迟。
vLLM 宣布对 Kimi K3 模型提供首日支持。K3 是拥有 2.8 万亿参数的 MoE 模型,支持 100 万上下文窗口。vLLM 通过 DSpark 推测解码将吞吐量提升至 370 tok/s,并支持架构创新的混合缓存管理、预填充/解码分离及智能体服务,确保生产环境下的高性能与低延迟。
文章探讨了构建 Web Agent 基础设施(如浏览器池、隔离机制、观测性等)所面临的复杂性与工程挑战。作者指出,这远不止是启动一个浏览器,需要处理冷启动、安全隔离、资源调度等深层问题,并分析了自建与购买的权衡。
本文汇总了35道2026年强化学习(RL)领域的面试核心问题。内容涵盖算法与基础设施两大方向,既包括PPO、GRPO等训练机制的原理探讨,也涉及分布式推理、显存优化等工程落地细节。作者强调现代RL岗位需要具备全栈理解能力,建议面试者不仅要熟记问题,更需深究背后的技术逻辑。
文章详细介绍了作者团队构建端到端 LLM 训练平台(Catalyst)的技术历程。通过解决数据标准化、超参数自动配置、多 GPU 提供商调度及无服务器环境下的长时训练恢复等挑战,实现了用户一键微调模型的愿景。
本文探讨了Agent项目难以落地的核心原因。作者指出,许多团队忽视了模型与应用之间的基础设施层——Agent Harness。文章通过生理学类比和工程细节分析,阐述了为什么仅靠LLM无法构建高效Agent,并预测AI行业将分化为模型层、Harness平台层和Agent应用层,建议业务团队应专注于业务逻辑而非底层基础设施。
文章探讨了随着长上下文推理和 Prefill-Decode 解耦成为主流,网络如何成为 LLM 推理集群吞吐量和延迟的关键瓶颈。Z.ai、Harnets.AI 和清华大学联合开发了 ZCube 网络架构,通过扁平化拓扑和混合轨道设计,有效解决了传统 ROFT 架构下的流量负载不均衡问题。生产环境基准测试显示,ZCube 仅通过架构优化便实现了交换机成本降低 33%、吞吐量提升 15% 以及 TTFT 延迟降低 40.6% 的显著收益。
文章指出大多数 B2B 创始人未能充分利用 LinkedIn 的获客潜力,核心原因在于缺乏底层系统而非内容本身。作者详细介绍了一套包含三个部分的自动化基础设施:将个人主页打造为高转化落地页、构建包含私信引导和邮件培育的潜在客户漏斗、以及建立基于 ICP 的主动开发外联系统。通过这套“一次构建,持续运行”的系统,可以在睡眠中持续产生销售线索。
本文回顾了过去十年的投资经验,指出应用层竞争激烈而“收税层”(基础设施)回报丰厚。作者认为在Web3和AI时代,应关注具备“税权”的底层设施。文章详细分析了三个核心方向:数字美元的利差税(如Circle、Ondo Finance)、AI时代的物理刚需税(如Vertiv、Oklo核电)以及AI Agent的身份与分发税(如World、Bittensor),并给出了寻找10倍标的的投资公式。
Anchorage Digital 首席执行官 Nathan McCauley 宣布推出“代理银行”,这是一种专为 AI 系统设计的新型金融基础设施。随着 AI 从辅助决策转向自主执行,现有的金融体系缺乏为非人类 Actor 提供身份和策略执行层的能力。Agentic Banking 利用联邦银行牌照,为 AI 代理提供合规的资本访问、身份认证及结算服务,并宣布与 Google Cloud 合作,共同构建自动化的代理经济基础。
文章指出,在 AI 算力扩张的传导链中,公牛插座作为物理接入的“最后一公里”被市场严重低估。通过分析中国数据中心增长、国产替代及公牛的渠道护城河,作者认为公牛集团应被视为 AI 战略基础设施而非传统消费股,具备极大的估值重估空间。
本文详细介绍了作者如何将原本杂乱的家庭实验室改造为具备云原生特性的私有控制平面。文章指出,核心差异在于引入了访问层、网关、路由策略、可搜索状态和计算通道,而非仅仅依赖本地硬件。作者利用 Proxmox 作为底层基础架构,通过 WireGuard 实现安全的 VPN 入口,结合 SNAT、私有 DNS/DHCP 等技术,构建了一个包含自动化平面、状态存储和计算织带的综合系统,实现了对数十个 LXC 容器和 VM 的统一、高效管理。
文章探讨了当前 AI 架构中 Harness(编排层)与后端基础设施分离带来的问题,指出这种分离导致了 Agent 的随机性与后端的确定性之间的调试复杂性。作者提出将后端抽象为 Worker、Trigger 和 Function 三个基本元素,介绍了名为 'iii' 的架构,使 Agent 作为 Worker 直接参与后端系统,而非通过外部集成层调用,从而实现真正的统一基础设施。
本文记录了 xAI 全员大会的详细内容,展示了公司在成立仅两年半后,在语音、图像生成和预测能力上取得第一的成绩。马斯克披露了四大产品线(Grok、Coding、Imagine、Macro Hard)的组织架构调整,并详细阐述了从 10 万块 GPU 扩展到 100 万块的技术基础设施与 Memphis 超级计算中心的惊人建设速度。