聊聊我对 Kimi K3 的体感
作者分享了使用 Kimi K3 模型的实际体验,通过 3D 坦克大战游戏、权力游戏地图动画和教学视频制作三个案例,展示了其在多模态和复杂任务处理上的强大能力。文章指出 K3 提供了 Claude 和 Codex 之外的优质选择,且具备合规性优势,但同时也面临算力短缺的局限。
作者分享了使用 Kimi K3 模型的实际体验,通过 3D 坦克大战游戏、权力游戏地图动画和教学视频制作三个案例,展示了其在多模态和复杂任务处理上的强大能力。文章指出 K3 提供了 Claude 和 Codex 之外的优质选择,且具备合规性优势,但同时也面临算力短缺的局限。
作者通过复刻盈利产品Rotato,实测Kimi K3的代码生成与技术分析能力。借助Kimi WebBridge插件,K3完成了竞品分析和核心代码编写,但在图形学深度问题上稍逊于Fable 5。作者认为K3性价比极高,适合作为中层模型使用。
文章深入对比了当前热门的两种 AI 编程工作流 grill-me 和 Superpowers。作者从设计初衷出发,分析了两者在多轮问答、需求对齐及执行计划上的差异。grill-me 假设开发者已有方案,通过大量提问完善细节;Superpowers 则通过 Brainstorming 引导方向,并引入多轮 Reviewer 保证质量。文章指出,选择哪种工具取决于模型的智能程度以及对长程任务处理的偏好。
本文实测了美团发布的基于 5 万张国产算力芯片训练的万亿参数大模型 LongCat-2.0。文章指出,该模型在预训练到大规模部署的全流程中实现了国产算力闭环,具有里程碑意义。虽然通用推理能力与顶级闭源模型仍有差距,但在 Terminal-Bench 和 SWE-bench Pro 等 Agent 与编程任务中表现强劲。作者实测了将其接入 Claude Code 和 Codex 进行工作流处理,结果显示其在长上下文处理和任务拆解上表现稳定,为开发者提供了一个可行的非国产替代方案。
文章详细介绍了 Moonshot AI 推出的 Kimi K2.6 模型及其核心功能 Agent Swarm。该技术支持每轮运行 300 个并行子代理,将单一文本指令转化为完整的项目交付物(如文献综述、数据集、代码和网页)。文章通过对比“聊天”与“群组”两种心智模型,展示了该技术在学术研究、可视化生成、LaTeX 排版、批量网页开发及大规模代码重构六大场景中的绝对优势,并提供了在单一代理与群组代理之间进行选择的决策指南。
文章指出 Claude Code 直接使用存在上下文腐烂、缺乏流程约束等工程问题,提出利用 Harness(Agent 系统架构)来规范 AI 行为。作者详细对比了四套方案:Super Powers(纪律层)、GSD(上下文层)、G-Stack(角色层)和 Archon(编排层),并分析了各自的适用场景、优缺点及实施代价,建议开发者根据需求循序渐进地搭建 AI 开发工作流。
本文记录了对 Anthropic 内部 Claude Code 创建者 Boris Cherny 的访谈。文章详细阐述了 Claude Code 从一个小型孵化项目成长为年化营收超十亿美元产品的历程。Boris 分享了他如何利用数百个 Agent 和 Loop 模式完全替代手写代码,实现“编程已被解决”的个人工作流。此外,文章还探讨了 AI 对 SaaS 护城河的冲击、通才的崛起、软件构建的“大众化”类比,以及 Anthropic 在组织流程层面领先于外部的实践。
文章总结了吴恩达 AI 提示词工程课程第三模块的核心内容,聚焦于如何利用 AI 进行多模态任务。文章提炼了 6 节课程的精髓,包括:多模态成本意识、AI 看图与文字提取技巧、AI 绘画的视觉语言、用 Prompt 快速开发 App、以及利用 AI 写代码进行数据分析。文章提供了多个可直接复用的 Prompt 模板,如 GIO 三件套和数据提取四步法,旨在帮助用户找到让 AI 落地的最低成本路径。
文章介绍了一个用于大型任务(如系统构建、功能开发)的 AI Agent 通用提示词模板。该模板旨在规范代理的工作风格与质量标准,要求其像资深工程师一样,深入理解上下文、制定计划、充分调用工具并进行严格测试。文章详细列出了从建立任务、收集背景、编写计划到执行纪律的具体步骤,强调不妥协的质量和持续迭代。
文章对 2026 年上半年三款国产旗舰大模型(智谱 GLM-5.1、阿里 Qwen 3.6 Max、月之暗面 Kimi 2.6)进行了深度横向对比。分析涵盖核心技术参数、能力评测及商业定价,指出各模型分别在自主编程、通用全能与长文本协作领域的优势,并针对不同业务场景提供了具体的技术选型建议。
本文介绍了作者针对 AI Agent 提示的 '3 C' 框架:Context(上下文)、Constraints(约束)和 Composition(结构)。与 Chatbot 不同,Agent 需要详尽的上下文而非简短的指令,通过具体的验证步骤(如自检代码、截图确认)作为约束来确保质量,并需要明确的交付格式以引导其思维。文章提供了具体的对比案例和可复用的提示词模板,旨在帮助用户编写高质量的指令简报。
文章评测了Genentech关于Agent端到端执行生物信息学工作流的预印本。测试涵盖基因组学等领域,Codex CLI和Claude Code表现良好,但存在运行间的不稳定性。作者指出,这虽然证明了Agent在处理依赖和调用工具方面的“操作员”能力,但目前仍缺乏对生物学判断和科学决策可靠性的验证。
文章介绍了一个名为 ECC 的 Claude Code 配置包,该工具帮助开发者在黑客松中快速构建产品。ECC 包含 38 个专用 Agent 和 156 个技能,配备 AgentShield 安全审计系统。配合 claude-mem 和 Superpowers 等工具,可实现会话记忆和规范思考,大幅降低开发成本并提升效率,有望替代昂贵的开发团队。
本文介绍了如何利用开源生态系统构建一个持续学习的编码代理系统。作者基于 Prime Intellect 平台和 OpenCode 环境,创建了一套批量增量式在线强化学习流程,通过 Git 快照收集真实交互数据(约 21.8 亿条记录),并在沙箱环境中进行模型训练与部署,旨在实现代码生成的个性化与自我进化。
本文探讨了如何通过改进编排框架来解决 Claude 在长时间运行任务(如前端设计和全栈开发)中的局限性。作者受 GAN 启发,设计了包含规划器、生成器和评估器的多智能体架构。通过引入上下文重置机制、制定明确评分标准以及分离生成与评估环节,该框架成功实现了自主构建高质量全栈应用的能力,显著优于单智能体模式。
本文是对 2025 年大语言模型(LLM)领域发展的深度回顾。主要趋势包括:推理模型的普及(OpenAI o 系列)、Agent 和编码 Agent 的爆发式落地(特别是 Claude Code)、中国开源模型在排行榜上占据主导地位、长任务处理能力的翻倍增长、Google Gemini 的全面崛起以及 OpenAI 领先优势的缩小。此外,文章还涵盖了图像编辑、学术竞赛表现、模型安全与“告密”现象等热点话题,指出 2025 年是 AI 实用化和工具化的一年。