BestBlogs 早报|实现周期骤缩后,创业者如何重选问题 ✍ ginobefun🕐 2026-07-30📦 23.0 KB 🟢 已读 𝕏 文章列表 本期早报探讨了 AI 智能体缩短实现周期后,创业者的机遇与挑战。文章涵盖 Sam Altman 对创业窗口的判断、GPT-5.6 的效率工程实践,以及如何通过 Skill Harness 将模型能力封装为可维护的产品功能。 GPT-5.6Agent创业效率工程ProductHarnessSkillLLMOpenAI # BestBlogs 早报|实现周期骤缩后,创业者如何重选问题:GPT‑5.6 效率工程与 Skill Harness 的产品化路径 **作者**: ginobefun **日期**: 2026-07-29T23:21:38.000Z **来源**: [https://x.com/hongming731/status/2082607511832826031](https://x.com/hongming731/status/2082607511832826031) ---  在线阅读本期早报 BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。 ## 导语 当 coding agent 能把过去数月的实现压缩到很短周期,创业者获得的不只是更快的编码速度,也必须重新回答:什么问题刚刚变得可做,哪些成本才是真正约束,以及怎样把模型能力变成可维护的产品功能。 今天的三篇精讲可以组成一条实践路径。 Sam Altman 的完整访谈提供机会判断框架:寻找多数人尚未更新认知的新能力,用持续数据建立逆共识。 OpenAI 对 GPT‑5.6 的一手拆解把效率放回训练、推理和 agentic harness 的完整系统。 关于 Skill 的演讲则继续往下走,说明如何用最小注册表、渐进披露、评测和治理,把能力封装成产品单元。 这三篇的证据性质并不相同。创业窗口主要是经验判断,效率数字来自 OpenAI 自身生产栈,技能规模阈值来自讲者实践。把它们并置的价值,是既看见机会,也保留验证条件,不把个人观点、内部工程数据和通用规律混为一谈。 ## 精讲一|Sam Altman:为什么现在可能是创办公司的最佳时机  这场 YC Startup School 2026 的完整访谈横跨创业、OpenAI、竞争、组织管理、AGI 与安全。最适合先抓住的判断是:技术版图快速变化、能力成本下降、实现周期缩短,让小团队能挑战过去受限于人手和时间的问题。Sam Altman 因而认为,这可能是一个对高抱负创业者有利的窗口。 窗口并不等于保证。 访谈给出的判断方法,比乐观结论本身更有用。创业者应寻找刚出现而多数人尚未更新认知的能力,再用持续数据检验自己的非共识观点。逆共识不是刻意反对市场,而是你掌握了一个尚未被广泛计入决策的新事实,并允许用户反馈、产品结果和技术进展不断修正它。 智能体缩短实现周期后,一个常见误区是把所有收益都用于更快地完成旧任务。访谈提出的方向更积极:把省下来的时间投入更大、更难、过去不可行的问题。小团队不必只做更薄的功能,也可以尝试更完整的用户闭环。此时最小可行产品的重点从砍掉多少功能,转向能否更快获得关键证据:能力是否跨过可用门槛,用户任务有没有改变,团队每周学到了什么。 这个框架也能帮助区分真正的产品杠杆与演示效果。若新增能力只让演示更丰富,却没有带来更清楚的用户行为、留存、付费或任务结果,它并没有提高学习速度。团队可以预先写下三类更新条件:支持判断的证据、反驳判断的证据,以及到什么时间仍无结果就收缩问题。这样,信念不会退化成固执,快速迭代也不会变成无方向地堆功能。 访谈后半还把创业机会与权力分布放在一起讨论。先进能力可能让更多人获得创造工具,也可能让数据、分发和决策权进一步集中。对创业者而言,这会具体影响客户迁移意愿、产品对平台的依赖,以及团队能否为长期结果负责。实现速度只是新杠杆的一部分,信任、分发和责任仍会决定产品能否留下来。 需要保留的边界是,这些关于未来模型、市场需求和创业窗口的判断来自一位长期创业者与投资者的经验,并不是创业成功率预测。读者真正可以带走的是一套可检验动作:找到刚改变的问题边界,为非共识判断建立更新点,并把节省的时间投向更高价值的未知。 ## 精讲二|GPT-5.6 如何将前沿智能与前沿效率融合  OpenAI 这篇一手文章没有把效率归结为模型单价,而是拆成三个相互作用的层级:模型训练、推理系统,以及 Codex 与 ChatGPT Work 使用的 agentic harness。它的中心信息是,孤立的小优化会在多轮模型调用、工具往返和长上下文里叠加,最终影响一次完整任务的速度与成本。 模型层首先追求用更直接的路径完成任务,让每个 token 产生更多有效工作。推理层则覆盖负载均衡、缓存、生产内核和推测解码。原文披露,生产内核优化让端到端服务成本下降 20%,改进的推测解码让 token 生成效率提升超过 15%。这些数字提供了具体工程锚点,但它们来自 OpenAI 自身生产环境。 推测解码可以说明系统协作的机制:更便宜的路径先提出候选,主模型再验证并接受可用部分,从而减少昂贵生成步骤。收益既取决于候选质量,也依赖验证、内核和调度效率。缓存亦然,只有稳定提示词前缀被正确组织,后续请求才能复用计算;若每轮都改写不变内容,理论上的缓存能力不会自动转化为成本下降。 到了 harness 层,优化对象变成上下文膨胀、工具发现与重复工作。智能体可能先规划,再搜索或执行代码,然后根据返回继续推理。每一轮重发的历史、工具描述和中间结果都会累积 token、网络等待与失败概率。延迟发现工具、维持稳定前缀、裁剪无用上下文和避免重复执行,看起来分别很小,却会在长任务中形成复利。 因此,团队评估智能体效率时应建立端到端账本。模型价格只是一个输入,还要同时记录任务成功率、调用轮数、缓存命中、工具等待、重试和人工返工。局部吞吐变快,但任务需要更多轮才能完成,用户感受到的速度仍可能下降;单次调用更便宜,但失败率提高,总成本也可能上升。 最可操作的实验方式,是先选一类稳定任务,冻结验收标准,记录优化前从用户请求到结果交付的总耗时和总用量,再一次改变一层。这样才能知道收益来自模型、推理调度还是编排。文章没有给出完整成本账本或跨供应商对照,所以这些比例不应直接成为外部采购结论;它们更像一张架构地图,提醒团队把模型与系统放在同一边界内衡量。 ## 精讲三|技能即新功能:构建以技能为中心的智能体 Harness  这场完整演讲把 prompt、tool 与 skill 分别概括为三个问题:智能体是谁,它能连接什么,以及它如何完成任务。Skill 承载步骤、领域知识、工具边界和完成标准,因此可以从编码助手的配置文件,提升为智能体产品里的功能与业务逻辑单元。 最小 Skill Harness 只需要几个部件:技能注册表、告诉模型如何发现技能的 system prompt、文件读取能力和受控执行环境。注册表先暴露名称、描述与路径,模型根据当前意图选择,再读取相关技能的完整内容。这种 渐进披露 避免把所有说明塞进上下文,也让技能描述承担路由信号的角色。 描述不是文案装饰。如果名称和描述无法区分相近任务,模型就可能读错技能或同时加载过多内容。技能的边界也应围绕用户意图,而不是内部数据模型。准备客户复盘和排查异常可能访问同一份数据,但步骤、工具和验收结果完全不同;按用户任务切分,评测才有明确输入、执行路径和完成条件。 演讲还给出一种协作分工。了解业务的人可以编写步骤、例外和验收口径,工程师负责 Harness、文件权限、工具调用和执行环境。这样,领域知识不必全部翻译成代码,安全与可观察性也不会被埋在一份无人维护的长提示词里。Skill 成为功能,意味着它同时需要产品 owner 与工程边界。 技能规模增长时,架构会发生变化。少量技能可以全部放入系统提示词;超过十个后,讲者建议引入检索;达到数百个时,则需要层级、元数据过滤、所有权、版本和生命周期治理。这里的数量是实践经验而非通用基准,但背后的约束成立:可选项越多,路由噪声越大,维护责任和退役策略也越重要。 模型升级或指令变化还必须重跑 eval。同一份 Skill 换到不同模型,可能出现不同路由、工具选择与完成质量。一个稳妥的建设顺序是:先用最小 registry 建立可测闭环,再增加评测和工具 allowlist,随后按真实规模引入检索、权限、owner、版本与退役机制。过早建设庞大平台会拖慢验证,完全不治理则会让技能库迅速失去可信度。 三篇精讲走到这里形成了完整路径:先用证据更新机会判断,再用端到端任务衡量效率,最后把可用能力沉淀成可测试、可维护的功能。它们共同反对一种捷径,即把新的模型能力直接等同于新的产品价值。中间仍然需要问题选择、系统工程和持续治理。 ## 速览|七条精华 相关性 ≠ 因果性:因果推断在 AI 评测归因中的方法与实践  阿里技术从组件级归因、扰动实验与因果 A/B 测试出发,讨论怎样定位 LLM、工具、运行环境或规划能力的真实贡献。新版 prompt 与任务成功率同时提高,并不自动证明 prompt 导致提升,请求难度等混杂因素可能同时影响两者。 文章的价值在于把评测问题从“哪个分数相关”推进到“干预某个组件会怎样”。团队可以先画出因果假设,再根据是否能随机实验、是否存在混杂与交互,选择归因方法,避免把一起变化的指标当成因果结论。 生产环境中 MCP 的安全防护:超越网关的纵深防御 生产 MCP 不能只依赖单一网关。文章提出四个独立控制层:安全执行、管理平面隔离、出站信任边界和语义完整性,分别处理代码在哪里运行、谁能操作控制面、连接可以访问哪里,以及工具描述和返回内容是否可信。 这套框架适合做威胁建模清单。即便身份验证与入口策略正确,恶意工具输出仍可能影响模型决策;即便执行被隔离,过宽的出站访问也会带来数据外泄风险。分层的意义正是避免一处控制失效后直接穿透全部系统。 Morgan Stanley Alpha Lab:从自动化量化研究到自我改进的研究环境 Morgan Stanley 的 Alpha Lab 展示智能体如何进入量化研究:先固定数据、研究环境、实验流程和评测量规,再让智能体自主提出与执行实验。这里的关键不是生成更多策略,而是让结果可复现、可比较,知道一次改进究竟来自哪里。 在高风险研究里,环境和评价标准本身就是产品。只有实验留下完整轨迹、研究假设与结果能够审计,自我改进才不会退化成对噪声的自动追逐。 当所有人都在给 AI 造缰绳,马厩正在消失 这篇观点文章把注意力从执行能力移向责任:当生成、分析和操作越来越便宜,真正稀缺的可能是对结果负责、承担承诺与处理后果。只优化动作速度,团队可能错过客户实际购买的价值。 它提供了一个产品检查问题:自动化完成后,谁对最终结果负责?如果答案始终回到客户,产品可能只交付工具;如果团队愿意承接结果,就必须同时建设验证、异常处理和责任边界。 微软面向 AKS 上 AI 智能体的三层 LLM 路由架构 微软的参考架构把路由拆为三层:语义路由理解请求,策略管理应用规则与约束,GPU 感知负载均衡再根据资源状态分配流量。智能体流量因而不只是网络转发,而是质量、成本与容量的联合决策。 分层还让不同变化有清楚归属。业务意图变化调整语义层,合规与预算变化调整策略层,集群容量变化交给基础设施层,避免所有逻辑挤在一个难以测试的网关里。 使用工具变量进行产品实验:在 Python 中消除 LLM 路由决策的混杂效应 教程用速率限制回退作为工具变量,并通过两阶段最小二乘法估计高级 LLM 路由对任务完成率的影响。它处理的偏差很常见:困难请求更容易被送往强模型,直接比较强弱模型两组结果,会把请求难度误算成模型效果。 工具变量需要满足严格前提,不能因为有一个自然波动就自动成立。实践中应说明它怎样影响路由、为何不会直接改变结果,并检查估计对不同样本与设定是否稳定。 SimilarWeb 如何使用 LangSmith 评估智能体报告 SimilarWeb 用基于评分标准的 LLM 评判、忠实性检查与人工校准,评估智能体生成的长篇研究报告。长报告没有唯一正确答案,完整性、事实支持与结构质量也难由一个自动指标覆盖。 案例最重要的提醒是先校准 rubric,再扩大自动化。若评分标准与人工认可的质量不一致,更多模型裁判只会更稳定地复制错误口径;保留人工样本能持续检查漂移。 ## 补充阅读|十条快讯 SimulationMaxxing:用仿真加速 AI 智能体交付  Snowglobe 与 Nubank 用包含真实上下文的多轮仿真生成客服智能体评测数据,加快场景覆盖与迭代。仿真结果仍需生产数据和人工评审校准,不能直接替代线上可靠性证据。 它适合先覆盖罕见、组合复杂或在线测试代价较高的客服场景,再把差异带回生产样本复核;仿真加速的是数据生成与反馈周期,不是省略真实世界验证。 存储暴跌,一夜惊魂 存储企业业绩增长与股价急跌同时发生,报道把近 430 亿美元市值蒸发放在宏观预期、杠杆 ETF 踩踏和资本开支担忧中解释。AI 基础设施需求、企业盈利和资本市场定价并不会始终同向。 观察这类波动时应把经营数据、资本开支周期与交易结构分开,避免用一天的价格变化直接推导长期需求;它提供的是市场机制案例,不是单一公司的价值判断。 为什么现成的 AI 无法真正理解金钱 前沿 LLM 可以生成流畅财务建议,但缺少可比较的状态、行动和结果数据时,很难可靠判断建议后果。演讲提出的分工是让结果驱动模型负责预测,让 LLM 负责交互与解释。 这种分工把语言流畅度与因果后果区分开:前者帮助用户表达需求,后者依赖结构化历史结果训练;金融场景尤其需要知道模型依据了什么状态,以及建议执行后如何回收反馈。 攻克 Windows 之门:将 RADV 移植到 WIN32 Collabora 展示把 Mesa 的开源 AMD GPU Vulkan 驱动 RADV 移植到 Windows 的实验进展,并运行 Counter‑Strike 2 演示。逆向工程、平台接口与长期稳定支持仍待解决,因此它是工程进展而非成熟发布。 这项工作也说明跨平台移植远不止编译通过,还涉及内核接口、窗口系统、驱动依赖和大量兼容性验证;演示证明路径可行,离稳定支持仍有完整工程清单。 卖 Token 还是卖结果:AI 商业模式的几个悖论 文章讨论按 token 收费与按结果收费的结构性张力:智能逐渐商品化后,利润可能向上游算力和下游承担交付责任的服务移动。评价一家公司的商业位置,既要看能力,也要看收费依据与责任归属。 按结果收费能更贴近客户价值,却要求供应商控制更多交付变量并承担失败风险;按 token 收费更易计量,客户却要自行吸收用量波动,两种模式背后是不同的风险分配。 ChatGPT 如何优化其智能体循环:编排层、API 与推理层 文章从编排、API 与推理三层梳理智能体循环,覆盖持久化 WebSocket、增量请求、稳定提示词前缀、延迟工具发现、缓存感知路由和推测解码。它与第二篇精讲形成补充,适合用来画出一次请求穿过完整系统的路径。 读者可以据此标记每一轮传输了什么、哪里发生等待、哪些内容可缓存,以及失败后从哪一步重试;把循环画出来,常常比先换模型更容易找到浪费。 模型好不好用,谁说了算?从榜单崇拜到自建评测 公开榜单能提供行业坐标,却无法保证模型适配具体业务。文章建议用真实任务建立自有测试集,并警惕古德哈特定律:指标一旦成为目标,就可能不再代表原本希望衡量的质量。 自建测试集也需要持续更新,避免样本被模型或团队记住后失去区分度;更稳妥的做法是保留线上失败案例,定期让人工判断与自动评分重新对齐。 对话叶奇意:中国两代 AI、人才迁徙与 AGI 信仰 投资人 Kiwi 回顾中国 AI 十年两代创业浪潮,讨论人才、资本、算力与工程经验如何跨周期传承,也谈到从存量数据范式向强化学习范式迁移。它更适合作为亲历者视角,而非对整个行业的唯一解释。 文章把月之暗面的早期投资故事放进更长的人才迁徙与产业周期,能帮助读者理解团队为何在特定时间聚集;人物经验提供线索,但市场结果仍受算力、产品和组织执行共同影响。 人格工程:AI 合成人格实战指南 这份实践指南讨论如何构建、测试和校准 LLM 合成人格,并把它作为市场研究中的有限预测工具。关键边界是把合成人格当假设生成与探索手段,持续与真实人群数据核对。 合成人格看似稳定,不代表它能替代真实消费者的偏好与行为;使用时应记录设定、模型版本和校准样本,避免把一次生成结果包装成确定的人群洞察。 Alexandr Wang 谈创业信念、训练数据与智能体未来 Alexandr Wang 从 Scale 的数据优先判断出发,讨论创始人的独立信念、训练数据、智能体编排和系统思维。与第一篇相照,它提醒创业信念需要落到可积累的数据与组织能力。 当模型能力快速变化,单次功能优势容易消失,数据闭环和系统执行更可能形成持续积累;访谈仍属于创始人经验,适合拿来审视自己的假设,而不是直接复制路径。 ## 今日阅读路径 如果只有十分钟,先读第二篇 GPT‑5.6,建立端到端效率的系统边界;如果正在做智能体产品,再接着读第三篇,把能力落成可测、可治理的 Skill。准备创业或重新选择产品方向的读者,可以最后回到第一篇,用证据更新点检查自己的逆共识判断。 读完后可以想一想:你的团队最近节省的实现时间,被用来扩大问题还是堆叠旧功能?你衡量智能体成本时,是否包含重试、工具等待和人工返工?欢迎在评论里分享你的任务、测量方式与仍然拿不准的边界。 ## 👉 近期早报 - BestBlogs 早报 · 2026-07-29 - BestBlogs 早报 · 2026-07-28 - BestBlogs 早报 · 2026-07-27 - BestBlogs.dev 第 105 期:明与暗 - BestBlogs.dev 第 104 期:判断力回归 - BestBlogs.dev 第 103 期:系统新信号 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。  ## 相关链接 - [ginobefun](https://x.com/hongming731) - [@hongming731](https://x.com/hongming731) - [1.2K](https://x.com/hongming731/status/2082607511832826031/analytics) - [在线阅读本期早报](https://www.bestblogs.dev/explore/brief/2026-07-30) - [BestBlogs.dev](https://bestblogs.dev/) - [Sam Altman:为什么现在可能是创办公司的最佳时机](https://www.bestblogs.dev/video/9486a453e) - [GPT-5.6 如何将前沿智能与前沿效率融合](https://www.bestblogs.dev/article/1237e03a4e) - [技能即新功能:构建以技能为中心的智能体 Harness](https://www.bestblogs.dev/video/fd0779622) - [相关性 ≠ 因果性:因果推断在 AI 评测归因中的方法与实践](https://www.bestblogs.dev/article/6e41628f05) - [生产环境中 MCP 的安全防护:超越网关的纵深防御](https://www.bestblogs.dev/article/f839ba7461) - [Morgan Stanley Alpha Lab:从自动化量化研究到自我改进的研究环境](https://www.bestblogs.dev/video/b2dab0d7e) - [当所有人都在给 AI 造缰绳,马厩正在消失](https://www.bestblogs.dev/article/f822c922e3) - [微软面向 AKS 上 AI 智能体的三层 LLM 路由架构](https://www.bestblogs.dev/article/82f4072abb) - [使用工具变量进行产品实验:在 Python 中消除 LLM 路由决策的混杂效应](https://www.bestblogs.dev/article/cc24450eff) - [SimilarWeb 如何使用 LangSmith 评估智能体报告](https://www.bestblogs.dev/article/8fd2379868) - [SimulationMaxxing:用仿真加速 AI 智能体交付](https://www.bestblogs.dev/video/ce917aeca) - [存储暴跌,一夜惊魂](https://www.bestblogs.dev/article/35090e1e76) - [为什么现成的 AI 无法真正理解金钱](https://www.bestblogs.dev/video/35896967c) - [攻克 Windows 之门:将 RADV 移植到 WIN32](https://www.bestblogs.dev/article/79b1696ff0) - [卖 Token 还是卖结果:AI 商业模式的几个悖论](https://www.bestblogs.dev/article/5497b5defb) - [ChatGPT 如何优化其智能体循环:编排层、API 与推理层](https://www.bestblogs.dev/article/928222df59) - [模型好不好用,谁说了算?从榜单崇拜到自建评测](https://www.bestblogs.dev/article/0bf84edaa8) - [对话叶奇意:中国两代 AI、人才迁徙与 AGI 信仰](https://www.bestblogs.dev/article/140d2015f8) - [人格工程:AI 合成人格实战指南](https://www.bestblogs.dev/video/55d0de2d4) - [Alexandr Wang 谈创业信念、训练数据与智能体未来](https://www.bestblogs.dev/video/2029aa403) - [BestBlogs 早报 · 2026-07-29](https://www.bestblogs.dev/explore/brief/2026-07-29) - [BestBlogs 早报 · 2026-07-28](https://www.bestblogs.dev/explore/brief/2026-07-28) - [BestBlogs 早报 · 2026-07-27](https://www.bestblogs.dev/explore/brief/2026-07-27) - [BestBlogs.dev 第 105 期:明与暗](https://www.bestblogs.dev/newsletter/issue105) - [BestBlogs.dev 第 104 期:判断力回归](https://www.bestblogs.dev/newsletter/issue104) - [BestBlogs.dev 第 103 期:系统新信号](https://www.bestblogs.dev/newsletter/issue103) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [7:21 AM · Jul 30, 2026](https://x.com/hongming731/status/2082607511832826031) - [1,205 Views](https://x.com/hongming731/status/2082607511832826031/analytics) --- *导出时间: 2026/7/30 10:50:51*
A Agent Harness 拆解:AI Agent 的工程化基础设施 本文深入探讨了 Agent Harness 的概念,即包裹在 LLM 外部、将无状态模型转化为可用智能体的完整软件基础设施。文章引用了 Anthropic、OpenAI 和 LangChain 的实践,详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、记忆系统、上下文管理、验证循环等),并阐述了如何通过优化这层“操作系统”来解决遗忘、工具调用失败和上下文腐烂等工程难题。 技术 › Harness Engineering ✍ 土豆本豆🕐 2026-05-21 AgentHarnessLLM架构设计LangChainClaudeOpenAI上下文管理工程化Agent拆解
C ChatGPT Agent Loop 优化技术解析 本文深入解析了 ChatGPT 如何通过 Harness、API 和 Inference 三层架构优化 Agent 循环,重点介绍了持久化 WebSocket、增量 Token 化、KV 缓存管理和推测解码等技术,以降低成本并提升效率。 技术 › Harness Engineering ✍ Bytebytego🕐 2026-07-30 Agent优化LLM架构ChatGPTOpenAI性能成本控制WebSocketTokenization
对 对话百川智能郭美青:你辛苦做的 Skill,最后都成了大模型的「养料」 本文是 AIGCLINK 与百川智能技术总监郭美青的对谈。双方探讨了 Skill 的本质是模型补丁,指出优质的 Skill 易被大模型内化成训练养料;同时梳理了 Harness、Loop、Graph 等新概念背后的技术演进逻辑。最后建议从业者不要将当下视作终局,应从生意出发,从上往下构建确定性,以应对底层技术的快速迭代。 技术 › Skill ✍ AIGCLINK🕐 2026-07-26 Agent大模型百川智能SkillAI创业HarnessLoop技术趋势行业观察职场建议
什 什么是图工程及其走红原因解析 文章解释了从“循环工程”到“图工程”的技术演进。循环是简单的单一代理执行模式,而图(由节点、边和状态组成)通过可视化的流程图处理复杂逻辑和多代理协作。文章介绍了如何使用 LangGraph 构建第一个图,并指出在逻辑变得复杂时应从循环升级到图。 技术 › Agent ✍ Alex Martin🕐 2026-07-21 Graph EngineeringLangGraphAgentLoopsLLMClaudeOpenAI教程
C Claude Skills: 如何通过 Anthropic 的新功能节省 Token 并提升效率 文章介绍了 Anthropic 推出的 Claude Skills 功能,通过文件夹和 YAML 配置实现渐进式披露,显著减少 Token 消耗和重复解释。详细说明了技能的构建规则、命名规范、测试方法及分发策略,帮助用户将聊天机器人转化为高效的专业工程团队。 技术 › Skill ✍ Mr. Buzzoni🕐 2026-07-17 ClaudeSkillTokenAnthropicDevOps工具与效率LLMMCPAgent
角 角色重构——工程师从「写代码的人」变成「编排 Agent 的人」 本文探讨了在 AI 时代,工程师角色的根本性转变。通过 OpenAI、Spotify 等案例,指出工程师正从「写代码的人」转变为「编排 Agent 的人」。文章详细阐述了新角色的四个维度:设计约束、编写 Spec、构建 Harness 和审阅产出。团队结构也随之重组,从按技术栈分工转向按 Spec/Review/Harness 流程分工。 技术 › Harness Engineering ✍ SagaSu🕐 2026-07-09 AIAgent角色重构OpenAISpec工程师HarnessDevOps生产力
H Hermes Agent 架构详细拆解:工业级 Agent 框架底层运行时揭秘 本文详细拆解了 Hermes Agent 的底层架构,将其定义为工业级运行时而非简单的 LLM 循环。文章类比前端工程模式,阐述了 Agent = Harness + Model 的核心公式。重点解析了从平台入口、适配器层、事件总线、GatewayRunner 核心调度层到 AI Agent 执行层的五层架构,揭示了 Hermes 如何通过共享线程池、会话复用和生命周期管理,实现高并发、有状态且安全可靠的 Agent 运行环境。 技术 › Hermes ✍ MateMatt🕐 2026-07-07 AgentHermes架构设计LLM事件总线多线程源码解析运行时HarnessReAct
人 人工智能的工程全景(下):Agent 全解 本文是《人工智能的工程全景》系列的下篇,深入探讨了2025-2026年AI行业的竞争焦点——Agent工程层。文章从Agent定义的演变出发,区分了Workflow与Agent的本质差异,解析了ReAct架构与关键能力清单。重点介绍了Function Calling的工业化起点、MCP协议带来的工具调用标准化,以及Context Engineering与Harness Engineering在Agent系统构建中的核心地位。 技术 › Agent ✍ snowboat🕐 2026-07-03 AgentMCPLLMContext EngineeringHarnessTool UseReAct人工智能工程化
盘 盘点16个把自己蒸馏成Skills的国民级App 文章盘点了瑞幸、麦当劳、飞猪、滴滴等16款国民级应用,这些产品正通过封装Skill、MCP或CLI接口,向Agent开放点咖啡、订票、打车、办公等核心能力。作者指出这标志着Agent化时代的到来,并对比了当前支付环节的“信任”壁垒,认为该趋势类似于2017年小程序爆发的前夜,未来Agent将成为人们在数字世界的另一个“贾维斯”。 技术 › Agent ✍ 数字生命卡兹克🕐 2026-06-25 AgentSkillMCP瑞幸咖啡飞书滴滴OpenAI趋势观察大模型生态
把 把 Skill 工作流打包成电脑 App 的新玩法 文章介绍了使用 KroWork 将 AI Skill 工作流打包成本地桌面 App 的新方法。作者指出单纯依赖对话框使用 Skill 存在重复输入和消耗额度的问题,通过 KroWork 可以将常用的 AI 技能组合(如提示词优化、AI 资讯阅读)封装成独立 App,支持定时任务和一键启动,从而实现自动化工具的沉淀与本地化复用。 技术 › Skill ✍ 卡尔的AI沃茨🕐 2026-06-25 SkillAgent工作流本地应用自动化效率工具KroWorkOpenAI
万 万字长文:做了些爆款 Skills 以后,我对 Skills 的看法 本文通过作者制作多个爆款 Skill(如 PPT、社交媒体卡片、Logo 生成等)的实战经验,深入探讨了 Skill 在 AI 时代的本质与价值。作者指出,Skill 不仅是提示词,更是封装专家经验、工作流和审美判断的“能力商品”,能有效弥合 Agent 使用中的认知差距。文章详细阐述了 Skill 的设计哲学(中心短、辐射厚)、像代码一样的维护流程,以及如何通过“把品味变成约束”来保证高质量输出。 技术 › Skill ✍ 歸藏(guizang.ai)🕐 2026-06-12 AgentSkillLLM上下文工程提示词工程产品设计经验封装DevOps交互设计AI应用
S Skill 工程化指南:解决不稳定与高 Token 消耗 文章指出 AI Skill 在应用中常因大模型的不确定性导致运行不稳定和 Token 消耗过高。作者提出应将确定性流程(如固定代码、参数)沉淀为脚本,仅让大模型负责逻辑判断与调度。通过视频字幕处理案例,详细演示了四步工程化法,并提供了可直接复制的工程化提示词,帮助用户实现流程稳定化与成本优化。 技术 › Skill ✍ 金尘马🕐 2026-06-03 AgentSkill工程化提示词DevOpsLLMCodexToken 优化工作流自动化