# 看完 Jason Liu 75 分钟实战,Codex 真正好用的分界线出现了
**作者**: 烟花老师
**日期**: 2026-07-28T16:09:39.000Z
**来源**: [https://x.com/teach_fireworks/status/2082136413462773936](https://x.com/teach_fireworks/status/2082136413462773936)
---

这两年看 Codex 教程,常见套路都很猛:模型开到最高,MCP 和 Skills 装满,一口气拉起几个 Agent,屏幕上的任务飞快往前跑。
Jason Liu 这场 75 分钟 workshop,开头却没那么爽。
Agent 越能干,一个人同时开的线程越多。最后先吃紧的,慢慢变成了自己的脑子:哪个任务还在跑,谁等着回复,什么必须今天收口,哪条结论已经过时。
看到这里有点扎心。
以前嫌 AI 干得慢,现在它快起来了,人反而先乱了。
Jason 给出的解法,也没有停在“再写一条更好的 Prompt”。他把长期线程、文件记忆、工具、定时唤醒、可验证目标和人工审阅接在一起,让一件工作有地方住、有东西可查、能继续推进,也知道什么时候该停。
Codex 真正好用的分界线,在于工作有没有变成一个可持续、可审阅、会停止的闭环。

Jason Liu 讲到知识工作的瓶颈正在变成记住发生过什么
<small>03:05|AI 提高了并发,也把“记住发生过什么、谁在等待、什么重要”推成新的负担。</small>
> 本文依据完整视频、时间戳字幕、Jason Liu 第一方文章与仓库、OpenAI 白皮书整理。视频中的个人数字和案例只作为经验,不当成产品 benchmark。
## 一个人同时盯很多事,问题就变了
Jason 在视频里说,一大部分知识工作正在变成“记住发生过什么”。
这句话很朴素,却比很多 Agent 架构图更接近真实使用。
当 Agent 一次只能改一个函数,人盯着它就行。现在它能查资料、写代码、做幻灯片、整理邮件,还能把任务交给其他线程。并发一下子上来了,人的注意力却没有升级。
于是桌面上很快多出一堆半截任务。
有的在等外部回复,有的需要验收,有的已经跑偏,只是暂时还没报错。再强的模型,也不会自动替人决定今天最重要的三件事。
Jason 展示了六个常用支点:语音、Skills、Automations、线程通信、Compaction 和 Goal。

Jason Liu 在 workshop 中列出的六个工作支点
<small>05:05|这些能力共同解决输入、复用、持续运行、协作、上下文压缩和完成标准。</small>
单看每一项都不算神奇。语音把想法交给固定线程,Automation 按时叫醒它,Goal 再用测试判断是否结束,几项能力这才接上。
语音负责把脑子里还没整理好的东西倒进去;Skill 保存反复出现的做法;Compaction 让长线程继续活着;Automation 负责在需要时叫醒它;Goal 给工作一个可以验证的终点。
从这里开始,聊天框才慢慢有了“工作台”的样子。
## 长线程先得有一个家
Jason 会给重要工作保留固定线程,并把它们置顶。Chief of Staff、Agents SDK、OpenAI CLI、开源项目,各有自己的长期入口。
他在视频里提到,有些线程已经持续数周,期间还调度过大量 Subagent。这个数字很抓眼球,不过它更像个人工作强度记录,不能拿来当性能结论。
更值得抄的是另一件小事:重要工作不要每次从一张白纸开始。
一个项目有固定线程,旧决定、偏好、待办和失败经验才有机会连续起来。Compaction 会把很长的对话压缩,线程因此能继续使用,代价是细节可能被压掉,长线程也可能更贵。
所以光靠聊天历史还不够。

Jason Liu 展示个人 monorepo 作为长期工作的共同入口
<small>18:05|个人 monorepo 把项目、人物、实验、Skills 和说明文件放在同一个可维护目录里。</small>
Jason 的做法是再给这些线程一个共同的文件目录。仓库放代码,Vault 放人物、项目、决定、开放问题和每日记录。不同线程都可以从这里读,也可以把新发现写回来。
这样一来,线程是入口,文件才是能留下来的底稿。
## 记忆要能打开、修改、做 diff
很多产品把“记忆”讲得很玄。
Jason 的版本反而很工程:写成文件,放进 Git。
这样做有三个好处。
第一,记忆可以被人直接打开。写错了就改,过时了就删,不需要猜模型到底记住了什么。
第二,git diff 会留下变化。Agent 认为“这个人喜欢什么”“项目在等谁”“哪个决定已经落地”,都能被审阅。
第三,就算线程压缩得不好,甚至整个会话丢了,重要上下文还在磁盘上。
说实话,这比“拥有无限记忆”让人踏实得多。
这次处理这段 75 分钟视频时,工作目录也采用了类似思路:1975 条带时间字幕、原始画面、关键截图、信源表、正文、QA 和 API 回执分别落盘。
会话可以被压缩,关键材料仍然能复查;文章里哪张图来自几分几秒,也能重新核对。
这个小验证只能说明文件化上下文对本次长任务确实有用,无法替所有团队下结论。它至少把“记忆”从一句宣传词,变成了一组能检查的东西。
## Heartbeat 和 Goal,管的是两种不同的失控
长任务最容易出现两个问题。
一种是外部世界还在变化。PR 可能来了新评论,Slack 可能多了一条反馈,客服可能终于上线。
另一种是工作本身还没有做好。测试没过,迁移没完成,页面仍有问题,需要继续迭代。
Jason 用 Heartbeat 和 Goal 把它们分开。

Heartbeat 与 Goal 的适用场景对比
<small>39:50|Heartbeat 适合等待外部状态变化;Goal 适合围绕验证标准持续改进。</small>
Heartbeat 像闹钟。它隔一段时间唤醒线程,检查外部有没有新情况;条件满足后改变频率,事情结束就停止。
Goal 更像一张终点清楚的任务卡。Agent 可以持续推进,但必须面对一个验证器。测试、截图、对账结果或其他可重复检查,决定它是不是真的完成。

Ultra Goal 将目标、计划与运行状态写入文件
<small>41:20|把 Goal、Plan 和 State 写成文件,人可以在运行中查看和修改方向。</small>
Jason 用 Python 的 Rich 库迁移到 Rust 举例:原项目测试就是现成的裁判。这个案例无法证明迁移结果适用于所有项目,却把关键机制讲清楚了——长时间运行本身没有价值,能不断逼近一个可验证结果才有价值。
这里还藏着一个常被忽略的安全阀:停止条件。
Heartbeat 不能永远检查,Goal 也不能无限烧 Token。什么时候结束、什么时候转人工、最多尝试几轮,最好在启动时一起写清楚。
## 工具越多,边界越要清楚
视频后半段,Jason 把行动界面分得很细:Connector 负责结构化服务,浏览器工具处理网页,Computer Use 处理只存在于 GUI 里的工作,Skill 则把重复流程包装起来。

Jason Liu 总结 Connector、浏览器、Computer Use 与 Skill 等行动界面
<small>52:40|同一件事可能有多条行动路径,稳定性、权限和可核验程度并不相同。</small>
工具一多,很容易变成“能点就点”。
有稳定 API 的操作,通常优先走 API;它会返回明确 ID、状态和错误,失败也容易定位。只有目标系统没有合适接口,工作又确实只存在于 GUI,Computer Use 才更合适。
这篇文章交付到 X 时,就只走官方 API。封面和正文图片分别上传,Article 创建后保存返回 ID、精确 payload 和哈希,不让 Agent 在浏览器里模拟点击。
这不代表 API 永远不会失败。它只是让“做过什么、结果是什么”更容易核对。
Jason 的个人仓库也把外部动作写得很克制:发消息、改会议、写共享文档、安装插件、修改长期记忆,都应该先获得明确许可。
Agent 能力越强,这些边界越重要。成熟的自动化,会把权限、证据和人工确认一起设计进去。
## 人不用一直盯着,但要能随时接手
Jason 在一张幻灯片上写了一句话:Codex does not need a puppet。
意思很直接,别把 Agent 当成需要每一步遥控的木偶。

给独立线程定义证据、下一步和停止条件
<small>57:10|让线程独立工作时,至少交代它要留下什么证据、下一步是什么、何时停止。</small>
放手也不等于失控。
一个靠谱的长期线程,应该随时说得清三件事:刚刚做了什么,证据放在哪里,接下来准备做什么。遇到需要授权的动作就停,验证器失败就换假设,任务完成就收口。
人不必盯着每一次工具调用,却应该能从产物、diff、截图和回执重新接管。
到了这里,Side panel、文件化记忆和线程控制才连成一体:工作持续往前,人仍然看得见,也改得动。
## 现在开始,先搭这四层
把 75 分钟 workshop 压成一张图,大概就是下面这个闭环。

把 Codex 变成长期工作台的四层闭环
<small>机制图|依据视频与第一方材料整理。“工作之家、可审阅记忆、持续机制、刹车系统”是本文归纳。</small>
第一层,给重要工作一个固定的家。
可以是一条置顶线程,也可以是一个项目目录。关键是下次回来不必重新解释全部背景。
第二层,把重要记忆写成文件。
人物、项目、决定、待办和踩坑记录都可以落盘,并用 diff 审阅变化。
第三层,分清持续机制。
外部状态可能变化,用 Heartbeat;工作需要围绕验收标准继续改,用 Goal。两者都要有频率、预算和停止条件。
第四层,装上刹车。
测试、截图、API 回执和人工审阅负责判断质量;发消息、发布、付款、删数据这类外部动作,留给明确授权。
这套做法看起来没有“一条神奇 Prompt”那么刺激。
可跑过长任务后就会发现,Agent 一次做了多少很快会过去。隔几个小时回来,仍然知道它做到了哪一步、哪里有证据、接下来该谁接手,才让人安心。
当工作有地方住,记忆能被检查,任务有终点,Agent 才开始像一个长期搭档。
原始来源
1. 完整 workshop:https://www.youtube.com/watch?v=il1c1a2FufU
2. Jason Liu《Codex-maxxing》:https://jxnl.co/writing/2026/05/10/codex-maxxing/
3. OpenAI 白皮书《Codex-maxxing for long-running work》:https://cdn.openai.com/pdf/8a9f00cf-d379-4e20-b06f-dd7ba5196a11/OAI_WhitePaper_Codex-maxxing26.pdf
4. Jason Liu 的 personal monorepo 模板:https://github.com/jxnl/personal-monorepo-template
5. Jason Liu《Six levels of complexity in a Codex morning brief》:https://jxnl.co/writing/2026/05/18/six-levels-of-complexity-of-an-ai-powered-morning-brief-with-codex/
## 关于我的付费专栏
我在墨问持续更新「硬核 AI 洞察第二季」,面向产品经理、AI 工程师、创业者和企业管理者。
这里重点整理普通资讯流里很难获得的内容:
重要论文与技术报告的中文压缩解读、Agent 与 Harness 工程实践、模型和产品的非公开实测、开源项目机会,以及值得持续追踪的行业信号。
每篇尽量给出原始出处,并明确区分事实、发布方说法和我的判断。
希望它不只是帮你“知道发生了什么”,还能帮你判断下一步该做什么
目前已有200+订阅,并且会长期存在有一个专门的微信群,
订阅
「硬核 AI 洞察第二季」:
https://note.mowen.cn/detail/aP693s9ahkAtCkkRk8-i9
## 相关链接
- [烟花老师](https://x.com/teach_fireworks)
- [@teach_fireworks](https://x.com/teach_fireworks)
- [https://www.youtube.com/watch?v=il1c1a2FufU](https://www.youtube.com/watch?v=il1c1a2FufU)
- [https://jxnl.co/writing/2026/05/10/codex-maxxing/](https://jxnl.co/writing/2026/05/10/codex-maxxing/)
- [https://cdn.openai.com/pdf/8a9f00cf-d379-4e20-b06f-dd7ba5196a11/OAI_WhitePaper_Codex-maxxing26.pdf](https://cdn.openai.com/pdf/8a9f00cf-d379-4e20-b06f-dd7ba5196a11/OAI_WhitePaper_Codex-maxxing26.pdf)
- [https://github.com/jxnl/personal-monorepo-template](https://github.com/jxnl/personal-monorepo-template)
- [https://jxnl.co/writing/2026/05/18/six-levels-of-complexity-of-an-ai-powered-morning-brief-with-codex/](https://jxnl.co/writing/2026/05/18/six-levels-of-complexity-of-an-ai-powered-morning-brief-with-codex/)
- [https://note.mowen.cn/detail/aP693s9ahkAtCkkRk8-i9](https://note.mowen.cn/detail/aP693s9ahkAtCkkRk8-i9)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [12:09 AM · Jul 29, 2026](https://x.com/teach_fireworks/status/2082136413462773936)
- [1,087 Views](https://x.com/teach_fireworks/status/2082136413462773936/analytics)
---
*导出时间: 2026/7/29 14:43:18*