返回

ChatGPT Work(Codex)之道:用管理的逻辑了解和使用AI Agent(准备工作&框架)

作者 兴之所志 发布于 2026.07.14 AI办公之道

ChatGPT Work(Codex)之道:用管理的逻辑了解和使用AI Agent(准备工作&框架)

一、引言

上次写过一篇《[[9-兴之所志/AI办公之道/Claude Code基础教程:用管理的逻辑打开AI Agent|Claude Code基础教程:用管理的逻辑打开AI Agent]]》,借用管理四职能的分类——计划、组织、领导和控制——较为全面地介绍了 Claude Code CLI 的功能。不过,目前我使用更多、也更愿意向别人推荐的 AI Agent,是 OpenAI 推出的原 Codex 桌面版,现已升级为 ChatGPT 桌面版。

ChatGPT 桌面版包含聊天、Work 和 Codex 三个产品入口。其中,聊天就是之前的网页聊天,ChatGPT Work 和 Codex 则基本对应原 Codex 桌面版的日常工作模式和编码模式,两者目前区别不大,功能也比较接近。本文以 ChatGPT Work 桌面版(网页端和手机端 ChatGPT 另有云端版的 Work,不在本文涉及范围之内)为主体,相关内容也基本适用于 Codex 桌面版。

对于 ChatGPT Work 这类办公类 AI Agent 的介绍和使用场景,我在《[[9-兴之所志/AI产品/说说目前在用的AI产品和工具(2026年6月)|说说目前在用的AI产品和工具(2026年6月)]]》、《[[9-兴之所志/AI产品/开了 ChatGPT Plus 却不用 Codex,你可能白白浪费了 10 美元|开了 ChatGPT Plus 却不用 Codex,你可能白白浪费了 10 美元]]》等文中分别进行了介绍和说明,这里不再赘述。

ChatGPT Work(Codex)分享系列,将继续沿用《[[9-兴之所志/AI办公之道/Claude Code基础教程:用管理的逻辑打开AI Agent|Claude Code基础教程:用管理的逻辑打开AI Agent]]》中提出的管理四职能框架,梳理 ChatGPT Work 的相关功能。管理四职能通常按照计划、组织、领导和控制展开,但是从理解和使用 AI Agent 的角度而言,我个人感觉四者的重要性依次是领导、组织、控制和计划,因此本系列也将按照这个顺序展开。通过这样一个框架,可以让纷繁复杂的 AI Agent 功能显得更有层次,也更便于理解、记住和使用。

本文是本系列的第一部分,主要介绍使用 ChatGPT Work 前需要做好的准备工作,并在此基础上概括领导、组织、控制和计划四个部分的基本内容。后续文章将围绕这四个部分分别展开,不断深入地探索 ChatGPT Work 的相关功能和使用技巧。 03-summary-management-functions

二、准备工作:进入 ChatGPT Work

1 安装与登录

打开 ChatGPT 网页下载页面,可以看到 macOS 和 Windows 两个下载入口。Windows 用户点击“Windows”后,会进入微软应用商店的 ChatGPT 下载页面,点击下载即可得到一个不足 2M 的在线安装包。

Pasted image 20260710175723

双击安装包,它会自动下载完整的安装文件并完成安装。安装结束后,ChatGPT 会自动启动并进入登录界面。如果有 ChatGPT 账号,建议直接使用账号登录,相比使用 OpenAI API 密钥要划算很多。 Pasted image 20260710180222

Pasted image 20260710180857

除了直接登录 ChatGPT 账号,也有人希望接入 DeepSeek 等第三方模型。虽然原 Codex 桌面版也可以通过修改配置文件接入第三方模型,理论上新版 ChatGPT 桌面版应该也可以,但由于我并未尝试过,也不能完全确定。而且即便能够接入,据我所知,ChatGPT 桌面版需要使用 OpenAI Responses API,而国产模型厂商对 Responses API 的兼容程度也很不一样,折腾起来也比较复杂。

不过市面上也有一些软件可以帮助 Codex 接入第三方模型,只是我觉得这种方式不够优雅,所以也没有使用。如果确实需要在 ChatGPT Work 中接入国产模型,可以搜索一下 CC Switch。

相比借助第三方软件把国产模型接入 ChatGPT Work,个人更倾向直接使用模型厂商自己推出的办公 Agent 产品,比如阿里的 QoderWork、腾讯的 WorkBuddy、智谱的 ZCode、字节的 TRAE Work、月之暗面的 Kimi Work。这类办公 Agent 产品的界面和功能大概率会逐渐趋同,抓住了产品的一些基本要素,实际使用起来应该不会有特别大的差别。

2 认识软件界面

登录 ChatGPT 桌面端后,默认可以看到左侧边栏(Sidebar)任务区域。左侧边栏用于切换入口、项目和任务等,任务区域则用于交代任务和查看执行过程。如果左侧边栏处于收起状态,点击左上角的按钮即可打开。需要时,还可以通过右上角的按钮展开右侧面板(Side Panel)底部面板(Bottom Panel)Pasted image 20260710234933

左侧边栏从上到下依次包括以下内容: 1. 工作模式:点击左上角的 ChatGPT Work,可以在 WorkCodex 两种模式之间切换。两者的差异目前主要在于对Git的支持,不是编程一般默认Work即可。 2. 主要按钮: - 搜索按钮用于查找已有任务或运行命令; - 新建任务用于开启一项独立工作; - 已安排(定时任务) 可以让 ChatGPT 按照设定的时间自动执行工作; - 插件用于给 ChatGPT Work 增加专门的工作能力,比如安装MCP、skill,连接邮箱、日历等; - 站点用于查看和管理 ChatGPT Work 创建的网站; - 聊天用于进入大家比较熟悉的 ChatGPT 对话。目前这个入口的设计比较简单,网上也有不少吐槽,未来可能还会继续完善。 3. 项目任务列表:显示已经新建或打开的项目及项目任务。点击项目名称,可以打开该项目下的任务列表;再点击具体的任务名称,即可进入相应任务。 4. 独立任务列表:显示没有归入任何项目的任务。这些任务单独列在左侧边栏的“任务”区域,点击任务名称即可进入相应任务。 5. 账号信息:点击左下角的账号名称,可以看到个人账号、设置和使用情况三个核心按钮。“个人账号”显示当前登录的 ChatGPT 账号;“设置”用于调整软件的各项配置;“使用情况”用于查看当前账号的额度消耗情况。

任务区域是交代任务和查看执行过程的地方。任务开始前,这里显示任务输入框以及项目、权限和模型等选项;任务开始后,还会持续显示你与 ChatGPT 的对话内容、任务执行过程和最终结果。任务输入框包括以下几个部分: 1. 项目:输入框顶部用于选择当前任务使用的项目。没有选择项目时显示“选择项目”,选择后则显示项目名称。不选择项目也可以直接交办任务;选择项目后,当前任务可以使用其中的共享材料和本地文件。 2. ➕(添加内容):点击输入框左下角的加号,可以把文件、Agent、插件或其他任务添加到当前任务中。 3. 权限模式:选择 ChatGPT Work 执行操作时如何处理权限请求,包括“请求批准”“替我审批”和“完全访问权限”三种模式。刚开始保持默认选择“请求批准”即可。 4. 模型与思考深度:输入框右下角用于选择执行任务的模型、推理强度和速度,模型越高级、推理强度越强,速度越快(指的是同一个模型同一种推理强度下的不同速度),费用越高,订阅的周限额消耗越快。 5. 语音输入:麦克风按钮用来进行语音输入。与 AI Agent 交流时,个人非常推荐使用语音,而不是打字。语音输入完成后,最好在发送前快速检查一下人名、数字和专有名词,避免错误信息误导 Agent。如果担心自带的语音输入消耗本就捉襟见肘的用量,或者网络连接不稳定,也可以使用其他靠谱的语音输入工具,比如电脑微信自带的语音输入功能、微信输入法现也支持语音输入。

右侧面板和底部面板是两个可以放置标签页的辅助面板,一个从主界面右侧展开,一个从底部展开。它们是同一套面板,只是展开的位置不同,通常可以打开的标签页包括:

  1. 浏览器:打开 ChatGPT Work 的内置浏览器,用于查找网页、操作网站或者查看任务涉及的页面。
  2. 文件:选择项目目录后,可以查看当前工作目录下的文件,并直接预览具体内容。任务执行过程中,点击Agent发出的文件链接,即可在右侧面板快速预览,检查 ChatGPT Work 修改后的结果。
  3. 侧边任务:在任务区域运行主任务时,如果有相关问题,但是不想影响主任务进度,可以在侧边任务中询问,有点类似于Claude Code的/btw
  4. 终端:打开当前任务工作目录的集成终端,用于运行命令、脚本等。普通办公用户很少需要使用,可以忽视。

Pasted image 20260710212909

3 项目与工作目录

使用普通聊天时,我们通常会把问题和材料直接发在对话框中,在 ChatGPT Work 中也可以直接这么干。但由于 ChatGPT Work 更大的优势还在于可以直接查看、生成和修改电脑上的文件。所以在对话之前,为当前对话或任务选择一个项目是一个明智的选择。

在 ChatGPT Work 这类Agent产品中,可以把项目理解为一个工作文件夹,以及围绕这个文件夹开展的一组相关任务。项目关联的文件夹就是Agent的工作目录。选择项目,就是告诉 ChatGPT Work 主要在哪个文件夹里查找和处理文件。

基于是否创建项目以及如何创建项目,在正式开始对话和任务前,主要有以下四种情况。

第一种是不选择项目,直接交代任务。如果任务不需要批量读取或修改本地文件,可以不选择项目,直接交代任务,比如让 ChatGPT Work 查阅邮件或日程。

第二种是新建空白项目后再交代任务。点击输入框上方的“添加项目”,依次选择“新建项目”→“新建空白项目”。在当前的 Windows 版 ChatGPT Work 中,输入项目名称后,ChatGPT Work 会在用户目录的 Documents 文件夹下新建一个同名文件夹,并把它作为这个项目的工作目录。此后在该项目中开启的任务,都会显示在左侧边栏对应的项目下。

第三种是添加已有文件夹后再交代任务。如果资料已经放在本地文件夹、知识库或代码仓库中,可以点击输入框上方的“添加项目”,依次选择“新建项目”→“添加现有文件夹”,选择你要工作的那个文件夹即可添加完成。这个文件夹会成为该项目的工作目录。

第四种是在已有项目中新建新任务。如果之前已经新建过项目,或者添加过相应的文件夹,这个项目会保留在左侧边栏中。点击项目名称右侧的新建任务按钮,就可以直接在该项目中开启一项新任务,不需要再次选择文件夹。

4 开展任务(会话)

ChatGPT Work 目前把围绕一项工作展开的一段连续聊天称为任务(Task)。在其他 AI 产品中,也可能叫作“对话”“会话”或“线程”。名称虽然不同,本质上都是一段拥有独立聊天记录和上下文的连续交流。本文沿用 ChatGPT Work 当前的“任务”这一名称。

上一节说过,创建任务时,可以选择项目,也可以不选择项目,因此任务就分为无项目任务和项目任务两类。

无项目任务:没有选择项目的任务,会直接显示在左侧边栏的独立任务列表中。在当前的 Windows 版 ChatGPT Work 中,即便是没有选择项目的任务,ChatGPT Work 仍会在用户目录的 Documents/Codex/日期/ 下新建一个独立目录,作为这项任务的工作目录。

下图就是以上文提到的查阅日程任务执行过程,因为此前没有在 ChatGPT 中连接日历服务,ChatGPT Work 会提示安装谷歌日历插件。按照提示安装、账号登录和授权即可。 Pasted image 20260710214432

项目任务:选择项目后创建的任务,会显示在左侧边栏相应项目的任务列表中。同一项目中的多个任务均可查阅和编辑工作目录下的项目文件,但各自保留独立的交流记录和上下文。每项相对独立的工作最好单独新建一个任务,这样既方便日后查找,也能避免不同任务互相干扰。

下图是一个空白项目的任务示例,任务开始后,可以在任务区域查看 ChatGPT Work 的执行过程。它通常会先说明自己打算怎么做;如果执行过程中需要额外权限,还会弹出“请求权限”的提示,等待你确认。 Pasted image 20260711004046

经过一番操作,ChatGPT Work 最终生成了一份文档,并把它保存在我们选择的工作目录中。

如果用过 Claude Code,可能会注意到 ChatGPT Work 和 Claude Code 在文件修改权限上的差别:默认模式下,Claude Code 修改文件前通常会请求确认,而 ChatGPT Work 对当前工作目录内的文件往往会直接编辑,只有修改自身配置或超出允许范围时才会请求额外授权。 Pasted image 20260711004326

置顶摘要:如上图所示,在任务开始后,任务区域右上方会出现一张名为“置顶摘要”的小卡片,用于集中显示当前任务的重要信息。卡片通常会显示“输出”和“来源”:“输出”汇总 ChatGPT Work 生成的文件、网站等成果,“来源”汇总任务中使用的网页和其他资料。点击相应内容,可以直接打开查看。在 Codex 模式下,置顶摘要会显示更多的信息。相比之下,Work 模式下主要显示输出和来源,目前的作用相对简单。

文件预览:点击 ChatGPT Work 输出的蓝色链接,就可以在右侧面板中打开这个文件。从 Codex 升级到 ChatGPT Work 后,Markdown 文档的查看和修改变得更加丝滑:既可以查看源文件,也可以切换到预览模式,还可以直接在预览模式下修改文档内容。如果对于 Markdown 文档不是特别了解,可以参阅《[[9-兴之所志/AI办公之道/AI时代,你也可以了解一下Markdown|AI时代,你也可以了解一下 Markdown]]》。 Pasted image 20260711004427

不过,Office 文档格式的兼容性就没有这么好了,不能像 Markdown 那样直接在预览页面直接编辑,预览效果有时也比较一般。

5 基础操作

大多数时候,我们可以像与他人聊天一样,直接向 ChatGPT Work 交代任务。除此之外,下面这些常用操作也能让使用过程更加方便。

@ 引用文件:需要引用当前项目中的文件时,可以在输入框中输入 @,接着输入文件名,ChatGPT Work 会在上方列出匹配的文件。选择相应文件后,就相当于明确告诉它这次任务需要使用哪份材料,可以减少它自行查找文件的时间和 Token 消耗。例如,输入 @Markdown,就可以筛选文件名中包含“Markdown”的文件。

+ 添加内容:点击输入框左下角的 +,既可以选择当前项目或电脑其他位置的文件,也可以添加 Agent、插件和其他任务。如果文件已经在当前项目中,并且知道文件名,使用 @ 引用更方便;需要从其他位置选择文件,或者添加文件以外的内容时,则可以使用 +

/ 斜杠命令:在输入框中输入 /,ChatGPT Work 会列出当前可以使用的斜杠命令。斜杠命令包括 ChatGPT Work 自带的功能命令和已经启用的 Skill,你可以直接从列表中选择,也可以继续输入命令名称进行筛选,中英文都可以,比如 /plan/计划 的效果相同 Pasted image 20260712121632 Pasted image 20260712123543 ChatGPT Work(Codex)通过 / 调用 Skill,似乎更多是为了兼容 Claude Code 用户的使用习惯,因为 Skill 在 ChatGPT Work 已经有专属的 $ 调用符;输入 $,可以直接打开 Skill 列表并选择需要使用的 Skill。

Shift+Enter 输入换行:在任务输入框中,按 Enter 会直接发送消息;需要换行输入时,可以按 Shift+Enter

Esc 终止任务:如果刚刚手速过快,发出了明显有问题的提示词,或者发现 ChatGPT Work 在执行过程中已经明显跑偏,继续执行只会浪费时间和 Token,就可以快速按两次 Esc 终止当前任务,然后修改或重新输入正确的提示词。

任务执行中发送消息:ChatGPT Work 执行任务时,你可以继续发送提示词,对于新发出的提示词,ChatGPT Work 有“排队(Queue)”和“引导(Steer)”两种处理方式。默认设置下,输入新提示词并按 Enter,会按照排队方式处理;按 Ctrl+Enter,则会按照引导方式处理。你也可以在“设置 → 常规 → 编辑器 → 跟进行为”中,把默认方式改为引导。

排队(Queue):新提示词会暂时显示在输入框上方,等 Agent 完成当前工作并停下来后自动发送,相当于提前安排好下一条任务或要求。消息发出前,可以修改或删除;如果不想继续等待,也可以点击右侧的“引导”或者直接按 Ctrl+Enter,这条提示词就会按引导的方式处理。 Pasted image 20260713150054 引导(Steer):新提示词会直接加入当前正在执行的这一轮任务,让 Agent 立即看到你刚补充的要求,并据此调整接下来的工作。例如,发现 Agent 正准备读取一批不需要的文件,可以马上发送“这些路径下的文件不用看,与当前任务无关”。这种方式适合及时纠正方向、补充遗漏信息或者添加当前任务马上要用到的材料,不需要用 Esc 终止任务。

01-comparison-queue-vs-steer

退出与继续:退出 ChatGPT 应用不会删除项目和任务记录。下次打开 ChatGPT Work 后,仍然可以从左侧边栏找到原来的项目和任务,继续上次的工作;也可以直接新建任务,开启一项新的工作。

6 远程控制

远程控制是指将手机端 ChatGPT 与 ChatGPT 桌面版进行配对。配对后即便离开电脑也能在手机延续电脑上的工作,比如查看任务进展、回复问题、批准操作等。

配对方式:在 ChatGPT 桌面版左侧边栏依次点击“账号信息 → 设置 → 连接 → 添加”,桌面端会弹出配对二维码。 Pasted image 20260713100111

然后在手机端打开 ChatGPT 的“Remote”,依次点击“我已在桌面版登录 → 我有配对码”,扫描桌面端显示的二维码,等待连接完成。 0e0c11d351357f20e1b2f6c8f2a6e4fb

连接成功后,桌面端会显示配对成功。已经连接的设备,可以在“设置 → 连接”中查看和管理。 Pasted image 20260713101406

需要特别说明的是,Remote 只是让手机远程控制电脑端的任务,项目文件、登录状态、工具和运行环境仍由电脑提供。因此,电脑需要保持开机、联网,并让 ChatGPT 桌面版继续运行;如果电脑进入睡眠或休眠状态、断开网络,或者彻底退出应用,远程连接就会中断。

02-comparison-remote-control

此外,手机端 ChatGPT 和网页目前也提供了单独的 ChatGPT Work 功能。这是一个在云端运行、仍在发展中的独立产品,不是本文介绍的电脑端 ChatGPT Work,也不要把它与前面介绍的通过手机端 Remote 管理桌面版 ChatGPT Work 的功能入口相混淆。

三、从会用到用好:管理 ChatGPT Work 的四项职能

完成前面的准备工作后,ChatGPT Work 已经可以满足一些基本使用需求。如果还希望让它完成更复杂、更有价值的工作,需要进一步深入了解它的各项功能。为此,我借用管理四职能的框架,把 ChatGPT Work 这类 AI Agent 的功能归纳为领导、组织、控制和计划四个部分,下面先对这四个部分的基本思路做一个概要介绍。

1 领导:让大模型更好地输出

管理人要懂人性,管理 AI,也要懂一点“AI性”。要懂一点“AI性”,还需要从最基础的大模型说起。

大模型简单来说就是一个根据你给它输入的文字,计算出一堆新文字输出给你的机器。每一次大模型想要输出点什么,它唯一可以参考和依赖的,就是你这次发送给它的所有信息,这些信息就叫做上下文(Context)。除此以外,它没有其他内部记忆或者内部信息源可以参考。虽然大模型确实知道很多东西,但这并不是因为它有一个可以随时查阅的知识库,而是这些知识背后的文字规律已经融入模型参数,成为模型本身的一部分。

但无论是最简单的聊天机器人,还是最复杂的 Agent,我们和它们交流时,都像是在跟一个有记忆的“硅基人”交流。实现这一点的方法其实很简单:聊天机器人或 Agent 每次给大模型发送消息时,都会把用户最新的提示词、此前的对话以及其他所有相关信息汇总起来,一把发给大模型。大模型每次都重新收到一遍前面发过的那些信息,输出内容就能做到“记得”我们此前说过什么。

04-comparison-agent-vs-model

但是,这样做会面临一个问题:大模型一次能够接收的文字数量是有限的。随着历史对话和其他所有相关信息不断叠加,每次发给大模型的内容会越来越多,直到超过这个限制。为了既给大模型提供足够的信息,又不让上下文长度尽可能晚地逼近这个限制,就需要明智地选择每次发给大模型的上下文。因此如何界定“其他所有相关信息”中的“相关”,就很考验产品设计者和用户的设计和使用水准了。界定哪些信息相关,再把相关信息组织好,AI 界就叫做“上下文工程”。

落实到 ChatGPT Work 的具体使用上,前面介绍的 @ 引用文件和 + 添加内容,就是由用户主动选择相关材料,并把它们加入当前任务上下文的方式,避免 Agent 自行查找带来的无关内容挤进上下文。除此之外,我们还需要判断什么时候应该继续当前任务/对话,什么时候应该压缩对话甚至直接新建任务;哪些内容应该写进 AGENTS.md,哪些过往信息可以交给记忆机制,哪些已经形成的工作方法适合沉淀为 Skills。这些问题在 ChatGPT Work 中,分别对应任务(对话)管理、AGENTS.md、记忆和 Skills 等功能和机制。它们解决的其实是同一个问题:让大模型每一次收到的信息既足够,又真正与当前任务相关。

2 组织:合理配置和整合资源

管理中的组织,核心是围绕工作目标合理配置和整合资源。使用 ChatGPT Work 时,为了更好地完成你的任务,你也需要思考如何组织和协调各种资源,包括基础的大模型和大模型可以使用的工具和资源。

ChatGPT Work 中与组织相关的功能,主要包括模型与推理强度选择以及工具、MCP、插件和子 Agent配置等。模型和推理强度决定使用什么样的基础能力可以既经济又有效地处理任务。工具负责执行具体操作,既包括图片生成、网页搜索、浏览器和 Computer Use 等自带工具,也包括通过终端调用的第三方脚本和工具,以及通过 MCP 接入的外部数据和工具。插件负责安装和打包这些工具和能力,可以同时带来 Skills、MCP 以及其他工具等。

从组织的角度看,Skill 会把完成一类任务需要的步骤、资料和工具组织起来,但是我更习惯把它看作一种上下文管理方式,因为它按需加载的方式,在不大幅占用模型上下文的情况下,极大扩展了 Agent 的工作能力,因此将它放在前面的“领导”部分。

而另一方面,主 Agent 可以把相对独立的工作拆开,交给不同的子 Agent 完成后再汇总,由于各项工作的材料和中间过程可以留在子 Agent 的上下文中,节省了主 Agent 的上下文,实际上有较大的上下文管理(隔离)的作用。但是考虑到子 Agent 还承担着任务分工和并行处理的作用,因此暂时将它放在“组织”部分进行说明和介绍。

3 控制:盯住偏差,控住风险

管理中的控制不是为了限制员工,而是希望通过一套可靠的机制,让管理者敢于放权最大限度地发挥员工的主观能动性。使用 ChatGPT Work 也是一样:既要划定它可以活动的范围,也要检查它实际做了什么,并在发现偏差时及时纠正。有了这些机制,我们才敢减少干预,让 ChatGPT Work 更自主地完成任务。

ChatGPT Work 中与控制相关的功能,主要是权限模式和沙箱这类事前控制。权限模式决定 Agent 哪些操作可以自己完成,哪些操作需要先得到用户同意;沙箱则是在计算机中为 Agent 划出一个相对隔离的活动范围,避免它随意触碰范围之外的文件和资源。

ChatGPT Work 中目前没有可靠的事后控制方式:文件一旦被改动,Work 本身不能保留版本并回滚,也就没有后悔药可吃。对于以 Markdown 为主的笔记库,最好的事后控制方式其实还是使用 Git,不过Git对于普通办公用户来说有一定的学习门槛。

4 计划:制定目标和行动方案

管理中的计划,核心是提前确定目标,并安排实现目标的行动方案。管理 AI 同样需要计划,让 AI 按照计划做事。这个计划既可以由我们事先制定并交给 AI,也可以让 AI 根据任务自行制定,再由我们确认后执行。

ChatGPT Work 中与计划相关的功能,主要包括任务清单、计划模式、Goal 和定时任务。任务清单由 Agent 根据任务需要自行生成,用于拆解和跟踪执行步骤;计划模式由用户主动开启,让 Agent 先分析问题、形成方案,经确认后再开始执行;Goal 用于让 Agent 持续工作直到完成一个明确的目标;定时任务则用于安排在指定时间执行一次或定期重复执行的工作。

兴之所志

2026-07-14