三句话速览
- 01
长时间 Agent 不是靠一句“继续做”实现,而是靠明确的退出条件、可验证反馈与适合任务类型的循环。
- 02
Thariq 的视频演示表明,规划的价值不是提前写完答案,而是先发现未知、理解工具边界,再把成熟流程固化成技能。
- 03
更强模型往往需要更少的硬规则;团队应定期删除过时约束,把人的精力转向验收标准、工具与判断。
本期提供了一套务实的 Agent 工程方法:先把模糊任务变成可观察、可验证的工作,再让 Agent 长时间运行;随着模型能力提升,减少提示词约束往往比继续叠加规则更有效。
10 条核心观点
011. 长时间运行必须有明确退出条件
A long-running agent becomes dependable only when the task has a concrete exit condition that the model can check for itself.
只有当任务具有模型能够自行检查的明确退出条件时,长时间运行的智能体才会变得可靠。
- long-running:持续运行较长时间的
- dependable:可靠、值得依赖的
- exit condition:退出条件或完成判据
- check for itself:自行检查
原文语境
约 01:00,Thariq 解释 `/goal` 会持续提醒模型最终目标,并仅在满足退出条件后允许结束;它适合复杂但终点清晰的任务。
观点解读
“不停止”本身不是质量保证。需要把完成定义转化为可观察结果,例如视频已渲染、测试通过或页面与 Figma 规范一致。
022. `/goal` 适用于探索已完成、执行仍复杂的任务
The goal loop works best after the user has explored the problem space enough for the agent to fill in local gaps without repeated approval.
当用户已经充分探索问题空间,使智能体能够在无需反复审批的情况下填补局部空白时,目标循环效果最好。
- problem space:问题空间
- fill in gaps:填补空白
- repeated approval:反复审批
- works best:效果最佳
原文语境
约 01:30–02:30,嘉宾说用户应先完成足够的规格说明与探索,再授权 Agent 遇到小问题时自行补足,而不是每一步停下来询问。
观点解读
这划定了自主权边界:战略未知仍由人澄清,执行中的局部未知可交给 Agent。若目标本身含糊,长循环只会把偏差放大。
033. 不同任务需要不同验证机制
Deterministic tasks can use direct metrics, while subjective tasks need rubrics and a separate verifier to judge the result.
确定性任务可以使用直接指标,而主观任务需要评分标准和独立验证者来判断结果。
- deterministic:结果可确定验证的
- subjective:主观的
- rubric:评分标准
- verifier:验证者或检查智能体
原文语境
约 03:00–04:30,延迟等指标可直接作为目标;设计截图较模糊,应建立 rubric 并让验证 Agent 评价。Figma MCP 则能提供更明确的规范。
观点解读
关键不是所有任务都套同一条 Agent 链,而是先判断反馈函数是否明确。反馈越模糊,越需要多视角评审和人工把关。
044. 一个提示词也能完成跨工具视频生产
A single well-scoped request can coordinate transcription, timed captions, visual overlays, and final rendering across several tools.
一个边界清晰的请求可以跨多个工具协调转写、定时字幕、视觉叠层和最终渲染。
- well-scoped:范围界定清楚的
- coordinate:协调
- visual overlay:视觉叠层
- rendering:渲染输出
原文语境
约 04:48–07:30,Thariq 演示让 Claude 使用 Whisper 转写、Remotion 生成逐词高亮字幕和叠层,并以完整视频渲染为退出条件。
观点解读
成功来自工作目录、工具和验收标准共同构成的环境,而非提示词魔法。人物指向定位等细节仍暴露了流程边界。
055. 先跑通流程,再把它封装成技能
A workflow should earn its way into a reusable skill only after repeated use reveals the real edge cases and desired behavior.
只有在反复使用揭示了真实边界情况和期望行为之后,工作流才值得被封装成可复用技能。
- reusable:可复用的
- repeated use:反复使用
- edge case:边界情况
- desired behavior:期望行为
原文语境
约 07:00,Thariq 明确说暂未立即创建技能,因为他还在观察手指、面部追踪和叠层位置等边界情况。
观点解读
过早固化会把临时假设写进长期规则。更好的顺序是人工试验、记录失败、稳定输入输出,最后才技能化。
066. 规划是发现未知的迭代过程
Planning is not a one-shot document; it is an iterative process for discovering what is unknown, possible, and actually wanted.
规划不是一次性文档,而是一个用来发现哪些事情未知、可行以及真正想要什么的迭代过程。
- one-shot:一次完成的
- iterative:迭代式的
- discover:发现
- actually wanted:真正想要的
原文语境
约 08:17–14:30,他让 Claude 解释 Whisper 的失败方式,包括静音幻觉、分段与说话人识别限制,并探索视频分割是否足够可靠。
观点解读
高质量计划不是更长的 PRD,而是更少的未知。若工具边界不清,先学习与原型验证比直接实现更便宜。
077. HTML artifact 让规格从文字变成可体验对象
Interactive HTML artifacts help teams explore visual options, review plans, and preserve implementation context better than static text alone.
与单纯静态文本相比,交互式 HTML 产物能更好地帮助团队探索视觉方案、审阅计划并保留实施上下文。
- interactive artifact:可交互产物
- visual option:视觉方案
- preserve context:保留上下文
- static text:静态文本
原文语境
约 14:32–18:35,嘉宾展示根据 Peter 网站生成多种字幕叠层方案,并说明 Anthropic 内部用 artifact 分享计划、PR 状态和事故报告。
观点解读
视觉问题应尽早用视觉媒介讨论。HTML 还可以成为 living document,让后续 Agent 直接读取已确认方案。
088. Slack 正在成为多人协作的 Agent 工作面
Remote agent sessions in Slack turn parallel background work into a shared conversation where humans, reviewers, and agents can coordinate.
Slack 中的远程智能体会话把并行后台工作变成共享对话,使人、审阅者和智能体能够协同。
- remote session:远程会话
- parallel:并行的
- background work:后台工作
- coordinate:协同
原文语境
约 18:35–27:30,Thariq 把探索、多任务与 PR babysitting 放在 Claude in Slack 中,让 Agent 修测试、@审阅者并保留团队对话;本地 Claude Code 则用于当前聚焦任务。
观点解读
这把 Agent 从个人 IDE 工具变成团队成员。共享上下文、权限和通知机制开始比聊天窗口本身更重要。
099. 创作者与验证者分离能提升非确定任务质量
Separating creation from verification gives subjective work a structured feedback loop instead of relying on one model's first answer.
把创作与验证分离,可以为主观工作建立结构化反馈循环,而不是依赖一个模型的第一次回答。
- separate:分离
- structured feedback loop:结构化反馈循环
- rely on:依赖
- first answer:第一次回答
原文语境
约 27:34,节目讨论让子 Agent 分别生成与验证;设计、图像等任务可调用图像工具,再由另一个 Agent 按标准审阅并迭代。
观点解读
多 Agent 有效的前提是角色目标不同且反馈可行动;多个 Agent 重复生成相似答案并不会自动提高质量。
1010. 模型越强,提示词越应该做减法
As models improve, teams should remove brittle instructions and examples that constrain reasoning instead of continually expanding the system prompt.
随着模型改进,团队应该删除那些限制推理的脆弱指令和示例,而不是持续扩充系统提示词。
- brittle:脆弱且容易失效的
- constrain:限制、束缚
- continually:持续不断地
- system prompt:系统提示词
原文语境
约 34:07,Thariq 说 Claude Code 团队把系统提示词削减约 80%;旧规则和示例可能把新模型限制在过去能力水平。
观点解读
提示词债务与代码债务相似。每次模型升级都应做规则审计:保留安全与业务硬约束,删除模型已能自行处理的说明。
深度分析
一、Agent 的产品单位从回答变成闭环
传统聊天优化单次回答,长任务则需要状态、反馈和终点。`/goal` 的意义不是强迫模型耗时,而是把“完成”变成持续可见的约束。
当任务可测试时可以直接闭环;当任务主观时,需要 rubric、验证 Agent 和人工决策。自主性的上限由验证能力决定。
二、规划正在从文档写作转向不确定性消除
Thariq 的计划包含学习 Whisper、列出失败模式、测试视频算法和生成可视化选项。它不是实施前的静态批准件,而是探索过程本身。
组织应衡量计划消除了多少未知,而不是写了多少页。能被视觉化或原型化的问题,应尽快转换媒介。
三、更强模型带来提示词去杠杆
大量规则通常来自旧模型失败后的补丁。新模型具备更强推理后,这些补丁会限制策略空间,甚至把模型锁在旧行为上。
因此提示工程不只是添加指令,也包括持续删除。安全、合规和业务事实仍是硬约束;表达风格和推理步骤则应谨慎固定。
值得回听的时间点
目标、循环与工作流
建立长时间 Agent 的退出条件和反馈框架。
单提示词制作完整视频
观察跨工具执行如何依赖可验证终点。
通过规划移除未知
展示研究工具边界和边界情况的过程。
HTML artifact 作为可视化规格
把计划变成可体验、可复用的 living document。
Slack 中运行并行 Agent
说明远程、多人与本地聚焦工作的分工。
创作者与验证者子 Agent
为主观任务增加独立反馈循环。
系统提示词减少 80%
解释模型升级后为什么要删除旧约束。
人物、工具与数字
立场与分歧
共同立场
- Agent 自主性必须建立在清晰目标和反馈之上。
- 规划的核心是降低未知,而不是增加文档长度。
- 随着模型变强,人的价值更集中于判断、验收与工具设计。
主要分歧
- Peter 从产品规格和团队协作角度提问;Thariq 更关注可执行环境、模型行为和验证机制。
- Peter 倾向尽快把流程理解为技能;Thariq强调先通过反复使用发现边界,再固化。
工作启发与行动
- 为每个长任务写可机器判断的完成标准。
- 把视觉规格从 Markdown 升级为可交互 HTML 原型。
- 将后台 Agent 工作放入团队可见渠道,并保留审阅责任。
- 模型升级时对 CLAUDE.md、技能和系统提示词执行删除式审计。
可以从这里开始
- 选一个现有自动化,为它增加明确退出条件与失败条件。
- 在固化新技能前至少运行三次并记录边界情况。
- 为主观任务建立 creator/verifier 两角色和明确 rubric。
- 把一个重要计划转为 HTML artifact,邀请实际使用者审阅。
- 删除一批仅为旧模型补能力的冗余提示词并做回归验证。
事实、观点与不确定项
以下沿用历史报告的标注与判断,归档迁移未对节目事实重新核验。
历史稿标注的事实
- 节目时长 41:17。
- 演示使用 Whisper 与 Remotion 制作带逐词字幕和视觉叠层的视频。
- 节目称 Claude Code 团队曾将系统提示词减少约 80%。
- Anthropic 内部使用 HTML artifact 分享计划、状态与事故报告。
观点与判断
- Thariq 认为 workflows 是让 Agent 长时间运行最强的形式之一。
- 他认为模型变强后通常需要更少方向、约束和示例。
- Peter 将 Slack 描述为多人版 Claude 协作体验。
仍需留意
- 80% 为嘉宾对团队实践的口头概述,节目未给出提示词版本或独立量化材料。
- 视频 demo 是受控案例,不能直接外推到所有非技术任务。
- 自动字幕把部分 Claude/Thariq 等专名识别错误,分析按上下文校正。
金句与关键词
As the models have gotten smarter, they need less direction, fewer constraints, and fewer examples.这句话浓缩了本期的反直觉观点:能力升级后,首要动作可能不是加规则,而是删掉限制模型发挥的旧规则。
回到原始内容
保留历史报告的观点与证据边界。英文观点句沿用原稿标注,转述句不作为逐字引用。了解编辑说明
收录于 2026-07-20