← 2026-07-20 期
Behind the Craft00:41:17 节目 · 12 分钟阅读

让 Claude Code 持续工作:目标、循环、验证与更轻的提示词

How I Plan, Build, and Run Loops with Claude Code in 40 Minutes | Thariq Shihipar

Peter Yang;Thariq Shihipar(Claude Code 团队)

节目日期 2026-07-19来源标注:官方字幕
THE BRIEF

三句话速览

  1. 01

    长时间 Agent 不是靠一句“继续做”实现,而是靠明确的退出条件、可验证反馈与适合任务类型的循环。

  2. 02

    Thariq 的视频演示表明,规划的价值不是提前写完答案,而是先发现未知、理解工具边界,再把成熟流程固化成技能。

  3. 03

    更强模型往往需要更少的硬规则;团队应定期删除过时约束,把人的精力转向验收标准、工具与判断。

核心判断

本期提供了一套务实的 Agent 工程方法:先把模糊任务变成可观察、可验证的工作,再让 Agent 长时间运行;随着模型能力提升,减少提示词约束往往比继续叠加规则更有效。

THE ARGUMENTS

10 条核心观点

01

1. 长时间运行必须有明确退出条件

英文观点句 · 历史稿忠实转述

A long-running agent becomes dependable only when the task has a concrete exit condition that the model can check for itself.

中文直译

只有当任务具有模型能够自行检查的明确退出条件时,长时间运行的智能体才会变得可靠。

难词注译
  • long-running:持续运行较长时间的
  • dependable:可靠、值得依赖的
  • exit condition:退出条件或完成判据
  • check for itself:自行检查

原文语境

约 01:00,Thariq 解释 `/goal` 会持续提醒模型最终目标,并仅在满足退出条件后允许结束;它适合复杂但终点清晰的任务。

观点解读

“不停止”本身不是质量保证。需要把完成定义转化为可观察结果,例如视频已渲染、测试通过或页面与 Figma 规范一致。

02

2. `/goal` 适用于探索已完成、执行仍复杂的任务

英文观点句 · 历史稿忠实转述

The goal loop works best after the user has explored the problem space enough for the agent to fill in local gaps without repeated approval.

中文直译

当用户已经充分探索问题空间,使智能体能够在无需反复审批的情况下填补局部空白时,目标循环效果最好。

难词注译
  • problem space:问题空间
  • fill in gaps:填补空白
  • repeated approval:反复审批
  • works best:效果最佳

原文语境

约 01:30–02:30,嘉宾说用户应先完成足够的规格说明与探索,再授权 Agent 遇到小问题时自行补足,而不是每一步停下来询问。

观点解读

这划定了自主权边界:战略未知仍由人澄清,执行中的局部未知可交给 Agent。若目标本身含糊,长循环只会把偏差放大。

03

3. 不同任务需要不同验证机制

英文观点句 · 历史稿忠实转述

Deterministic tasks can use direct metrics, while subjective tasks need rubrics and a separate verifier to judge the result.

中文直译

确定性任务可以使用直接指标,而主观任务需要评分标准和独立验证者来判断结果。

难词注译
  • deterministic:结果可确定验证的
  • subjective:主观的
  • rubric:评分标准
  • verifier:验证者或检查智能体

原文语境

约 03:00–04:30,延迟等指标可直接作为目标;设计截图较模糊,应建立 rubric 并让验证 Agent 评价。Figma MCP 则能提供更明确的规范。

观点解读

关键不是所有任务都套同一条 Agent 链,而是先判断反馈函数是否明确。反馈越模糊,越需要多视角评审和人工把关。

04

4. 一个提示词也能完成跨工具视频生产

英文观点句 · 历史稿忠实转述

A single well-scoped request can coordinate transcription, timed captions, visual overlays, and final rendering across several tools.

中文直译

一个边界清晰的请求可以跨多个工具协调转写、定时字幕、视觉叠层和最终渲染。

难词注译
  • well-scoped:范围界定清楚的
  • coordinate:协调
  • visual overlay:视觉叠层
  • rendering:渲染输出

原文语境

约 04:48–07:30,Thariq 演示让 Claude 使用 Whisper 转写、Remotion 生成逐词高亮字幕和叠层,并以完整视频渲染为退出条件。

观点解读

成功来自工作目录、工具和验收标准共同构成的环境,而非提示词魔法。人物指向定位等细节仍暴露了流程边界。

05

5. 先跑通流程,再把它封装成技能

英文观点句 · 历史稿忠实转述

A workflow should earn its way into a reusable skill only after repeated use reveals the real edge cases and desired behavior.

中文直译

只有在反复使用揭示了真实边界情况和期望行为之后,工作流才值得被封装成可复用技能。

难词注译
  • reusable:可复用的
  • repeated use:反复使用
  • edge case:边界情况
  • desired behavior:期望行为

原文语境

约 07:00,Thariq 明确说暂未立即创建技能,因为他还在观察手指、面部追踪和叠层位置等边界情况。

观点解读

过早固化会把临时假设写进长期规则。更好的顺序是人工试验、记录失败、稳定输入输出,最后才技能化。

06

6. 规划是发现未知的迭代过程

英文观点句 · 历史稿忠实转述

Planning is not a one-shot document; it is an iterative process for discovering what is unknown, possible, and actually wanted.

中文直译

规划不是一次性文档,而是一个用来发现哪些事情未知、可行以及真正想要什么的迭代过程。

难词注译
  • one-shot:一次完成的
  • iterative:迭代式的
  • discover:发现
  • actually wanted:真正想要的

原文语境

约 08:17–14:30,他让 Claude 解释 Whisper 的失败方式,包括静音幻觉、分段与说话人识别限制,并探索视频分割是否足够可靠。

观点解读

高质量计划不是更长的 PRD,而是更少的未知。若工具边界不清,先学习与原型验证比直接实现更便宜。

07

7. HTML artifact 让规格从文字变成可体验对象

英文观点句 · 历史稿忠实转述

Interactive HTML artifacts help teams explore visual options, review plans, and preserve implementation context better than static text alone.

中文直译

与单纯静态文本相比,交互式 HTML 产物能更好地帮助团队探索视觉方案、审阅计划并保留实施上下文。

难词注译
  • interactive artifact:可交互产物
  • visual option:视觉方案
  • preserve context:保留上下文
  • static text:静态文本

原文语境

约 14:32–18:35,嘉宾展示根据 Peter 网站生成多种字幕叠层方案,并说明 Anthropic 内部用 artifact 分享计划、PR 状态和事故报告。

观点解读

视觉问题应尽早用视觉媒介讨论。HTML 还可以成为 living document,让后续 Agent 直接读取已确认方案。

08

8. Slack 正在成为多人协作的 Agent 工作面

英文观点句 · 历史稿忠实转述

Remote agent sessions in Slack turn parallel background work into a shared conversation where humans, reviewers, and agents can coordinate.

中文直译

Slack 中的远程智能体会话把并行后台工作变成共享对话,使人、审阅者和智能体能够协同。

难词注译
  • remote session:远程会话
  • parallel:并行的
  • background work:后台工作
  • coordinate:协同

原文语境

约 18:35–27:30,Thariq 把探索、多任务与 PR babysitting 放在 Claude in Slack 中,让 Agent 修测试、@审阅者并保留团队对话;本地 Claude Code 则用于当前聚焦任务。

观点解读

这把 Agent 从个人 IDE 工具变成团队成员。共享上下文、权限和通知机制开始比聊天窗口本身更重要。

09

9. 创作者与验证者分离能提升非确定任务质量

英文观点句 · 历史稿忠实转述

Separating creation from verification gives subjective work a structured feedback loop instead of relying on one model's first answer.

中文直译

把创作与验证分离,可以为主观工作建立结构化反馈循环,而不是依赖一个模型的第一次回答。

难词注译
  • separate:分离
  • structured feedback loop:结构化反馈循环
  • rely on:依赖
  • first answer:第一次回答

原文语境

约 27:34,节目讨论让子 Agent 分别生成与验证;设计、图像等任务可调用图像工具,再由另一个 Agent 按标准审阅并迭代。

观点解读

多 Agent 有效的前提是角色目标不同且反馈可行动;多个 Agent 重复生成相似答案并不会自动提高质量。

10

10. 模型越强,提示词越应该做减法

英文观点句 · 历史稿忠实转述

As models improve, teams should remove brittle instructions and examples that constrain reasoning instead of continually expanding the system prompt.

中文直译

随着模型改进,团队应该删除那些限制推理的脆弱指令和示例,而不是持续扩充系统提示词。

难词注译
  • brittle:脆弱且容易失效的
  • constrain:限制、束缚
  • continually:持续不断地
  • system prompt:系统提示词

原文语境

约 34:07,Thariq 说 Claude Code 团队把系统提示词削减约 80%;旧规则和示例可能把新模型限制在过去能力水平。

观点解读

提示词债务与代码债务相似。每次模型升级都应做规则审计:保留安全与业务硬约束,删除模型已能自行处理的说明。

A CLOSER LOOK

深度分析

一、Agent 的产品单位从回答变成闭环

传统聊天优化单次回答,长任务则需要状态、反馈和终点。`/goal` 的意义不是强迫模型耗时,而是把“完成”变成持续可见的约束。

当任务可测试时可以直接闭环;当任务主观时,需要 rubric、验证 Agent 和人工决策。自主性的上限由验证能力决定。

二、规划正在从文档写作转向不确定性消除

Thariq 的计划包含学习 Whisper、列出失败模式、测试视频算法和生成可视化选项。它不是实施前的静态批准件,而是探索过程本身。

组织应衡量计划消除了多少未知,而不是写了多少页。能被视觉化或原型化的问题,应尽快转换媒介。

三、更强模型带来提示词去杠杆

大量规则通常来自旧模型失败后的补丁。新模型具备更强推理后,这些补丁会限制策略空间,甚至把模型锁在旧行为上。

因此提示工程不只是添加指令,也包括持续删除。安全、合规和业务事实仍是硬约束;表达风格和推理步骤则应谨慎固定。

LISTEN AGAIN

值得回听的时间点

00:00

目标、循环与工作流

建立长时间 Agent 的退出条件和反馈框架。

04:48

单提示词制作完整视频

观察跨工具执行如何依赖可验证终点。

08:17

通过规划移除未知

展示研究工具边界和边界情况的过程。

14:32

HTML artifact 作为可视化规格

把计划变成可体验、可复用的 living document。

18:35

Slack 中运行并行 Agent

说明远程、多人与本地聚焦工作的分工。

27:34

创作者与验证者子 Agent

为主观任务增加独立反馈循环。

34:07

系统提示词减少 80%

解释模型升级后为什么要删除旧约束。

人物、工具与数字

Claude Code/goal、/loop 与 workflowsWhisper 转写Remotion 视频渲染Figma MCPClaude in SlackHTML artifacts系统提示词减少约 80%
PERSPECTIVES

立场与分歧

共同立场

  • Agent 自主性必须建立在清晰目标和反馈之上。
  • 规划的核心是降低未知,而不是增加文档长度。
  • 随着模型变强,人的价值更集中于判断、验收与工具设计。

主要分歧

  • Peter 从产品规格和团队协作角度提问;Thariq 更关注可执行环境、模型行为和验证机制。
  • Peter 倾向尽快把流程理解为技能;Thariq强调先通过反复使用发现边界,再固化。
INTO PRACTICE

工作启发与行动

  • 为每个长任务写可机器判断的完成标准。
  • 把视觉规格从 Markdown 升级为可交互 HTML 原型。
  • 将后台 Agent 工作放入团队可见渠道,并保留审阅责任。
  • 模型升级时对 CLAUDE.md、技能和系统提示词执行删除式审计。

可以从这里开始

  1. 选一个现有自动化,为它增加明确退出条件与失败条件。
  2. 在固化新技能前至少运行三次并记录边界情况。
  3. 为主观任务建立 creator/verifier 两角色和明确 rubric。
  4. 把一个重要计划转为 HTML artifact,邀请实际使用者审阅。
  5. 删除一批仅为旧模型补能力的冗余提示词并做回归验证。
EVIDENCE & LIMITS

事实、观点与不确定项

以下沿用历史报告的标注与判断,归档迁移未对节目事实重新核验。

历史稿标注的事实

  • 节目时长 41:17。
  • 演示使用 Whisper 与 Remotion 制作带逐词字幕和视觉叠层的视频。
  • 节目称 Claude Code 团队曾将系统提示词减少约 80%。
  • Anthropic 内部使用 HTML artifact 分享计划、状态与事故报告。

观点与判断

  • Thariq 认为 workflows 是让 Agent 长时间运行最强的形式之一。
  • 他认为模型变强后通常需要更少方向、约束和示例。
  • Peter 将 Slack 描述为多人版 Claude 协作体验。

仍需留意

  • 80% 为嘉宾对团队实践的口头概述,节目未给出提示词版本或独立量化材料。
  • 视频 demo 是受控案例,不能直接外推到所有非技术任务。
  • 自动字幕把部分 Claude/Thariq 等专名识别错误,分析按上下文校正。
LANGUAGE & CONCEPTS

金句与关键词

As the models have gotten smarter, they need less direction, fewer constraints, and fewer examples.

这句话浓缩了本期的反直觉观点:能力升级后,首要动作可能不是加规则,而是删掉限制模型发挥的旧规则。

BACK TO THE SOURCE

回到原始内容

保留历史报告的观点与证据边界。英文观点句沿用原稿标注,转述句不作为逐字引用。了解编辑说明

收录于 2026-07-20