← 2026-08-24 期
Behind the Craft53:52 节目 · 9 分钟阅读

用 Claude Code 搭建更好的 AI 评测:从失败样本到可复用判断系统

Peter Yang / Shreya Shankar / Hamel Husain

节目日期 2026-08-23 21:00(北京时间)来源标注:完整 RSS 音频 · 本地转写核验
THE BRIEF

三句话速览

  1. 01

    AI 评测的真正难点不是写一个评分器,而是持续发现产品实际失败的方式。

  2. 02

    最可靠的流程把专家先验的“自上而下”标准,与真实样本中发现的“自下而上”标准分开维护。

  3. 03

    AI 可以并行检查、聚类和整理反馈,但决定什么叫好、什么值得优化,仍必须由人来负责。

核心判断

把 eval 当成持续运行的产品学习系统,而不是上线前的一次考试:人负责品味和错误分类,代理负责规模化执行。

THE ARGUMENTS

10 条核心观点

01

评测必须同时拥有两套来源

英文观点句 · 历史稿忠实转述

A strong evaluation system combines top-down criteria with bottom-up failure discovery.

中文直译

一套强健的评测系统,会把自上而下的标准与自下而上的失败发现结合起来。

难词注译
  • top-down:自上而下的
  • bottom-up:自下而上的
  • failure discovery:失败发现

原文语境

嘉宾把领域专家预先知道的基础要求称为 top-down,把从实际轨迹和用户样本中发现的新错误称为 bottom-up。

观点解读

前者保证底线,后者追随真实产品变化;混在一个模糊评分里会让团队既不知道标准来源,也无法更新。

02

AI 不擅长凭空发明真实失败模式

英文观点句 · 历史稿忠实转述

Claude is weak at inventing bottom-up evaluations because those evaluations must come from observed data.

中文直译

Claude 不擅长发明自下而上的评测,因为这类评测必须来自被观察到的数据。

难词注译
  • invent:凭空构造
  • observed data:观测数据
  • evaluation:评测项

原文语境

现场演示强调,模型可以整理已有反馈,却无法替团队预见尚未在真实用户中出现的全部失败。

观点解读

这要求团队先采样、看轨迹、听用户,再让代理把反复出现的问题固化为标准。

03

把每条标准分发给独立子代理

英文观点句 · 历史稿忠实转述

Each rubric criterion can be graded by a separate subagent and then aggregated into one result.

中文直译

每一条评分标准都可以交给独立子代理判断,再汇总为一个结果。

难词注译
  • rubric criterion:评分标准条目
  • subagent:子代理
  • aggregate:汇总

原文语境

演示让多个子代理分别对一条标准给出通过或失败,最终形成表格。

观点解读

独立判断减少长上下文干扰,也方便定位到底是哪一项失败,而不是只看到一个不可解释的总分。

04

先扩大样本多样性,再讨论准确率

英文观点句 · 历史稿忠实转述

Diverse samples reveal more useful failure modes than repeatedly testing only happy paths.

中文直译

多样化样本比反复测试顺利路径更能暴露有用的失败模式。

难词注译
  • diverse samples:多样化样本
  • failure mode:失败模式
  • happy path:理想路径

原文语境

嘉宾用 UI 浏览不同输出并聚类,要求人对差异明显的样本给开放式反馈。

观点解读

评测覆盖面的瓶颈常常不是 judge 模型,而是样本太同质;先扩大场景才能避免虚假的高通过率。

05

开放式人类反馈应被蒸馏成规则

英文观点句 · 历史稿忠实转述

An agent can distill open-ended human feedback into actionable rubric items.

中文直译

代理可以把开放式的人类反馈提炼成可执行的评分条目。

难词注译
  • distill:提炼
  • open-ended:开放式的
  • actionable:可执行的

原文语境

人在界面里写下“哪里不对”,代理随后归纳重复模式并建议新的 eval。

观点解读

这样既保留人的语境判断,也把零散评论变成可重复运行的工程资产。

06

一次事故要沉淀为长期防线

英文观点句 · 历史稿忠实转述

A recurring failure should become a rubric, a judge, a dashboard signal, or real-time monitoring.

中文直译

反复出现的失败应当转化为评分规则、评判器、仪表盘信号或实时监控。

难词注译
  • recurring:反复发生的
  • judge:自动评判器
  • monitoring:监控

原文语境

对话把发现错误后的产物分成 rubric、LLM judge、dashboard 和在线监控。

观点解读

如果问题只在复盘文档中出现,它还会回来;真正完成闭环,是把它变成能自动提醒团队的机制。

07

错误分析比写评分代码更困难

英文观点句 · 历史稿忠实转述

Error analysis is the hardest part of building useful evaluations.

中文直译

错误分析是建立有用评测体系中最困难的部分。

难词注译
  • error analysis:错误分析
  • useful evaluations:有效评测
  • building:构建

原文语境

两位嘉宾反复把精力放在阅读输出、命名错误簇和判断业务影响,而不是代码本身。

观点解读

工程工具越来越容易,稀缺能力变成对错误分类、优先级和产品后果的判断。

08

自动评测会制造误报和旁枝

英文观点句 · 历史稿忠实转述

Automated evaluators can surface red herrings that look important but do not reflect product quality.

中文直译

自动评测器可能抛出看似重要、却不反映产品质量的错误线索。

难词注译
  • surface:暴露
  • red herring:误导性线索
  • reflect:反映

原文语境

嘉宾提醒,模型能捕捉显眼错误,但也可能把无关差异当作严重问题。

观点解读

自动 judge 的输出仍需校准;否则团队会优化容易计数的指标,而非用户真正感受到的质量。

09

通用编程代理已能完成大量专用评测工作

英文观点句 · 历史稿忠实转述

General coding agents are approaching specialized auto-evaluation tools for many workflows.

中文直译

在许多工作流中,通用编程代理的能力正接近专用自动评测工具。

难词注译
  • approach:接近
  • specialized:专用的
  • workflow:工作流

原文语境

节目比较了 Claude Code 一类代理与专门 eval 聊天工具,认为核心分析能力差距缩小。

观点解读

专用工具仍在轨迹集成、展示和监控上有便利,但团队可以先用现有代理低成本建立方法。

10

人机思考应交替进行

英文观点句 · 历史稿忠实转述

The best workflow interleaves human thinking time with AI thinking time.

中文直译

最好的工作流会把人类思考时间与 AI 思考时间交替编排。

难词注译
  • interleave:交替穿插
  • thinking time:思考时间
  • workflow:工作流程

原文语境

演示不是一键生成:人挑样本、写反馈,AI 聚类和提案,人再复核。

观点解读

这是把速度与品味组合起来的关键;完全自动化会失去目标,完全手工又无法覆盖规模。

A CLOSER LOOK

深度分析

评测正在变成产品发现机制

传统测试回答“系统是否符合已知要求”,代理评测还必须回答“它正在以哪些新方式失败”。因此数据采样和错误命名与写测试同等重要。

这会改变团队分工:产品和领域专家负责判断后果,工程师把判断做成可重复运行的资产。

规模化不等于取消人工

子代理可以把一次检查扩展到数百条标准和样本,但没有人工校准就会放大误报。真正有效的是交替循环,而非把整个评测交给模型。

最小可行 eval 栈

先用真实样本、文本 rubric、并行 judge 和简单结果表就能起步。只有当错误模式稳定、在线风险明确后,再投入专用平台和实时监控。

LISTEN AGAIN

值得回听的时间点

00:00

评测为什么变了

从静态测试转向持续观察代理行为。

05:14

Top-down 与 bottom-up

定义两类标准的来源与边界。

14:32

现场使用 eval skill

展示子代理并行评分与汇总。

23:46

人工标注与聚类

从开放反馈形成可执行标准。

34:37

失败沉淀为系统

把一次错误转成长期监控。

43:19

人类判断的不可替代性

AI 能找模式,但人决定品味。

人物、工具与数字

Claude CodeLLM judgeRubricSubagentError analysis约 4,500 名课程学员(节目所述)
PERSPECTIVES

立场与分歧

共同立场

  • 评测要来自真实样本,而不只是预设答案。
  • 人类必须掌握产品判断与最终校准。

主要分歧

  • 通用代理与专用 eval 平台的差异主要落在集成、展示和在线监控,而非单次推理能力。
INTO PRACTICE

工作启发与行动

  • 把客服投诉、人工抽检与代理轨迹统一变成错误样本池。
  • 让每个重要失败模式拥有负责人、规则和监控信号。

可以从这里开始

  1. 本周抽取 30 条真实轨迹,人工标出最影响用户的 5 类错误。
  2. 把基础合规项与数据驱动失败项拆成两个 rubric 文件。
  3. 让子代理逐条评分,并保留失败证据而非只保留总分。
  4. 每周校准误报并把新失败加入回归集。
EVIDENCE & LIMITS

事实、观点与不确定项

以下沿用历史报告的标注与判断,归档迁移未对节目事实重新核验。

历史稿标注的事实

  • 节目进行了 Claude Code eval 工作流的现场演示。
  • 内容覆盖样本浏览、人工反馈、子代理评分和结果聚合。

观点与判断

  • 错误分析是评测中最难也最有杠杆的工作。
  • 人的品味目前不能由自动 judge 替代。

仍需留意

  • 自动转写可能对少量工具名和人名存在拼写误差。
  • 课程人数等数字来自节目陈述,未做独立审计。
LANGUAGE & CONCEPTS

金句与关键词

The human is the one driving the taste.

“真正驱动品味的是人。”这句话点明了整期方法的责任边界:AI 扩大观察和执行,人决定何为好。

BACK TO THE SOURCE

回到原始内容

保留历史报告的观点与证据边界。英文观点句沿用原稿标注,转述句不作为逐字引用。了解编辑说明

收录于 2026-08-24