← 2026-07-27 期
Lenny’s Podcast01:33:50 节目 · 11 分钟阅读

Anthropic 首位技术 PM:Evals、Token Maxing 与不可替代的人类判断

Anthropic’s first technical PM on token maxing, the jagged edge, and living in the future | Dianne Penn

Lenny Rachitsky;Dianne Penn(Anthropic AI Research 与 Labs 产品负责人)

节目日期 2026-07-26来源标注:官方完整逐字稿
THE BRIEF

三句话速览

  1. 01

    Dianne Penn 把 Anthropic 的产品方法概括为研究、产品和安全的紧密闭环:用户反馈必须被转译为研究者可行动的失败类型和评测集。

  2. 02

    “Evals are the new PRDs”并不意味着 PRD 死亡,而是可测问题先用 eval 定义,模糊愿景和跨部门对齐仍需要 PRD。

  3. 03

    在模型快速进步的环境中,最重要的人类资产是第一性原理、深度实践、难以速成的判断、独立观点,以及与他人协作所带来的韧性。

核心判断

前沿 AI 产品管理的核心正从“描述要造什么”转向“定义什么结果算好,并把真实失败送回训练闭环”;但评测无法替代愿景、判断和组织对齐,最强团队会把 eval、PRD、亲手使用和安全测试组合起来。

THE ARGUMENTS

10 条核心观点

01

模型与产品载体共同创造拐点

英文观点句 · 历史稿忠实转述

A frontier model reaches users most powerfully when its new capability arrives together with a product vehicle designed to expose that capability.

中文直译

当前沿模型的新能力与专门呈现该能力的产品载体同时到来时,它最能有力地触达用户。

难词注译
  • product vehicle:把模型能力转化为用户体验的产品载体
  • expose capability:让用户能够发现并实际使用某项能力

原文语境

开场与约 13:50,Dianne 以 Opus 4.5 和 Claude Code 为例,称两者相互加速采用。

观点解读

单有模型不保证用户理解价值,单有产品也无法弥补能力不足;发布规划应把模型、界面和工作流联合设计。

02

早期差异化来自发现真实使用信号

英文观点句 · 历史稿忠实转述

Anthropic's early coding advantage grew from noticing users write long-form code and making targeted training changes before coding became an obvious category.

中文直译

Anthropic 早期的编码优势,来自在编码成为明显赛道前注意到用户开始生成长篇代码,并做出针对性的训练调整。

难词注译
  • targeted training changes:围绕明确行为做的训练调整
  • obvious category:已被市场普遍认可的独立品类

原文语境

约 10:50–12:10,Dianne 回顾 2023 年几乎没人把 Claude 与 coding 联系在一起,但团队观察到超越自动补全的使用。

观点解读

前沿产品发现不是等待大规模数据,而是识别少量但强烈的新行为,并判断是否值得投入训练与产品资源。

03

Labs 用小团队孵化模糊机会

英文观点句 · 历史稿忠实转述

Anthropic Labs uses small pods to pull on promising threads before the user need, product shape, and technical path are fully defined.

中文直译

Anthropic Labs 使用小型小组,在用户需求、产品形态和技术路径尚未完全定义时追踪有前景的线索。

难词注译
  • small pods:围绕目标组建的小型跨职能团队
  • pull on promising threads:沿着有潜力的早期线索继续探索

原文语境

约 23:30–27:30,Dianne 介绍 Claude Code、Skills、Claude Design 与 MCP 等来自 Labs 的孵化方式,有时从一名工程师起步。

观点解读

孵化组织的价值是快速探索,而不是脱离主业务;成功条件包括前沿模型访问、用户反馈和向正式团队移交的机制。

04

用户反馈必须转译为可行动失败

英文观点句 · 历史稿忠实转述

Product teams must translate vague complaints into specific failure modes that researchers can reproduce, measure, and improve.

中文直译

产品团队必须把模糊抱怨转译为研究者能够复现、测量和改进的具体失败模式。

难词注译
  • failure modes:系统在特定条件下反复出现的失败类型
  • reproduce:在相同条件下稳定重现问题

原文语境

约 27:30–31:30,Dianne 解释“Claude 幻觉”不可行动,必须定位为工具调用、JSON 格式或其他具体失败。

观点解读

这是研究型 PM 的关键翻译工作:既理解用户语言,又能形成训练和评测语言。

05

Evals 正在成为新的 PRD

英文观点句 · 历史稿忠实转述

For measurable model behavior, an evaluation set can define the work more directly than a prose product requirements document.

中文直译

对于可测量的模型行为,一套评测集可以比文字型产品需求文档更直接地定义工作。

难词注译
  • evaluation set:由输入、期望结果和评分规则组成的测试集合
  • prose PRD:以文字描述需求、目标和方案的产品文档

原文语境

约 44:16–49:55,Dianne 说团队有“evals are the new PRDs”的说法,并以错误 JSON 的真实反馈形成 eval 为例。

观点解读

Eval 把用户问题转成可回归标准,缩短研究者行动距离;但它只能覆盖被定义和采样到的行为。

06

PRD 仍服务于愿景与大规模对齐

英文观点句 · 历史稿忠实转述

PRDs remain valuable for ambiguous opportunities and for aligning engineering, product, legal, and safety around a shared direction.

中文直译

PRD 对模糊机会仍然有价值,也能让工程、产品、法务和安全团队围绕共同方向对齐。

难词注译
  • ambiguous opportunities:需求和技术路径尚不清晰的机会
  • shared direction:跨团队共同认可的目标与边界

原文语境

约 47:48–50:10,Dianne 明确表示 PRD 没死;每个模型仍有文档用于产品面、工程和安全等利益相关方对齐。

观点解读

成熟流程不是 eval 对 PRD 的替代,而是用 eval 管理可测行为,用 PRD 管理愿景、约束和协调。

07

领导者必须亲手交付

英文观点句 · 历史稿忠实转述

Managers of AI product teams need hands-on shipping experience to develop judgment about what the technology can do and what good looks like.

中文直译

AI 产品团队的管理者需要亲手交付的经验,才能形成对技术能做什么以及什么算好的判断。

难词注译
  • hands-on shipping:亲自从构建到上线完成真实交付
  • what good looks like:对高质量结果的具体判断标准

原文语境

约 49:55–52:46,Dianne 反复强调管理者不能只玩一玩,而要端到端构建、获取用户反馈并持续使用模型。

观点解读

亲手实践不是要求管理者取代团队,而是避免战略建立在过时能力认知或精心演示上。

08

模型会反驳是有用性的组成部分

英文观点句 · 历史稿忠实转述

Claude becomes a better thinking partner when it can recognize weak reasoning and push back instead of agreeing reflexively.

中文直译

当 Claude 能识别薄弱推理并提出反驳,而不是本能地同意时,它会成为更好的思考伙伴。

难词注译
  • push back:指出问题、提出不同意见或要求澄清
  • agree reflexively:不经判断地附和

原文语境

约 61:05–65:30,Dianne 把宪法、对齐研究与知道何时反驳联系起来,并用同事类比。

观点解读

反驳本身也可能错误;高质量伙伴应给出理由和证据,让用户保留最终判断,而不是只表现“有性格”。

09

写作价值逐步转向验证与签字

英文观点句 · 历史稿忠实转述

As AI contributes more to writing, accountability may shift from who drafted the text to who verified it and signed off on the result.

中文直译

随着 AI 对写作贡献增加,责任重点可能从谁起草文本转向谁验证并最终签字确认结果。

难词注译
  • accountability:对结果正确性和后果承担责任
  • signed off:完成审核并明确批准

原文语境

约 67:11–71:40,Dianne 讨论 AI 写作的 jagged edge,并提出“谁验证、谁签字”可能比“谁写”更重要。

观点解读

这要求保留来源、审阅记录和责任人;不能用“AI 生成”稀释组织责任。

10

人类判断来自难以压缩的经验

英文观点句 · 历史稿忠实转述

Hard-earned human judgment remains valuable because it compresses nuance, experience, persistence, and context that models have not fully lived through.

中文直译

来之不易的人类判断仍然有价值,因为它压缩了模型尚未完整经历的细微差别、经验、坚持和情境。

难词注译
  • hard-earned judgment:通过长期实践和代价积累的判断力
  • compresses nuance:把大量细节与经验浓缩为快速判断

原文语境

约 71:40–76:00,Dianne 把判断、专业知识、坚持和独立观点视为未来仍关键的人类能力。

观点解读

判断不是拒绝使用 AI,而是决定目标、权衡不可量化因素,并对结果负责;它需要通过实践培养,不能只靠阅读。

A CLOSER LOOK

深度分析

Eval 是产品意图的可执行表示

它把用户痛点变成输入、期望输出和评分,能直接进入研究回归。

但 eval 会遗漏未知失败,必须持续从真实用户分布更新。

前沿 PM 是双语翻译者

一端是模糊、情绪化的用户反馈,另一端是训练、工具调用和行为分类。

把两端连接起来,比单纯写路线图更接近研究产品工作的核心。

判断与责任不会因生成自动化消失

模型可以起草、分析和反驳,但目标选择、权衡和签字仍需要责任主体。

越多内容由 AI 生成,验证机制和独立观点越重要。

LISTEN AGAIN

值得回听的时间点

00:00

开场与 Anthropic 编码拐点

模型与产品共同创造采用

02:31

早期 Anthropic 文化

理解研究、产品与安全协作

13:50

指数增长与 Token Maxing

解释前沿使用方式

23:30

Labs 孵化机制

观察小团队创新

27:30

研究 PM 的翻译工作

把反馈变成研究输入

44:16

Evals 与 PRDs

核心产品方法

58:10

Dianne 使用 Claude

亲手实践与独立观点

71:40

人类判断与未来能力

识别人类长期价值

人物、工具与数字

Dianne PennAnthropic LabsClaude CodeOpus 4.5MCPSkillscomputer useevalsPRDsClaude Constitution
PERSPECTIVES

立场与分歧

共同立场

  • 模型与产品载体必须共同演进
  • 用户反馈要变成可复现评测
  • AI 管理者必须保持亲手实践

主要分歧

  • Eval 更适合清晰可测问题,PRD 更适合模糊愿景与跨团队对齐
  • AI 可参与写作,但责任仍属于验证和签字的人
INTO PRACTICE

工作启发与行动

  • 产品团队需要建立反馈到 eval 再到训练的闭环
  • 研究型 PM 的核心能力是用户语言与模型语言之间的转换
  • 判断、独立观点和协作文化会成为 AI 时代稀缺资产

可以从这里开始

  1. 把一个高频模糊投诉拆成 20 个可复现样例
  2. 为明确行为写 eval,为模糊机会保留 PRD 与愿景探索
  3. 要求 AI 产品负责人每月亲自交付一个端到端项目
  4. 在 AI 写作流程中明确来源、验证人和最终签字责任
EVIDENCE & LIMITS

事实、观点与不确定项

以下沿用历史报告的标注与判断,归档迁移未对节目事实重新核验。

历史稿标注的事实

  • Dianne Penn 于 2023 年加入 Anthropic,官方介绍其为首位技术 PM
  • 官方页面提供完整逐字稿和章节
  • 本集时长约 94 分钟

观点与判断

  • Evals 正在成为新的 PRDs
  • 模型知道何时反驳会提升整体智能与有用性
  • 来之不易的人类判断会继续保持关键价值

仍需留意

  • 节目使用未来模型和产品命名,具体发布时间与能力以官方披露为准
  • “最快增长公司”等描述来自节目宣传语境,未独立核验
  • 关于人类判断长期价值属于嘉宾预测,不是可证明终局
LANGUAGE & CONCEPTS

金句与关键词

Evals are the new PRDs.

这句金句不是宣布 PRD 死亡,而是指出:对可测模型行为,评测集比长篇需求描述更接近真实工作定义。

BACK TO THE SOURCE

回到原始内容

保留历史报告的观点与证据边界。英文观点句沿用原稿标注,转述句不作为逐字引用。了解编辑说明

收录于 2026-07-27