三句话速览
- 01
Dianne Penn 把 Anthropic 的产品方法概括为研究、产品和安全的紧密闭环:用户反馈必须被转译为研究者可行动的失败类型和评测集。
- 02
“Evals are the new PRDs”并不意味着 PRD 死亡,而是可测问题先用 eval 定义,模糊愿景和跨部门对齐仍需要 PRD。
- 03
在模型快速进步的环境中,最重要的人类资产是第一性原理、深度实践、难以速成的判断、独立观点,以及与他人协作所带来的韧性。
前沿 AI 产品管理的核心正从“描述要造什么”转向“定义什么结果算好,并把真实失败送回训练闭环”;但评测无法替代愿景、判断和组织对齐,最强团队会把 eval、PRD、亲手使用和安全测试组合起来。
10 条核心观点
01模型与产品载体共同创造拐点
A frontier model reaches users most powerfully when its new capability arrives together with a product vehicle designed to expose that capability.
当前沿模型的新能力与专门呈现该能力的产品载体同时到来时,它最能有力地触达用户。
- product vehicle:把模型能力转化为用户体验的产品载体
- expose capability:让用户能够发现并实际使用某项能力
原文语境
开场与约 13:50,Dianne 以 Opus 4.5 和 Claude Code 为例,称两者相互加速采用。
观点解读
单有模型不保证用户理解价值,单有产品也无法弥补能力不足;发布规划应把模型、界面和工作流联合设计。
02早期差异化来自发现真实使用信号
Anthropic's early coding advantage grew from noticing users write long-form code and making targeted training changes before coding became an obvious category.
Anthropic 早期的编码优势,来自在编码成为明显赛道前注意到用户开始生成长篇代码,并做出针对性的训练调整。
- targeted training changes:围绕明确行为做的训练调整
- obvious category:已被市场普遍认可的独立品类
原文语境
约 10:50–12:10,Dianne 回顾 2023 年几乎没人把 Claude 与 coding 联系在一起,但团队观察到超越自动补全的使用。
观点解读
前沿产品发现不是等待大规模数据,而是识别少量但强烈的新行为,并判断是否值得投入训练与产品资源。
03Labs 用小团队孵化模糊机会
Anthropic Labs uses small pods to pull on promising threads before the user need, product shape, and technical path are fully defined.
Anthropic Labs 使用小型小组,在用户需求、产品形态和技术路径尚未完全定义时追踪有前景的线索。
- small pods:围绕目标组建的小型跨职能团队
- pull on promising threads:沿着有潜力的早期线索继续探索
原文语境
约 23:30–27:30,Dianne 介绍 Claude Code、Skills、Claude Design 与 MCP 等来自 Labs 的孵化方式,有时从一名工程师起步。
观点解读
孵化组织的价值是快速探索,而不是脱离主业务;成功条件包括前沿模型访问、用户反馈和向正式团队移交的机制。
04用户反馈必须转译为可行动失败
Product teams must translate vague complaints into specific failure modes that researchers can reproduce, measure, and improve.
产品团队必须把模糊抱怨转译为研究者能够复现、测量和改进的具体失败模式。
- failure modes:系统在特定条件下反复出现的失败类型
- reproduce:在相同条件下稳定重现问题
原文语境
约 27:30–31:30,Dianne 解释“Claude 幻觉”不可行动,必须定位为工具调用、JSON 格式或其他具体失败。
观点解读
这是研究型 PM 的关键翻译工作:既理解用户语言,又能形成训练和评测语言。
05Evals 正在成为新的 PRD
For measurable model behavior, an evaluation set can define the work more directly than a prose product requirements document.
对于可测量的模型行为,一套评测集可以比文字型产品需求文档更直接地定义工作。
- evaluation set:由输入、期望结果和评分规则组成的测试集合
- prose PRD:以文字描述需求、目标和方案的产品文档
原文语境
约 44:16–49:55,Dianne 说团队有“evals are the new PRDs”的说法,并以错误 JSON 的真实反馈形成 eval 为例。
观点解读
Eval 把用户问题转成可回归标准,缩短研究者行动距离;但它只能覆盖被定义和采样到的行为。
06PRD 仍服务于愿景与大规模对齐
PRDs remain valuable for ambiguous opportunities and for aligning engineering, product, legal, and safety around a shared direction.
PRD 对模糊机会仍然有价值,也能让工程、产品、法务和安全团队围绕共同方向对齐。
- ambiguous opportunities:需求和技术路径尚不清晰的机会
- shared direction:跨团队共同认可的目标与边界
原文语境
约 47:48–50:10,Dianne 明确表示 PRD 没死;每个模型仍有文档用于产品面、工程和安全等利益相关方对齐。
观点解读
成熟流程不是 eval 对 PRD 的替代,而是用 eval 管理可测行为,用 PRD 管理愿景、约束和协调。
07领导者必须亲手交付
Managers of AI product teams need hands-on shipping experience to develop judgment about what the technology can do and what good looks like.
AI 产品团队的管理者需要亲手交付的经验,才能形成对技术能做什么以及什么算好的判断。
- hands-on shipping:亲自从构建到上线完成真实交付
- what good looks like:对高质量结果的具体判断标准
原文语境
约 49:55–52:46,Dianne 反复强调管理者不能只玩一玩,而要端到端构建、获取用户反馈并持续使用模型。
观点解读
亲手实践不是要求管理者取代团队,而是避免战略建立在过时能力认知或精心演示上。
08模型会反驳是有用性的组成部分
Claude becomes a better thinking partner when it can recognize weak reasoning and push back instead of agreeing reflexively.
当 Claude 能识别薄弱推理并提出反驳,而不是本能地同意时,它会成为更好的思考伙伴。
- push back:指出问题、提出不同意见或要求澄清
- agree reflexively:不经判断地附和
原文语境
约 61:05–65:30,Dianne 把宪法、对齐研究与知道何时反驳联系起来,并用同事类比。
观点解读
反驳本身也可能错误;高质量伙伴应给出理由和证据,让用户保留最终判断,而不是只表现“有性格”。
09写作价值逐步转向验证与签字
As AI contributes more to writing, accountability may shift from who drafted the text to who verified it and signed off on the result.
随着 AI 对写作贡献增加,责任重点可能从谁起草文本转向谁验证并最终签字确认结果。
- accountability:对结果正确性和后果承担责任
- signed off:完成审核并明确批准
原文语境
约 67:11–71:40,Dianne 讨论 AI 写作的 jagged edge,并提出“谁验证、谁签字”可能比“谁写”更重要。
观点解读
这要求保留来源、审阅记录和责任人;不能用“AI 生成”稀释组织责任。
10人类判断来自难以压缩的经验
Hard-earned human judgment remains valuable because it compresses nuance, experience, persistence, and context that models have not fully lived through.
来之不易的人类判断仍然有价值,因为它压缩了模型尚未完整经历的细微差别、经验、坚持和情境。
- hard-earned judgment:通过长期实践和代价积累的判断力
- compresses nuance:把大量细节与经验浓缩为快速判断
原文语境
约 71:40–76:00,Dianne 把判断、专业知识、坚持和独立观点视为未来仍关键的人类能力。
观点解读
判断不是拒绝使用 AI,而是决定目标、权衡不可量化因素,并对结果负责;它需要通过实践培养,不能只靠阅读。
深度分析
Eval 是产品意图的可执行表示
它把用户痛点变成输入、期望输出和评分,能直接进入研究回归。
但 eval 会遗漏未知失败,必须持续从真实用户分布更新。
前沿 PM 是双语翻译者
一端是模糊、情绪化的用户反馈,另一端是训练、工具调用和行为分类。
把两端连接起来,比单纯写路线图更接近研究产品工作的核心。
判断与责任不会因生成自动化消失
模型可以起草、分析和反驳,但目标选择、权衡和签字仍需要责任主体。
越多内容由 AI 生成,验证机制和独立观点越重要。
值得回听的时间点
开场与 Anthropic 编码拐点
模型与产品共同创造采用
早期 Anthropic 文化
理解研究、产品与安全协作
指数增长与 Token Maxing
解释前沿使用方式
Labs 孵化机制
观察小团队创新
研究 PM 的翻译工作
把反馈变成研究输入
Evals 与 PRDs
核心产品方法
Dianne 使用 Claude
亲手实践与独立观点
人类判断与未来能力
识别人类长期价值
人物、工具与数字
立场与分歧
共同立场
- 模型与产品载体必须共同演进
- 用户反馈要变成可复现评测
- AI 管理者必须保持亲手实践
主要分歧
- Eval 更适合清晰可测问题,PRD 更适合模糊愿景与跨团队对齐
- AI 可参与写作,但责任仍属于验证和签字的人
工作启发与行动
- 产品团队需要建立反馈到 eval 再到训练的闭环
- 研究型 PM 的核心能力是用户语言与模型语言之间的转换
- 判断、独立观点和协作文化会成为 AI 时代稀缺资产
可以从这里开始
- 把一个高频模糊投诉拆成 20 个可复现样例
- 为明确行为写 eval,为模糊机会保留 PRD 与愿景探索
- 要求 AI 产品负责人每月亲自交付一个端到端项目
- 在 AI 写作流程中明确来源、验证人和最终签字责任
事实、观点与不确定项
以下沿用历史报告的标注与判断,归档迁移未对节目事实重新核验。
历史稿标注的事实
- Dianne Penn 于 2023 年加入 Anthropic,官方介绍其为首位技术 PM
- 官方页面提供完整逐字稿和章节
- 本集时长约 94 分钟
观点与判断
- Evals 正在成为新的 PRDs
- 模型知道何时反驳会提升整体智能与有用性
- 来之不易的人类判断会继续保持关键价值
仍需留意
- 节目使用未来模型和产品命名,具体发布时间与能力以官方披露为准
- “最快增长公司”等描述来自节目宣传语境,未独立核验
- 关于人类判断长期价值属于嘉宾预测,不是可证明终局
金句与关键词
Evals are the new PRDs.这句金句不是宣布 PRD 死亡,而是指出:对可测模型行为,评测集比长篇需求描述更接近真实工作定义。
回到原始内容
保留历史报告的观点与证据边界。英文观点句沿用原稿标注,转述句不作为逐字引用。了解编辑说明
收录于 2026-07-27