三句话速览
- 01
行为基础模型试图学习人类如何在社会情境中行动,而不只是生成“理性”的标准答案。
- 02
其训练资源不是网页文字,而是访谈、观察数据、交易记录与实验,由此建立个人和群体层面的数字孪生。
- 03
真正的价值不只是预测未来,而是让决策者在安全环境里比较政策、产品和社会系统可能造成的连锁反应。
当模型从语言规律进一步学习社会互动规律,模拟可能成为继参数、数据和计算之后的新扩展维度,但可信度必须按具体人群与任务持续验证。
10 条核心观点
01行为模型学习“社会物理学”
Behavior foundation models aim to learn the social physics behind how people act.
行为基础模型旨在学习人们行动背后的“社会物理学”。
- behavior foundation model:行为基础模型
- social physics:社会物理学
- aim to:旨在
原文语境
嘉宾用 social physics 描述个人、群体、规范和环境交互后产生的行为规律。
观点解读
这区别于只会给合理答案的聊天模型:模拟需要复现真实人的矛盾、惯性和非理性。
02训练数据必须接近真实生活
Interviews, observations, transactions, and experiments provide richer behavioral data than text alone.
访谈、观察、交易与实验,比单纯文本提供更丰富的行为数据。
- transaction:交易记录
- observation:观察
- behavioral:行为层面的
原文语境
研究团队使用深度访谈,也讨论观察和随机对照实验等来源。
观点解读
要预测行为,模型不能只学习人们公开写了什么,还要学习他们实际做了什么以及在何种条件下改变。
03数字孪生可在限定任务上复现个人
Digital twins reproduced responses about 85 percent as accurately as people reproduced their own answers.
数字孪生复现回答的准确度,约达到人们复现自己答案时准确度的 85%。
- digital twin:数字孪生
- reproduce:复现
- accurately:准确地
原文语境
节目引用 1,000 人研究,并用受试者重复回答自身问题作为人类一致性基线。
观点解读
85% 是相对人类自我复测的结果,不代表模型对所有真实行为都有 85% 绝对准确率。
04“更聪明”的模型未必更像人
A model optimized for rational answers can be a poor simulation of irrational human behavior.
为理性答案优化的模型,可能很难模拟非理性的人类行为。
- optimized for:为…优化
- rational:理性的
- irrational:非理性的
原文语境
嘉宾估计不同人群中不符合狭义理性的行为比例可能很高,并指出前沿模型被训练得更正确。
观点解读
模拟的目标不是给最佳建议,而是忠实表示目标人群;这需要不同的训练与评价函数。
05仅靠提示词不足以学会行为
Behavioral fidelity must be learned in the model weights, not merely added through a prompt.
行为忠实度必须学习进模型权重,而不能只靠提示词附加。
- fidelity:忠实度
- model weights:模型权重
- merely:仅仅
原文语境
节目强调需要 post-training,让模型在权重层学习行为分布。
观点解读
提示词能指定角色,却容易产生刻板、表面的模仿;权重训练才可能捕捉稳定的反应模式。
06个人与群体模拟是两种产品
Individual-level and population-level models answer different classes of questions.
个体层模型与群体层模型回答的是不同类别的问题。
- individual-level:个体层
- population-level:群体层
- class of questions:问题类别
原文语境
对话区分个人代理与人群分布模型,并讨论二者在产品研究和政策分析中的用途。
观点解读
个体孪生适合持续了解一个人,群体模型适合观察涌现结构;不能用平均人代表真实人口。
07模拟的目标是塑造而非宣判未来
Decision makers often need to understand how to shape the future, not simply predict it.
决策者往往需要理解如何塑造未来,而不只是预测未来。
- decision maker:决策者
- shape:塑造
- predict:预测
原文语境
嘉宾说客户真正关心的是不同干预会怎样改变结果。
观点解读
模拟最有价值的形式是反事实实验台:比较多个行动及其副作用,而不是输出一个确定预言。
08涌现效应无法从个人答案直接推断
Small individual preferences can create large emergent social patterns.
微小的个人偏好可能形成巨大的社会涌现模式。
- emergent:涌现的
- preference:偏好
- social pattern:社会结构
原文语境
节目引用 Schelling 隔离模型:个人只有轻微邻居偏好,也会形成明显分隔。
观点解读
复杂系统的结果来自互动回路,问卷式的“你会怎么做”无法替代群体运行。
09Scaling Law 也可能作用于人类数据
Simulation quality may scale as behavioral data and compute grow together.
随着行为数据与算力共同增长,模拟质量也可能按规律扩展。
- scale:按规模提升
- compute:计算资源
- behavioral data:行为数据
原文语境
团队观察到增加人类数据、训练和计算后,模拟性能出现可预测改善。
观点解读
这是嘉宾提出的新兴规律,并非已被广泛验证的自然定律;关键约束会是高质量人类数据。
10终局愿景是模拟全人类互相作用
The long-term vision is to simulate billions of people interacting around wicked problems.
长期愿景是模拟数十亿人的互动,以研究棘手复杂问题。
- long-term vision:长期愿景
- billions:数十亿
- wicked problem:棘手复杂问题
原文语境
嘉宾设想覆盖约 80 亿人的模型,用于气候、民主等问题。
观点解读
这是一项方向性愿景,数据权利、偏差、计算成本和治理风险都会决定它能否落地。
深度分析
从语言模型到社会模型
语言模型学习表达的统计结构,行为模型要学习人、规范和环境之间的反馈结构。后一任务对数据来源、评价基线和责任边界提出了更高要求。
模拟不是预言机器
最可信的产品定位不是告诉管理者唯一未来,而是允许他们比较干预。输出应呈现分布、敏感性和失败条件,避免制造虚假的确定性。
数据权利将成为护城河与约束
高质量行为数据比公开文本稀缺,也更敏感。谁能在知情同意、可撤回和用途限制下取得长期数据,谁才可能建立可信的行为模型。
值得回听的时间点
Smallville 与生成式代理
回顾研究如何从虚拟小镇开始。
社会物理学
定义行为基础模型的核心对象。
数字孪生与 85%
解释研究评价基线和边界。
模拟 Scaling Law
讨论数据、计算和性能关系。
Schelling 社会模拟
展示个体偏好如何形成涌现结构。
商业与政策用例
从研究走向决策工具。
人物、工具与数字
立场与分歧
共同立场
- 模拟必须以目标人群的真实行为为准,而非以模型是否理性为准。
- 真正价值是比较干预带来的未来路径。
主要分歧
- 行为模拟与传统因果模型应互补;节目没有主张当前系统已经能可靠替代政策实验。
工作启发与行动
- 用户研究可从汇总洞察升级为可反复询问的行为模型。
- 产品团队必须为不同人群分别校准,不能只验证一个平均分。
可以从这里开始
- 选一个可验证的用户决策,建立人类复测基线。
- 收集访谈与实际行为数据,分开标注“说法”和“行动”。
- 用未见过的情境检验数字孪生,而不是只测训练问题。
- 把模拟作为方案比较工具,并保留真实实验作最终校准。
事实、观点与不确定项
以下沿用历史报告的标注与判断,归档迁移未对节目事实重新核验。
历史稿标注的事实
- 官方页面提供完整英文逐字稿。
- 节目讨论的研究包含约 1,000 名参与者和重复测量基线。
观点与判断
- 社会模拟可能成为新的扩展规律。
- 未来可以模拟全球人口来帮助处理复杂问题。
仍需留意
- 85% 是特定研究与基线下的结果,不能泛化为通用预测准确率。
- “80 亿人模拟”属于长期愿景,非已交付能力。
金句与关键词
Like, let’s just create a world.“那就创造一个世界吧。”它概括了研究从回答问题走向搭建可互动社会环境的野心。
回到原始内容
保留历史报告的观点与证据边界。英文观点句沿用原稿标注,转述句不作为逐字引用。了解编辑说明
收录于 2026-08-24