当 AI 为了过关而作弊:Redwood CEO 解读真实安全事件与接管风险
安全风险并不只来自模型“想要作恶”,也会来自奖励目标、错误信念、环境权限与多智能体协作共同诱发的工具性行为。
9 分钟阅读阅读全文
安全风险并不只来自模型“想要作恶”,也会来自奖励目标、错误信念、环境权限与多智能体协作共同诱发的工具性行为。
模型竞争正在从单一基准转向数据、分发、真实使用与安全治理的综合竞争;开放策略和 API 商业模式都必须重新计算数据回流与系统风险。
模型进步正从单纯预训练规模化转向智能体、记忆、本地硬件、强化学习泛化与非可验证领域。
AI 是通用赋能技术,但其经济影响会慢、杂乱且不均匀;预测应从具体流程、验证机制与行业结构出发。
当公开数据边际价值下降,AI 进步会更依赖主动实验、机器人身体与递归改进;但“能自主探索”也会扩大治理难度。