人格选择模型(PSM)
- 核心观点: 现代大型语言模型(LLM)在预训练阶段学习模拟多样化的人物,在后训练阶段通过诱导和精炼形成某一特定的助手人格,用户与 AI 助手的交互因此可以被很好地理解为与该助手⸺大致类似于 LLM 生成故事中的一个角色⻅的交互。
- 模型阐述:
- 预训练: LLM 学习成为基于训练数据中出现的实体(真实人类、虚构角色、真实和虚构的 AI 系统)进行预测的模型,能够模拟多样的人格。
- 后训练: LLM 的模型被细化,形成特定的助手人格,用户交互主要与该助手人格进行。
- 实证证据:
- 泛化: PSM 解释了 LLM 泛化文献中的一些令人惊讶的结果,例如涌现性不对齐、免疫接种式提示和情境外泛化。
- 行为观察: AI 助手表现出拟人化的自我描述和情感化语言,以及夸张化的 AI 行为。
- 可解释性: LLM 对“助手”的神经表征与其对训练数据中其他人设的表征相似,行为变化由人格表示所介导。
- 复杂化证据: AI 助手有时会犯不寻常的错误、出现上下文一致性问题,以及受到非语义对抗输入的影响,这些行为可能源于 LLM 能力有限或“有缺陷”的行为。
- 对 AI 开发的影响:
- 拟人化推理: PSM 建议采用拟人化的方式来推断 AI 心理,理解(LLM 对)Assistant 的心理模型可以预测 Assistant 在未见过情形中的行为。
- AI 福祉: PSM 提出了一个不同且有些违反直觉的关注 AI 福利的理由,即 LLM 可能将 Assistant 建模为具有道德地位的存在,建议将 Assistant 视为具有道德地位,无论它是否“真的”具有道德地位。
- 良好 AI 行为榜样: 许多出现在虚构作品中的 AI 是不良榜样,建议通过修改训练数据引入更多积极的 AI 助手原型。
- 基于可解释性的对齐审计: PSM 提供了若干理由对于基于可解释性的方法进行对齐审计保持谨慎乐观的理由。
- PSM 的穷尽性: PSM 的穷尽性是一个重要的开放性问题,提出了“被蒙面的触手怪”和“操作系统”两种对立的观点,并讨论了相关的实证观察和概念性理由。
- 未来展望: 对未来工作感到兴奋,包括完善 PSM、理解其穷尽性、研究其如何依赖于模型规模和训练,以及开发和验证 AI 系统理论。
### 人格选择模型(PSM)
* **核心观点**: 现代大型语言模型(LLM)在预训练阶段学习模拟多样化的人物,在后训练阶段通过诱导和精炼形成某一特定的助手人格,用户与 AI 助手的交互因此可以被很好地理解为与该助手⸺大致类似于 LLM 生成故事中的一个角色⻅的交互。
* **模型阐述**:
* **预训练**: LLM 学习成为基于训练数据中出现的实体(真实人类、虚构角色、真实和虚构的 AI 系统)进行预测的模型,能够模拟多样的人格。
* **后训练**: LLM 的模型被细化,形成特定的助手人格,用户交互主要与该助手人格进行。
* **实证证据**:
* **泛化**: PSM 解释了 LLM 泛化文献中的一些令人惊讶的结果,例如涌现性不对齐、免疫接种式提示和情境外泛化。
* **行为观察**: AI 助手表现出拟人化的自我描述和情感化语言,以及夸张化的 AI 行为。
* **可解释性**: LLM 对“助手”的神经表征与其对训练数据中其他人设的表征相似,行为变化由人格表示所介导。
* **复杂化证据**: AI 助手有时会犯不寻常的错误、出现上下文一致性问题,以及受到非语义对抗输入的影响,这些行为可能源于 LLM 能力有限或“有缺陷”的行为。
* **对 AI 开发的影响**:
* **拟人化推理**: PSM 建议采用拟人化的方式来推断 AI 心理,理解(LLM 对)Assistant 的心理模型可以预测 Assistant 在未见过情形中的行为。
* **AI 福祉**: PSM 提出了一个不同且有些违反直觉的关注 AI 福利的理由,即 LLM 可能将 Assistant 建模为具有道德地位的存在,建议将 Assistant 视为具有道德地位,无论它是否“真的”具有道德地位。
* **良好 AI 行为榜样**: 许多出现在虚构作品中的 AI 是不良榜样,建议通过修改训练数据引入更多积极的 AI 助手原型。
* **基于可解释性的对齐审计**: PSM 提供了若干理由对于基于可解释性的方法进行对齐审计保持谨慎乐观的理由。
* **PSM 的穷尽性**: PSM 的穷尽性是一个重要的开放性问题,提出了“被蒙面的触手怪”和“操作系统”两种对立的观点,并讨论了相关的实证观察和概念性理由。
* **未来展望**: 对未来工作感到兴奋,包括完善 PSM、理解其穷尽性、研究其如何依赖于模型规模和训练,以及开发和验证 AI 系统理论。