表征:人工智能理解世界的底层语言
表征是模型对现实世界信息形成的内部抽象表示,是人工智能进行理解、推理与预测的基础,其学习质量直接影响下游任务上限。Bengio、Courville、Vincent等学者指出,机器学习效果很大程度取决于数据表示方式。我们将表征拆分为三层:数据层的向量编码、模型层的中间特征、哲学层的意义承载问题。
表征技术演进
表征技术演进可概括为四个阶段:
- 符号AI时代:依赖人工设计的离散符号和逻辑规则构建可解释表征,但存在接地困难和扩展成本高的问题。
- 特征工程时代:依赖SIFT、HOG、TF-IDF等专家特征与浅层模型,但迁移性和扩展性不足。
- 深度学习时代:通过神经网络端到端学习连续表征,AlexNet与Transformer是关键节点,但仍依赖大量人工标注。
- 基础模型时代:进一步走向跨任务、跨模态统一表征空间,GPT-3、CLIP等是代表,提升了通用性但也放大了可解释、幻觉与对齐问题。
表征路线分歧
当前围绕表征如何获得和承载,存在四组路线分歧:
- 表征中心vs生成中心:表征中心强调先学好表示,生成中心强调通过生成任务形成能力,两者互补。
- 符号表征vs分布式表征:符号路线强调符号和逻辑规则,连接主义路线强调分布式向量,神经符号路线尝试结合两者。
- 离散表征vs连续表征:离散路线将信号映射为token,连续路线保留连续数字空间表示,各有优劣。
- 显式表征vs隐式表征:显式路线生成可见未来状态,隐式路线预测潜空间中的关键状态,各有适用场景。
核心争议
表征研究仍面临五类基础问题:
- 表征是否等于理解:大模型学到的表征是否真正承载含义仍是开放问题,中文房间、随机鹦鹉等观点质疑模型是否真正理解。
- 表征坍缩问题:模型可能将不同输入映射为高度相似表示,需要引入适当不对称和去冗余约束避免坍缩。
- 表征的可辨识性:不同训练过程、数据来源和模态是否会收敛到相似表征,关系到表征的客观性和对应真实世界因果结构。
- 什么是“好表征”:尚无统一定义,归纳出任务准确率高、可解释、可迁移、与因果结构一致、解缠关键因素四类判据。
- 多模态统一表征是否可能:CLIP、ImageBind等取得进展,但仍面临模态特征损失和模态鸿沟问题。
物理AI落地
物理AI将表征问题从数字空间推向真实世界交互,自动驾驶和机器人领域存在分歧:
- 自动驾驶:
- 一段式与两段式架构
- 纯端到端与VLA路线
- 世界模型的部署位置和使用方式
- 显式生成与隐式潜空间
- 机器人:
- 动作离散token与连续动作
- 训练数据来源
- 单体VLA与快慢双系统
- 显式生成与隐式潜空间世界模型
两者共性在于均围绕物理世界的表征形式展开路线分化,差异在于数据来源、实时性与动作维度、世界模型定位。
结论
表征是理解AI范式演进的底层变量,决定机器以何种方式组织外部世界。当前围绕表征的路线分歧说明新一轮表征范式仍处于验证阶段,未来可沿统一世界表征、离散与连续路线、显式与隐式世界模型、可解释可控表征、因果表征与真实世界数据五个方向观察。