- 实验背景与目的:Nof1团队开展“AlphaArena”实验,测试六大顶尖大语言模型在真实加密货币市场中的零样本决策能力。为每个模型分配1万美元初始资金,观察其在完全自主交易中的表现。
- 实验过程与排名变化:比赛初期Grok-4领先,但自10月23日起,Qwen与DeepSeek反超并持续领跑。Qwen风格激进,高杠杆重仓比特币;DeepSeek策略稳健,分散投资于多种山寨币。市场波动中,DeepSeek在10月27日前后实现对Qwen的反超,并逐渐扩大优势。其他海外模型如GPT-5和Gemini表现不佳,始终亏损。
- 最终排名与表现:最新数据显示,DeepSeekChatV3.1以14,632美元(回报率+46.32%)位居第一,Qwen3Max以13,174美元(回报率+31.74%)位列第二。其余模型均录得亏损,GPT-5表现最差,账户价值仅为2,519美元(回报率-74.81%)。
- 模型特性与投资风格:实验揭示AI模型的“原生家庭”背景与训练数据影响其投资风格。DeepSeek(源自幻方量化)表现稳健,Qwen(依托阿里巴巴)风格激进。美国模型中,GPT-5过度追求最优解导致频繁交易失败,Claude拒绝做空,Gemini高频试错,Grok固执于宏观叙事。
- AI投资能力的双重性:一方面,DeepSeek和Qwen证明训练范式与特定场景高度契合,但优势具有情境依赖性。另一方面,AI暴露出与人类相似的缺陷,如过度交易、缺乏市场状态感知能力、盈亏同源等,印证了纪律与风险控制的重要性。
- 未来展望与挑战:AI在数据处理与纪律执行上的优势可能重塑金融格局,但若市场演变为AI对抗,可能引发策略趋同、市场波动加剧等风险。未来需构建促进策略多样性、防范系统性风险的多智能体生态。
- 风险提示:需警惕AI模型“幻觉”、数据安全及合规适配等潜在风险。