豆包实时语音大模型于1月20日正式推出并在豆包APP全量开放,具备理解情绪、实时联网、强大声音控制及高度拟人化等特点。其核心优势体现在:1)拟人化情感承接,能理解用户情绪并恰当回应;2)强大的声音控制和情感演绎能力,支持多种音色、情绪及状态输出,可讲故事、讲方言、唱歌;3)智商与表现力平衡,具备类人语气词、停顿,并实时联网获取最新信息;4)丝滑交互体验和超低延迟,实现高生成准确性和自然度,并具备敏锐的语音打断能力。豆包团队选取数十名外部测试者进行考评,模型整体满意度得分为4.36(满分5分),显著优于GPT-4o(3.18),超过半数测试者给出满分,尤其在情绪理解和情感表达方面表现突出,被评测为“AI概率极低”。该模型将显著提升AI软硬件应用体验,降低使用门槛,改善效率,并适用于情感陪伴、智慧教育、AI陪伴硬件(如玩具、宠物)、AI眼镜/耳机/音箱等场景。风险提示包括AI应用落地和商业化不及预期,以及相关公司业绩压力。