- 核心观点:Google发布新一代开源语言模型Gemma 4,模型能力实现跃迁,将催化终端硬件升级周期。
- 模型能力增强:
- Agent与复杂推理:支持多步骤推理与复杂逻辑规划,具备面向Agent场景的自主工作流执行能力,可调用多种工具与API。
- 多模态:所有模型原生支持图像与视频处理,E2B/E4B版本额外支持原生音频输入,OCR与图表理解能力突出。
- 离线代码生成:支持本地环境下代码生成。
- 长上下文:小模型支持128K上下文窗口,大模型最高支持256K,提升长文档与复杂任务处理能力。
- 多语言能力:支持超过140种语言。
- 技术迭代聚焦:
- 内存效率:延续Per-Layer Embeddings(PLE)机制,降低终端硬件使用门槛,使模型可在中端设备上运行。
- 长上下文优化:通过“交替式滑动窗口+全局注意力”及Shared KV Cache设计,大幅优化内存使用效率,使KV缓存需求较传统全注意力机制下降74%。
- 多模态下沉:将视觉+音频的原生多模态能力首次下沉至2B级模型,为手机端实现理解屏幕、语音交流等功能提供技术基础。
- 生态与落地:
- 开源协议:切换至Apache2.0协议,降低企业采用门槛,吸引更多开发者与商业客户。
- Android体系:作为Gemini Nano 4的基础模型,计划年内落地新一代旗舰Android设备。
- 生态建设:Gemma系列累计下载量超4亿次,衍生模型超10万个,初步形成Gemmaverse开发者生态。
- 研究结论:
- 端侧AI加速:Gemma 4通过架构创新提升端侧模型对多模态任务的处理能力,并扩大可触达设备范围,加速端侧AI产业节奏。
- 硬件升级催化:开源协议放宽与Android体系导入将驱动端侧硬件性能升级与新形态产品创新,带动新一轮换机周期。
- 风险提示:技术创新不及预期风险、终端需求不足风险、宏观环境风险。