多模态技术驱动AI应用落地与创新
1. 多模态技术与AI应用的突破
- Gemini 1.0:12月7日,谷歌推出了多模态大模型Gemini 1.0,标志着多模态技术的重大进展,这加速了AI应用的落地,特别是AI与绘画、视频的结合,如AI+绘图、AI+视频等领域。
2. AI扩图功能的兴起与普及
- AI扩图功能:AI扩图技术在各类应用中崭露头角,包括美图秀秀、剪映、Wink、Uncrop等APP纷纷加入AI扩图功能,满足用户的图片扩展需求。
- 用户参与度:随着大众软件的加入,AI图片创作成为大众参与的热门活动,推动了AI技术的普及与应用。
3. 不同产品特性和用户体验
- 美图秀秀:侧重于背景的扩展,保持主体的完整性,适合追求自然风格的用户。
- Wink:在主体周围添加背景,可能在处理有明显主体的图片时存在局限性。
- 剪映:以视频形式输出,通过模板快速生成图片,适用于短视频制作场景。
- Uncrop:增加主体内容,风格鲜明,适合创意导向的用户,但可能因元素过多而产生瑕疵。
4. 投资方向与关注点
- 多模态应用:关注AI+绘图领域的公司,如万兴科技。
- AI+视频:考虑投资涉及视频处理与生成技术的公司,如当虹科技、虹软科技。
- 大模型基座:关注基础模型构建的公司,如科大讯飞。
5. 风险提示
- 技术研发风险:大模型的持续研发可能面临技术瓶颈。
- 政策风险:政策环境的变化可能影响技术的应用与推广。
- 市场竞争风险:行业竞争加剧可能导致技术优势丧失。
- 测试结论风险:AI扩图技术的评估结果可能存在不确定性。
结论
多模态技术的快速发展正催化AI应用的创新与落地,特别是在AI扩图、AI+绘图和AI+视频领域展现出巨大的潜力。随着技术的不断进步和应用的普及,预计会有更多创新的AI功能和服务出现,同时,投资者应关注相关技术公司的动态,以把握市场机遇。然而,技术发展和应用过程中仍存在多重挑战和风险,需密切关注政策、市场和技术发展的动态。