大模型进程焦点:OpenAI春季发布会及谷歌开发者大会要点归纳
OpenAI GPT-4o发布及应用
- GPT-4o发布:北京时间5月14日凌晨,OpenAI发布GPT-4o,该模型能接受文本、音频和图像任意组合输入,并生成相应的文本、音频和图像输出,响应速度接近人类水平。
- 功能升级:GPT-4o的文本和图像功能已应用于ChatGPT,免费用户享受额外调用额度,GPT-4o的API现已支持文本和视觉模型访问。
- 多模态交互:展示了一系列实时多模态交互能力,包括语音交流、情绪感知、多语言交互、视频实时交互以及代码协助等。
Google I/O大会亮点
- Gemini系列更新:Google I/O大会上,Gemini系列模型得到升级,包括引入Gemini 1.5 Pro、新增Gemma模型,以及更新Gemini版本以适应更复杂任务。
- AI代理项目:Google展示了AI代理项目Google Astra,旨在实现多模态交互,虽在实时性、情绪感知等方面与GPT-4o相比仍有提升空间。
- 视频生成模型Veo:推出高质量视频生成模型Veo,能生成电影级别的1080p视频,时间超过一分钟。
- Imagen3升级:升级文生图模型Imagen3,增强图像细节把控能力,减少视觉伪影,更好地融合提示信息,保持图像一致性。
- Lyria音乐生成模型:发布AI音乐生成模型Lyria,与音乐家合作开发音乐AI工具,为音乐创作提供新平台。
- 搜索与问照片功能:对谷歌搜索、问照片功能进行升级,提供AI概览搜索体验,满足复杂查询和照片搜索需求。
行业投资建议
- 关注AI陪伴+IP:汤姆猫、上海电影、奥飞娱乐、华策影视、中文在线等。
- AI+搜索:昆仑万维、三六零等。
- AI+影视:华策影视、慈文传媒、上海电影等。
- AI+IP与版权:芒果超媒、中广天择、华数传媒、中文在线等。
- AI+出版/教育:南方传媒、皖新传媒等。
- AI+游戏:巨人网络、恺英网络、神州泰岳、三七互娱、姚记科技、盛天网络等。
- 特别提示:微软系/语音助手类标的,如紫天科技、易点云、万兴科技、视觉中国、科大讯飞、商汤(港股)等。
风险提示
生成式人工智能模型的迭代速度、AI应用的实际效果均存在不确定性,投资者需谨慎评估风险。
总结
此报告概述了OpenAI春季发布会和谷歌开发者大会的关键信息,重点关注了大模型技术的最新进展及其应用。OpenAI推出了GPT-4o,提升了多模态交互能力,增强了文本、音频和图像处理的实时性和拟人化情感互动。Google则通过Gemini系列模型的升级、AI代理项目的展示、视频生成模型Veo的推出、Imagen3的改进以及Lyria音乐生成模型的发布,展现了其在生成式AI领域的持续进步。报告还提供了对相关行业和公司的投资建议,强调了AI技术在各个领域的潜在影响,并提醒了投资者面临的风险。