GPT-4o发布:多模态能力提升及免费开放
发布概览:
OpenAI于5月14日发布了GPT-4o,这一全新大模型旨在适应未来的人机交互范式,具备文本、语音、图像三种模态的理解能力,并表现出快速反应和情感表达的特点。
主要特点:
- 多模态能力:GPT-4o在多种模态间展现出强大的实时推理能力,尤其在视觉和音频理解方面有显著提升,支持用户上传各种图片、视频及包含图片和文字的文档进行讨论。
- 更人性化:通过声音和图像感知,实现情绪分析,让交流更贴近人类体验。
- 快速响应与低成本API:GPT-4o的平均响应时间大幅缩短至320毫秒,API成本降低50%,提升用户体验。
- 3D视觉内容生产:能从多个生成的图像构建3D模型。
免费提供与新应用:
GPT-4o将免费向公众开放,并推出桌面版ChatGPT,旨在使AI应用更易于集成到日常工作中。
竞争趋势:
- 海内外大模型竞争加剧,聚焦于多模态能力、Agent能力及API调用成本优化。
- 预计AI应用将在影视、音乐、教育、营销、搜索、办公等领域实现更高效、更具性价比的商业化。
风险提示:
- 多模态大模型技术发展存在不确定性。
- AIGC(人工智能内容生成)商业化进程可能面临挑战。
投资建议:
建议关注AI应用领域,特别是:
- AI影视(如上海电影、阅文集团)
- AI音乐(如盛天网络、云音乐)
- AI教育(如世纪天鸿、南方传媒、盛通股份)
- AI营销(如引力传媒、因赛集团、蓝色光标)
- AI Agent(如奥飞娱乐、汤姆猫)
- AI+3D(如锋尚文化、风语筑、凡拓数创、丝路视觉、恒信东方)
以上总结基于提供的文字内容,详细阐述了GPT-4o的发布背景、特点、商业化前景及其对各行业的影响,并提出了投资领域的建议,同时指出了潜在的风险。