传媒互联网行业周报:关注人机交互方式变革下的三条主线
时间:2024-05-20
作者:郑磊
报告摘要 OpenAI发布混合多模态模型GPT-4o,变革人机交互方式OpenAI发布混合多模态模型GPT-4o,该模型是OpenAI探索提升模型易用性的新成果,是一个集成文本、图片、视频、语音的全能模型。GPT-4o改变了人机交互方式,在功能上体现为具备实时语音及视频交互能力:1)在语音交互方面,GPT-4o响应音频输入的平均时间与人类对话的反应速度一致,实现实时的复杂对话、语音翻译、通过语音识别说话者情绪等功能;2)在视频交互方面,具备更复杂的多模态交互能力,实现实时识别视频拍摄内容,并给予反馈等功能。同时发布GPT-4o API,速度提高2倍,价格便宜50%,调用模型的速率限制较GPT-4-Turbo提高了5倍。 谷歌发布多项新成果,Project Astra实现视觉和语音交互谷歌I/O大会发布多项新成果:1)混合多模态模型发布:ProjectAstra具备与GPT-4o不相上下的视觉识别和语音交互效果,能够帮助用户整合工作流,提升效率;2)AI Overview重塑谷歌搜索:允许用户通过提问和聊天的方式进行AI驱动的搜索,且用户无需自行查阅结果,可由AI Overview代办一切;3)Gemini模型能力提升:Gemini1.5Pro上下文长度将从100万tokens提升至200万;4)多模态模型取得多项进展:文生视频模型Veo的扩展功能可持续增加视频时长,最终时长达1分10秒,超过Sora。文生图模型Imagen3提升文本渲染等能力。音乐工具Music AI Sandbox具备改变输入旋律风格等功能。 核心观点 我们认为,OpenAI GPT-4o和谷歌Project Astra均实现了实时语音及视频交互功能,改变了人机交互方式。建议关注三条主线:1)AGI具像化:视觉识别和语音交互功能有望以形象IP、数字人为载体实现具像化,利好拥有形象IP内容资产及数字人制作技术的公司。建议关注:形象IP:汤姆猫、上海电影,奥飞娱乐;数字人:捷成股份、蓝色光标、易点天下、天娱数科。2)强交互场景:人机交互方式改变有望在强交互性场景中催生新应用,看好情感陪伴、电商、教育场景;3)AI终端硬件:模型交互能力有望与硬件产品相结合,赋能用户日常工作生活。 风险提示 AI技术发展不及预期的风险、政策监管风险、行业竞争加剧的风险。