谷歌近日发布Gemini Live全新语音功能更新,试图让用户通过自然语音指令调用聊天、Spark、每日简报等能力,完成信息处理、任务执行等操作。谷歌表示,升级后的Gemini应用能够自动理解用户需求,无需用户判断具体任务应使用哪项功能。

谷歌大模型Gemini

不过,这一设计也暴露出当前AI应用面临的交互挑战。尽管谷歌希望通过语音入口简化操作,但Gemini仍将聊天、Spark和每日简报作为独立功能呈现,分别拥有不同图标和入口,增加了用户理解和选择成本。

其中,每日简报依托Gmail、日历等谷歌生态数据,为用户提供主动式个性化更新,但其信息筛选能力仍存在不足,部分提醒可能并非用户当前所需。相比之下,Spark作为具备任务执行能力的AI代理,更接近未来AI助手的发展方向,但谷歌将其独立品牌化,也让用户需要额外理解不同功能之间的区别。

这一问题并非Gemini独有。当前AI行业普遍存在将内部模型架构、功能模式直接暴露给用户的问题。例如,部分AI产品要求用户区分聊天、协作、代理等不同模式,而消费者更希望通过统一入口提出需求,由AI自动判断并调用合适能力。

业内认为,未来AI助手的发展方向可能是降低交互复杂度,将复杂的模型、代理和工具调用隐藏在后台。苹果围绕Siri的策略,以及部分基于文本交互的AI代理产品,均强调通过熟悉的聊天方式完成任务。随着AI能力不断增强,如何让用户无需学习新的操作逻辑,或将成为下一阶段AI产品竞争的重要方向。