xAI推出新一代语音识别模型 Grok Voice Think Fast2.0,面向构建语音智能体的开发者开放,在智能水平、转录准确率、对话能力以及工具调用效率方面实现升级。该模型定价为每分钟音频0.08美元,xAI表示无需修改现有提示词,Think Fast2.0即可在多数应用场景中带来性能提升。

在Artificial Analysis语音识别基准测试中,Grok Voice Think Fast2.0综合得分达到82.9%,高于前代Think Fast1.0的75.7%,同时超过GPT-Realtime-2.1的79.1%和Gemini3.1Flash的69.5%。其中,智能体能力评分达到56.5%,领先于Think Fast1.0的52.1%、GPT-Realtime-2.1的45.7%以及Gemini3.1Flash的37.7%。模型首次音频播放时间也从1.25秒降低至0.70秒,响应速度进一步提升。

QQ20260730-105746.jpg

在语音转录方面,xAI针对24种语言的大量语音片段进行了测试。官方数据显示,相比Deepgram Nova3和ElevenLabs Scribe v2,Think Fast2.0的转录准确率提升约1.5至2倍;相比上一代模型,准确率提升约1.4倍。在背景噪音和电话压缩等复杂环境下,xAI称两者差距可扩大至约10倍。

技术层面,Think Fast2.0支持语音并行推理,通过减少等待时间提升复杂任务处理效率。相比上一代模型,其推理标记使用量中位数下降至0.4次,使工具调用通常能够在智能体完成首句回复前执行。同时,强化学习优化了模型对话策略,使其倾向于采用更短回答、单次处理一个问题,并减少无效信息输出,以更好支持复杂工作流程。

xAI表示,此次升级主要面向真实业务场景中的语音Agent可靠性提升。目前,Grok Voice已在Starlink电话服务中进行A/B测试,并带来了销售转化率和客服响应效率提升。

按照计划,2026年8月5日,grok-voice-latest别名将自动从grok-voice-think-fast-1.0切换至grok-voice-think-fast-2.0。仍需使用旧版本的开发者需要提前锁定1.0版本标识符,其他用户无需额外操作。

随着AI Agent逐步进入客服、销售、办公等实际应用场景,低延迟、高准确率、多工具协同的语音模型正成为下一阶段智能交互的重要基础。