今天一早,SpaceXAI 推出最强模型 Grok4.7。发布页开头只有一句极具“攻击性”的定位:面向编程与知识工作的最强模型,速度达可比模型两倍,价格仅一半。这次升级没有停留在跑分表上——Grok4.7换用更大的基础模型,强化长时间任务、自我检查和长上下文管理,并把文档、演示、法律、医疗和工程等专业工作纳入重点测试,目标是让模型在持续数小时的任务里少走弯路、交出可直接使用的结果。
马斯克发推称,Grok4.7在智能水平、运行速度和成本之间取得了“很有竞争力的平衡”。

长任务成为主战场
Grok4.7采用比 Grok4.6更大的基础模型,训练阶段延长了强化学习周期,任务组合进一步加难,其中更多样本需要数小时完成。官方称新模型在检查自身工作、管理长上下文方面均有提升,直接对应编程智能体最棘手的问题:复杂软件任务包含读仓库、拆需求、改多处文件、跑测试和反复纠错,模型能否在漫长执行链中保持目标、发现错误,往往比一次写出漂亮代码更重要。

在考察长时间编码的 CursorBench4.0上,Grok4.7得分46.3%,高于上一代的40.4%;DeepSWE v1.1高推理强度成绩71.0%;Terminal-Bench4.0从上一代20.3% 升至38.0%。模型也被训练为原生理解 Grok Bot 运行框架,官方称这改善了对话与通用知识工作表现,意味着升级重点已从单轮回答延伸到模型与工具、执行环境的持续协作。
从写代码走向完整知识工作
编程仍是 Grok4.7最醒目的标签,但评测范围明显更宽。AA Briefcase v1.1上它获1657分(上代1546),GDPval Elo 由1605升至1695,接近 Fable5.1的1735,高于 GPT-6Astra 的1542。专业领域同样提升:EEBench 由53.0% 升至64.0%,Harvey Legal Agent Benchmark 由15.8% 升至19.6%,HealthBench Professional 由48.5% 升至56.7%。这透露出清晰趋势——前沿模型竞争正进入“完成整项工作”阶段,需理解任务、调用工具、产出文件并自行复核。
安全方面,Grok4.7启用全新防护体系,官方称是拒答与抵抗越狱表现最强的一款;生物安全 LatchBio 基准以62.4% 登顶,HackerBench v0.3仅放行3.3% 高风险双重用途提示,并很少误拦正常安全研究。SpaceXAI 还向少数网络安全伙伴开放邀请制红队能力。
价格上,标准版起价每百万输入 Token2美元、输出6美元,与 Grok4.6一致;快速版速度翻倍。Grok4.7已上线 Cursor 和 Grok Build,并通过 API、第三方框架及云平台提供。开发者无需为换代多付标准版 Token 成本,却能获得更强的长任务与专业工作表现。不过网友似乎并不买账,有人直言“这种模型居然也敢发布”。客观来看,Grok4.7的卖点并非全面碾压竞品,而是用远低于部分旗舰的 API 成本,换来了相当接近、并在个别专业任务上领先的性能。
VIP会员