Grok 4.5登顶FrontierSWE榜单第二,性能碾压Claude Opus与GPT-5.5
AI军备竞赛又迎来一位值得关注的选手。xAI于7月8日发布的Grok 4.5在FrontierSWE排行榜上以4.09分跃居第二,超越Anthropic的Claude Opus 4.8和OpenAI的GPT-5.5,这一基准测试被视为衡量真实软件工程能力的最重要指标。FrontierSWE评分越低越好。Claude Opus 4.8以4.82分位居第三,GPT-5.5以5.21分排名第五。在模型性能差异微乎其微的领域,如此大的差距已非“四舍五入”可解释,而是“不同量级”。该模型专为编程打造,旨在处理长周期软件工程任务——开发者需要AI跨多文件推理数千行代码的场景。Grok 4.5拥有...