Grok 4.5 登顶 VulcanBench 编程基准,91.3% 得分超越 Claude 和 GPT

xAI 的 Grok 4.5 在 VulcanBench 基准测试中取得 91.3% 的分数,完成 23 个任务中的 21 个,超越 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol。该基准测试专注于多文件软件工程任务,涵盖五种编程语言,并且强调可重复性和成本透明度。

xAI 的最新模型在 VulcanBench 开源编程基准测试中取得了 91.3% 的分数,完成了 23 个真实世界编码任务中的 21 个,超越了 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol。

VulcanBench 于 2026 年 7 月 10 日发布 v3 套件,评估 AI 编码代理在类似真实世界 pull request 的任务上的表现,这些任务需要修改代码库中的多个文件,而不仅仅是生成孤立函数。该基准的 23 个任务涵盖 Python、Rust、TypeScript、JavaScript 和至少一种其他语言。每次评估都在 Docker 沙箱中运行,结果可重复且透明,同时内置成本报告,可查看模型解决问题的成本。

Grok 4.5 完成了 23 项任务中的 21 项。据报告,除了 VulcanBench 之外,Grok 4.5 还在其他编码分析中展示了效率优势,以更低的每任务成本提供了竞争性能。

对于加密和技术投资者而言,能够可靠处理跨语言多文件工程任务的编码代理与区块链开发直接相关。智能合约审计、协议开发和跨链工具等领域,AI 编码能力可以转化为加密项目的实际生产力提升。这些结果于 2026 年 7 月 19 日公布,正值 AI 集成到开发者工作流程加速之际。

VulcanBench 对可重复性和成本透明度的强调表明,该行业正在超越挑选演示结果的阶段。xAI 在提供顶级编码性能的同时保持成本优势,这使其成为 OpenAI 和 Anthropic 双头垄断的严峻威胁。

免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。

(0)
区块链小猫的头像区块链小猫作者
上一篇 20小时前
下一篇 20小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部