VulcanBench
-
Grok 4.5 登顶 VulcanBench 编程基准,91.3% 得分超越 Claude 和 GPT
xAI 的 Grok 4.5 在 VulcanBench 基准测试中取得 91.3% 的分数,完成 23 个任务中的 21 个,超越 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol。该基准测试专注于多文件软件工程任务,涵盖五种编程语言,并且强调可重复性和成本透明度。
xAI 的 Grok 4.5 在 VulcanBench 基准测试中取得 91.3% 的分数,完成 23 个任务中的 21 个,超越 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol。该基准测试专注于多文件软件工程任务,涵盖五种编程语言,并且强调可重复性和成本透明度。