Meta 周三推出旗下首款 AI 编程代理 Muse Code(测试版)。然而在 Meta 随发布公开的基准对比中,Anthropic 的 Claude Opus 5 在所有四项比较里全部胜出。Meta 仍选择公布这些图表,意在推销更便宜而非更强的工具。独立测试数据暗示,实际性能差距比 Meta 展示的更宽。
Muse Code 由编程专用模型 Muse Spark 1.2 驱动。它在 Terminal-Bench 2.1 上得分 82.9%,而 Claude Opus 5 为 86.7%。Terminal-Bench 由 Laude Institute 与斯坦福研究人员推出,涵盖 89 个真实任务,涉及系统修复、数据处理和安全。第二名的成绩并不差,Muse Code 击败了 OpenAI 的 Codex(81.8%)和 Grok Build(81.6%)。
下一项基准更为残酷。DeepSWE 1.1 设置 113 个编码任务,并在评分时切断网络,Muse Spark 1.2 以 59.3% 的成绩跌至第三。Meta 还发布了一项自行构建的测试,取自自家工程师的 440 个真实 pull request,Muse Spark 1.2 得分为 70.6%,比 Opus 5 低约 9 个百分点。此外,Muse Spark 1.2 在 NVIDIA Hopper 上运行内核优化任务长达 24 小时,工具调用超过 1000 次,在早期探索阶段后仍持续发现实际加速。然而这一成绩仅比 7 月发布的 Muse Spark 1.1 高 2.3 个百分点。
Meta 在自家编码图表中拿 GPT-5.6 Terra 作比,但 OpenAI 还有更强型号 Sol,而 Sol 被排除在所有三张编码图之外。在独立 Terminal-Bench 2.1 排行榜上,Sol 以 89.5% 居首,Opus 5 以 89.1% 紧随。这两个数字均高于 Meta 为 Opus 5 报告的 86.7%。Meta 挑了最强对手的较弱设置,结果仍落后。若对照真正的领头羊 Sol,Muse Spark 1.2 落后 6.6 分,而非 3.8 分。Meta 仅在一处纳入了 Sol:GPU 内核任务(工具调用超过 1000 次)中,Sol 比基线提升 71.2%,Muse Spark 1.2 提升 68.7%,在六个模型中列第四。一个值得注意的折扣因素:Muse Spark 1.2 尚未出现在公共排行榜上,该榜 183 个追踪模型中仅 26 个经过测试,其 82.9% 仍属 Meta 自报数据。扎克伯格称,这是‘朝前沿迈进’的下一步,更大更强的模型已在路上。
更有戏剧性的是,据媒体报道,Meta 正与 Anthropic 洽谈算力租赁,交易规模或达两年 100 亿美元。这意味着 Meta 的数据中心将帮助运行 Claude 模型,而后者正是 Muse Code 试图取代的对象。Muse Code 背后的领导团队代价不菲:扎克伯格曾在 2025 年 6 月以 143 亿美元收购 Scale AI 及其创始人 Alexandr Wang,后者现任 Meta Superintelligence Labs 负责人。价格是 Wang 手里的杠杆。Muse Code 的费率与 Meta 7 月首次付费 API 一致:每百万输入 token 1.25 美元,每百万输出 token 4.25 美元。参与“贡献者”层级的开发者需允许 Meta 使用其工作训练模型,费用可降低逾 10 倍。Wang 未透露 Muse Spark 系列的采用数据。
Meta 的财报解释了折扣逻辑:上季度营收增长 28% 至 608 亿美元,但营业利润下降 8% 至 188 亿美元;营业利润率从一年前的 43% 降至 31%。单季资本支出高达 310.8 亿美元,全年指引最高至 1450 亿美元。Muse Code 确实提供了 Claude Code 所不具备的工程能力:后台代理可跨会话保持上下文,子代理在隔离的代码库副本中工作。Meta 打造了一个扎实的“第二好”编码工具,并按预算款定价。测试版的表现将决定开发者是否愿意以几个百分点的准确率换取约十分之一的费用。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。