基准测试
-
Kimi K3 登顶 AA-Briefcase 第二,但成本高企成隐忧
Moonshot AI 的 Kimi K3 在 AA-Briefcase 基准测试中位列第二,性能超越 GPT-5.6 Sol,但每任务耗时近一小时,成本约为 Opus 4.8 的十倍,高成本或影响其竞争力。
-
Grok 4.5 登顶智能体基准测试,马斯克“Opus级”宣称获证实
在 Artificial Analysis 的 AutomationBench-AA 测试中,马斯克旗下 xAI 的 Grok 4.5 以 51.4% 的得分和每任务仅 0.34 美元的成本力压 Claude 系列,成为最顶尖的智能体模型。