AI基准测试初创公司 Vals AI 宣布完成 4000 万美元 A 轮融资,由 Andreessen Horowitz(a16z)领投。该公司旨在为 AI 模型构建独立评估基准,聚焦语言模型在标准化测试中的表现与其在实际经济价值工作中行为之间的差距。
Vals AI 此前以自筹资金模式运营,截至 2025 年底估计年经常性收入(ARR)为 130 万美元。此次融资标志着该公司的一次重大跃升。
与常见的抽象逻辑谜题或 Wikipedia 句子补全测试不同,Vals AI 评估的是前沿大语言模型在企业真实付费场景中的表现,包括财务分析、编码、法律研究和网络搜索。
该公司的旗舰产品 Vals Index 汇总这些真实世界类别的性能数据,并对模型进行排名。该指数最新一次更新是在 2026 年 8 月,Claude Fable 5 以 75.14% 的得分位居榜首。
Vals AI 还推出了多个专项基准测试,包括 Finance Agent Benchmark 和 Web Search Index。这些基准均由领域专家而非仅机器学习研究人员参与构建。
为什么基准测试比以往更重要
当前广泛引用的多数基准测试源于学术场景,并日益成为模型开发者直接优化的目标。这给企业采购者选择模型带来了实质困扰:当 OpenAI、Anthropic、Google 和 Meta 都在重叠的基准上宣称自己达到 SOTA 性能时,这些数字对采购决策已失去参考意义。
a16z 的布局与下一步
Andreessen Horowitz 一直是 AI 基础设施领域最激进的 VC 之一,投资覆盖从芯片设计到应用层的完整产业链。将 Vals AI 纳入投资组合,表明其认为 AI 生态中的评估层相对于其重要性仍被低估。
这笔 4000 万美元资金将帮助 Vals AI 将基准覆盖扩展到新的垂直领域,聘请领域专家,并构建企业客户使用自有数据运行评估所需的工具。该公司还同步发布了新产品,显示出从独立基准测试服务向持续模型监控方向拓展的意图。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。