判断一个AI生成的网站是否美观,机器并不擅长。自动化指标能告诉你图片像素是否达标、页面加载是否够快,却无法判断视觉效果是否真正令人愉悦。这需要人类来完成,而旧金山初创公司Design Arena刚刚获得800万美元融资,以确保这种人类判断能够规模化进行。
Design Arena由Grace Li创立于2025年,出自Y Combinator S25孵化营,概念非常简单:将两个AI生成的设计并排展示,让用户选出更好看的一个,并将数百万次投票汇聚成Elo排名。可以把它看作老牌网站“Hot or Not”的AI视觉版——只不过你评价的不是人,而是GPT-5.6或GLM-5.2谁生成的落地页更漂亮。
该平台已吸引来自140多个国家的超过500万用户。用户对AI生成的内容进行盲测对比,涵盖网页设计、图片、视频、音频和UI/UX布局,没有任何标签或品牌提示,纯粹是原始输出的比拼。
这些投票会被整理成公开排行榜,与广泛被引用的大语言模型基准LMSYS Chatbot Arena类似。不过Chatbot Arena侧重于文本推理和对话质量,Design Arena则专注于美学和主观视觉偏好。
平台最近的基准测试显示,GPT-5.6在网页设计评估中位居榜首,而GLM-5.2在某些其他设计细分领域也占据了领先位置。包括OpenAI和Anthropic在内的前沿AI实验室,正将Design Arena的排行榜视为其模型在创意和视觉领域表现的真实信号。
这800万美元融资使Design Arena跻身于一个日益壮大的赛道——为AI构建评估基础设施,而非开发AI模型本身。与雇佣大量标注员提供结构化反馈不同,Design Arena将评估变成了一种休闲活动。用户投票是因为快速且有趣,而非为了报酬。这就产生了一个真正具有地域和人口多样性的数据集,覆盖全球140多个国家。
传统的视觉AI基准往往依赖FID分数或CLIP相似度等技术指标,它们衡量技术保真度,却完全忽视了“看起来是否美观”这一主观维度。Design Arena以真实的人类判断填补了这一空白,其规模是传统标注流程难以负担的。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。