联合创始人 Grace Li 透露,她的公司 Intelligence 始于 2025 年毕业前夕。当时几位大学好友尝试开发一款 AI 游戏引擎,尽管模型能够生成功能完整的游戏,但没有一个游戏是“好玩”的。这引发了一个关键思考:如何衡量一款游戏是否具备趣味性?他们意识到,人类的直觉和主观审美是无可替代的,于是开始探索大规模获取真实人类反馈的途径。这一探索的结晶便是 Design Arena,目前全球已有超过 530 万用户 在使用这款工具。
AI 行业对可扩展的用户反馈有着极度饥渴的需求。Li 表示:“对许多模型来说,在设计领域实现突破的缺失瓶颈就是缺乏高质量的审美反馈。” 在产品发布仅一周后,他们就与一家头部前沿实验室达成了首笔重大交易。近日,Intelligence 正式宣布完成了 7.9 百万美元 的种子轮融资,由 Index Ventures 领投,Conviction(Sarah Guo 与 Mike Vernal 创立)、A*、Valkyrie 等机构跟投。
对于普通用户而言,使用 Design Arena 类似于使用一个高级的模型路由器。它提供了一个类似 ChatGPT 的提示词窗口,并带有网站、图像等十几种视觉格式的下拉菜单。输入请求、格式和风格后,系统会展示一系列 'A vs. B' 的对比选项,供用户进行排序。这种直观的交互让平台能够收集到高质量的、多维度的偏好数据。
平台的真正商业价值在于企业端。前沿实验室和 AI 公司可以将该平台作为其多媒体生成模型的持续反馈源。由于用户更关心最终输出的质量,而非背后的具体模型,他们的真实投票能为评估用户真正的‘审美偏好’提供关键数据。目前,该网站的年经常性收入(ARR)已达到惊人的 6000 万美元,成为 AI 行业人机协同评估不可或缺的数据源。
此外,用户必须登录才能获取输出,这使得 Intelligence 能够跨地域、跨时间追踪用户审美偏好的演变(例如,亚洲用户更偏好信息密度极高的“大而全”设计风格)。这种人类主导的评估是对传统自动化基准测试的重要补充,因为后者虽规模庞大,但极易被操纵,正如上周 Hugging Face 漏洞事件所戏剧性展示的那样。然而,众包人类反馈赛道并非一路平坦,此前融资 3300 万美元的竞争对手 Yupp 就在斩获前沿模型客户后因无法持续盈利而宣告倒闭。
随着大语言模型在逻辑和代码能力上逐渐逼近天花板,AI Agent 在实际应用中正面临从“能用”到“好用”的审美和体验瓶颈。Design Arena 的成功证明了,由人类直觉、品味(Taste)和情绪价值主导的“主观性评估数据”正在成为下一代 AI Agent 精细化对齐的核心资产。在未来的多模态与 Generative UI(生成式UI)时代,Agent 不仅需要完成任务,还需要动态生成符合用户特定地域、文化甚至个人偏好的交互界面。Design Arena 建立的高壁垒人类偏好数据集(#RLHF),将深刻影响个性化 Agent 的进化路径。这表明,AI 评估(Evaluation)正在从单纯的硬性 benchmark 转向更具颗粒度的人类品味共鸣。