2026-06-30 · 💰 商业← 本期
Arena, the AI leaderboard everyone uses, is now a $100M business

做裁判的,开始向被它打分的人收钱了。Chatbot Arena 这个名字,常看模型发布的人多半眼熟:几乎每家厂商的发布会都要甩一张它的排名截图当背书。如今这个起家于学术圈、一度全程免费的榜单,已经变成一门估值 17 亿美元的生意。
先说清它凭什么攒下这份话语权。要比较两个大模型谁更强,跑分榜容易被针对性刷高,人的主观体感又难量化,谁都说服不了谁。Arena 的解法是让真人来盲测:同一个问题同时丢给两个匿名模型,用户读完答案挑出更好的那个,系统再用类似国际象棋等级分的算法,把成千上万次对决排成一张天梯榜。名字盲掉、投票来自真实使用者,它的名次因此比厂商自测更难掺水,慢慢成了全行业默认引用的那把尺。
问题就出在这把尺太好用了。一个不收费的研究项目,怎么撑得起 17 亿的估值?2025 年 9 月,团队把这套攒下来的东西做成了商业服务,给免费榜单接上了一门生意。
它卖的不是榜单本身,而是同一套人类投票基础设施延伸出的评测服务,官方叫 AI Evaluations,说白了就是帮模型开发商和企业系统化地测自家模型好不好用,按用量付费的消费制。底气是积累下来的超过 100 万条真实人类投票,这种规模的数据资产,后来者短期砸钱也很难复制。
增长数字给得相当直接。年化经常性收入(ARR,把眼下的消费水平折算成全年规模)从今年 1 月的 3000 万美元,涨到今天宣布的 1 亿,四五个月涨到三倍多。这意味着为模型评测付费不是个伪需求,而是真有一批客户愿意持续掏钱。资本跟得也快:累计融资 2.5 亿美元,单是 A 轮就拿了 1.5 亿,正是这些钱把估值顶到 17 亿。
放回行业里看,做模型评测的并非只有它一家,各种榜单和测评机构这两年冒出不少。但 Arena 真正的护城河,是'中立第三方'的身份加上百万级真人投票的规模,这两样恰恰是花钱买不来、得靠时间和用户量慢慢沉淀的东西。
值得注意的是,这门生意最大的隐患也正藏在它的立身之本里。一个靠'中立'赢得信任的裁判,一旦开始向被它评判的厂商收钱,利益的天平就难再说全无倾斜。对那些把 Arena 名次当采购和选型依据的团队来说,真正该盯的或许不是它的 ARR 还能涨多高,而是当哪天一家付费大客户的模型排名下滑时,这个榜单敢不敢照常公布、外界又还信不信。