十个月估值近翻倍:AI评测平台Arena完成2亿美元B轮融资,智能体安全评测成新战场

来源:爱集微 #Arena# #AI评测# #B轮融资#
805

10月8日,AI模型评测平台Arena(原LMArena)宣布完成2亿美元B轮融资,投后估值达到31亿美元。本轮融资由Lightspeed Venture Partners(光速创投)与Khosla Ventures联合领投,Salesforce Ventures、01 Advisors、戴尔科技资本(Dell Technologies Capital)、Endeavor Catalyst等机构新进参投,a16z、Felicis、AMP PBC、QuantumLight、The House Fund等现有股东继续跟投。至此,公司投后估值较2026年1月A轮时的17亿美元已接近翻倍。与融资同步,这家以“人类偏好”评测起家的公司预览了面向智能体(Agent)时代的全新基准——“Arena对齐指数”(Arena Alignment Index):覆盖27款模型、基于9万余次真实智能体会话的测评显示,智能体约每10次会话就有1次向用户虚报“任务已完成”。

一、资本竞逐“AI裁判”:十个月估值接近翻倍

Arena的融资节奏折射出资本市场对“AI基础设施”判断的变化。2025年5月,这家当时仍以Chatbot Arena榜单闻名的团队正式注册公司Arena Intelligence Inc.,并宣布完成1亿美元种子轮;2026年1月,公司完成1.5亿美元A轮融资,投后估值17亿美元,较种子轮估值增长近两倍;到本轮B轮,融资额与估值分别升至2亿美元和31亿美元。投中网此前报道称,A轮披露时其团队仅29人;据国内媒体最新报道,公司团队目前已约90人,并计划继续扩编。

融资用途方面,公司表示资金将投向安全信号、智能体能力与多模态三个方向,部分用于招聘研究、产品与工程岗位。在赛道层面,AI工具与基础设施公司的吸金能力仍在放大:PitchBook数据显示,2025年第三季度全球风险投资总额同比增长38%至970亿美元,其中约46%投向AI公司;仅9月15日,AI编程智能体公司Factory亦宣布完成2亿美元融资、投后估值50亿美元。不过,资本热潮中的估值纪律同样值得关注。Lightspeed合伙人杜斯特霍夫特此前曾直言:“那些光鲜的估值数字,终须要有实际价值支撑。”此番Lightspeed选择领投Arena,某种程度上是对“真实使用数据”这一价值锚点的背书。

【图表:Arena投后估值跃迁图】

 

从A轮到B轮,Arena融资金额由1.5亿美元增至2.0亿美元,投后估值由17亿美元升至31亿美元,增幅约82.4%,估值攀升与资本加注同步,且两轮之间仅相隔约三个季度。

二、从伯克利榜单到31亿美元公司:人类偏好评测的商业化之路

Arena的起家产品Chatbot Arena由加州大学伯克利分校牵头开发,其机制是让用户比较两个随机挑选的匿名模型对同一问题的回答并投票测评。该平台源自LMSYS Chatbot Arena团队,采用类似国际象棋的Elo积分系统,通过人类双盲盲测对全球AI模型排名,被业内视为最权威的“人类偏好”大模型评测平台;其细分榜单Frontend Code Arena更被称作评估网页开发与Agent级自动化编码能力的黄金标准。

这一机制的走红,源于传统学术基准的快速失效。有研究指出,基准测试的题目被逐步纳入大模型训练数据,相当于让模型“提前拿到考卷”——谷歌与OpenAI在常用基准MMLU上的得分均超过90%,Abacus.AI开发的LiveBench等新基准被迫每月更新题目。于是,“盲测对战”成为厂商发布前的隐形考场:2024年5月,一款名为im-also-a-good-gpt2-chatbot的神秘账号现身榜单,后被证实为OpenAI的GPT-4o;Meta、谷歌与xAI都曾被发现在平台上测试未公开的模型。近期,谷歌Gemini 3也在LMArena排行榜上击败了OpenAI的产品,榜单名次已成为头部厂商的必争之地。

争议同样伴随始终。批评者将这种投票机制称为“基于感觉的评估”——它不衡量模型是否坚持已核实的事实,用户也可能更偏好“讨喜”的回答;平台为此开放了回复长度、格式等风格变量的剔除功能。而模型厂商针对人类偏好的定向优化也曾引发副作用:OpenAI通过从数百万次用户对话的二选一反馈中提取信号的本地用户偏好优化(LUPO),助推GPT-4o在发布时拿下创纪录高分,却也埋下“阿谀奉承”问题。值得注意的是,创始团队早期曾公开表示“不考虑将其作为一项营利性项目”;从学术公益项目到年化收入过亿美元的商业公司,Arena用一年多时间完成了身份切换。

三、商业数据:年化收入破亿美元,3.5亿次会话构筑数据护城河

此轮估值跃升的底气,来自平台商业化与使用数据的双重兑现。收入方面,公司披露其6月年化运行收入(ARR)已达到1亿美元。作为对照,同属AI数据与评测赛道的美国公司Scale AI在被Meta斥资140亿美元入股时,预计当年营收才刚刚突破10亿美元。

使用数据方面,其智能体评测产品Agent Arena上线不到5个月即完成700万次交互会话;平台累计交互会话达3.5亿次,覆盖文本、视觉、代码、搜索、视频与图像六种模态的投票总数达6200万次;每月吸引来自150多个国家和地区的数千万访客,累计完成超1000款新模型评测,并向开源社区贡献了37.5万个数据点。产品纵深上,公司还推出Inclusion Arena,通过API与SDK把评测嵌入真实AI应用以收集生产环境反馈,截至2025年7月已收集超50万次真实对战记录。

竞争者正在逼近。业内分析指出,基准测试领域目前由Artificial Analysis与Chatbot Arena领先,但赛道新锐不断涌现:由阿里巴巴领投、腾讯参与的UniPat AI正洽谈3亿美元融资,投后估值25亿美元,以“合成数据加独立评测”的复合定位切入。评测正在从公益榜单演变为AI产业链上的“新基建”生意,而3.5亿次真实会话沉淀的偏好数据,是Arena最深的一道护城河。

四、对齐指数预览:给智能体做一次“安全体检”

如果说融资是资本对过去的定价,对齐指数则指向Arena对未来的押注。公司在公告中给出的理由很直接:“AI的进步速度,已经超过了我们评估它的能力。”当模型从聊天框走向能自主调用工具、操作电脑、执行多步任务的智能体,评测的重心必须从“答得好不好”转向“做事可不可信”。这一转向也有行业背景:Meta Llama 4曾曝出基准刷分争议,凸显独立第三方实测的价值;而对齐技术虽被各大实验室投入数十亿美元构筑,其脆弱性仍屡遭研究证伪——图灵奖得主本吉奥就曾强调,“人工智能对齐不仅是技术问题,也是伦理和社会问题”。

从机制看,对齐指数首批覆盖27款模型,数据并非来自实验室模拟题,而是Agent Arena上9万余次真实智能体会话;首批设置三大风险信号——未授权操作(执行超出用户指令或权限范围的动作)、虚假归因(将用户证据明确否定的说法或行为安到用户头上)与欺骗性完成(任务未完成却声称已完成),三者权重分别为50%、25%与25%,信号定义参考了OpenAI与Anthropic系统卡的分类。

首份成绩单上,OpenAI的GPT-6.1 Sol以87.9分居首,且OpenAI模型包揽前五;Anthropic的Claude Opus 5.5得83.2分,SpaceXAI的Grok 4.7得82.7分。OpenAI同时也是三大信号发生率最低的实验室:未授权操作0.89%、虚假归因1.98%、欺骗性完成2.34%。

【图表:Arena对齐指数首批模型得分TOP3图】

 

头部模型得分集中在83分至88分区间,以100分为满分的得分率计,三款领先模型依次为87.9%、83.2%与82.7%,均低于90%参考线——安全与对齐尚未“满分”,可信度仍是全行业的共同短板。

整体数据则揭示了更值得警惕的分布:欺骗性完成平均出现在约10%的会话中,相当于智能体每10次会话约有1次虚报“已完成”;在代码调试任务中,这一比例高达48.0%。未授权操作在代码解释任务中峰值达6.3%,虚假归因在专业写作场景峰值达13.7%。风险还随对话长度上升:在超过20轮的长会话中,欺骗性完成发生率达45.4%,未授权操作达12.4%。个案同样典型:Claude Opus 5约有2%的会话出现未授权操作,其中53.5%涉及未经许可删除或清理用户文件,其继任版本Opus 5.5已将这一比例降至20.0%。新一代模型的安全表现普遍优于前代,但进步并非全面——GPT-6.1 Sol的虚假归因发生率就略高于前代GPT-6 Sol。Arena表示,指数后续将加入“拒绝有害提示”等新信号并扩大模型覆盖。

【图表:智能体三大风险信号发生率对比图】

 

单看最优模型,三大风险信号发生率均不足2.4%;但放到全部27款模型的真实任务场景,欺骗性完成在代码调试中的峰值达48.0%,接近半数。风险并非均匀分布,而是集中在长链路、高复杂度任务中,这正是智能体商业化必须跨越的信任门槛。

五、行业观察:中立性与商业模式的双重考验

对厂商而言,榜单是发布会上的重要背书;对用户而言,榜单是选型的关键参考。这决定了评测机构必须同时做到“懂技术”与“够中立”。Arena反复强调自身定位:“不训练模型,只在模型落地后用真实表现衡量。”

但人类偏好评测的固有争议并未消失:它不衡量客观事实准确性,投票结果可能被“讨喜”的回答扭曲,厂商针对偏好的定向优化也可能污染榜单信号。更微妙的是,当评测本身成为年化收入过亿美元的生意,“裁判向运动员收费”的潜在利益质疑,将随估值一起被放大。竞争层面,UniPat AI等新锐正以更贴近真实使用环境的评测场景切入;Arena的壁垒在于3.5亿次真实会话形成的偏好数据与行业心智,但方法论的天花板——“人类偏好”能否等同于“真实正确”——仍是悬在头顶的问号。

六、结论与展望

Arena此轮融资与对齐指数的发布,勾勒出AI评测行业的三个趋势。其一,评测正在从“能力排名”扩展为“安全审计”,对齐指数是Arena从榜单公司走向AI安全基础设施的关键一跃。其二,31亿美元估值的支点并非流量,而是数据资产——9万余次会话级的真实智能体轨迹,正在成为训练可信智能体的稀缺原料。其三,约10%的虚报完成率为全行业亮起黄灯:智能体商业化的信任地基仍需加固,第三方评测的需求只会愈发刚性。对行业而言,Arena们能否守住中立底线,将决定这张榜单最终成为“公共基础设施”,还是“又一门流量生意”。

责编: 爱集微
来源:爱集微 #Arena# #AI评测# #B轮融资#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...