菜单
科技

Anthropic会在2026年底登上Chatbot Arena排行榜第一名吗?

结算: 更新于:

要点

市场目前倾向于认为Anthropic有较大机会在年底登顶,但远未确定。最大的变量是从现在到2026年12月31日之间近五个月的时间里,OpenAI、谷歌、xAI以及DeepSeek、月之暗面等中国实验室都可能发布新模型,任何一次高排名的新发布都可能改变格局。

事件编辑插图:Anthropic会在2026年底登上Chatbot Arena排行榜第一名吗?

合约如何运作

这类合约在结算时只有两种结果:如果到2026年12月31日美东时间中午查看LMArena文本排行榜(style control关闭)时,排名第一的模型属于Anthropic,合约将结算为1美元;如果第一名属于其他公司,合约结算为零。市场价格反映的是交易者对这一结果发生概率的共同判断,例如价格为0.30意味着市场认为这一情形大约有三成的可能性发生,这只是一个用于说明机制的假设数字,并非本市场当前价格。持有者通常可以在结算日之前将持仓按当时的价格卖出,不必等到12月31日才能退出。若结算时排行榜因故无法访问,结算将推迟至榜单恢复可查看为止。
市场如何评估结果
$100
68%

事件会发生

当前价格
$0.68
如果投入 $100
$147
32%

事件不会发生

当前价格
$0.32
如果投入 $100
$313

概率

自事件纳入追踪起开始记录历史

价格如何变动

目前可见的成交记录集中在Polymarket,隐含概率为67%,累计成交量为62,772美元,是本页面唯一有公开数据的交易场所。由于成交量相对有限,且没有其他平台数据可用于对比价差,现阶段无法从多平台价格差异或历史走势中提炼出明确的变动趋势,只能说市场目前将这一结果判断为发生概率高于五成、但尚未接近确定。

分析

背景

Chatbot Arena(现由LMArena运营)是一个众包式的大语言模型排名平台,用户在不知道模型身份的情况下对两个模型的回答进行盲选投票,系统据此计算Arena分数并生成排行榜。该榜单被广泛视为衡量前沿大模型综合能力的公开指标之一,参与排名的实验室包括OpenAI、谷歌、Anthropic、xAI、Meta,以及中国的DeepSeek、月之暗面(Kimi)、阿里巴巴(Qwen)等。 这个问题关注的是文本排行榜(style control关闭版本)在2026年12月31日美东时间中午的快照中,排名第一的模型是否属于Anthropic。榜单历史上曾多次因新模型发布而重新排序,谷歌、OpenAI等实验室都曾在不同时期占据榜首,Anthropic的Claude系列模型也长期保持在前列,但登顶并非常态。 这一问题因此也被部分读者视为观察美中AI竞争的一个具体节点:同一榜单同时收录美国主要实验室和中国头部实验室的模型,任何一方登顶都会被解读为阶段性的技术信号。
目前唯一有公开成交记录的场所是Polymarket,市场隐含概率为67%,累计成交量为62,772美元。这一成交量规模不大,说明这个问题尚未吸引大量资金参与讨论,价格更多反映的是少数交易者的判断,而非广泛的市场共识,这一点在解读67%这个数字时需要留意。由于目前只有一个场所在交易,无法给出跨平台价差作为佐证,这本身也说明该事件的关注度和流动性仍处于早期阶段。 从结算机制看,榜单采用style control关闭版本,即不对回答风格(如格式、长度)进行统计调整的原始投票结果,这与另一版本(开启style control)可能给出不同排名,因此关注这一问题需要具体看这一版本的表现,而不是笼统地看某个实验室是否被普遍认为技术领先。并列时先比较未经四舍五入的具体Arena分数,再按公司名称字母顺序判定,这意味着即便分数极为接近,规则本身也不会产生无法判定的结果。 从时间跨度看,从2026年8月到12月底还有近五个月,这段时间内主要实验室历史上都曾发布过至少一次新的旗舰模型。Anthropic若在此期间推出新一代Claude模型并取得强劲评分,将直接提升其登顶概率;但OpenAI、谷歌、xAI同样有能力在这段时间内发布新模型,DeepSeek和月之暗面等中国实验室近年也证明了能够将模型能力推进到接近甚至匹敌一线水平,这些都是压低Anthropic概率的现实因素。67%这个数字可以理解为市场认为Anthropic在这场持续到年底的多方竞赛中处于相对有利但并非压倒性的位置。

影响概率的因素

  1. Anthropic自身的发布节奏

    如果Anthropic在12月31日前发布新一代Claude旗舰模型并取得高分,将直接提高其登顶概率;反之,如果年底前没有新发布,现有模型面对竞品迭代可能被逐渐超越。

  2. OpenAI、谷歌、xAI的竞品发布

    这几家实验室历史上都曾登上Arena榜首,且发布节奏频繁,任何一次高分新模型发布都可能在12月31日的快照时点上占据第一名,是压低Anthropic概率的主要力量。

  3. 中国实验室的追赶速度

    DeepSeek、月之暗面等实验室已多次证明可以将模型能力推进到接近一线水平,它们同样出现在同一榜单上,构成了这场排名竞争中不可忽视的额外变量。

  4. style control关闭版本的具体表现

    结算依据的是不对回答风格进行调整的原始投票结果,某些模型在这一版本下的排名可能与经过风格调整的版本不同,这意味着结果对具体版本的表现敏感,而非泛泛的技术声誉。

  5. 并列打分规则

    结算规则先比较未经四舍五入的具体Arena分数,再按公司名称字母顺序判定并列,这使得即便顶部分数极为接近,规则本身也能给出明确结果,减少了因分数胶着而产生的解读空间。

支持理由

  • Anthropic若在2026年12月31日前发布新一代Claude旗舰模型并获得社区高分投票,有机会重新占据或巩固榜首位置。
  • 从现在到年底还有近五个月时间,给了Anthropic多次迭代和优化模型的窗口。
  • Claude系列模型历史上长期保持在Arena排行榜前列,说明其在盲选评测中具备持续的竞争力基础。

反对理由

  • OpenAI、谷歌、xAI历史上都曾登上Arena榜首,且这些实验室发布节奏频繁,年底前推出更强模型的可能性同样存在。
  • DeepSeek、月之暗面等中国实验室已证明能够将模型能力推进到接近一线水平,为顶部排名带来额外竞争者。
  • Arena排行榜历史上因新模型发布而频繁重新排序,说明任何一家实验室在某一时点的领先地位都可能是短暂的,难以保证一直维持到12月31日的具体快照时刻。

后续关注

接下来需要关注的具体节点包括:Anthropic是否发布新一代Claude模型及其在LMArena上的实际评分;OpenAI、谷歌、xAI是否推出新的旗舰模型并登上榜首;DeepSeek、月之暗面等中国实验室的新模型发布及排名表现;以及最终在2026年12月31日美东时间中午对文本排行榜(style control关闭)进行的结算快照。

交易该结果合约

平台(1)

了解该事件

平台(1)

概率

  • 到2026年12月底,Anthropic是否会拥有最佳AI模型?68%
  • 到2026年12月底,OpenAI是否会拥有最佳AI模型?11%
  • 到2026年12月底,xAI是否会拥有最佳AI模型?3%
  • 到2026年12月底,Meta是否会拥有最佳AI模型?2%
  • 到2026年12月底,Moonshot是否会拥有最佳AI模型?2%
  • 到2026年12月底,DeepSeek是否会拥有最佳AI模型?1%
  • 到2026年12月底,Z.ai是否会拥有最佳AI模型?1%
  • 到2026年12月底,ByteDance是否会拥有最佳AI模型?0%
  • 到2026年12月底,Amazon是否会拥有最佳AI模型?0%
  • 到2026年12月底,Mistral是否会拥有最佳AI模型?0%
  • 到2026年12月底,Microsoft是否会拥有最佳AI模型?0%

结算规则

结算依据
https://lmarena.ai/leaderboard/text
结算日期

结算依据为LMArena官网(lmarena.ai/leaderboard/text)文本排行榜的Rank部分,且使用style control关闭的版本。判定时间为2026年12月31日美东时间中午12点,若当时排名第一的模型所属公司为Anthropic,则结果为“是”。如遇分数并列,先比较未经四舍五入的具体Arena分数,再按公司名称字母顺序判定。若结算检查时点榜单无法访问,结算将推迟至榜单恢复可查看为止。

计算方法

本地视角

这个问题对简体中文读者的直接意义在于,Chatbot Arena同一榜单上同时收录了DeepSeek、月之暗面等中国头部实验室的模型,使其成为观察美中AI竞争进展的一个具体、可核实的节点,而不只是笼统的技术领先叙事。对于长期关注芯片出口管制、模型能力对比等话题的读者而言,这类排名结果提供了一个相对客观、公开可查的参照点。

常见问题

这个问题什么时候、依据什么结算?
结算时间是2026年12月31日美东时间中午12点,依据是LMArena官网文本排行榜(Rank部分,style control关闭)在该时点的快照,第一名所属公司决定结果。
当前的价格或概率数字代表什么?
价格反映的是交易者对Anthropic登顶这一结果发生可能性的共同判断,并非对结果的确定预测,也不代表任何官方机构的评估。
如果结算时榜单打不开或数据缺失怎么办?
按照规则,如果榜单在结算检查时点无法访问,结算将推迟,直到榜单重新可查看为止,不会因技术故障而强行判定结果。
如果两家公司的模型分数非常接近,怎么判定第一名?
规则规定先比较未经四舍五入的具体Arena分数,如果仍然并列,再按公司名称的字母顺序判定,因此不会出现无法裁定的情况。
Claude历史上有没有登上过Arena榜首?
Claude系列模型长期保持在排行榜前列,但榜首位置随着各实验室新模型的发布而频繁变动,并非由单一实验室长期垫底或长期垫顶。
为什么中国实验室的表现会影响这个问题?
因为DeepSeek、月之暗面等中国实验室的模型同样出现在同一份榜单上参与排名,它们的表现越强,Anthropic以外的竞争者登顶的可能性就越高。

相关预测事件

代币化股票

为该资产催化因素提供背景的市场隐含概率。

相关事件

68%/ 32%
/