菜单
科技

Anthropic 的 Claude 会在 2026 年底登上 LM Arena 排行榜第一吗?

结算: 更新于:
62%

市场共识

市场给出的事件概率——不是你猜中的概率

事件会发生
62%
事件不会发生
38%

交易该结果合约

要点

市场把这件事当作小概率结果:Claude 被视为有机会但不是最被看好的一方,同一合约家族中价格最高的那一档远远高于它。核心原因是 LM Arena 文本总榜的首位长期在其他实验室之间轮换,而 Anthropic 的产品重心一向不在这类人类偏好投票榜单上。若 Anthropic 在第四季度推出新的前沿 Claude 并及时上榜,且该模型在“移除风格校正”视图下拿到第一,定价会迅速改变;反之,年底前 Google 或 OpenAI 再发一版新模型,这个概率会被继续压低。

合约如何运作

这是一份二元合约:结算日若条件成立,每份合约兑付 1 美元;不成立则归零,价格就是买卖双方当下认可的发生概率。举例说明这种换算:某份合约成交在 0.30,意味着市场认为该结果大约每十次发生三次;成交在 0.80,则意味着市场认为它多半会发生。本合约结算的问题是:2026年12月31日当天 LM Arena 文本排行榜(移除风格校正视图)的第一名,是否为 Anthropic 的 Claude 家族模型;若首位属于 OpenAI、Google、xAI、Meta、阿里巴巴、月之暗面、百度或任何其他开发者,则该合约以不成立结算,并列情况按榜单当日显示的排列顺序判定。持有的仓位通常不必等到结算日,可以在此之前按当时的市场价格卖出,卖出价可能高于也可能低于买入价。
市场如何评估结果
$100
62%

事件会发生

当前价格
$0.62
如果投入 $100
$161
38%

事件不会发生

当前价格
$0.38
如果投入 $100
$263
0%25%50%75%100%12:2617:5823:3105:0310:3516:07
共识Kalshi

价格如何变动

记录始于 2026年7月29日,Claude 一档当时报 37%,此后下移到两成附近,累计已录得 1,016 个价格观测。聚合序列显示的 36% 至 100% 区间需要拆开看:36% 一端与 Claude 这一档的实际走势吻合,100% 一端来自同一题目下其他开发者条目被并入序列,不代表这份合约曾被定价为必然发生。这轮从三成七到两成的下移没有对应任何单一的公开事件,更像是流动性在这组按开发者拆分的合约之间重新分配——最被看好的一档累计成交约 179 万美元,明显高于其余各档,资金正在向少数几个名字集中。整体而言,这个市场目前更接近“默认格局定价”,而不是对某个已发生消息的反应。

背景

LM Arena(前身为 LMSYS Chatbot Arena)是目前流传最广的大模型公开排名之一。它的做法是让匿名用户对两个未标明来源的模型回答做盲选,再用统计评分方法把大量两两比较折算成一张总榜。因为投票来自公众而非固定考题,它衡量的是“人类更喜欢哪一个回答”,而不是某项能力的绝对水平。 这张榜单的首位在过去两年多次易主,Google 的 Gemini 系列与 OpenAI 的 GPT 系列是常见的榜首占据者,xAI、Meta 以及阿里巴巴(Qwen)、月之暗面(Kimi)、百度等中国实验室则在榜单不同区段持续上移。Anthropic 的 Claude 家族在编程与企业场景中口碑突出,但在这张以公众偏好投票为基础的文本总榜上,历史上并未长期占据第一。 本合约结算看的是一个具体视图:LM Arena 文本排行榜的“Remove Style Controls”(移除风格校正)读数。风格校正是榜单方为削弱回答长度、排版、标题符号等表层因素影响而加入的统计调整;把它移除,等于回到未经调整的原始排序。两个视图的排名顺序可能不同,因此这个设定本身就是决定结果的一部分。

分析

先说这个页面上最容易被误读的一组数字。聚合口径显示,最高与最低报价之间相差 63.3 个百分点,八条 Kalshi 记录从 64% 一路排到 0%。同一份是非合约的报价不可能相差 63 个百分点——那会是一个自动被套利抹平的价差。这些记录实际上是同一道题目下按开发者拆分的一整组平行合约:榜首归谁,每家一份。因此 63.3 个百分点不是“场馆分歧”,而是市场对不同实验室夺冠机会的排序。Claude 一档的聚合读数约为两成,处于这组合约的中间偏后位置,而最被看好的那一档接近三分之二。 这组价格传达的判断很直接:市场认为年底榜首大概率仍在一家非 Anthropic 的实验室手中,而且它对“是哪一家”并不像对“不是 Claude”那样犹豫——排在首位的那档 64% 已经明显脱离其余各档,最低的几档只有个位数甚至归零。整组合约累计成交 7,777,158 美元,其中前四档就贡献了约 550 万美元,说明流动性集中在几个被认为真正有机会的名字上,而不是均匀分散——这类分布通常意味着参与者对格局有共识,而非对信息缺乏。 价格历史目前很薄。首次记录发生在 2026年7月29日,当时 Claude 一档为 37%;已录得 1,016 个价格观测,聚合序列的区间横跨 36% 到 100%。100% 这个上沿不可能属于 Claude 这一档在同一时点的报价,它反映的是聚合序列混入了这组合约中的其他条目。可靠的部分是:Claude 一档从三成七附近下移到两成左右,方向清楚,幅度不小,但时间窗口太短,无法归因于任何单一公开事件。 从事件本身看,压低这个概率的结构性因素有两个。一是历史模式:LM Arena 文本总榜的第一名在过去两年多次更替,占据者主要来自 Google 与 OpenAI,Claude 家族虽长期位居前列,但登顶并非常态。二是结算口径:合约读的是移除风格校正后的原始排序,而这一视图对回答长度与排版更为敏感,与 Anthropic 一贯的产品取向未必契合——榜单方引入风格校正的初衷,正是因为原始排序会放大这类表层差异。 反方向的力量同样具体。结算是 2026年12月31日的单日快照,而这张榜单的首位可以在一次新模型上线后的几天内换人。年末历来是前沿模型密集发布的窗口,Anthropic 若在第四季度推出新一代 Claude 并及时接入 Arena,评分累积到足以定序通常只需要一到两周。也就是说,这份合约在 11 月之前的定价主要反映“默认格局”,真正的信息会集中在最后六到八周释放。

影响概率的因素

  • 第四季度是否有新的前沿 Claude

    Anthropic 若在 10 至 12 月发布新一代模型并接入 LM Arena,是唯一能把这个概率大幅推高的事件,方向明确向上。榜单需要累积足够票数才能给出稳定排名,通常在上线后一到两周内定序。若到 12 月中旬仍未出现新模型上榜,剩余时间几乎不足以改变结果。

  • Google 与 OpenAI 的发布节奏

    这两家是当前合约中定价最高的一侧,任何一方在年末推出新版本并重新拿下首位,都会直接压低 Claude 一档,方向向下。反过来,若两家在第四季度都无重大更新,榜首位置的争夺就会向其他实验室打开。这项因素对概率的影响量级最大。

  • “移除风格校正”这一视图设定

    结算读的是未经风格调整的原始排序,该视图对回答长度、排版结构等表层特征更敏感,与加了校正的默认视图可能给出不同的第一名。哪家模型在这一读法下更占便宜,是一个持续存在的偏移项,方向取决于各家的输出风格。对最终判定而言,这是低频但可能直接决定胜负的因素。

  • 单日快照的时点风险

    合约只看 2026年12月31日当天的榜单,而不是全年平均或最长占据时间。历史上榜首在一年内多次易主,因此临近年末的一次发布就足以改写结果。这项因素让所有各档的概率都难以在 12 月之前收敛。

  • 中国实验室的位次上移

    阿里巴巴、月之暗面、百度的模型在同一组合约中被单独定价,目前多处于个位数区间。它们若在年末把位次推进到前两名,压低的不只是 Claude 一档,而是整个美国前沿阵营的定价。这是概率分布的尾部风险,量级小但方向清晰。

支持理由

  • Anthropic 若在第四季度发布新一代 Claude 并接入 LM Arena,模型在上线一到两周内即可累积足够票数进入定序,赶得上 2026年12月31日的快照。
  • 合约只判定年末单日的榜单读数,而这张榜单的首位在过去两年多次易主,任何在 12 月落地的领先发布都能直接改写结果。
  • 移除风格校正后的原始排序与默认视图的排名可能不同,Claude 家族在其中一种读法下占优就足以满足结算条件。
  • 当前定价把绝大部分概率集中在少数几家身上,若最被看好的那一方在年末未推出更新,榜首的争夺面会明显扩大。

反对理由

  • LM Arena 文本总榜的第一名历史上主要在 Google 与 OpenAI 的模型之间轮换,Claude 家族长期位居前列但登顶并非常态。
  • 同组合约中定价最高的一档接近三分之二,与 Claude 一档拉开了很大距离,说明市场对“榜首不属于 Anthropic”这一判断相当集中。
  • 结算采用移除风格校正的原始排序,该视图放大回答长度与排版等表层差异,榜单方引入校正正是为了抑制这种影响。
  • Anthropic 的产品重心偏向编程与企业部署,对公众盲选偏好榜单的针对性优化动机弱于以消费级聊天为主的竞争者。

交易该结果合约

平台(1)

打开 Kalshi 网站 0.62
  • 无需外部钱包
  • 免 Gas 费

平台(1)

概率

  • Claude62%
  • ChatGPT14%
  • Gemini11%
  • Grok6%
  • Muse Spark3%
  • Kimi3%
  • Qwen(通义千问)1%
  • Ernie(文心一言)1%

结算规则

结算依据
截至2026年12月31日的 LM Arena 排行榜(Remove Style Controls 视图)
结算日期

结算源为 LM Arena 文本排行榜,且明确指定“Remove Style Controls”(移除风格校正)视图,读取日期为 2026年12月31日。当日榜单第一名若为 Anthropic 开发的 Claude 家族模型,合约以“是”结算;若第一名属于 OpenAI、Google、xAI、Meta、阿里巴巴、月之暗面、百度或任何其他开发者,则以“否”结算。名次并列时,按榜单当日显示的排列顺序判定。本题目下按开发者拆分的各档合约全部采用同一个结算源,因此各档之间的价格差异反映的是对不同开发者夺冠机会的判断,而不是结算依据不同。

计算方法

本地视角

这道题目把中国实验室与美国前沿实验室放进了同一组合约:阿里巴巴、月之暗面、百度都被单独标价。对新加坡、马来西亚、香港以及关注两岸科技竞争的读者而言,这提供了一个罕见的、可公开核对的量化读数——在美国对先进算力实施出口管制的背景下,市场认为中国模型距离“公开偏好榜单第一名”还有多远。这些档位目前多处于个位数区间,说明市场并不认为差距已经消失,但也没有归零。 更直接的影响在采购与成本端。东南亚与香港的企业在云端选型时,普遍参考的是几张公开榜单加上自建评测;哪家模型被认为处在前沿,会影响云服务合约的议价、API 单价走向,以及本地开发者社群的技术栈选择。同时要注意这张榜单衡量的是人类盲选偏好,不是编程、推理或长文本处理的专项能力,用它替代实际业务评测会产生系统性偏差。

后续关注

最关键的窗口是 2026 年第四季度的模型发布节奏:Anthropic 是否推出新一代 Claude,以及新模型是否在 12 月中旬前接入 LM Arena 并累积到足以定序的票数。同样要看 Google 与 OpenAI 在年末是否有新版本上线,这两家的更新历来能在数日内改变榜首。此外值得盯住 LM Arena 官方对榜单方法的调整——风格校正的口径、模型条目的合并或下架,都会影响“移除风格校正”视图的最终排序。阿里巴巴的 Qwen、月之暗面的 Kimi 与百度模型在总榜上的位次变化,则决定了这组合约尾部各档的重新定价。最终读数以 2026年12月31日榜单为准。

常见问题

这份合约到底由什么决定,什么时候结算?
结算依据 LM Arena 文本排行榜的“Remove Style Controls”(移除风格校正)视图,读取时间为 2026年12月31日。若当天第一名是 Anthropic 的 Claude 家族任一模型,合约以成立结算;若首位属于其他任何开发者,则以不成立结算。并列情况按榜单当日显示的排列顺序判定。
页面上显示的价格代表什么意思?
价格就是市场对该结果发生概率的共同估计,换算方式是把价格直接读成百分比。一份合约成立时兑付 1 美元,不成立时归零,所以成交在 0.30 意味着市场认为大约每十次发生三次。价格随新消息和资金流动持续变化,不是任何机构的官方预测。
为什么同一个市场里会出现从 64% 到 0% 这么大的价差?
因为这些记录不是对同一道是非题的不同报价,而是同一题目下按开发者拆分的一组平行合约——榜首归谁,每家一份。同一份合约的报价相差 63 个百分点在实务中不可能长期存在。把这组价格连起来看,就是市场对各家实验室年底夺冠机会的排序。
如果 LM Arena 在年底前改版或停更,结果怎么算?
结算读取的是 2026年12月31日榜单实际公布的内容。若榜单方调整了方法、合并了模型条目,仍以该日期公布的“移除风格校正”视图为准。榜单在结算日无法读取或视图不再存在,属于需要交易场所依据合约细则处理的情形,具体判定以场所公告为准。
“移除风格校正”和默认视图有什么区别,为什么重要?
风格校正是 LM Arena 用来削弱回答长度、排版和标题符号等表层因素对评分影响的统计调整。移除它之后,排序回到未经调整的原始状态,对输出更长、格式更丰富的模型相对有利。两个视图的第一名可能不是同一个模型,因此这项设定本身就可能决定合约结果。
Claude 之前在 LM Arena 上排到过第一吗?
Claude 家族长期位居这张文本总榜的前列,但首位在过去两年主要在 Google 与 OpenAI 的模型之间更替,Anthropic 并未长期占据第一。这正是市场把这份合约定价在偏低区间的主要历史依据。榜单首位更替频繁,也意味着一次年末发布仍可能改变结果。

相关事件

62%/ 38%
/