合约如何运作
概率
价格如何变动
分析
背景
影响概率的因素
第四季度是否有新的前沿 Claude
Anthropic 若在 10 至 12 月发布新一代模型并接入 LM Arena,是唯一能把这个概率大幅推高的事件,方向明确向上。榜单需要累积足够票数才能给出稳定排名,通常在上线后一到两周内定序。若到 12 月中旬仍未出现新模型上榜,剩余时间几乎不足以改变结果。
Google 与 OpenAI 的发布节奏
这两家是当前合约中定价最高的一侧,任何一方在年末推出新版本并重新拿下首位,都会直接压低 Claude 一档,方向向下。反过来,若两家在第四季度都无重大更新,榜首位置的争夺就会向其他实验室打开。这项因素对概率的影响量级最大。
“移除风格校正”这一视图设定
结算读的是未经风格调整的原始排序,该视图对回答长度、排版结构等表层特征更敏感,与加了校正的默认视图可能给出不同的第一名。哪家模型在这一读法下更占便宜,是一个持续存在的偏移项,方向取决于各家的输出风格。对最终判定而言,这是低频但可能直接决定胜负的因素。
单日快照的时点风险
合约只看 2026年12月31日当天的榜单,而不是全年平均或最长占据时间。历史上榜首在一年内多次易主,因此临近年末的一次发布就足以改写结果。这项因素让所有各档的概率都难以在 12 月之前收敛。
中国实验室的位次上移
阿里巴巴、月之暗面、百度的模型在同一组合约中被单独定价,目前多处于个位数区间。它们若在年末把位次推进到前两名,压低的不只是 Claude 一档,而是整个美国前沿阵营的定价。这是概率分布的尾部风险,量级小但方向清晰。
支持理由
- Anthropic 若在第四季度发布新一代 Claude 并接入 LM Arena,模型在上线一到两周内即可累积足够票数进入定序,赶得上 2026年12月31日的快照。
- 合约只判定年末单日的榜单读数,而这张榜单的首位在过去两年多次易主,任何在 12 月落地的领先发布都能直接改写结果。
- 移除风格校正后的原始排序与默认视图的排名可能不同,Claude 家族在其中一种读法下占优就足以满足结算条件。
- 当前定价把绝大部分概率集中在少数几家身上,若最被看好的那一方在年末未推出更新,榜首的争夺面会明显扩大。
反对理由
- LM Arena 文本总榜的第一名历史上主要在 Google 与 OpenAI 的模型之间轮换,Claude 家族长期位居前列但登顶并非常态。
- 同组合约中定价最高的一档接近三分之二,与 Claude 一档拉开了很大距离,说明市场对“榜首不属于 Anthropic”这一判断相当集中。
- 结算采用移除风格校正的原始排序,该视图放大回答长度与排版等表层差异,榜单方引入校正正是为了抑制这种影响。
- Anthropic 的产品重心偏向编程与企业部署,对公众盲选偏好榜单的针对性优化动机弱于以消费级聊天为主的竞争者。
