概率
价格如何变动
市场于2026年7月29日首次被记录时,阿里巴巴登顶的概率仅为22%,随后在两天内经历了剧烈震荡,价格区间覆盖了从6%的低点到100%的高点,203次报价记录显示交易者的判断反复摇摆,这通常对应着排行榜实际名次的反复变化而非单纯情绪波动。截至目前,价格回落到96%附近,较24小时前下降了17.7个百分点,表明尽管交易者仍普遍认为阿里模型保持领先,但确定性较此前的高点有所松动。
分析
背景
这个市场追踪的是Chatbot Arena(俗称LMArena)的文本竞技场总榜——一个由全球用户进行匿名模型对战投票、按胜率换算成类似ELO分数排名的大模型评测体系,是业内公认最贴近真实使用体验的公开榜单之一。2026年以来,阿里巴巴的通义千问(Qwen)系列在该榜单的中国厂商阵营中长期占据前列,但DeepSeek、月之暗面(Moonshot,Kimi系列)、MiniMax、智谱AI等公司也持续推出新模型冲击榜单,任何一家发布新版本都可能在几天内改变排名顺序。这个问题只关心一个非常具体的时间点——2026年7月31日美东时间中午12点——排行榜上排名最高的中国厂商模型是否属于阿里巴巴。
这个市场只在Polymarket一个平台交易,累计成交量为234,904美元,规模不大但足以反映交易者的实时判断。市场于2026年7月29日首次被记录时,阿里巴巴登顶的概率仅为22%,说明当时交易者普遍认为其他中国厂商——很可能是DeepSeek或月之暗面——在榜单上暂时领先。但此后短短一两天内,价格出现了剧烈波动,记录到的203次报价中,概率一度触及6%的低点,也曾冲高到100%,波动区间之宽在如此短的存续期内相当罕见。这种大幅摆动通常意味着排行榜本身发生了实际变化,或者有厂商发布新模型导致名次反复易手,而不是单纯的交易情绪波动。过去24小时内,价格从更高位回落了17.7个百分点,目前落在96%附近,显示出交易者虽仍倾向于认为阿里巴巴保持领先,但对结果的确定性有所下调,可能是因为观察到某个竞争对手的新模型评分逼近甚至一度超越了阿里的模型。由于结算日期是7月31日,距离市场首次被记录仅有两天时间,任何一家中国AI厂商在这个窗口期内提交新模型到LMArena,都可能在评测数据积累后引发排名变化,这也是本市场价格远比典型的长周期市场更为敏感的原因。
影响概率的因素
LMArena榜单实时更新
该榜单会随着新模型提交和用户投票持续滚动更新,排名并非静态,厂商可以在结算前的任意时刻上线新版本模型参与竞技场评测。这意味着即便当前阿里模型领先,竞争对手仍有时间窗口反超。
通义千问的既有优势
阿里巴巴的Qwen系列此前在中国厂商阵营中多次占据榜首,积累了较高的基础分数和用户认可度,这构成了当前96%高概率的基本盘。
DeepSeek与月之暗面的追赶
DeepSeek和月之暗面(Kimi)是最主要的竞争者,历史上曾多次在榜单上短暂超越阿里模型,过去24小时的价格回落很可能与这类竞争对手评分上升有关。
结算窗口极短
距离7月31日中午12点(美东时间)的检查节点仅剩不到两天,新模型即使发布也需要积累足够的对战数据才能稳定进入榜单,这在客观上限制了排名剧烈反转的概率。
并列时的裁定规则
若两家厂商评分并列,先比较底层竞技场分数,再按公司名称字母顺序裁定,这一规则在评分极为接近时可能起到微小的裁决作用。
支持理由
- 阿里巴巴需要在7月31日美东时间中午12点这一具体检查时刻,其Qwen系列模型在Text Arena总榜(关闭风格控制)的中国厂商阵营中排名第一。
- 这要求DeepSeek、月之暗面、MiniMax、智谱AI等竞争对手在此之前未能凭借新模型或评分提升超越阿里的模型。
- 阿里此前在该榜单上长期保持中国厂商中的领先地位,为这一结果提供了基本面支撑。
反对理由
- 如果DeepSeek或月之暗面在结算窗口关闭前提交了新版本模型并迅速积累足够对战数据获得更高分数,榜首可能易主。
- 过去24小时价格已经从更高位回落17.7个百分点,显示交易者正在下调对阿里稳赢的信心,不能排除进一步波动。
- 该市场存续期内曾出现6%到100%的极端价格区间,说明排名本身可能极不稳定,结算前仍存在变数。
