菜单
科技

阿里巴巴的AI模型能否在Chimera Arena排行榜上保持中国模型第一?

结算: 更新于:

要点

市场认为阿里巴巴在8月31日的快照时刻大概率仍是中国厂商中排名最高的模型,这一判断建立在阿里巴巴通义千问系列长期保持领先分数区间的基础上。若DeepSeek、智谱(Z.ai)或月之暗面在截止日前发布新版本并迅速积累投票、跃升分数,结果可能被改写。

事件编辑插图:阿里巴巴的AI模型能否在Chimera Arena排行榜上保持中国模型第一?

合约如何运作

这份合约在2026年8月31日美东时间12:00对Arena.ai文本竞技场总体排行榜(关闭风格控制选项)进行一次快照检查:若名单中11家中国科技生态公司里排名最高的模型属于阿里巴巴,合约到期结算为1美元;若属于其他任何一家公司,则结算为零。合约的价格反映的是市场对“阿里巴巴保住第一”这一结果发生概率的共识,举例来说,若某合约价格为0.30美元,意味着市场认为该结果发生的概率大约是十分之三,这只是说明价格含义的假设例子,并非本市场当前价格。在结算日之前,持有者可以随时按当时的市场价格卖出仓位,无需等到8月31日。
市场如何评估结果
$100
96%

事件会发生

当前价格
$0.96
如果投入 $100
$104
4%

事件不会发生

当前价格
$0.04
如果投入 $100
$2,500

概率

自事件纳入追踪起开始记录历史

价格如何变动

目前可获得的数据显示,该问题只在Polymarket一个场所交易,市场隐含概率处于95%附近,累计成交金额约156,172美元,尚无公开的跨场所价差或分时波动记录可供比对。这一价位本身说明市场已经将“阿里巴巴保持第一”视为接近但未完全确定的结果,而非模糊的五五分歧,若无进一步的历史走势数据,不宜臆测价格是从更低水平上升而来,目前只能确认这是当前唯一场所的共识水平。

分析

背景

Chimera Arena(即Arena.ai运营的文本竞技场)是一个通过匿名人类偏好投票对语言模型进行排名的平台,机制与业内熟知的Chatbot Arena类似:用户同时看到两个模型的回答,不知道模型身份,投票选出更优答案,系统据此计算类似Elo的分数。这类排行榜被全球AI实验室视为衡量模型综合能力的公开指标之一,参与者包括OpenAI、谷歌、Anthropic等美国公司,也包括阿里巴巴、DeepSeek、百度、智谱、月之暗面、字节跳动、腾讯、小米、美团、MiniMax、StepFun等中国厂商。这份市场只关注这些被列入“中国科技生态”名单的公司之间的排名,与美国模型的整体排名无关。近两年,阿里巴巴的通义千问系列因发布频率高、迭代速度快,在多次快照中占据中国厂商榜首,但DeepSeek等对手的新模型发布也曾在短期内引发排名波动。
目前唯一追踪该问题的场所是Polymarket,市场隐含概率处于95%附近,累计成交金额约156,172美元。由于只有一个场所在交易,无法通过跨场所价差判断分歧程度,但单一场所内较高的成交量表明这一价位已吸纳了相当规模的资金押注,而非零星报价。95%这一水平意味着市场认为“阿里巴巴以外的公司在8月31日快照时刻反超”的情形发生概率大致只有二十分之一左右,这与阿里巴巴通义千问系列长期、高频迭代所积累的分数优势相符。结算规则列出的11家公司里,真正在这类竞技场排行榜上具备冲击前列实力的通常只是其中两三家,例如DeepSeek凭借其模型在开源社区的广泛使用曾多次进入榜单前列,智谱(Z.ai)的GLM系列和月之暗面的Kimi系列也偶有强势版本发布。这份市场的结算规则还包含一条细节:若阿里巴巴与另一家公司在Arena原始分数上出现并列,将按公司名称的字母顺序判定胜负,阿里巴巴(Alibaba)的字母排序早于百度(Baidu)、字节跳动(Bytedance)、腾讯(Tencent)等大多数竞争对手,这意味着在极端并列的情况下,规则本身对阿里巴巴略微有利。整体来看,95%的价位反映的是一种“基本认定但留有余地”的状态,而非“完全排除意外”,真正的风险集中在临近8月31日窗口期内是否会有对手发布高分新版本并迅速获得足够投票量以体现在最终快照中。

影响概率的因素

  1. 通义千问的发布节奏

    阿里巴巴过去一年多次推出通义千问新版本,发布频率高于多数中国同行,这种持续迭代是其分数长期占优的主要原因,推动市场概率维持在高位。

  2. 竞争对手临近发布新模型

    若DeepSeek、智谱或月之暗面在8月31日前的十天内推出新旗舰版本并获得足够投票积累分数,有可能在快照时刻短暂超越通义千问,这是拉低概率的主要风险点。

  3. 人类偏好投票的短期波动性

    竞技场排名依赖持续累积的匿名投票,新发布模型在早期样本量较小时分数可能出现暂时性偏高或偏低,这种波动在分数接近时会放大结果的不确定性。

  4. 并列时的字母顺序判定规则

    若两家公司在Arena原始分数上并列,规则按公司名称字母顺序判定,阿里巴巴的英文名称排序早于名单中的多数竞争对手,这一细节在极端并列情形下对阿里巴巴略有利。

  5. 结算快照的具体时刻

    市场只取2026年8月31日美东时间12:00这一个时间点的排行榜状态,而非某段时期的平均表现,任何模型在该精确时刻前后的短暂波动都可能直接决定结果。

支持理由

  • 阿里巴巴的通义千问系列模型需要在2026年8月31日美东时间12:00的快照中,在Arena文本竞技场总体排行榜(关闭风格控制)上保持中国厂商中的最高分数。
  • 名单中其余10家公司,包括DeepSeek、百度、智谱、月之暗面、字节跳动、腾讯、小米、美团、MiniMax和StepFun,都不能在此之前发布一个能够反超通义千问分数的新模型。
  • 若出现原始分数并列的情况,阿里巴巴的名称字母顺序已在多数竞争对手之前,规则本身在极端情形下对其有利。

反对理由

  • 在距8月31日结算不到十天的窗口期内,任何一家竞争对手若发布新旗舰模型并迅速积累足够投票,理论上可能在快照时刻反超通义千问。
  • 竞技场排名依赖投票样本量,新模型上线初期的分数可能因样本较少而出现暂时性偏高,恰好覆盖到8月31日这一具体检查时刻就会改变结果。
  • 名单中11家公司里任何一家,即便只是短暂地在快照那一刻分数高于阿里巴巴,都会使这份市场结算为“否”。

后续关注

需要关注的时间点是2026年8月31日美东时间12:00,即Arena.ai对文本竞技场总体排行榜进行结算判定的确切快照时刻。在此之前,值得留意DeepSeek、智谱(Z.ai)、月之暗面、百度、字节跳动等公司是否发布新版本模型并在Arena上获得足够投票量以体现在排名中,同时也要留意阿里巴巴自身是否会在窗口期内推出新的通义千问版本以巩固领先优势。

交易该结果合约

平台(1)

了解该事件

平台(1)

概率

  • 2026年8月底时,阿里巴巴是否会拥有最佳中文AI模型?96%
  • 2026年8月底时,Moonshot是否会拥有最佳中文AI模型?2%
  • 2026年8月底时,Z.ai是否会拥有最佳中文AI模型?1%
  • 2026年8月底时,百度是否会拥有最佳中文AI模型?1%
  • 2026年8月底时,DeepSeek是否会拥有最佳中文AI模型?0%
  • 2026年8月底时,MiniMax是否会拥有最佳中文AI模型?0%

结算规则

结算依据
https://arena.ai/leaderboard/text/overall-no-style-control
结算日期

结算依据为Arena.ai网站上的文本竞技场总体排行榜,网址为arena.ai/leaderboard/text/overall-no-style-control,风格控制选项需保持关闭状态。检查时点为2026年8月31日美东时间12:00,系统比较名单中阿里巴巴、DeepSeek、智谱、百度、MiniMax、月之暗面、字节跳动、腾讯、小米、美团、StepFun这11家公司里排名最高的模型,若属于阿里巴巴则结算为“是”,否则结算为“否”。若原始Arena分数出现并列,先以分数本身判定,若仍并列则按公司名称字母顺序判定。目前公开追踪该问题的场所只有Polymarket一家,未见其他场所采用不同结算源。

计算方法

本地视角

对于关注中美科技竞争和中国AI产业格局的简体中文读者而言,阿里巴巴与DeepSeek、百度等厂商在权威第三方排行榜上的名次之争,常被视为衡量中国AI模型综合实力的公开指标之一,也与阿里巴巴在香港上市股份(9988.HK)的市场情绪、以及外界评估中国AI企业估值和融资前景时的参考因素相关。这一结果本身不直接影响汇率或大宗商品价格,但作为科技竞争力的公开信号,会被投资者和媒体纳入对中国AI产业整体叙事的判断。

常见问题

这份市场具体在什么时候、依据什么结算?
结算时点是2026年8月31日美东时间12:00,依据是Arena.ai网站上的文本竞技场总体排行榜(关闭风格控制选项)。系统会检查名单中11家中国科技生态公司里,谁的模型分数最高,若是阿里巴巴则结算为“是”。
市场价格代表什么?
价格反映的是交易参与者对“阿里巴巴保持第一”这一结果发生概率的共识,价格越接近1美元表示市场认为该结果发生的可能性越高,价格会随着新信息不断变化,页面上显示的是实时数值。
如果排行榜在结算当天出现故障或延迟怎么办?
结算规则以“31 August 2026, 12:00 PM ET”这一具体检查时刻为准,若该时刻的排行榜数据不可获取,通常会依据最接近该时刻的可用读数进行判定,具体处理方式由结算方在届时公告。
为什么这11家公司被算作“中国科技生态”?
结算规则明确列出了阿里巴巴、DeepSeek、智谱(Z.ai)、百度、MiniMax、月之暗面、字节跳动、腾讯、小米、美团和StepFun这11家公司,作为总部或主要运营在中国科技生态内的厂商名单,只在这个范围内比较谁的模型排名最高。
如果两家公司分数并列怎么判定?
规则规定先比较Arena的原始分数,若仍然并列,则按公司名称的字母顺序判定,阿里巴巴(Alibaba)的英文名称排序早于名单中的大多数公司。
这个排行榜的排名是怎么产生的?
Arena.ai的文本竞技场通过让用户在不知道模型身份的情况下,对两个模型给出的回答进行匿名投票选择更优者,系统据此计算出类似Elo等级分的分数,再按分数高低排出名次。

相关事件

96%/ 4%
/