菜单
科技

阿里巴巴的AI模型能否在2026年9月底成为LMArena排行榜上排名最高的中国模型?

结算: 更新于:

要点

市场认为阿里巴巴大概率会在2026年9月30日的检查时点保持中国模型中的最高排名,这主要反映了阿里巴巴Qwen系列模型在LMArena上长期占据中国模型榜首的既有格局。能改变这一判断的因素是DeepSeek、Moonshot、Z.ai等竞争对手在检查日前发布更强模型并被社区投票推高评分。

事件编辑插图:阿里巴巴的AI模型能否在2026年9月底成为LMArena排行榜上排名最高的中国模型?

合约如何运作

该合约的判定基于2026年9月30日美东时间中午12点对LMArena文本竞技场总排行榜(无风格控制版本)的一次性快照检查:如果阿里巴巴的模型在上述中国公司模型中排名最高,合约结算为1美元;否则结算为0美元。价格本身代表的是市场当前对“会发生”这一结果的概率估计,例如若某合约价格为0.30美元,意味着市场认为该结果发生的概率约为三成,这只是一个说明性的例子,并非本市场当前的价格。持有者通常可以在2026年10月1日正式结算前的任何时间以当时的市场价格卖出手中的仓位。
市场如何评估结果
$100
87%

事件会发生

当前价格
$0.87
如果投入 $100
$115
13%

事件不会发生

当前价格
$0.13
如果投入 $100
$769

概率

自事件纳入追踪起开始记录历史

价格如何变动

目前可获得的数据是跨平台共识87%这一快照,以及129,850美元的累计交易量,公开信息未提供该合约自开盘以来完整的价格轨迹细节,因此无法准确描述其逐日或逐周的变动路径。由于目前只有Polymarket一家平台交易该合约,也就没有跨场所价差可以用来衡量市场内部的分歧程度,这本身说明该问题目前被市场视为方向相对明确、但尚未完全确定的状态。

分析

背景

LMArena(此前称Chatbot Arena)是一个由用户匿名盲测投票产生的大模型排行榜,参与者对比两个模型的回答后选出更优者,系统据此计算出类似Elo的评分并排名。这一事件关注的不是全球第一,而是在“主要来自中国AI公司”这一子集中,阿里巴巴的模型是否排名最高,该子集明确列出了阿里巴巴、Moonshot、DeepSeek、Z.ai、腾讯、字节跳动、百度、小米、MiniMax、美团和StepFun等公司。
跨平台共识目前为87%,交易量为129,850美元,且目前只有Polymarket一家平台在交易该合约,因此没有跨平台价差可供比较,这一情况本身就是信息:说明这是一个相对小众但仍吸引真实资金关注的科技类市场,而非被多个平台反复定价、经过充分套利的品类。87%这一水平意味着市场认定阿里巴巴保住中国模型第一的可能性较大,但并未视为定局——仍留出约13个百分点的空间给竞争对手在检查日前反超的情形。判定规则明确列出了参与比较的公司名单,覆盖了目前中国AI大模型领域几乎所有主要玩家,这意味着阿里巴巴需要同时压过DeepSeek、Moonshot(Kimi)、Z.ai(原智谱GLM)、字节跳动(豆包)等多条产品线的最新迭代,而不仅仅是维持自身模型不退步。规则中的排位判定方式(先比较Arena底层评分,再按公司名称字母顺序)在实际操作中很少会被触发,因为LMArena的评分通常有明显区分度,这意味着最终结果大概率取决于谁在检查日前拥有更高的原始评分,而不是并列规则本身。由于检查时点是9月30日中午这一固定瞬间而非某段时间的平均值,任何一方在检查日前几天内发布新模型并被社区快速投票推高评分,都可能在短时间内改变排名,这也是当前价格没有完全逼近100%的核心原因。

影响概率的因素

  1. Qwen系列的迭代节奏

    阿里巴巴近年持续高频发布Qwen系列模型更新,这是其在中国模型子集中长期占据LMArena较高排名的主要支撑,对结果为“是”构成正向推动。

  2. 竞争对手的新发布

    DeepSeek、Moonshot(Kimi)、Z.ai(GLM)、字节跳动(豆包)等公司若在9月30日检查日前推出新版本并获得社区更高评分,将直接压低阿里巴巴保持第一的概率。

  3. LMArena评分的投票驱动性质

    该排行榜的评分来自用户盲测投票而非固定基准测试,短期内可能因新模型上线后的投票热度波动而出现名次变化,这为检查日前的最后几周带来不确定性。

  4. 检查时点的一次性

    判定只看9月30日美东中午12点这一个时间点的快照,而不是某段时间的平均排名,这意味着临近检查日的任何一次模型发布都可能对结果产生放大效应。

支持理由

  • 阿里巴巴需要在2026年9月30日美东中午12点的检查时点,其Qwen模型在列出的中国公司模型中拥有最高的Arena评分。
  • 如果阿里巴巴在检查日前继续保持其一贯的高频模型更新节奏,且没有竞争对手发布评分明显更高的新模型,结果将判定为“是”。
  • 历史上Qwen系列在LMArena的中国模型子集中长期保持领先地位,这一既有优势是市场给出较高概率的基础。

反对理由

  • DeepSeek、Moonshot、Z.ai、字节跳动等公司在2026年均保持活跃的模型发布节奏,任何一家在检查日前推出评分更高的新模型都会直接推翻结果。
  • LMArena的评分基于社区投票,短期内可能出现较大波动,一次成功的新模型发布可能在几周内改变排名格局。
  • 规则列出的竞争公司数量较多,意味着阿里巴巴需要同时压过多条产品线,而不仅仅是防守某一个特定对手。

后续关注

需要关注的核心日期是2026年9月30日美东时间中午12点,即LMArena文本竞技场总排行榜(无风格控制)被读取用于最终判定的时刻。在此之前,DeepSeek、Moonshot、Z.ai、字节跳动、百度等公司若发布新版本大模型并被计入该榜单评分,都可能改变排名格局;阿里巴巴自身是否在此期间发布新版本Qwen模型同样是关键变量。

交易该结果合约

平台(1)

了解该事件

平台(1)

概率

  • 到2026年9月底,阿里巴巴是否将拥有最好的中文AI模型?87%
  • 到2026年9月底,Moonshot是否将拥有最好的中文AI模型?11%
  • 到2026年9月底,Z.ai是否将拥有最好的中文AI模型?2%
  • 到2026年9月底,DeepSeek是否将拥有最好的中文AI模型?0%
  • 到2026年9月底,字节跳动是否将拥有最好的中文AI模型?0%
  • 到2026年9月底,百度是否将拥有最好的中文AI模型?0%
  • 到2026年9月底,腾讯是否将拥有最好的中文AI模型?0%

结算规则

结算依据
https://arena.ai/leaderboard/text/overall-no-style-control
结算日期

该事件依据LMArena官方文本竞技场总排行榜(无风格控制版本,网址为https://arena.ai/leaderboard/text/overall-no-style-control)在2026年9月30日美东时间中午12点的显示结果判定。若阿里巴巴的模型在列出的中国公司模型(包括Moonshot、DeepSeek、Z.ai、腾讯、字节跳动、百度、小米、MiniMax、美团、StepFun)中排名最高,则判定为“是”;若评分并列,先比较底层Arena评分,再按公司名称字母顺序判定。目前唯一交易该合约的平台Polymarket也采用同一来源作为结算依据,因此不存在因结算来源不同而产生的价差。

计算方法

本地视角

对新加坡、马来西亚、香港及全球华人读者而言,追踪阿里巴巴、DeepSeek、Moonshot等公司谁在AI模型排名上领先,往往带有对中国科技产业整体实力的关注色彩,这类话题在中文科技媒体和社交平台上讨论热度较高。此外,阿里巴巴云及相关AI服务在东南亚多地被广泛用于电商和企业客户场景,其模型在国际公认榜单上的排名也间接影响外界对该公司技术实力的评价。

常见问题

这个市场最终依据什么、什么时候结算?
结算依据是2026年9月30日美东时间中午12点对LMArena文本竞技场总排行榜(无风格控制版本)的读取结果,正式结算日期为2026年10月1日。判定只看列出的中国公司模型中,阿里巴巴的模型是否排名最高。
当前跨平台共识87%这个数字代表什么?
这个数字是市场买卖双方对“阿里巴巴模型在检查日排名最高”这一结果发生概率的共同估计,不是对结果的保证,也不代表交易该合约会获得回报。价格会随着新信息(例如新模型发布)不断变化。
如果排名出现并列怎么处理?
规则规定先比较模型的底层Arena评分,评分更高者排名更高;如果评分也完全相同,则按公司名称的字母顺序判定,但这种情况在实际评分体系下出现的概率很低。
LMArena排行榜是怎么运作的?
LMArena让用户对两个模型的回答进行盲测投票选出更优者,系统据此计算出类似Elo等级分的评分,并据评分对模型排名,评分会随着新一轮投票持续更新。
哪些公司被算作“中国AI公司”参与比较?
规则明确列出阿里巴巴、Moonshot、DeepSeek、Z.ai、腾讯、字节跳动、百度、小米、MiniMax、美团和StepFun,且要求公司总部及主要业务运营须在中国科技生态体系内,非此条件的公司不计入比较范围。
如果检查日排行榜出现更新延迟或数据异常怎么办?
判定依据是明确指定的官方网址https://arena.ai/leaderboard/text/overall-no-style-control在指定时间点的显示结果,若该榜单本身出现延迟或异常,通常会以该来源在可获取时最接近指定时间点的数据为准。

相关事件

87%/ 14%
/