菜单
科技

Anthropic的模型能否在2026年9月底登上LMArena排行榜第一?

结算: 更新于:

要点

市场认为这一结果基本大概率会发生。主要原因是Anthropic的模型目前在LMArena文本竞技场总榜上处于领先或接近领先位置,而截至目前没有公开确认的竞争对手旗舰模型会在9月30日检查时点前发布并明显超越它。如果OpenAI、谷歌或某家中国实验室在9月底前推出新旗舰模型并在盲测投票中胜出,这一判断会发生变化。

事件编辑插图:Anthropic的模型能否在2026年9月底登上LMArena排行榜第一?

合约如何运作

这类合约在结果发生时结算为1美元,不发生则结算为零。价格本身就是市场参与者当前认为该结果发生概率的体现,比如某个合约价格为0.30,大致意味着市场认为这件事发生的可能性在十次里约有三次,这只是举例说明机制,并非本市场实际价格。本市场将在2026年9月30日结算,依据是届时arena.ai文本竞技场总榜(风格控制关闭)上排名第一的模型归属公司。在结算日之前,持有该合约的一方通常可以按当时市场愿意接受的价格卖出退出,不必等到结算时刻。
市场如何评估结果
$100
90%

事件会发生

当前价格
$0.90
如果投入 $100
$111
10%

事件不会发生

当前价格
$0.10
如果投入 $100
$1,000

概率

自事件纳入追踪起开始记录历史

价格如何变动

目前只有Polymarket一家平台交易这一事件,市场隐含概率为90%,累计成交量约64,230美元。由于只有单一平台报价,无法与其他平台的定价做比较,这也意味着当前90%这一水平反映的是相对有限的一批参与者的判断,而非跨平台共识。没有可靠的分日或分周价格变动数据可用来描述该市场近期走势,因此不对具体变动原因做推测性描述;可以确定的是,交易规模处于较低水平,与这类聚焦AI行业细分动态的技术性事件市场的一般特征相符。

分析

背景

LMArena(此前称Chatbot Arena)是由arena.ai运营的一个基于人类投票的大模型评测平台。用户在不知道模型身份的情况下,对两个模型的回答进行盲选打分,系统据此计算出一个总排名。这个排名因为反映真实用户偏好而被业界广泛引用,常被视为衡量大模型综合能力的一个参考指标,尽管它衡量的是人类偏好而非单一的客观能力。 目前在这个榜单上竞争的主要公司包括Anthropic(Claude系列)、OpenAI(GPT系列)、谷歌(Gemini系列)、xAI(Grok系列),以及来自中国的阿里巴巴(通义千问/Qwen系列)和深度求索(DeepSeek系列)。各家公司发布新版本模型的节奏并不统一,过去一年里榜首位置曾多次因新模型发布而更替。 这个市场问的是一个非常具体的时间点判断:2026年9月30日美国东部时间中午12点,arena.ai文本竞技场总榜(关闭风格控制版本)上排名第一的模型是否归属于Anthropic。这不是对整年趋势的判断,而是对一个固定检查时刻的快照判断。
目前唯一交易该事件的平台是Polymarket,市场隐含概率为90%,累计成交量约64,230美元。由于只有一个平台报价,这个数字反映的是单一撮合市场的共识,而不是多平台之间价格差异的平均结果——这类窄众技术类事件市场常见的情况是,交易量集中在少数关注AI行业动态的参与者手中,而非广泛的投机资金,64,230美元的规模也印证了这一点。 从结算机制看,决定结果的关键变量是9月30日中午12点(美国东部时间)这一固定时刻榜单的状态,而不是整个9月的平均表现。这意味着即便某家竞争对手在9月中旬短暂超越,只要Anthropic在检查时点重新夺回或维持第一,市场依然会结算为“是”;反过来,如果Anthropic在检查前几天被超越且未能反超,结果也会翻转。这种“瞬时快照”规则放大了检查日期前后任何新模型发布的权重。 历史上看,LMArena总榜的第一名并非长期固定,过去曾因OpenAI、谷歌、Anthropic以及中国实验室的新版本发布而多次更替,但每次更替往往紧跟在具体的新模型公开发布之后,而不是渐进式变化。截至目前没有证据显示9月底前有已公开确认、且已展示出明显超越现有榜首模型基准表现的新发布计划,这也是市场将概率维持在较高水平的合理基础。 并列情形的处理规则值得注意:若出现并列,先比较底层Arena评分,再按公司名称字母顺序判定,这在结果非常接近时会影响归属判断,但目前市场给出的高概率意味着交易者预期出现如此接近并列的情况本身概率不高。

影响概率的因素

  1. Claude当前榜单位置

    Anthropic的模型目前在LMArena总榜上处于领先或接近领先位置,这是市场给出高概率的直接基础。只要这一位置在9月30日检查时点前未被明显超越,结果倾向于“是”。

  2. 竞争对手旗舰发布时点

    OpenAI、谷歌或xAI若在9月底前发布新旗舰模型并在盲测中胜出,会直接压低这一概率。目前没有公开确认的、已展示超越现有榜首表现的具体发布计划,这是概率维持较高水平的关键前提。

  3. 中国实验室的追赶速度

    阿里巴巴通义千问和深度求索近年模型迭代速度较快,曾在部分类别榜单上取得亮眼名次,若其新版本在9月底前提交并在总榜盲测中胜出,可能改变结果。目前尚无证据显示已有此类模型进入总榜前列。

  4. 检查时点的瞬时性

    结算依据是9月30日中午12点(美国东部时间)这一固定时刻的榜单快照,而非整月平均表现。这意味着临近检查日期前后的任何新模型发布,其影响会被放大,即便发布时间很短。

  5. 并列处理规则

    若出现评分并列,先看底层Arena分数,再按公司名称字母顺序判定归属。这一规则只在结果非常接近时才起作用,目前的高概率意味着交易者预期出现如此接近并列的情况本身概率不高。

支持理由

  • Anthropic的模型目前在LMArena文本竞技场总榜上处于领先或接近领先的位置。
  • 截至目前没有公开确认的竞争对手旗舰模型计划在2026年9月30日前发布并已展示出明显超越现有榜首的基准表现。
  • Anthropic此前曾在该榜单上维持领先位置较长时间,说明其模型在人类盲测偏好上具备持续竞争力。

反对理由

  • OpenAI、谷歌或xAI有可能在9月底前发布新旗舰模型,并在盲测投票中反超Claude。
  • 阿里巴巴通义千问或深度求索等中国实验室的模型迭代速度较快,存在在检查时点前提交更强版本并进入总榜前列的可能性。
  • 该榜单历史上曾多次因新模型发布而在数周内更替第一名,说明榜首位置本身并非长期稳定。

后续关注

需要关注的关键节点包括:OpenAI、谷歌Gemini、xAI Grok系列是否在9月30日前发布新旗舰模型并提交至LMArena评测;阿里巴巴通义千问、深度求索等中国实验室是否有新版本模型进入总榜前列;以及arena.ai文本竞技场总榜(风格控制关闭)本身在临近9月30日中午12点(美国东部时间)检查时点前的排名变化。这些发布和榜单更新是决定结果的直接变量。

交易该结果合约

平台(1)

了解该事件

平台(1)

概率

  • 到2026年9月底,Anthropic是否将拥有最佳AI模型?90%
  • 到2026年9月底,OpenAI是否将拥有最佳AI模型?6%
  • 到2026年9月底,Google是否将拥有最佳AI模型?3%
  • 到2026年9月底,SpaceXAI是否将拥有最佳AI模型?2%
  • 到2026年9月底,DeepSeek是否将拥有最佳AI模型?0%
  • 到2026年9月底,Alibaba是否将拥有最佳AI模型?0%
  • 到2026年9月底,Xiaomi是否将拥有最佳AI模型?0%
  • 到2026年9月底,Microsoft是否将拥有最佳AI模型?0%

结算规则

结算依据
https://arena.ai/leaderboard/text/overall-no-style-control
结算日期

本市场依据arena.ai文本竞技场总榜(网址为arena.ai/leaderboard/text/overall-no-style-control,风格控制功能关闭)进行判定。检查时间为2026年9月30日美国东部时间中午12点,若该时刻榜单上排名第一的模型归属公司为Anthropic,则结算为“是”,否则为“否”。若出现评分并列,先比较模型的底层Arena评分,再按公司名称字母顺序判定;若资料来源在检查时点不可访问,则采用Polymarket规则下的下一个可用榜单快照作为依据。目前仅有Polymarket一家平台交易该事件,不存在跨平台结算来源不一致的情况。

计算方法

本地视角

中文读者对这一话题的关注,很大程度上来自阿里巴巴通义千问和深度求索这两家中国实验室长期是LMArena榜单上的主要参与者,它们的排名表现常被视为观察中美AI能力差距的一个具体、可公开验证的指标。若某家中国模型在9月底检查时点前进入总榜前列甚至夺得第一,会被视为中美AI基准竞赛格局变化的一个信号,进而影响相关公司股价和行业叙事,即便这一变化未必直接反映在日常消费应用层面。

常见问题

这个市场具体依据什么、什么时候结算?
依据arena.ai文本竞技场总榜(风格控制关闭版本),结算时间为2026年9月30日美国东部时间中午12点。届时该榜单排名第一的模型若归属Anthropic,市场结算为“是”,否则为“否”。
当前价格90%左右意味着什么?
这一数字是市场参与者根据现有信息对结果发生概率的共同判断,不是对结果的保证,也不构成对该结果“划算”或“值得参与”的建议。价格会随新信息(例如新模型发布)随时变化。
如果arena.ai网站在检查时间点无法访问怎么办?
根据结算规则,若资料来源在检查时点不可用,将采用Polymarket规则下下一个可用的榜单快照作为判断依据,而不会因技术性中断而使市场无限期悬置。
为什么Anthropic目前处于领先位置?
这一判断来自LMArena总榜当前的排名状态,该榜单基于大量用户对模型回答的盲选投票计算得出,反映的是人类偏好而非单一基准测试分数。具体排名会随各公司新版本模型的提交而持续更新。
如果出现并列名次怎么判定归属?
规则规定先比较模型的底层Arena评分,分数更高者优先;若评分仍然相同,则按公司名称的字母顺序判定归属。
为什么这个市场的交易量看起来不大?
这是一个聚焦AI行业细分动态的技术性事件市场,受众相对有限,64,230美元的累计成交量与这类利基市场的一般规模相符,并不代表市场判断的可靠性存在问题。

相关预测事件

代币化股票

为该资产催化因素提供背景的市场隐含概率。

相关事件

90%/ 10%
/