菜单
科技

谷歌能在2026年12月底成为最强AI模型吗?

结算: 更新于:

要点

市场目前认为谷歌年底登顶的可能性偏低。核心原因是OpenAI、Anthropic、xAI以及阿里巴巴、DeepSeek等实验室同样在密集发布新模型,排行榜第一的位置历史上更换频繁,谷歌需要在12月31日检查时点恰好占据榜首才算兑现。若谷歌在年底前推出新一代Gemini并明显超越对手评分,这一判断会改变。

事件编辑插图:谷歌能在2026年12月底成为最强AI模型吗?

合约如何运作

这份合约在结算日检查LMArena文本排行榜(关闭风格控制后的排名),如果谷歌旗下模型排在第一名,合约结算为1美元;如果不是,结算为零。市场价格反映的是交易者对这一结果发生概率的共识,例如价格为0.30就意味着交易者认为大约十次里有三次会发生,这只是举例说明机制,并非本市场当前的价格。结算日期为2026年12月31日检查后确定,最终由2027年1月1日的市场结算流程完成。在结算之前,持有的仓位通常可以按当时的市场价格卖出。
市场如何评估结果
$100
10%

事件会发生

当前价格
$0.10
如果投入 $100
$1,000
90%

事件不会发生

当前价格
$0.90
如果投入 $100
$111

概率

自事件纳入追踪起开始记录历史

价格如何变动

该市场目前只有Polymarket一家平台在交易,共识价格为10%,总交易量约74,984美元。由于没有公开的逐日或逐周价格变动数据,也没有其他平台可供比较价差,无法描述价格经历过怎样的波动路径,只能说明当前10%是现有交易活动下形成的静态水平,交易规模相对有限,价格发现程度还不高。

分析

背景

这一合约追踪的是LMArena(前身Chatbot Arena)文本排行榜——一个通过用户盲测投票为大语言模型打分的公开榜单,被业界广泛引用为衡量模型综合能力的参考指标之一。谷歌的Gemini系列此前曾一度登上该榜单第一名,但OpenAI、Anthropic、xAI以及来自中国的阿里巴巴通义千问、DeepSeek等团队也在持续更新模型,榜首位置在过去两年多次易主。 结算时点被设定在2026年12月31日美国东部时间中午12点,即检查当天该榜单排名第一的模型所属公司。如果并列,先比较榜单背后的Arena评分,评分仍并列则按公司名称字母顺序判定。这意味着结果高度依赖各家实验室在年底前的发布节奏,而不是当前谁暂时领先。
目前各交易平台对该结果的共识价格为10%,总交易量约74,984美元,且交易集中在Polymarket一家平台,尚未形成跨平台价差可供比较,这本身说明这是一个交易活跃度有限、价格发现程度不高的市场,随着结算日临近,交易量和跨平台一致性可能会上升。由于没有公开的逐日或逐周价格变动记录,无法描述该价格是否经历过明显波动,只能说明当前的10%水平是现有交易活动下形成的静态共识。 从结果本身看,决定权完全在于LMArena榜单在检查那一刻的排名,而不是任何公司自我宣称的技术领先。历史上,Gemini系列曾一度短暂占据该榜单第一名,但很快被OpenAI或Anthropic的新版本超越,这种更替反映出榜单本身对最新发布模型高度敏感——往往是谁在检查日前最近发布了新模型,谁就更占优势。这种机制对谷歌既是机会也是风险:如果谷歌选择在年底前发布新一代Gemini,理论上有机会短暂登顶;但同样的逻辑也适用于所有竞争者,任何一家实验室在12月发布强力模型都可能改变结果。 另外需要注意,该榜单采用关闭风格控制的排名方式,这一设定会影响不同模型的相对得分,因为风格控制会削弱模型输出格式讨喜带来的加分效应,关闭后某些回答风格更受用户偏好的模型可能获得额外优势,这也是判断谁更容易登顶时需要考虑的技术细节。

影响概率的因素

  1. 发布节奏决定短期排名

    榜单第一名历史上跟随最新发布的旗舰模型频繁更替,谁在12月31日检查前最近发布新版本,往往更占优势。这对谷歌是双向因素:如果谷歌选择在年底集中发布新一代Gemini,短期登顶概率会上升;但对手同样可以选择在同一时间窗口发布。

  2. 中国实验室的竞争压力

    阿里巴巴通义千问、DeepSeek等中国团队近年在该榜单排名持续上升,增加了榜首竞争者数量,这会压低谷歌在任意时点独占第一的概率。这也是本市场吸引中文读者关注的直接原因之一。

  3. OpenAI与Anthropic的持续更新

    OpenAI和Anthropic的模型迭代周期通常较短,且历史上多次交替占据榜首,这种竞争密度本身就限制了任何单一公司长期占据第一名的概率。

  4. 风格控制关闭的评分方式

    结算规则明确使用关闭风格控制的排名版本,这一设定会让回答风格更受用户直觉偏好的模型获得额外加分,具体哪家公司的模型更受益取决于届时各自的输出风格,是一个技术性但会实际影响排名结果的变量。

  5. 单一平台交易量偏低

    目前仅Polymarket一家平台报价,总交易量约74,984美元,规模有限,意味着当前10%的共识价格建立在相对薄的交易基础上,随时可能因新信息或新发布而出现较大调整。

支持理由

  • 谷歌需要在2026年12月31日美国东部时间中午12点的检查时刻,其模型恰好排在LMArena文本排行榜第一名。
  • 谷歌此前已证明具备短暂登顶该榜单的技术能力,只要在检查日前发布足够强的新一代Gemini模型,理论上可以复制这一结果。
  • 谷歌拥有大规模自有算力(TPU集群)支持持续训练更强模型,这为在年底前推出竞争力更强的版本提供了基础条件。

反对理由

  • OpenAI、Anthropic、xAI以及阿里巴巴、DeepSeek等多家实验室同样在密集迭代模型,任何一家在检查日前发布强力新版本都可能抢占第一名位置。
  • 该榜单历史上第一名更替频繁,没有任何公司能够长期稳定占据榜首,这种波动性本身就压低了谷歌在特定时点独占第一的概率。
  • 当前市场共识价格仅为10%,反映出交易者普遍认为这一结果发生的可能性较低。

后续关注

需要关注的关键节点包括:谷歌DeepMind下一代Gemini模型的发布时间表,OpenAI、Anthropic、xAI各自的模型更新节奏,以及阿里巴巴通义千问、DeepSeek等团队是否在年底前推出新版本冲击榜首。最直接的观察点是LMArena排行榜本身的实时排名变化,以及最终结算所依据的2026年12月31日美国东部时间中午12点的检查结果。

交易该结果合约

平台(1)

了解该事件

平台(1)

概率

  • 到2026年12月底,Google是否会拥有最佳AI模型?10%
  • 到2026年12月底,Alibaba是否会拥有最佳AI模型?1%
  • 到2026年12月底,Baidu是否会拥有最佳AI模型?0%
  • 到2026年12月底,Meituan是否会拥有最佳AI模型?0%

结算规则

结算依据
https://lmarena.ai/leaderboard/text
结算日期

该市场在2026年12月31日美国东部时间中午12点检查lmarena.ai的Chatbot Arena文本排行榜(关闭风格控制版本),如果谷歌旗下模型排名第一,结算为“是”,否则结算为“否”。如果出现并列排名,先比较榜单背后的Arena评分,评分仍并列则按公司名称字母顺序判定,最终结果于2027年1月1日确定。

计算方法

本地视角

对中文读者而言,这一结果不仅是中美科技公司之间的排名竞争,也是观察中美人工智能实力对比的一个具体窗口:阿里巴巴通义千问、DeepSeek等中国实验室的模型是否能在同一榜单上超越谷歌,直接关系到中美AI竞赛叙事中"谁更领先"的公开证据。这类排行榜结果也常被援引用于讨论技术出口管制、芯片限制等政策议题是否奏效,因而具有超出单一市场价格本身的参考意义。

常见问题

这个市场具体依据什么、什么时候结算?
结算依据是lmarena.ai的Chatbot Arena文本排行榜(关闭风格控制版本),检查时间为2026年12月31日美国东部时间中午12点,如果届时谷歌旗下模型排名第一,则结算为“是”。
当前价格代表什么意思?
价格反映的是交易者对谷歌年底登顶概率的共识估计,并不代表确定的结果,也不构成任何关于结果发生可能性的建议。
如果榜单在检查时出现并列排名怎么办?
规则明确规定,如果出现并列,先比较榜单背后的Arena评分,如果评分仍然并列,则按公司名称的字母顺序判定归属。
谷歌历史上有没有登上过该榜单第一名?
公开报道显示,谷歌的Gemini系列此前曾一度短暂占据该榜单第一名,但很快被其他实验室的新版本超越,这也是该榜单排名更替频繁的一个例证。
为什么这个市场只有一个平台在交易,交易量看起来不大?
目前只有Polymarket一家平台列出该市场,总交易量约74,984美元,规模相对有限,说明市场关注度和流动性还处于较早阶段,随着结算日临近可能会发生变化。

相关预测事件

代币化股票

为该资产催化因素提供背景的市场隐含概率。

相关事件

10%/ 91%
/