菜单
科技

Anthropic会在2026年底拥有最佳编程AI模型吗?

结算: 更新于:
56%

市场共识

市场给出的事件概率——不是你猜中的概率

事件会发生
56%
事件不会发生
44%

通过 Binance Wallet 交易

在 Binance Wallet 选择可交易合约

打开目录并选择事件

本页报价来自 Kalshi。Binance Wallet 提供单独的活跃市场目录:打开目录、选择事件,再选择 YES 或 NO。确认前会显示合约的准确表述和价格。

要点

市场目前认为这一结果的可能性略高于五五开,但远未确定。核心原因是该市场只有一天历史,价格从开盘到现在出现过大幅波动,说明交易者对未来五个月内谁会发布更强编程模型仍存在明显分歧。促使判断改变的关键是各家实验室未来的模型发布节奏,尤其是Anthropic、OpenAI和谷歌之间的更新周期。

合约如何运作

这份合约在2026年12月31日结算:如果届时LiveBench.ai的“编程平均分”榜单上排名第一的模型来自Anthropic,合约支付1美元;如果第一名来自其他任何公司,合约归零。价格本身就是市场对这一结果发生概率的共识,例如一份价格为0.30美元的合约意味着市场认为该结果大约有三成的可能性发生——这只是举例说明机制,并非本合约当前的价格。在12月31日结算之前,持有者通常可以随时按当时的市场价格卖出仓位,不必等到结算日。
市场如何评估结果
$100
56%

事件会发生

当前价格
$0.56
如果投入 $100
$179
44%

事件不会发生

当前价格
$0.44
如果投入 $100
$227
0%25%50%75%100%12:0017:3623:1204:4810:2416:00
共识Kalshi

价格如何变动

该市场于2026年7月29日首次被记录,隐含概率为42%,随后一天内一度冲高至99%,波动幅度极大,目前回落并稳定在56%附近,最近24小时仅上升1个百分点。这种剧烈波动加趋稳的走势,符合一个刚刚建立、成交尚在积累中的新市场的典型特征,目前没有公开报道的单一事件可以解释这一轮波动,更可能是早期价格发现过程本身的结果。

背景

这一合约追踪的是LiveBench.ai——一个持续更新的AI模型基准测试网站——在其“编程平均分”(Coding Average)类别下的排名。截至2026年12月31日,如果Anthropic的模型在该榜单上排名第一,合约将结算为是。与之相关的还有针对OpenAI、谷歌、xAI和月之暗面(Moonshot AI)的独立是非合约,四家公司争夺同一个榜首位置,彼此互为对手盘。 Anthropic以Claude系列模型闻名,长期被开发者社区认为在代码生成和调试任务上表现突出。但OpenAI的GPT系列、谷歌的Gemini系列、xAI的Grok系列,以及中国公司月之暗面的Kimi系列,都在过去一年中多次刷新过各类基准测试的排名,包括LiveBench的编程类别。榜首归属会随着新模型发布而频繁易主,这也是该市场存在的根本原因。

分析

该市场于2026年7月29日首次被记录时,隐含概率为42%,随后一天内出现剧烈波动,触及过99%的高点,目前各交易平台的共识价格在56%附近,24小时内仅上升1个百分点。这种“开盘即剧烈摆动、随后趋于稳定”的走势,是典型的新市场特征:市场刚建立时交易者数量少、信息不对称大,价格容易被少量交易推向极端,随着更多资金和信息进入,价格逐渐向一个相对稳定的区间收敛。目前Kalshi平台上该合约累计成交量约为234,994美元,考虑到市场仅上线一天,这一成交量说明关注度不低,但仍处于价格发现的早期阶段,56%这一共识不能被视为经过充分检验的稳定判断。 从结算机制看,LiveBench.ai的排名会随着新模型发布而实时更新,这意味着从现在到2026年12月31日的五个月里,任何一家实验室发布的重大模型更新都可能立刻改变榜首归属。历史上看,编程类基准测试的榜首更迭频率相当高:过去几轮更新中,OpenAI、Anthropic和谷歌都曾轮流占据编程类别的第一名,每次新模型发布后榜单排名往往会在几天内重新洗牌。这种波动性正是当前56%这一价格没有更接近90%或10%这类“接近确定”水平的根本原因——市场认可Anthropic当前具备优势,但同时清楚这一优势可能在结算日之前被任何一次新模型发布打破。 月之暗面(Moonshot AI)作为该榜单上唯一的中国实验室代表,其Kimi系列模型的表现也是市场需要消化的变量之一,尽管其被视为夺得编程类别第一名的可能性明显低于Anthropic、OpenAI和谷歌这三家头部实验室。总体而言,当前价格反映的是一个多方竞争、结果尚未收敛的格局,而非某一家公司已经建立起难以撼动的领先地位。

影响概率的因素

  • 模型发布节奏

    Anthropic、OpenAI、谷歌各自的下一代旗舰模型发布时间是最直接的变量。若Anthropic在四季度前发布新版Claude并在编程测试中拉开差距,将推高该合约价格;反之若竞争对手抢先发布更强模型,价格会相应下滑。

  • LiveBench更新频率

    LiveBench.ai会随新模型发布持续调整榜单和评分方法,测试题目和权重的微调可能在没有新模型发布的情况下改变排名归属,这为结果增加了额外的不确定性。

  • 月之暗面等中国实验室的进展

    作为唯一入选独立合约的中国团队,月之暗面若发布性能显著提升的模型,会分流原本押注Anthropic或OpenAI夺冠的资金,尽管目前市场认为其夺得编程类第一的概率相对有限。

  • 市场仍处早期、成交稀薄

    该市场仅上线一天,价格曾在42%到99%之间大幅摆动,说明当前共识价格容易受到个别大额交易影响,尚未形成经过充分验证的稳定判断。

支持理由

  • Anthropic需要在2026年12月31日之前发布或维持一款在LiveBench编程平均分上排名第一的模型。
  • 这要求Anthropic的模型更新节奏至少不落后于OpenAI和谷歌,并且在具体编程测试题目上保持技术优势。
  • LiveBench.ai需要在结算当天仍将编程平均分作为主要排名依据,且该榜单的评测方法未发生实质性变化。

反对理由

  • OpenAI、谷歌或xAI中的任何一家若在未来五个月内发布性能更优的编程模型,都可能夺走榜首位置。
  • 编程类基准测试历史上榜首更迭频繁,过去多轮更新中头部位置曾在不同实验室之间反复易手。
  • 月之暗面等其他实验室的意外突破也可能改变最终排名,尽管这一可能性目前被市场认为相对较小。

可参与的方式

选择市场并建立仓位

上方价格反映 Kalshi 的市场估值。若要通过 Binance Wallet 参与,可打开当前事件目录,或在下方选择可直接进入的相关合约。

在 Binance Wallet 选择事件

确认前会显示所选合约的准确表述和当前价格;具体可用性取决于事件和所在地区。

  1. 1打开 Binance Wallet 目录
  2. 2选择事件
  3. 3选择 YES 或 NO

平台(1)

概率

  • Anthropic56%
  • OpenAI31%
  • xAI6%
  • Google3%
  • Moonshot AI2%

结算规则

结算依据
LiveBench.ai
结算日期

该合约由LiveBench.ai这一独立基准测试网站的排名结果决定:若2026年12月31日当天,Anthropic的模型在该网站“编程平均分”类别下排名第一,则结算为是,否则为否。目前追踪该合约的Kalshi平台采用同一结算依据,未出现不同交易平台使用不同数据源的情况。

计算方法

本地视角

月之暗面(Moonshot AI)是这份榜单上唯一的中国实验室代表,其Kimi系列模型能否在编程类基准测试中跻身前列,是中美AI竞争叙事中的一个具体观察点。对于关注科技出口管制和中美技术脱钩进程的读者而言,这类基准测试排名提供了一个相对客观、持续更新的观察窗口,可以用来判断中国AI实验室在具体技术指标上与美国头部实验室之间的差距变化。

后续关注

接下来五个月里,需要关注的时间点包括Anthropic、OpenAI、谷歌各自可能发布的新一代旗舰模型的具体日期,以及LiveBench.ai对编程平均分评测方法或题库的任何调整。由于该榜单是实时更新的,任何一次重大模型发布后的几天内,都可能直接改变当前的排名格局。最终结算将以2026年12月31日当天LiveBench.ai网站上的编程平均分排名为准。

常见问题

这个市场最终依据什么结算,什么时候结算?
结算依据是LiveBench.ai网站在2026年12月31日当天公布的“编程平均分”(Coding Average)排名。如果排名第一的模型来自Anthropic,合约结算为是,否则为否。
当前的价格或百分比具体代表什么?
价格反映的是交易者对Anthropic在年底夺得编程类第一名这一结果的共同判断,而不是对错的确定性陈述。价格会随着新信息(例如新模型发布)不断变化,直到结算日为止。
如果LiveBench在年底前更改了评测方法或榜单结构,市场会怎么处理?
结算规则以2026年12月31日当天LiveBench.ai实际呈现的编程平均分排名为准,若该网站的评测方法在此之前发生调整,最终排名仍将按调整后的方法确定,市场本身不会另设备用规则。
为什么这个市场刚上线一天,价格就出现了从42%到99%的巨大波动?
新市场在刚建立时参与交易的资金和信息都比较有限,少量大额交易就可能把价格推向极端。随着更多交易者进入并带来更充分的信息,价格通常会逐渐向一个更稳定的区间收敛。
除了Anthropic,还有哪些公司在争夺这个榜首位置?
相关的独立是非合约还覆盖了OpenAI、谷歌、xAI和月之暗面(Moonshot AI),这四家公司与Anthropic一样,都有机会在年底成为LiveBench编程平均分榜单上排名第一的公司。
这类编程基准测试排名过去是否经常变动?
是的,LiveBench等基准测试榜单的编程类别排名历史上曾在不同实验室之间多次易手,几乎每次头部模型的重大更新之后,榜单前列的位置都可能重新洗牌。

相关事件