Меню
Технологии

Станет ли Claude от Anthropic моделью №1 в рейтинге LM Arena на конец 2026 года?

Разрешение: Обновлено:
63%

консенсус рынка

вероятность события по оценке рынка — не ваш шанс угадать

ДаСобытие произойдёт
63%
НетСобытие не произойдёт
37%

Купить контракт на исход

Коротко

Рынок считает такой исход маловероятным: сводная оценка по площадкам держится существенно ниже половины. Главная причина — не сила моделей Anthropic как таковая, а устройство самого рейтинга: расчёт идёт по представлению LM Arena без поправки на стиль, где голосующие систематически предпочитают более длинные и богато отформатированные ответы, а первое место почти всегда занимает тот разработчик, кто выпустил флагман последним. Пересобрать оценку способен только один сценарий — выход новой флагманской модели Claude в ноябре — декабре 2026 года и быстрое накопление голосов в её пользу до даты расчёта.

Как устроен контракт

Контракт на исход — это обязательство, которое при расчёте превращается в 1 долл., если событие произошло, и в ноль, если не произошло. Цена контракта и есть оценка вероятности, о которой сейчас договорились покупатели и продавцы: контракт по цене 0,30 означает, что рынок оценивает событие примерно как три случая из десяти. Здесь расчёт привязан к одной дате — 31 декабря 2026 года — и к одному источнику: текстовому рейтингу LM Arena в представлении без поправки на стиль, как он опубликован на эту дату. Расчёт «да» происходит, если первую строку занимает модель семейства Claude, разработанная Anthropic; расчёт «нет» — если это модель любого другого разработчика. Позицию, как правило, можно продать до даты расчёта по той цене, которая будет в этот момент на рынке, не дожидаясь публикации итогового рейтинга.
Как рынок оценивает исход
$100
Да63%

Событие произойдёт

Стоит сейчас
$0,63
Если вложить $100
$159
Нет37%

Событие не произойдёт

Стоит сейчас
$0,37
Если вложить $100
$270
0%25%50%75%100%12:2617:5823:3105:0310:3516:07
КонсенсусKalshi

Как двигалась цена

Регулярное наблюдение за этой группой контрактов началось 29 июля 2026 года; за короткий период собрано 1 016 ценовых наблюдений, первая зафиксированная оценка по группе — 37%, диапазон по группе — от 36% до 100%. Верхняя граница диапазона относится не к контракту на Claude: в одной группе торгуются контракты на разных разработчиков, и цена, близкая к 100%, описывает исход, который к моменту наблюдения выглядел практически решённым, а не лидерство Anthropic. По самому Claude движение с первой отметки шло вниз, к текущему низкому уровню, и это снижение не привязано к какому-то одному публично объявленному событию — оно отражает перераспределение вероятностей внутри группы по мере того, как участники учитывали календарь релизов конкурентов. История серии пока короткая, поэтому по ней нельзя судить о долгосрочной устойчивости оценки; устойчиво другое — разрыв в 63,3 процентных пункта между крайними контрактами группы, который показывает, что рынок считает распределение первого места сильно смещённым в пользу одного-двух не-Anthropic разработчиков.

Контекст

LM Arena (ранее Chatbot Arena) — публичная площадка сравнения языковых моделей, где пользователи получают ответы двух анонимных моделей на один и тот же запрос и выбирают лучший. Из этих парных сравнений строится рейтинг по логике, близкой к шахматной Elo: чем чаще модель выигрывает у сильных соперников, тем выше её место. За несколько лет этот рейтинг стал самым цитируемым публичным индикатором «кто сейчас впереди» — на него ссылаются и сами лаборатории в анонсах, и корпоративные заказчики при выборе поставщика. У рейтинга есть два режима отображения. В одном включены style controls — статистическая поправка на длину ответа и наличие разметки: заголовков, списков, выделений. Поправку ввели потому, что живые голосующие заметно склонны к «красивым» и подробным ответам, даже когда содержательно они не лучше. Данный контракт рассчитывается по режиму без поправки (Remove Style Controls), то есть по «сырым» голосам, где стилистическое преимущество не нейтрализовано. Вопрос сводится к тому, чья модель окажется на первой строке этого рейтинга в один конкретный день — 31 декабря 2026 года. Anthropic конкурирует не с одним соперником: правила прямо перечисляют OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Позиционирование Anthropic при этом смещено в сторону программирования, агентных сценариев и корпоративных внедрений, а не потребительского чата, из которого и приходит основная масса голосов на Arena.

Разбор

Сводная оценка по площадкам на момент подготовки страницы — около 20%, то есть рынок относит лидерство Claude к маловероятным, но не исключённым исходам. Формальный разброс между самым дорогим и самым дешёвым контрактом в группе — 63,3 процентных пункта, и это не спор о Claude: один и тот же исход не может одновременно стоить 64% и 1%. Контракты внутри группы относятся к разным разработчикам, перечисленным в правилах, и вместе описывают распределение вероятностей по всему полю участников. Совокупный оборот по группе — 7 777 158 долл., крупнейший отдельный контракт собрал 1 788 864 долл.; при таких объёмах цены отражают позиционирование участников, а не единичные сделки. Ключевая деталь правил — расчёт по представлению без поправки на стиль. Style controls в LM Arena появились как ответ на измеримое смещение: голосующие чаще выбирают ответ длиннее и с более выраженной разметкой. Убрав поправку, вопрос переводится в ту систему координат, где такое смещение работает в полную силу. Anthropic исторически настраивает Claude на более сдержанный, менее «раздутый» ответ и делает акцент на надёжности в коде и агентных цепочках — качества, которые в парных сравнениях коротких потребительских запросов почти не видны. Это структурный минус, не связанный с тем, насколько сильна модель на инженерных задачах. Вторая причина низкой оценки — вопрос решается на одну дату, а не по итогам года. Первую строку Arena, как правило, занимает тот, кто выпустил флагман последним: после релиза модель быстро набирает голоса и вытесняет предыдущего лидера, и лидерство меняется в течение недель. Поэтому цена контракта — это по сути оценка календаря релизов ноября и декабря 2026 года у Google, OpenAI, xAI и китайских лабораторий, а не оценка среднего качества моделей за год. Anthropic исторически выпускает флагманы вне привязки к публичным рейтингам и не оптимизирует модели под голосование в Arena, что делает совпадение «свежий релиз Claude ровно к концу декабря» дополнительным условием, а не данностью. Третий фактор — арифметика широкого поля. Даже если Claude входит в число двух-трёх сильнейших семейств, первое место на конкретный день делится между семью и более названными разработчиками, включая быстро подтягивающиеся Alibaba, Moonshot и Baidu, чьи модели дешевле в обучении и активно продвигаются в открытых рейтингах. Чем больше претендентов способны занять верхнюю строку, тем ниже вероятность любого отдельного из них — и именно это распределение видно в разбросе цен внутри группы. Отдельный риск, который рынок учитывает лишь частично, — методологический. LM Arena за свою историю не раз меняла состав представлений и способ расчёта рейтинга, и любая правка в том, как считается лидерство без поправки на стиль, способна сдвинуть первую строку без выхода новых моделей. Для контракта, привязанного к снимку одного дня, это означает: часть неопределённости лежит не в лабораториях, а в самой платформе.

Что двигает вероятность

  • Календарь релизов ноября — декабря

    Верхнюю строку Arena обычно занимает последний вышедший флагман. Если Anthropic выпустит новую крупную модель Claude в ноябре или декабре 2026 года и та быстро наберёт голоса, вероятность исхода вырастет резко — это единственный драйвер, способный сдвинуть оценку на десятки пунктов. Симметрично, релиз конкурента в те же недели её обрушит.

  • Режим без поправки на стиль

    Расчёт идёт по «сырым» голосам, где длинные и структурированные ответы получают преимущество. Это устойчиво работает против моделей, настроенных на краткость, и объясняет значительную часть разрыва между репутацией Claude у разработчиков и его позицией в этом конкретном представлении рейтинга. Драйвер направлен в сторону «нет» и не меняется без правок методологии.

  • Приоритеты Anthropic

    Компания концентрируется на программировании, агентных сценариях и корпоративных контрактах, где качество измеряется не голосованием в чате. Пока продуктовая стратегия не смещается в сторону потребительского диалога, публичный рейтинг Arena остаётся для Anthropic побочной метрикой. Это удерживает оценку низко на протяжении всего периода.

  • Плотность конкурентов

    В правилах перечислены OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Чем больше лабораторий реально способны занять первую строку, тем ниже вероятность каждой отдельной; появление ещё одного сильного претендента механически снижает цену контракта на Claude, даже без ухудшения его моделей.

  • Изменения методологии LM Arena

    Платформа неоднократно меняла набор представлений и способ агрегирования голосов. Любая правка в расчёте рейтинга без поправки на стиль способна переставить лидера без единого нового релиза. Эффект двусторонний и трудно прогнозируемый, но для контракта, привязанного к снимку одного дня, он существен.

Аргументы за

  • Anthropic должна выпустить новую флагманскую модель Claude достаточно близко к концу 2026 года, чтобы к 31 декабря она успела набрать объём голосов, выводящий её на первую строку.
  • Эта модель должна выигрывать парные сравнения в режиме без поправки на стиль, то есть не проигрывать соперникам по длине и оформлению ответа, а не только по содержательной точности.
  • Конкуренты — прежде всего Google, OpenAI и xAI — не должны выпустить собственный флагман в тот же промежуток ноября — декабря, иначе преимущество свежести релиза перейдёт к ним.
  • Методология LM Arena к дате расчёта должна остаться такой, что первую строку определяет рейтинг по «сырым» голосам, где текущее лидерство и фиксируется.

Аргументы против

  • Первая строка рейтинга почти всегда принадлежит последнему вышедшему флагману, и совпадение релиза Claude ровно с концом декабря — отдельное маловероятное условие, а не следствие качества моделей.
  • Расчёт идёт по представлению без поправки на длину и разметку ответа, где систематически выигрывают более многословные модели, а Claude настроен на краткость.
  • Претендентов на первое место минимум семь семейств, включая Alibaba, Moonshot и Baidu, и любое их усиление механически снижает вероятность для Anthropic.
  • Anthropic не оптимизирует модели под голосование в Arena, ориентируясь на программирование, агентов и корпоративные внедрения, где успех измеряется другими метриками.

Купить контракт на исход

Площадки (1)

Открыть сайт KalshiДа 0,63
  • Внешний кошелёк не нужен
  • газ оплачен

Площадки (1)

Вероятность

  • Claude63%
  • ChatGPT14%
  • Gemini10%
  • Grok6%
  • Kimi4%
  • Muse Spark3%
  • Qwen1%
  • Ernie1%

Правила расчёта

Источник расчёта
Рейтинг LM Arena (представление Remove Style Controls) на 31 декабря 2026 года
Дата разрешения

Источник расчёта — текстовый рейтинг LM Arena в представлении Remove Style Controls, то есть без статистической поправки на длину и форматирование ответов, по состоянию на 31 декабря 2026 года. Расчёт «да» — если первую строку занимает модель, разработанная Anthropic (семейство Claude). Расчёт «нет» — если первая строка принадлежит любому другому разработчику, включая OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Рейтинг читается в том виде, в каком он опубликован на дату расчёта; ничьи разрешаются по порядку строк, показанному на самой странице рейтинга. Все перечисленные площадки используют один и тот же источник, поэтому различия в ценах между контрактами объясняются тем, что они относятся к разным разработчикам, а не разными правилами расчёта.

Методология расчёта

Локальный контекст

Для русскоязычных разработчиков и ИТ-специалистов вопрос «кто сейчас первый» имеет прикладной смысл: доступ к западным ИИ-сервисам из ряда стран ограничен, и практические обходные схемы — корпоративные аккаунты, облачные посредники, региональные реселлеры в Казахстане, Израиле, ЕС и странах Залива — привязаны к конкретному поставщику. Смена лидера означает не абстрактную смену рейтинга, а вопрос о том, к чьему API придётся выстраивать доступ заново и по какой цене. Второй канал — открытые весовые модели. Alibaba, Moonshot и другие китайские лаборатории входят в число претендентов на первую строку, и их модели чаще доступны для локального развёртывания. Чем ближе они к вершине публичного рейтинга, тем убедительнее выглядит для команд в России и Белоруссии сценарий «работать на моделях, которые можно запустить у себя», вместо выстраивания доступа к закрытым американским сервисам. Рейтинг LM Arena — один из немногих публичных ориентиров, по которому такой выбор аргументируют перед заказчиком.

За чем следить

Главное — анонсы флагманских моделей в четвёртом квартале 2026 года: любой релиз Anthropic, OpenAI, Google, xAI или крупных китайских лабораторий в ноябре — декабре способен переставить первую строку за считаные недели. Второе — публикации самой LM Arena о методологии: изменение состава представлений, правил агрегирования голосов или того, как считается рейтинг без поправки на стиль, влияет на расчёт напрямую. Третье — динамика уже находящихся в рейтинге моделей в декабре: позиции подвижны, пока голоса продолжают накапливаться, и лидер начала декабря не обязан быть лидером 31 декабря. Наконец, стоит следить за тем, попадают ли новые модели Claude в Arena вообще и как быстро: если релиз не выводится на площадку в первые недели, шанс занять первую строку к дате расчёта резко падает.

Частые вопросы

Что именно определит исход и когда
Исход определяет текстовый рейтинг LM Arena в представлении без поправки на стиль (Remove Style Controls) в том виде, в каком он опубликован 31 декабря 2026 года. Если на первой строке стоит модель семейства Claude, разработанная Anthropic, контракт рассчитывается как «да». Любой другой разработчик на первой строке — расчёт «нет».
Что означает цена контракта
Цена — это оценка вероятности, о которой договорились покупатели и продавцы. Контракт по цене 0,30 соответствует представлению рынка о том, что событие происходит примерно в трёх случаях из десяти. При расчёте контракт стоит 1 долл. при наступлении события и ноль при его ненаступлении.
Почему цены на разных площадках отличаются больше чем на 60 пунктов
Потому что в одну группу собраны контракты на разных разработчиков, а не разные мнения об одном и том же исходе: там перечислены OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Все они рассчитываются по одному и тому же источнику — рейтингу LM Arena без поправки на стиль. Разброс отражает распределение вероятностей по полю, а не расхождение оценок по Claude.
Что будет, если рейтинг изменит методику или на 31 декабря будет неоднозначная картина
Расчёт читается с рейтинга в том виде, в каком он опубликован на дату расчёта, в указанном представлении. Ничьи разрешаются по порядку, показанному на самом рейтинге. Если платформа меняет способ расчёта, это меняет и итог — методологический риск здесь несёт сам контракт, а не отдельная площадка.
Почему Claude популярен у разработчиков, но не считается фаворитом рейтинга
Голоса в LM Arena приходят из коротких потребительских сравнений, где выигрывают более длинные и структурированные ответы, а расчёт идёт как раз без поправки на этот эффект. Anthropic же настраивает модели на краткость и делает ставку на программирование и агентные сценарии, качество которых в парных сравнениях чата почти не проявляется. Отсюда разрыв между репутацией и позицией в этом конкретном представлении рейтинга.
Можно ли закрыть позицию до 31 декабря 2026 года
Как правило, да: позицию можно продать до даты расчёта по той цене, которая сложилась на рынке в этот момент. Итог будет зависеть от разницы между ценой покупки и ценой продажи, а не от того, что покажет рейтинг в конце года.

Связанные рынки предсказаний

Токенизированные акции

Рыночные вероятности событий, которые дают контекст ближайшим драйверам актива.

63 %/ 37 %
Да / Нет