Станет ли Claude от Anthropic моделью №1 в рейтинге LM Arena на конец 2026 года?
вероятность события по оценке рынка — не ваш шанс угадать
- Да — Событие произойдёт
- 62%
- Нет — Событие не произойдёт
- 38%
Купить контракт на исход
Коротко
Рынок считает такой исход маловероятным: сводная оценка по площадкам держится существенно ниже половины. Главная причина — не сила моделей Anthropic как таковая, а устройство самого рейтинга: расчёт идёт по представлению LM Arena без поправки на стиль, где голосующие систематически предпочитают более длинные и богато отформатированные ответы, а первое место почти всегда занимает тот разработчик, кто выпустил флагман последним. Пересобрать оценку способен только один сценарий — выход новой флагманской модели Claude в ноябре — декабре 2026 года и быстрое накопление голосов в её пользу до даты расчёта.
Как устроен контракт
Вероятность
Как двигалась цена
Контекст
Разбор
Что двигает вероятность
Календарь релизов ноября — декабря
Верхнюю строку Arena обычно занимает последний вышедший флагман. Если Anthropic выпустит новую крупную модель Claude в ноябре или декабре 2026 года и та быстро наберёт голоса, вероятность исхода вырастет резко — это единственный драйвер, способный сдвинуть оценку на десятки пунктов. Симметрично, релиз конкурента в те же недели её обрушит.
Режим без поправки на стиль
Расчёт идёт по «сырым» голосам, где длинные и структурированные ответы получают преимущество. Это устойчиво работает против моделей, настроенных на краткость, и объясняет значительную часть разрыва между репутацией Claude у разработчиков и его позицией в этом конкретном представлении рейтинга. Драйвер направлен в сторону «нет» и не меняется без правок методологии.
Приоритеты Anthropic
Компания концентрируется на программировании, агентных сценариях и корпоративных контрактах, где качество измеряется не голосованием в чате. Пока продуктовая стратегия не смещается в сторону потребительского диалога, публичный рейтинг Arena остаётся для Anthropic побочной метрикой. Это удерживает оценку низко на протяжении всего периода.
Плотность конкурентов
В правилах перечислены OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Чем больше лабораторий реально способны занять первую строку, тем ниже вероятность каждой отдельной; появление ещё одного сильного претендента механически снижает цену контракта на Claude, даже без ухудшения его моделей.
Изменения методологии LM Arena
Платформа неоднократно меняла набор представлений и способ агрегирования голосов. Любая правка в расчёте рейтинга без поправки на стиль способна переставить лидера без единого нового релиза. Эффект двусторонний и трудно прогнозируемый, но для контракта, привязанного к снимку одного дня, он существен.
Аргументы за
- Anthropic должна выпустить новую флагманскую модель Claude достаточно близко к концу 2026 года, чтобы к 31 декабря она успела набрать объём голосов, выводящий её на первую строку.
- Эта модель должна выигрывать парные сравнения в режиме без поправки на стиль, то есть не проигрывать соперникам по длине и оформлению ответа, а не только по содержательной точности.
- Конкуренты — прежде всего Google, OpenAI и xAI — не должны выпустить собственный флагман в тот же промежуток ноября — декабря, иначе преимущество свежести релиза перейдёт к ним.
- Методология LM Arena к дате расчёта должна остаться такой, что первую строку определяет рейтинг по «сырым» голосам, где текущее лидерство и фиксируется.
Аргументы против
- Первая строка рейтинга почти всегда принадлежит последнему вышедшему флагману, и совпадение релиза Claude ровно с концом декабря — отдельное маловероятное условие, а не следствие качества моделей.
- Расчёт идёт по представлению без поправки на длину и разметку ответа, где систематически выигрывают более многословные модели, а Claude настроен на краткость.
- Претендентов на первое место минимум семь семейств, включая Alibaba, Moonshot и Baidu, и любое их усиление механически снижает вероятность для Anthropic.
- Anthropic не оптимизирует модели под голосование в Arena, ориентируясь на программирование, агентов и корпоративные внедрения, где успех измеряется другими метриками.
Купить контракт на исход
- Внешний кошелёк не нужен
- газ оплачен
Площадки (1)
- KalshiРекомендуюДа62%0,62
- Объём (24ч)
- 14,1 тыс. $
- Комиссия
- 1,63 %
Вероятность
- Claude62%
- ChatGPT14%
- Gemini11%
- Grok6%
- Muse Spark3%
- Kimi3%
- Qwen1%
- Ernie1%
Правила расчёта
Источник расчёта — текстовый рейтинг LM Arena в представлении Remove Style Controls, то есть без статистической поправки на длину и форматирование ответов, по состоянию на 31 декабря 2026 года. Расчёт «да» — если первую строку занимает модель, разработанная Anthropic (семейство Claude). Расчёт «нет» — если первая строка принадлежит любому другому разработчику, включая OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Рейтинг читается в том виде, в каком он опубликован на дату расчёта; ничьи разрешаются по порядку строк, показанному на самой странице рейтинга. Все перечисленные площадки используют один и тот же источник, поэтому различия в ценах между контрактами объясняются тем, что они относятся к разным разработчикам, а не разными правилами расчёта.
Методология расчёта →Локальный контекст
За чем следить
Частые вопросы
- Что именно определит исход и когда
- Исход определяет текстовый рейтинг LM Arena в представлении без поправки на стиль (Remove Style Controls) в том виде, в каком он опубликован 31 декабря 2026 года. Если на первой строке стоит модель семейства Claude, разработанная Anthropic, контракт рассчитывается как «да». Любой другой разработчик на первой строке — расчёт «нет».
- Что означает цена контракта
- Цена — это оценка вероятности, о которой договорились покупатели и продавцы. Контракт по цене 0,30 соответствует представлению рынка о том, что событие происходит примерно в трёх случаях из десяти. При расчёте контракт стоит 1 долл. при наступлении события и ноль при его ненаступлении.
- Почему цены на разных площадках отличаются больше чем на 60 пунктов
- Потому что в одну группу собраны контракты на разных разработчиков, а не разные мнения об одном и том же исходе: там перечислены OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Все они рассчитываются по одному и тому же источнику — рейтингу LM Arena без поправки на стиль. Разброс отражает распределение вероятностей по полю, а не расхождение оценок по Claude.
- Что будет, если рейтинг изменит методику или на 31 декабря будет неоднозначная картина
- Расчёт читается с рейтинга в том виде, в каком он опубликован на дату расчёта, в указанном представлении. Ничьи разрешаются по порядку, показанному на самом рейтинге. Если платформа меняет способ расчёта, это меняет и итог — методологический риск здесь несёт сам контракт, а не отдельная площадка.
- Почему Claude популярен у разработчиков, но не считается фаворитом рейтинга
- Голоса в LM Arena приходят из коротких потребительских сравнений, где выигрывают более длинные и структурированные ответы, а расчёт идёт как раз без поправки на этот эффект. Anthropic же настраивает модели на краткость и делает ставку на программирование и агентные сценарии, качество которых в парных сравнениях чата почти не проявляется. Отсюда разрыв между репутацией и позицией в этом конкретном представлении рейтинга.
- Можно ли закрыть позицию до 31 декабря 2026 года
- Как правило, да: позицию можно продать до даты расчёта по той цене, которая сложилась на рынке в этот момент. Итог будет зависеть от разницы между ценой покупки и ценой продажи, а не от того, что покажет рейтинг в конце года.