Как устроен контракт
Вероятность
Как двигалась цена
Разбор
Контекст
Что двигает вероятность
Календарь релизов ноября — декабря
Верхнюю строку Arena обычно занимает последний вышедший флагман. Если Anthropic выпустит новую крупную модель Claude в ноябре или декабре 2026 года и та быстро наберёт голоса, вероятность исхода вырастет резко — это единственный драйвер, способный сдвинуть оценку на десятки пунктов. Симметрично, релиз конкурента в те же недели её обрушит.
Режим без поправки на стиль
Расчёт идёт по «сырым» голосам, где длинные и структурированные ответы получают преимущество. Это устойчиво работает против моделей, настроенных на краткость, и объясняет значительную часть разрыва между репутацией Claude у разработчиков и его позицией в этом конкретном представлении рейтинга. Драйвер направлен в сторону «нет» и не меняется без правок методологии.
Приоритеты Anthropic
Компания концентрируется на программировании, агентных сценариях и корпоративных контрактах, где качество измеряется не голосованием в чате. Пока продуктовая стратегия не смещается в сторону потребительского диалога, публичный рейтинг Arena остаётся для Anthropic побочной метрикой. Это удерживает оценку низко на протяжении всего периода.
Плотность конкурентов
В правилах перечислены OpenAI, Google, xAI, Meta, Alibaba, Moonshot и Baidu. Чем больше лабораторий реально способны занять первую строку, тем ниже вероятность каждой отдельной; появление ещё одного сильного претендента механически снижает цену контракта на Claude, даже без ухудшения его моделей.
Изменения методологии LM Arena
Платформа неоднократно меняла набор представлений и способ агрегирования голосов. Любая правка в расчёте рейтинга без поправки на стиль способна переставить лидера без единого нового релиза. Эффект двусторонний и трудно прогнозируемый, но для контракта, привязанного к снимку одного дня, он существен.
Аргументы за
- Anthropic должна выпустить новую флагманскую модель Claude достаточно близко к концу 2026 года, чтобы к 31 декабря она успела набрать объём голосов, выводящий её на первую строку.
- Эта модель должна выигрывать парные сравнения в режиме без поправки на стиль, то есть не проигрывать соперникам по длине и оформлению ответа, а не только по содержательной точности.
- Конкуренты — прежде всего Google, OpenAI и xAI — не должны выпустить собственный флагман в тот же промежуток ноября — декабря, иначе преимущество свежести релиза перейдёт к ним.
- Методология LM Arena к дате расчёта должна остаться такой, что первую строку определяет рейтинг по «сырым» голосам, где текущее лидерство и фиксируется.
Аргументы против
- Первая строка рейтинга почти всегда принадлежит последнему вышедшему флагману, и совпадение релиза Claude ровно с концом декабря — отдельное маловероятное условие, а не следствие качества моделей.
- Расчёт идёт по представлению без поправки на длину и разметку ответа, где систематически выигрывают более многословные модели, а Claude настроен на краткость.
- Претендентов на первое место минимум семь семейств, включая Alibaba, Moonshot и Baidu, и любое их усиление механически снижает вероятность для Anthropic.
- Anthropic не оптимизирует модели под голосование в Arena, ориентируясь на программирование, агентов и корпоративные внедрения, где успех измеряется другими метриками.
