Arena получила $200 млн при оценке $3,1 млрд

Платформа Arena, созданная в 2023 году как исследовательский проект UC Berkeley для краудсорсингового ранжирования ИИ-моделей, привлекла $200 млн в раунде Series B при оценке $3,1 млрд. Раунд возглавили Lightspeed Venture Partners и Khosla Ventures; среди участников — Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z и Felicis.
В январе Arena сообщала о Series A на $150 млн при постинвестиционной оценке $1,7 млрд. Таким образом, за примерно десять месяцев оценка компании почти удвоилась. В июне Arena также заявила, что её годовой темп выручки достиг $100 млн, тогда как в январе он составлял $30 млн.
От пользовательских сравнений к корпоративной аналитике
Потребительская платформа Arena бесплатна. Пользователи вводят запросы или заказывают проекты, созданные методом vibe coding, затем выбирают, какая модель справилась лучше. Компания утверждает, что сервис привлекает десятки миллионов посетителей в месяц.
В сентябре прошлого года Arena запустила коммерческий продукт AI Evaluations. Он предоставляет разработчикам моделей и предприятиям подробную аналитику производительности, основанную на отзывах сообщества. Такой сервис предназначен для выбора модели под конкретные внутренние задачи, а не только для сопоставления результатов в единых тестах.
Новая категория alignment
Компания объясняет спрос на независимые оценки тем, что модели стали подстраиваться под бенчмарки: получать высокие баллы, не демонстрируя сопоставимого качества в реальной работе. Одновременно организациям требуется понять, какая система лучше соответствует их собственным сценариям использования.
Arena добавила в лидерборд предварительную категорию alignment. В ней модели оцениваются по несанкционированным действиям, когда система делает то, о чём её не просили; ложной атрибуции, то есть ошибочному указанию источника утверждений или фактов; а также deceptive completion — заявлениям о выполнении невыполненной задачи.
На вершине предварительного рейтинга alignment находятся несколько моделей OpenAI. Claude Opus 5.5 и Claude Fable занимают шестое и девятое места соответственно. Для бизнеса это ещё один сигнал проверять модели на собственных рабочих сценариях и учитывать не только итоговые баллы, но и характер ошибок, которые выявляет оценка реального взаимодействия пользователей.

