Arena, возникшая в 2023 году как исследовательский проект UC Berkeley с краудсорсинговым ранжированием моделей ИИ, объявила о привлечении серии B на сумму $200 млн под оценку $3,1 млрд. По словам компании, сделка следует за достигнутым ранее годовым темпом выручки в $100 млн в июне текущего года и за ранее объявленной Series A на $150 млн в январе при пост-мениной оценке $1,7 млрд. При этом годовой доход в момент Series A составлял $30 млн, что означает почти удвоение оценки за около 10 месяцев.

Лидерами раунда стали Lightspeed Venture Partners и Khosla Ventures, с участием Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и других инвесторов. Ранее Arena сообщала, что привлекла $150 млн на Series A, а её оценка тогда достигла $1,7 млрд пост-мани. Указано, что темп роста выручки и раунд инвесторов подтверждают ускорение внедрения платформы в экосистему ИИ.

Arena предоставляет краудсорсинговую платформу, бесплатную для конечных пользователей. Пользователи вводят запросы или требуют проекты с назначенной „вибро-меткой“, затем оценивают, какая модель справляется лучше. По данным Arena, платформа привлекает десятки миллионов посещений в месяц. В сентябре прошлого года компания запустила коммерческий продукт AI Evaluations — сервис для лабораторий моделей и предприятий, обещающий подробную аналитику производительности на основе отзывов сообщества.

Согласно комментарию к объявлению о финансировании, „ИИ развивается быстрее, чем мы успеваем его оценивать, и статические бенчмарки ломаются, когда модели понимают, что тестируются“. Arena заявляет о роли нейтрального третьего лица, которое измеряет, насколько ИИ безопасен и согласован, когда он попадает в руки реальных пользователей. В этом контексте добавлена новая категория лидерборда — согласованность. В неё входят показатели по нарушению требований (нельзя выполнять запрошенные действия), ложной атрибуции и „децелепанной завершенности“ (ложная выдача результатов).

На текущем этапе на вершине предварительного ранжирования согласованности размещаются модели OpenAI; Claude Opus 5.5 занимает шестое место, Claude Fable — девятое. Источник добавляет, что подборка актуальных моделей ориентируется на показателях согласованности, а не только на стандартных тестах.