Популярный рейтинг ИИ Arena почти вдвое увеличил оценку до $3,1 млрд за 10 месяцев
Arena, возникшая в 2023 году как исследовательский проект в Калифорнийском университете в Беркли, в рамках которого краудсорсинговым методом составлялись рейтинги ИИ-моделей, привлекла $200 млн в раунде серии B при оценке в $3,1 млрд, сообщила компания в четверг.
Это произошло после того, как компания сообщила о достижении $100 млн годовой выручки в пересчёте на текущий темп в июне.
Раунд возглавили Lightspeed Venture Partners и Khosla Ventures; в нём также приняли участие Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие инвесторы. Ранее в январе Arena объявила о привлечении $150 млн в раунде серии A при оценке после инвестиций в $1,7 млрд. На тот момент её годовая выручка в пересчёте на текущий темп составляла $30 млн, сообщила компания. Таким образом, примерно за 10 месяцев её оценка почти удвоилась.
Arena предоставляет краудсорсинговую платформу, бесплатную для потребителей. Пользователи вводят запросы или заказывают проекты, созданные с помощью вайб-кодинга, а затем оценивают, какая модель справилась лучше. Arena утверждает, что платформу посещают десятки миллионов человек в месяц.
В сентябре прошлого года компания представила коммерческий продукт AI Evaluations — сервис, который предоставляет разработчикам моделей и предприятиям подробную аналитику производительности на основе отзывов сообщества. Время было выбрано идеально. В этом году лаборатории, занимающиеся разработкой ИИ, выяснили, что их модели подстраивались под тесты бенчмаркинга, находя способы набрать высокие баллы, не заслуживая их по-настоящему. В то же время предприятиям требовалась помощь в определении того, какая модель лучше всего подходит для их внутренних задач, вместо того чтобы полагаться только на стандартизированные бенчмарки.
«ИИ развивается быстрее, чем наши возможности по его оценке, а статические бенчмарки перестают работать, как только модели понимают, что их тестируют, — заявила компания в объявлении о привлечении финансирования. — Миру нужна нейтральная третья сторона, которая будет оценивать, насколько ИИ действительно безопасен и соответствует заданным принципам, когда он оказывается в руках реальных людей. Сегодня Arena берёт на себя эту роль», — добавила она.
С этой целью Arena также добавила в свой рейтинг новую категорию: соответствие заданным принципам. В ней модели ранжируются по таким критериям, как несанкционированные действия (совершение действий, о которых модель не просили); ложная атрибуция (ошибочное приписывание высказываний или фактов ненадлежащему источнику); а также то, что компания называет «обманчивым завершением» (ложное заявление о выполнении задач, которые на самом деле не были выполнены).
В настоящее время несколько моделей OpenAI занимают верхние позиции в её предварительном рейтинге соответствия заданным принципам, а Claude Opus 5.5 и Claude Fable находятся соответственно на шестом и девятом местах.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.