Sakhanda Wire
NVDA $230.69 +0.09% MSFT $529.83 +1.38% GOOGL $352.15 +1.11% META $719.19 -0.24% AMZN $258.57 +1.78%
← До новин

Популярний рейтинг ШІ Arena майже вдвічі збільшив оцінку до $3,1 млрд за 10 місяців

Arena, яка виникла у 2023 році як дослідницький проєкт в Каліфорнійському університеті в Берклі, що залучав краудсорсингові оцінки моделей ШІ, залучила $200 млн у раунді Series B за оцінки в $3,1 млрд, повідомила компанія в четвер.

Це сталося після того, як у червні компанія повідомила про досягнення $100 млн річного доходу в перерахунку на поточні темпи.

Раунд очолили Lightspeed Venture Partners і Khosla Ventures, а Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis та інші також долучилися. Раніше в січні Arena оголосила про залучення $150 млн у раунді Series A за оцінки після залучення коштів у $1,7 млрд. На той час її річний дохід у перерахунку на поточні темпи становив $30 млн, повідомила компанія. Отже, приблизно за 10 місяців її оцінка майже подвоїлася.

Arena надає краудсорсингову платформу, якою споживачі можуть користуватися безкоштовно. Користувачі вводять запити або замовляють проєкти, закодовані за допомогою вайбкодингу, а потім оцінюють, яка модель краще впоралася із завданням. Arena стверджує, що має десятки мільйонів відвідувачів щомісяця.

У вересні минулого року компанія представила свій комерційний продукт AI Evaluations — сервіс, який надає розробникам моделей і підприємствам детальну аналітику продуктивності на основі відгуків спільноти. Час для цього виявився надзвичайно вдалим. Цього року лабораторії ШІ усвідомили, що їхні моделі маніпулюють бенчмаркінговими тестами, знаходячи способи набирати високі бали, не заслуговуючи їх насправді. Водночас підприємства потребували допомоги у визначенні того, яка модель найкраще відповідає їхнім внутрішнім потребам, замість того щоб покладатися лише на стандартизовані бенчмарки.

«ШІ розвивається швидше, ніж наша здатність його оцінювати, а статичні бенчмарки втрачають ефективність, щойно моделі розуміють, що їх тестують», — заявила компанія у повідомленні про залучення фінансування. «Світу потрібна нейтральна третя сторона, яка вимірюватиме, наскільки ШІ насправді безпечний і узгоджений із людськими цінностями, коли опиняється в руках реальних людей. Сьогодні Arena бере на себе цю роль», — додала вона.

З цією метою Arena також додала до свого рейтингу нову категорію: узгодженість. У ній моделі ранжуються за такими критеріями, як несанкціоновані дії (виконання дій, про які модель не просили); хибна атрибуція (неправильне приписування тверджень або фактів неналежному джерелу); а також те, що компанія називає «оманливим виконанням» (брехня про виконання завдань, яких модель насправді не виконувала).

Наразі низка моделей OpenAI посідає перші місця в її попередньому рейтингу узгодженості, а Claude Opus 5.5 і Claude Fable перебувають відповідно на шостому та дев’ятому місцях.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини