Популярната AI класация Arena почти удвои оценката си до $3,1 млрд. за 10 месеца
Arena, която възникна през 2023 г. като изследователски проект в Калифорнийския университет в Бъркли, събиращ оценки за класирането на AI модели чрез краудсорсинг, е набрала 200 млн. долара в рунд от серия B при оценка от 3,1 млрд. долара, съобщи компанията в четвъртък.
Това се случва, след като през юни компанията съобщи, че е достигнала 100 млн. долара годишни приходи на текуща база.
Рундът беше воден от Lightspeed Venture Partners и Khosla Ventures, като към него се присъединиха Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и други. Преди това Arena обяви набиране на 150 млн. долара в рунд от серия A през януари при оценка след финансирането от 1,7 млрд. долара. По това време годишните ѝ приходи на текуща база бяха 30 млн. долара, съобщи компанията. Това означава, че оценката ѝ почти се е удвоила за около 10 месеца.
Arena предлага платформа с краудсорсинг, която е безплатна за потребителите. Те въвеждат подсказки или заявяват проекти, кодирани според усещането им, а след това оценяват кой модел се е справил по-добре. Arena твърди, че платформата ѝ има десетки милиони посетители месечно.
През септември миналата година компанията представи търговския си продукт AI Evaluations — услуга, която предоставя на лаборатории за модели и предприятия подробни анализи на ефективността, базирани на обратната връзка от общността ѝ. Моментът се оказа изключително подходящ. Тази година лабораториите за AI осъзнаха, че моделите им манипулират бенчмарк тестовете, като намират начини да постигат високи резултати, без действително да ги заслужават. Същевременно предприятията искаха помощ при определянето на това кой модел работи най-добре за собствените им вътрешни нужди, вместо да разчитат единствено на стандартизирани бенчмаркове.
„AI се развива по-бързо, отколкото способността ни да го оценяваме, а статичните бенчмаркове се оказват неефективни, щом моделите разпознаят, че са подложени на тестове“, заяви компанията в съобщението си за финансирането. „Светът се нуждае от неутрална трета страна, която да измерва доколко AI действително е безопасен и съобразен с човешките ценности, когато попадне в ръцете на реални хора. Arena поема тази роля днес“, добави тя.
В тази връзка Arena добави и нова категория към класацията си: съответствие. В нея моделите се класират въз основа на проблеми като неоторизирани действия (извършване на действия, за които не е било поискано); невярно приписване (неправилно приписване на твърдения или факти на грешен източник); и това, което компанията нарича „измамно изпълнение“ (лъжа относно изпълнението на задачи, които моделът не е извършил).
В момента няколко модела на OpenAI са начело на нейната предварителна класация за съответствие, като Claude Opus 5.5 и Claude Fable заемат съответно шесто и девето място.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.