Sakhanda Wire
NVDA $225.16 -0.06% MSFT $495.40 -0.30% GOOGL $345.90 -0.13% META $589.85 -0.86% AMZN $262.65 -0.94%
← Към новините

Optima отстранява най-големия недостатък на бенчмаркинга на ИИ, като позволява на потребителите да тестват модели със собствените си данни

Optima отстранява най-големия недостатък на бенчмарковете за AI, като позволява на потребителите да тестват модели със собствените си данни
Tomislav Bezmalinović
16 авг. 2026 г.
Nano Banana Pro, подканен от THE DECODER

Основни акценти

  • Artificial Analysis представи Optima — платформа, която позволява на потребителите да създават собствени бенчмаркове за AI, адаптирани към конкретни случаи на употреба.
  • Тестовете могат да използват собствени източници на данни или описания на желания сценарий, заедно с примерни входове и изходи. След това Optima сравнява AI моделите не само по качество, но и по цена на задача и време за изпълнение на задача.
  • Платформата се справя с ограничената полезност на бенчмарковете с общо предназначение за приложения от реалния свят. Дали персонализираният бенчмарк е методологично издържан и отразява реалната бизнес стойност все пак зависи от начина, по който е проектиран.

Optima позволява на потребителите да създават персонализирани бенчмаркове и да сравняват AI модели по качество, цена и бързина за конкретните си случаи на употреба.

Artificial Analysis, известна със своите независими оценки на LLM и реализации на бенчмаркове като GDPval-AA и AA-Briefcase, представи нова платформа, наречена Optima. Идеята е проста: публичните бенчмаркове сравняват моделите по предварително зададени задачи и критерии, но не е задължително да покажат кой модел работи най-добре за конкретен случай на употреба. Optima се стреми да запълни тази празнина със сравнения, адаптирани към индивидуалните работни процеси.

Според Artificial Analysis потребителите могат да създават собствени бенчмаркове, като използват собствените си данни, работни процеси или описания на конкретен случай на употреба, след което да ги изпълняват с водещите актуални модели и да сравняват резултатите по качество, цена на задача и време за изпълнение на задача. Optima е вече достъпна.

Три начина за създаване на персонализиран бенчмарк

Optima приема няколко вида изходни материали. Потребителите могат да качват съществуващи набори от данни за оценка от собствените си файлове или от Hugging Face, както и записи на действията на AI агенти от платформи като Arize, Braintrust или Langfuse. Разработчиците могат също да инсталират умение, което събира информация от тяхната среда за програмиране и предишни сесии, пише Artificial Analysis.

Потребителите, които не разполагат с такива данни, могат вместо това да опишат планирания случай на употреба и да предоставят примерни входове и изходи. След това Optima генерира предложения за тестови входове, критерии за оценка и примерни задачи. Потребителите могат да ги прегледат и усъвършенстват чрез обратна връзка, преди да стартират самия бенчмарк.

Налични са два подхода за оценяване: оценка по рубрика спрямо обективни критерии или метод за двойно сравнение, който Artificial Analysis използва и за бенчмаркове като GDPval-AA и AA-Briefcase. При подхода с двойно сравнение потребителите първо оценяват извадка от двойки отговори и посочват кой отговор предпочитат. След това Optima извежда пълното класиране на целия тестов набор въз основа на тези предпочитания.

Цената и бързината стават основни показатели за сравнение

Освен чистото качество на моделите, Optima проследява цената на задача и времето за изпълнение на задача като самостоятелни измерения за сравнение. Това позволява да се провери дали подобрението в представянето действително оправдава по-високата цена или по-дългото време за обработка на даден модел.

При приложения с агенти самата цена на токените казва много малко. По-евтин модел може в крайна сметка да струва повече като цяло, ако се нуждае от повече опити, допуска повече грешки или изисква допълнителна работа по почистването на резултатите. Цената на изпълнена задача често е по-смисленият показател.

Според Artificial Analysis ранните тестери са създали бенчмаркове за агенти във финансите и счетоводството, за да установят кой модел може да намали разходите десетократно без значителна загуба на качество. Други са тествали кой модел най-добре имитира стила на писане на юристи или най-точно идентифицира елементи в патентован набор от изображения.

Според Artificial Analysis при създаването и изпълнението на бенчмаркове Optima начислява само действителните разходи за токени на използваните модели, без надценка. Оценките по рубрика струват 0,125 долара на критерий за модел, а оценките чрез двойно сравнение струват 0,375 долара на сравнение. В началото на създаването на бенчмарк, при всяко изпълнение на бенчмарка и при всеки кръг на оценяване платформата задържа баланс въз основа на прогнозна цена. След това таксуването се основава на действителното потребление и направените разходи за оценяване.

Защо бенчмарковете с общо предназначение не са достатъчни

Optima се справя с добре познат проблем при AI бенчмарковете. Анализ на Epoch AI показа, че резултатите от бенчмарковете зависят от детайли по реализацията, които рядко се разкриват. Различната формулировка на подсказките и настройките на температурата са довели до осезаемо различни резултати за един и същ модел в зависимост от конфигурацията. При бенчмаркове за агенти като SWE-bench простата смяна на обвивката — тоест управляващия софтуер на агента и средата му от инструменти — е довела до разлика от до 15 процентни пункта.

Още по-мащабно проучване, разглеждащо 445 научни публикации за бенчмаркове от водещи конференции за AI, установи по-системни проблеми. Почти всички са имали методологични слабости поне в една област, включително неясни дефиниции, непредставителни извадки и липсваща статистическа валидация. Само около 10 процента от изследваните бенчмаркове са използвали цялостни задачи от реалния свят, които отразяват действителни сценарии на приложение. Ключови концепции като разсъждение или съгласуваност често са били зле дефинирани, което ограничава надеждността на направените изводи.

Optima може да реши проблема с това, че общите бенчмаркове не успяват да уловят конкретен случай на употреба. Но по-дълбоките методологични предизвикателства при бенчмарковете не изчезват. Дори при бенчмарк, адаптиран към собствените ви задачи, полезността му зависи от това колко точно са дефинирани целевите способности, доколко тестовите случаи са представителни и как е реализирана и документирана оценката.

Има още едно ограничение, което си струва да се има предвид. Дори цената и времето за изпълнение на задача не ви казват каква е действителната стойност на резултата за бизнеса. Евтин и бърз AI работен процес все пак може да бъде неефективен, ако резултатите му изискват сериозна допълнителна обработка или добавят малка стойност към процеса, от който са част.

AI новини без сензации — подбрани от хора

Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, ексклузивния ни шест пъти годишно доклад за водещите технологии „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Artificial Analysis

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини