Sakhanda Wire
NVDA $225.16 -0.06% MSFT $495.40 -0.30% GOOGL $345.90 -0.13% META $589.85 -0.86% AMZN $262.65 -0.94%
← До новин

Optima усуває головний недолік бенчмаркінгу ШІ, даючи змогу користувачам тестувати моделі на власних даних

Optima усуває найбільшу ваду бенчмаркінгу ШІ, дозволяючи користувачам тестувати моделі на власних даних
Tomislav Bezmalinović
16 серпня 2026
Nano Banana Pro за запитом THE DECODER

Ключові моменти

  • Artificial Analysis випустила Optima — платформу, яка дає змогу користувачам створювати власні бенчмарки ШІ, адаптовані до конкретних сценаріїв використання.
  • Тести можуть використовувати власні джерела даних користувачів або описи бажаного сценарію разом із прикладами вхідних і вихідних даних. Після цього Optima порівнює моделі ШІ не лише за якістю, а й за вартістю та часом виконання завдання.
  • Платформа розв’язує проблему обмеженої практичної цінності загальнодоступних бенчмарків для застосувань у реальному світі. Водночас те, чи є спеціально створений бенчмарк методологічно коректним і чи відображає він реальну бізнес-цінність, усе ще залежить від того, як його розроблено.

Optima дає змогу користувачам створювати власні бенчмарки та порівнювати моделі ШІ за якістю, вартістю й швидкістю для конкретних сценаріїв використання.

Artificial Analysis, відома своїми незалежними оцінюваннями великих мовних моделей і реалізаціями бенчмарків на кшталт GDPval-AA та AA-Briefcase, запустила нову платформу під назвою Optima. Принцип простий: загальнодоступні бенчмарки порівнюють моделі за заздалегідь визначеними завданнями й критеріями, але не обов’язково показують, яка модель найкраще працює для конкретного сценарію використання. Optima прагне усунути цю прогалину за допомогою порівнянь, адаптованих до індивідуальних робочих процесів.

За даними Artificial Analysis, користувачі можуть створювати власні бенчмарки на основі власних даних, робочих процесів або описів сценарію використання, а потім запускати їх на найкращих актуальних моделях і порівнювати результати за якістю, вартістю та часом виконання завдання. Optima вже доступна.

Три способи створити власний бенчмарк

Optima приймає кілька типів вихідних матеріалів. Користувачі можуть завантажувати наявні набори даних для оцінювання зі своїх файлів або з Hugging Face, а також трейси роботи ШІ-агентів із таких платформ, як Arize, Braintrust або Langfuse. Розробники також можуть встановити спеціальний інструмент, який збирає інформацію з їхнього середовища програмування та попередніх сесій, пише Artificial Analysis.

Користувачі, які не мають таких даних, можуть натомість описати запланований сценарій використання та надати приклади вхідних і вихідних даних. Після цього Optima генерує запропоновані тестові вхідні дані, критерії оцінювання та приклади завдань. Користувачі можуть переглянути й уточнити їх за допомогою зворотного зв’язку, перш ніж запускати фактичний бенчмарк.

Доступні два підходи до оцінювання: оцінювання за рубрикою на основі об’єктивних критеріїв або попарне порівняння, яке Artificial Analysis також використовує для таких бенчмарків, як GDPval-AA та AA-Briefcase. У разі попарного підходу користувачі спочатку оцінюють вибірку пар відповідей і вказують, якій відповіді вони віддають перевагу. Потім Optima виводить повний рейтинг для всього тестового набору на основі цих уподобань.

Вартість і швидкість стають ключовими показниками порівняння

Окрім безпосередньої якості моделі, Optima відстежує вартість і час виконання завдання як окремі виміри для порівняння. Це дає змогу перевірити, чи справді приріст продуктивності виправдовує вищу вартість або довший час обробки, властиві певній моделі.

Для агентних застосувань сама лише ціна токенів мало про що говорить. Дешевша модель зрештою може обійтися дорожче загалом, якщо їй потрібно більше спроб, вона частіше зазнає невдач або потребує додаткового очищення результатів. Вартість виконаного завдання часто є значно змістовнішим показником.

За даними Artificial Analysis, перші тестувальники створювали бенчмарки для фінансових і бухгалтерських агентів, щоб з’ясувати, яка модель може скоротити витрати вдесятеро без істотної втрати якості. Інші перевіряли, яка модель найкраще відповідає стилю письма юристів або найточніше визначає елементи у власному наборі даних зображень.

За даними Artificial Analysis, під час створення та запуску бенчмарків Optima стягує лише фактичну вартість токенів використаних моделей, без націнки. Оцінювання за рубрикою коштує $0.125 за критерій для кожної моделі, а попарне оцінювання — $0.375 за порівняння. На початку створення бенчмарку, під час кожного його запуску та кожного раунду оцінювання платформа резервує баланс на основі оцінки вартості. Після цього оплата здійснюється відповідно до фактичного використання та понесених витрат на оцінювання.

Чому загальнодоступні бенчмарки не дають повної картини

Optima розв’язує добре відому проблему бенчмарків ШІ. Аналіз Epoch AI показав, що результати бенчмарків залежать від деталей реалізації, які рідко розкриваються. Різні формулювання запитів і налаштування температури призводили до помітно різних результатів тієї самої моделі залежно від конфігурації. Для агентних бенчмарків на кшталт SWE-bench проста заміна каркаса, тобто керувального програмного забезпечення агента та середовища його інструментів, спричиняла різницю до 15 процентних пунктів.

Ще масштабніше дослідження 445 наукових статей про бенчмарки з провідних конференцій з ШІ виявило системніші проблеми. Майже всі вони мали методологічні недоліки принаймні в одній сфері, зокрема нечіткі визначення, нерепрезентативні вибірки та відсутність статистичної перевірки. Лише близько 10 відсотків досліджених бенчмарків використовували повні завдання з реального світу, що відображали фактичні сценарії застосування. Ключові поняття, як-от міркування чи узгодженість, часто визначалися недостатньо чітко, що обмежувало надійність будь-яких висновків, зроблених на їхній основі.

Optima може розв’язати проблему неспроможності загальних бенчмарків відобразити конкретний сценарій використання. Але глибші методологічні виклики бенчмаркінгу нікуди не зникають. Навіть у разі бенчмарку, адаптованого до власних завдань, його корисність залежить від того, наскільки точно визначено цільові можливості, наскільки репрезентативними є тестові приклади та наскільки якісно реалізовано й задокументовано оцінювання.

Варто пам’ятати й про ще одне обмеження. Навіть вартість і час виконання завдання не показують, чого насправді вартий результат для бізнесу. Дешевий і швидкий робочий процес із ШІ все одно може бути неефективним, якщо його результати потребують значного доопрацювання або додають мало цінності процесу, частиною якого вони є.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ та наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, мати повний доступ до архіву й розділу коментарів.

Джерело: Artificial Analysis

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини