Optima устраняет главный недостаток бенчмаркинга ИИ, позволяя пользователям тестировать модели на собственных данных
Ключевые моменты
- Artificial Analysis выпустила Optima — платформу, которая позволяет пользователям создавать собственные бенчмарки ИИ, адаптированные под конкретные сценарии использования.
- Тесты могут использовать собственные источники данных пользователей или описания нужного сценария с примерами входных и выходных данных. Затем Optima сравнивает модели ИИ не только по качеству, но и по стоимости и времени выполнения задачи.
- Платформа решает проблему ограниченной полезности универсальных бенчмарков для реальных приложений. Однако методологическая обоснованность пользовательского бенчмарка и его способность отражать реальную ценность для бизнеса по-прежнему зависят от того, как он спроектирован.
Optima позволяет пользователям создавать собственные бенчмарки и сравнивать модели ИИ по качеству, стоимости и скорости для конкретных сценариев использования.
Artificial Analysis, известная своими независимыми оценками больших языковых моделей и реализациями бенчмарков, такими как GDPval-AA и AA-Briefcase, запустила новую платформу под названием Optima. Принцип прост: публичные бенчмарки сравнивают модели по заранее заданным задачам и критериям, но не обязательно показывают, какая модель лучше всего подходит для конкретного сценария использования. Optima стремится устранить этот пробел с помощью сравнений, адаптированных под индивидуальные рабочие процессы.
По данным Artificial Analysis, пользователи могут создавать собственные бенчмарки на основе своих данных, рабочих процессов или описаний сценария использования, а затем запускать их на ведущих современных моделях и сравнивать результаты по качеству, стоимости и времени выполнения задачи. Optima уже доступна.
Три способа создать собственный бенчмарк
Optima принимает несколько типов исходных материалов. Пользователи могут загружать существующие наборы данных для оценки из собственных файлов или с Hugging Face, а также трассировки работы ИИ-агентов с таких платформ, как Arize, Braintrust или Langfuse. Разработчики также могут установить навык, который собирает информацию из их среды разработки и прошлых сессий, пишет Artificial Analysis.
Пользователи, у которых нет подобных данных, могут вместо этого описать предполагаемый сценарий использования и предоставить примеры входных и выходных данных. Затем Optima генерирует предлагаемые тестовые входные данные, критерии оценки и примеры задач. Пользователи могут проверить и уточнить их с помощью обратной связи перед запуском самого бенчмарка.
Доступны два подхода к оценке: оценка по рубрике на соответствие объективным критериям или метод попарного сравнения, который Artificial Analysis также использует в таких бенчмарках, как GDPval-AA и AA-Briefcase. При попарном подходе пользователи сначала оценивают выборку пар ответов и указывают, какой ответ они предпочитают. Затем Optima выводит полный рейтинг по всему тестовому набору данных на основе этих предпочтений.
Стоимость и скорость становятся полноценными метриками сравнения
Помимо общего качества моделей, Optima отслеживает стоимость и время выполнения задачи как самостоятельные параметры сравнения. Это позволяет проверить, действительно ли прирост производительности оправдывает более высокую стоимость или более длительное время обработки у конкретной модели.
Для агентских приложений одна лишь цена токенов мало о чем говорит. Более дешевая модель в итоге может обойтись дороже, если ей требуется больше попыток, она чаще ошибается или требует дополнительной ручной обработки. Стоимость завершенной задачи часто является более значимым показателем.
По данным Artificial Analysis, первые тестировщики создавали бенчмарки для финансовых и бухгалтерских агентов, чтобы выяснить, какая модель сможет сократить расходы в десять раз без существенной потери качества. Другие проверяли, какая модель лучше всего соответствует стилю письма юристов или наиболее точно выявляет элементы в закрытом наборe данных изображений.
По данным Artificial Analysis, при создании и запуске бенчмарков Optima взимает только фактическую стоимость токенов использованных моделей, без наценки. Оценка по рубрике стоит 0,125 доллара за критерий для каждой модели, а попарная оценка — 0,375 доллара за одно сравнение. В начале создания бенчмарка, при каждом его запуске и каждом раунде оценки платформа резервирует сумму на основе расчетной стоимости. Затем оплата рассчитывается исходя из фактического использования и понесенных расходов на оценку.
Почему универсальные бенчмарки не справляются
Optima решает хорошо известную проблему бенчмарков ИИ. Анализ Epoch AI показал, что результаты бенчмарков зависят от деталей реализации, которые редко раскрываются. Разные формулировки запросов и настройки температуры приводили к заметно разным оценкам одной и той же модели в зависимости от конфигурации. В агентских бенчмарках, таких как SWE-bench, одна лишь замена каркаса — то есть управляющего программного обеспечения агента и среды его инструментов — давала разницу до 15 процентных пунктов.
Еще более масштабное исследование 445 научных статей о бенчмарках, представленных на ведущих конференциях по ИИ, выявило системные проблемы. Почти во всех работах были методологические недостатки как минимум в одной области, включая нечеткие определения, нерепрезентативные выборки и отсутствие статистической проверки. Лишь около 10 процентов изученных бенчмарков использовали полные задачи из реального мира, отражающие реальные сценарии применения. Ключевые понятия, такие как рассуждение или согласованность с человеческими ценностями, часто определялись недостаточно четко, что ограничивало надежность любых сделанных на их основе выводов.
Optima может решить проблему неспособности универсальных бенчмарков отражать конкретный сценарий использования. Но более глубокие методологические проблемы бенчмаркинга никуда не исчезают. Даже при наличии бенчмарка, адаптированного под собственные задачи, его полезность зависит от того, насколько точно определены целевые возможности, насколько репрезентативны тестовые примеры и как организована и документирована оценка.
Есть и еще одно ограничение, о котором стоит помнить. Даже стоимость и время выполнения задачи не показывают, какую реальную ценность результат представляет для бизнеса. Дешевый и быстрый рабочий процесс с ИИ все равно может быть неэффективным, если его результаты требуют значительной доработки или почти не добавляют ценности процессу, частью которого они являются.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.