Почему бенчмарки ИИ-моделей не отражают реальную стоимость их использования

Фото: images.ctfassets.net
Краткий ответ
Бенчмарки ИИ-моделей, такие как Qwen 3.8-Max и Claude Opus 5, не всегда отражают реальную стоимость их использования из-за различий в бюджетах времени и токенов.
Alibaba недавно представила модель Qwen 3.8-Max, позиционируя её как одну из лидеров среди ИИ-систем. Однако независимые тесты, проведённые с использованием фреймворка VulcanBench, показали, что результаты сильно зависят от условий тестирования. В то время как Alibaba предоставляла моделям до 12 часов на выполнение задач, VulcanBench ограничивал время 45–60 минутами. Это привело к тому, что Qwen 3.8-Max показала средние результаты в стандартных настройках и худшие — в режиме по умолчанию.
Проблема заключается в том, что традиционные метрики, такие как цена за токен, не учитывают реальные затраты на выполнение задач. Например, модель может потратить большую часть токенов на размышления, не достигнув конечного результата, что приведёт к пустому ответу и полной оплате за неудачную попытку. Исследование Artificial Analysis показало, что модель DeepSeek-V4-Flash при максимальных настройках использовала в два раза больше токенов, чем средний показатель по классу, хотя её стоимость оставалась низкой благодаря дешёвым токенам.
Эксперты предлагают перейти к метрике стоимости за успешное выполнение задачи, которая учитывает все затраты, включая неудачные попытки. Это особенно важно для моделей с высоким уровнем рассуждений, где превышение бюджета токенов или времени может стать основной причиной провалов. Например, в тестах Long-Horizon-Terminal-Bench 79% неудачных запусков были связаны с превышением временных лимитов, а не с ошибками моделей.
Также выяснилось, что стандартные подходы к маршрутизации запросов между моделями могут быть неэффективными. Например, эскалация на более дорогую модель при неудаче не всегда оправдана: в некоторых случаях это приводит лишь к превышению бюджета без улучшения результата. Компании, такие как HubSpot и Zendesk, уже перешли на оплату за успешное выполнение задач, что позволяет точнее оценивать эффективность ИИ-решений.
Для повышения прозрачности рекомендуется фиксировать причины неудач — например, превышение бюджета или ошибки верификации. Это позволит точнее определять, какие именно аспекты работы модели требуют оптимизации. Кроме того, стоит учитывать, что настройки по умолчанию могут быть неоптимальными: так, Qwen 3.8-Max в стандартном режиме использует максимальный уровень рассуждений, что в независимых тестах показало худшие результаты.
Частые вопросы
- Почему результаты бенчмарков ИИ-моделей могут отличаться?
- Результаты зависят от временных и токенных бюджетов, заданных в тестах. Разные подходы к настройкам приводят к значительным расхождениям в итоговых показателях.
- Какая метрика лучше отражает реальную стоимость использования ИИ?
- Рекомендуется использовать метрику стоимости за успешное выполнение задачи, которая учитывает все затраты, включая неудачные попытки.
- Как влияет настройка уровня усилий модели на её эффективность?
- В некоторых случаях более низкий уровень усилий может быть эффективнее, так как высокие настройки могут приводить к превышению бюджета времени или токенов, снижая общую производительность.
Лента для Дзен: /feed/dzen.xml · RSS: /feed.xml