V-Help
← Все новости
Искусственный интеллект

Почему бенчмарки ИИ-моделей не отражают реальную стоимость их использования

Почему бенчмарки ИИ-моделей не отражают реальную стоимость их использования

Фото: images.ctfassets.net

Краткий ответ

Бенчмарки ИИ-моделей, такие как Qwen 3.8-Max и Claude Opus 5, не всегда отражают реальную стоимость их использования из-за различий в бюджетах времени и токенов.

Alibaba недавно представила модель Qwen 3.8-Max, позиционируя её как одну из лидеров среди ИИ-систем. Однако независимые тесты, проведённые с использованием фреймворка VulcanBench, показали, что результаты сильно зависят от условий тестирования. В то время как Alibaba предоставляла моделям до 12 часов на выполнение задач, VulcanBench ограничивал время 45–60 минутами. Это привело к тому, что Qwen 3.8-Max показала средние результаты в стандартных настройках и худшие — в режиме по умолчанию.

Проблема заключается в том, что традиционные метрики, такие как цена за токен, не учитывают реальные затраты на выполнение задач. Например, модель может потратить большую часть токенов на размышления, не достигнув конечного результата, что приведёт к пустому ответу и полной оплате за неудачную попытку. Исследование Artificial Analysis показало, что модель DeepSeek-V4-Flash при максимальных настройках использовала в два раза больше токенов, чем средний показатель по классу, хотя её стоимость оставалась низкой благодаря дешёвым токенам.

Эксперты предлагают перейти к метрике стоимости за успешное выполнение задачи, которая учитывает все затраты, включая неудачные попытки. Это особенно важно для моделей с высоким уровнем рассуждений, где превышение бюджета токенов или времени может стать основной причиной провалов. Например, в тестах Long-Horizon-Terminal-Bench 79% неудачных запусков были связаны с превышением временных лимитов, а не с ошибками моделей.

Также выяснилось, что стандартные подходы к маршрутизации запросов между моделями могут быть неэффективными. Например, эскалация на более дорогую модель при неудаче не всегда оправдана: в некоторых случаях это приводит лишь к превышению бюджета без улучшения результата. Компании, такие как HubSpot и Zendesk, уже перешли на оплату за успешное выполнение задач, что позволяет точнее оценивать эффективность ИИ-решений.

Для повышения прозрачности рекомендуется фиксировать причины неудач — например, превышение бюджета или ошибки верификации. Это позволит точнее определять, какие именно аспекты работы модели требуют оптимизации. Кроме того, стоит учитывать, что настройки по умолчанию могут быть неоптимальными: так, Qwen 3.8-Max в стандартном режиме использует максимальный уровень рассуждений, что в независимых тестах показало худшие результаты.

Частые вопросы

Почему результаты бенчмарков ИИ-моделей могут отличаться?
Результаты зависят от временных и токенных бюджетов, заданных в тестах. Разные подходы к настройкам приводят к значительным расхождениям в итоговых показателях.
Какая метрика лучше отражает реальную стоимость использования ИИ?
Рекомендуется использовать метрику стоимости за успешное выполнение задачи, которая учитывает все затраты, включая неудачные попытки.
Как влияет настройка уровня усилий модели на её эффективность?
В некоторых случаях более низкий уровень усилий может быть эффективнее, так как высокие настройки могут приводить к превышению бюджета времени или токенов, снижая общую производительность.
Поделиться:

Лента для Дзен: /feed/dzen.xml · RSS: /feed.xml

Почему этому можно верить

Материал подготовлен редакцией V-Help на основе первоисточника с указанием даты публикации.

Публикация: Новостной отдел V-Help.ru

Источник материала: VentureBeat