Аналитики Bank of America зафиксировали у китайских провайдеров структурный сдвиг: вместо массового снижения цены за токен компании переходят к многоуровневому ценообразованию, где главной становится стоимость выполнения задачи целиком, а не единичной операции. Этот сдвиг фиксируется на фоне роста значимости не только базового инферинса, но и более сложных возможностей, которые требуют больших контекстов и агентов.

По оценке банка, базовый инференс становится более доступным и коммерциализируемым, тогда как передовые возможности сохраняют дифференциацию. В качестве триггера эксперты называют появление дешевых моделей DeepSeek, которые значительно сжали цены для разработчиков и стали одной из причин переоценки состава тарифов.

По данным индекса Silicon Data за август средняя цена инференса составила примерно 1,16–1,18 доллара за миллион токенов — минимум за год и заметно ниже конца мая (около 2,04 доллара). В июле провайдеры запустили временной тариф: на модель V4 цена удваивалась в пекинские часы пик (с 9:00–12:00 и 14:00–18:00), до 6–12 юаней за миллион токенов на выходе.

Эксперты Bank of America подчёркнули: текущая цена за токен перестала отражать реальную стоимость для заказчика. В сценариях на базе агентных подходов речь идет о множественных вызовах модели, обращении к инструментам, повторениях шагов и валидации человеком — такие элементы не отражены в построчных тарифах API. Премиальное ценообразование сохраняется только за моделями с сильным рассуждением, длинным контекстным окном, мультимодальностью и агентностью, что требует пересмотра метрики закупки.

Для команд ML это означает смену подхода: вместо сравнения цены за токен нужно оценивать общую стоимость получения надёжного результата, включая вероятность успешного завершения задачи, накладные расходы на вызовы инструментов и ресурсы на пост-проверку человеком.