До 30 раз больше работы на ватт: NVIDIA Vera Rubin NVL72 устанавливает новый стандарт эффективности для агентов ИИ
Согласно данным OpenRouter, рабочие нагрузки агентного ИИ потребляют в 15 раз больше токенов, чем простой запрос в чат. Почему?
Рассмотрим, что происходит, когда агент ИИ исследует компанию для принятия инвестиционного решения. Агент запрашивает финансовые базы данных, ищет новости и документы, вызывает субагента для сравнения аналогов и моделирования оценок, а затем синтезирует все в рекомендации. Агенты и субагенты продолжают рассуждать до тех пор, пока задача не будет выполнена, что приводит к увеличению спроса на токены. На каждом этапе накопленные токены становятся входными данными для следующего, что делает обработку длинного контекста центральным элементом производительности агентного ИИ.
Одна и та же закономерность наблюдается во всех случаях использования агентов: от разработки программного обеспечения до обслуживания клиентов и глубоких исследований.
Источник: NVIDIA (перевод)
