Сложные ИИ-модели выбрасывают в 50 раз больше CO₂
Исследование показало, что сложные языковые модели ИИ могут производить до 50 раз больше выбросов CO₂ по сравнению с более простыми аналогами, особенно при генерации развернутых ответов. Энергоэффективность и точность моделей существенно различаются в зависимости от их архитектуры и типа задач.
Natura
Исследователи из Университета прикладных наук Hochschule München (Германия) провели анализ экологических последствий использования крупных языковых моделей (LLM). В рамках работы были протестированы 14 различных LLM — от базовых до более сложных — с помощью 1 000 одинаковых стандартных вопросов. Количество сгенерированных токенов каждой моделью было пересчитано в выбросы парниковых газов.
Основные выводы исследования
Установлено, что модели с развитым механизмом рассуждения производят до 50 раз больше выбросов CO₂ по сравнению с моделями, которые дают краткие ответы. Это связано с тем, что сложные модели генерируют больше токенов, а вычисления требуют значительных энергозатрат, что приводит к увеличению выбросов.
Для оценки энергопотребления использовался компьютер с GPU NVIDIA A100 и фреймворк Perun, а также средний коэффициент выбросов 480 г CO₂/кВт·ч. Каждая из 14 моделей отвечала на 1 000 вопросов по философии, мировой истории, международному праву, абстрактной алгебре и математике. В исследовании участвовали текстовые и рассуждающие модели от компаний Meta, Alibaba, Deep Cognito и Deepseek.
Сравнение моделей
Рассуждающие модели в среднем создавали 543,5 токена на вопрос, тогда как текстовые — около 37,7 токена. При этом увеличение числа токенов не всегда приводило к большей точности — зачастую ответы становились просто более развернутыми.
- Самой точной оказалась модель Deep Cogito 70B (70 миллиардов параметров) с точностью 84,9%. Однако она производила в три раза больше выбросов, чем аналогичные по размеру модели, дающие более простые ответы.
- Самой энергоемкой стала модель Deepseek R170B — 2 042 г CO₂-эквивалента на 1 000 вопросов, что сопоставимо с поездкой на автомобиле на 15 км. Ее точность составила 78,9%. По расчетам, если эта модель ответит на 600 000 вопросов, выбросы будут эквивалентны перелету Лондон — Нью-Йорк и обратно.
- Самой энергоэффективной оказалась модель Alibaba Qwen 7B (27,7 г CO₂-эквивалента), но ее точность составила лишь 31,9%.
Влияние типа вопросов
Энергопотребление также зависело от типа вопроса: задачи по абстрактной алгебре и философии требовали больше вычислений, чем простые вопросы. В исследовании не рассматривались некоторые крупные LLM, такие как ChatGPT от OpenAI, Gemini от Google, Grok от X и Claude от Anthropic.
Результаты исследования опубликованы в журнале Frontiers in Communication.
