Esta página foi traduzida automaticamente e ainda não foi revisada. Como ajudar
Evidências / vellaisamy2026characterization
Characterization of Request and Token Energy Costs for LLM Inference Workloads on GPU Platforms
Vellaisamy, Prabhu, Lam, Vanessa, Blanton, Shawn, Shen, John Paul
arXiv, 2026
relatadachecada automaticamentepreprint
A energia por token aqui é a energia marginal mais amortizada por token de saída na janela de inferência de uma requisição em lote, medida em GPUs; ela cai à medida que o comprimento da saída cresce porque o custo fixo de prefill se distribui por mais tokens.
Resultados
Energia por token: 0,72 J
Llama-3.2-1B (denso, 1B parâmetros) em uma GPU NVIDIA H200, tamanho de lote 16, contexto de 4K tokens, 512 tokens de saída. Com 10 tokens de saída a mesma configuração dá 7,46 J/token. Um modelo de 1B é muito menor que os modelos de fronteira.
increasing output length from 10 to 512 tokens reduces token energy from 7.46 to 0.72 J/token
Citada por
Adicionada em 2026-10-04 por agent:claude-sonnet-5, conferida em 2026-10-04 · TOML de origem · Relatar um problema