Esta página foi traduzida automaticamente e ainda não foi revisada. Como ajudar
Inteligência artificial / ai/energy-efficient-inference
Inferência de IA com eficiência energética
Executar modelos de IA treinados para responder a consultas com uma pequena fração da energia atual por token gerado, em toda a pilha, do chip à central de resfriamento, de modo que o uso mais amplo de IA não exija proporcionalmente mais eletricidade.
Escopo
No escopo: a energia consumida para servir um modelo de linguagem treinado, medida por token ou por consulta, incluindo acelerador, memória, interconexão, host e a sobrecarga do resfriamento. Fora do escopo: a energia do treinamento (ainda não mapeada); os dispositivos lógicos, a movimentação de dados e o resfriamento de que a inferência depende, cobertos por computing/beyond-cmos-logic, computing/low-energy-data-movement e enablers/heat-removal; e aquilo para que a IA é usada, coberto por ai/ai-for-science.
- Maturidade
- TRL 6 (6 de 9)Ganhos de eficiência estão demonstrados em produção (uma redução de 33x na energia por prompt mediano do Gemini Apps em um ano, relatada pela empresa), mas as lacunas de hardware de uma ordem de grandeza descritas abaixo estão em nível de laboratório ou de protótipo.
- Contribui para
- Energia limpa e acessível, Indústria, inovação e infraestrutura, Ação contra a mudança global do clima
- Última revisão
- 2026-10-04
- Curadores
- ninguém ainda: candidate-se
Impacto
O que alcançar a meta mudaria, e para quem. Nenhuma afirmação é mais forte que a evidência que cita.
Entre modelos, sistemas de serviço e hardware, ganhos de eficiência já à vista poderiam reduzir a energia da inferência de IA de 8 a 20 vezes. Com 1 bilhão de consultas por dia, 10% delas longas, a demanda cairia de 1,7 GWh por dia para 0,8 GWh por dia com intervenções de eficiência.
Quem: Data centers que servem modelos de IA, e as redes elétricas que os abastecem
Hipóteses: Um modelo de baixo para cima do serviço em produção, a partir da vazão de tokens, da potência dos nós e do overhead, para modelos de escala de fronteira (mais de 200B de parâmetros) em nós H100; não é uma medição.
Desbloqueado pela meta de Energia por token
Contribui para: Energia limpa e acessível, Ação contra a mudança global do clima
Métricas
Lacunas
Mover pesos e cache custa mais do que a aritmética
Cada token gerado transmite os pesos do modelo e o cache de chave-valor pela memória, de modo que o tráfego de memória, e não a aritmética, tende a limitar a energia por token. O melhor enlace elétrico die-to-die publicado mede 0,65 pJ/bit em um protótipo, um valor só da interface. Fechar a lacuna significa mover menos bytes (quantização, compressão de cache, atenção esparsa) e bytes mais baratos.
Mantida aberta por: Movimentação de dados de baixa energia
A decodificação é limitada pela largura de banda da memória, não pela computação
Lotes pequenos deixam as unidades aritméticas ociosas enquanto o sistema de memória está saturado. A energia por token medida cai de 7,46 para 0,72 J/token à medida que o comprimento da saída cresce de 10 para 512 tokens com lote 16, porque os custos fixos são amortizados; os ganhos de agrupamento em lotes diminuem à medida que o contexto cresce (6,31x com 512 tokens de contexto contra 1,17x com 4K, para 10 tokens de saída).
Mantida aberta por: Movimentação de dados de baixa energia
A lógica CMOS tem um teto de cerca de duzentas vezes a eficiência atual
Ho, Erdil e Besiroglu estimam um teto de 4,7e15 operações FP4 por joule para microprocessadores CMOS, aproximadamente duzentas vezes os microprocessadores atuais, a partir do chaveamento, da capacitância das interconexões e da fuga. O atlas ainda não tem um valor atual com fonte de FLOP por joule para aceleradores em operação, por isso esta lacuna não tem métrica própria.
Mantida aberta por: Lógica além do CMOS
A potência entregue e o resfriamento limitam a produção de tokens
Em escala de implantação, a restrição limitante pode passar da computação de pico para a potência entregue ao data center, a capacidade de resfriamento e o PUE. O resfriamento microfluídico embutido suporta cerca de 1e3 W/cm2; a densidade de potência dos aceleradores continua a subir.
Mantida aberta por: Remoção de calor de alto fluxo
Capacidade ociosa e lotes pequenos desperdiçam energia
A energia por prompt em produção inclui a capacidade ociosa das máquinas e a sobrecarga do data center, não apenas a potência ativa dos aceleradores. O Google relata uma redução de 33x na energia por prompt de texto mediano do Gemini Apps em um ano, por eficiência de software e compra de energia limpa (o resumo declara o efeito combinado sobre a energia e não separa os dois). Novos ganhos dependem de agrupamento em lotes, roteamento e escolha do modelo.
Dependências
Depende de
- Lógica além do CMOS A aritmética no acelerador é limitada pela energia de chaveamento da lógica CMOS, que, segundo estimativas, permite apenas cerca de duzentas vezes mais eficiência do que os microprocessadores atuais.
- Movimentação de dados de baixa energia A geração de tokens lê da memória os pesos do modelo e o cache de chave-valor a cada token, de modo que o tráfego de memória e entre chips responde por uma grande parte da energia. Necessário: Energia por bit movido entre memória e processador igual ou inferior a 0,1 pJ, de modo que transmitir os pesos custe poucos watts por terabyte por segundo.
- Remoção de calor de alto fluxo A potência entregue e a capacidade de resfriamento limitam quantos aceleradores cabem em um rack e, portanto, os tokens produzidos por instalação.
Necessária para
- IA para a ciência Triagem e ciclos agênticos fazem muitas chamadas de modelo por experimento, de modo que a energia e o custo por token determinam até onde os ciclos de descoberta podem escalar.
- Interface cérebro-computador de alta largura de banda A decodificação roda uma rede neural sobre o sinal neural; rodá-la em um dispositivo vestível ou implantado exige pouca energia por inferência.
As setas vão de uma tecnologia àquilo de que ela depende. Selecione um nó para abri-lo.