Escape Velocity

Esta página foi traduzida automaticamente e ainda não foi revisada. Como ajudar

Inteligência artificial / ai/energy-efficient-inference

Inferência de IA com eficiência energética

mapeadaTRL 6 (6 de 9)horizonte Década de 2030lacuna crítica aberta

Executar modelos de IA treinados para responder a consultas com uma pequena fração da energia atual por token gerado, em toda a pilha, do chip à central de resfriamento, de modo que o uso mais amplo de IA não exija proporcionalmente mais eletricidade.

Escopo

No escopo: a energia consumida para servir um modelo de linguagem treinado, medida por token ou por consulta, incluindo acelerador, memória, interconexão, host e a sobrecarga do resfriamento. Fora do escopo: a energia do treinamento (ainda não mapeada); os dispositivos lógicos, a movimentação de dados e o resfriamento de que a inferência depende, cobertos por computing/beyond-cmos-logic, computing/low-energy-data-movement e enablers/heat-removal; e aquilo para que a IA é usada, coberto por ai/ai-for-science.

Maturidade
TRL 6 (6 de 9)
Ganhos de eficiência estão demonstrados em produção (uma redução de 33x na energia por prompt mediano do Gemini Apps em um ano, relatada pela empresa), mas as lacunas de hardware de uma ordem de grandeza descritas abaixo estão em nível de laboratório ou de protótipo.
Contribui para
Energia limpa e acessível, Indústria, inovação e infraestrutura, Ação contra a mudança global do clima
Última revisão
2026-10-04
Curadores
ninguém ainda: candidate-se

Impacto

O que alcançar a meta mudaria, e para quem. Nenhuma afirmação é mais forte que a evidência que cita.

Benefícioextrapolação

Entre modelos, sistemas de serviço e hardware, ganhos de eficiência já à vista poderiam reduzir a energia da inferência de IA de 8 a 20 vezes. Com 1 bilhão de consultas por dia, 10% delas longas, a demanda cairia de 1,7 GWh por dia para 0,8 GWh por dia com intervenções de eficiência.

Quem: Data centers que servem modelos de IA, e as redes elétricas que os abastecem

Hipóteses: Um modelo de baixo para cima do serviço em produção, a partir da vazão de tokens, da potência dos nós e do overhead, para modelos de escala de fronteira (mais de 200B de parâmetros) em nós H100; não é uma medição.

Desbloqueado pela meta de Energia por token

Contribui para: Energia limpa e acessível, Ação contra a mudança global do clima

Métricas

Energia por token principalfaltam 1,0 ordens de grandeza

Energia consumida por token gerado na inferência de um modelo de linguagem, conforme a definição da fonte. O número pertence a uma de três fronteiras de medida, e as condições do valor dizem qual: só o chip ou acelerador; o sistema, como potência na tomada (o MLPerf Power mede a potência do sistema inteiro com um analisador de potência aprovado pela SPEC, lido pelo Power-Thermal Daemon, PTD, arXiv:2410.12032); ou a instalação, o sistema multiplicado pela eficiência no uso de energia do data center (PUE, ISO/IEC 30134-2:2026). Números de fronteiras diferentes não são comparáveis. Quanto menor, melhor.
Energia por token: escala logarítmica, uma marca por ordem de grandeza; melhor à direitametahoje
Atual (2026-08-01)0,72 J
Meta0,07 J
Limite–
Condições. Energia da GPU na janela de inferência dividida pelos tokens de saída, conforme a fonte a define; depende fortemente do tamanho do modelo, do tamanho do lote, do contexto e do comprimento da saída. O valor atual é para um modelo denso de 1B de parâmetros, o extremo favorável da faixa.
Por que esta meta. Uma ordem de grandeza abaixo do valor atual nas mesmas condições. Oviedo et al. (Joule 2026) estimam reduções de energia de 8 a 20 vezes, já à vista, entre modelos, sistemas de serviço e hardware; 10 vezes fica dentro dessa faixa e não exige nova física de dispositivos.
Observação. Com 10 tokens de saída, a mesma configuração mede 7,46 J/token, de modo que o número só é comparável nas condições declaradas. as_of é o mês aproximado do preprint; o resumo não dá data.

Lacunas

Mover pesos e cache custa mais do que a aritmética

críticaengenhariacamada: sistemaativa

Cada token gerado transmite os pesos do modelo e o cache de chave-valor pela memória, de modo que o tráfego de memória, e não a aritmética, tende a limitar a energia por token. O melhor enlace elétrico die-to-die publicado mede 0,65 pJ/bit em um protótipo, um valor só da interface. Fechar a lacuna significa mover menos bytes (quantização, compressão de cache, atenção esparsa) e bytes mais baratos.

Mantida aberta por: Movimentação de dados de baixa energia

A decodificação é limitada pela largura de banda da memória, não pela computação

altaengenhariacamada: dispositivoativa

Lotes pequenos deixam as unidades aritméticas ociosas enquanto o sistema de memória está saturado. A energia por token medida cai de 7,46 para 0,72 J/token à medida que o comprimento da saída cresce de 10 para 512 tokens com lote 16, porque os custos fixos são amortizados; os ganhos de agrupamento em lotes diminuem à medida que o contexto cresce (6,31x com 512 tokens de contexto contra 1,17x com 4K, para 10 tokens de saída).

Mantida aberta por: Movimentação de dados de baixa energia

A lógica CMOS tem um teto de cerca de duzentas vezes a eficiência atual

médialimite fundamentalcamada: princípioaberta

Ho, Erdil e Besiroglu estimam um teto de 4,7e15 operações FP4 por joule para microprocessadores CMOS, aproximadamente duzentas vezes os microprocessadores atuais, a partir do chaveamento, da capacitância das interconexões e da fuga. O atlas ainda não tem um valor atual com fonte de FLOP por joule para aceleradores em operação, por isso esta lacuna não tem métrica própria.

Mantida aberta por: Lógica além do CMOS

A potência entregue e o resfriamento limitam a produção de tokens

médiaengenhariacamada: implantaçãoativa

Em escala de implantação, a restrição limitante pode passar da computação de pico para a potência entregue ao data center, a capacidade de resfriamento e o PUE. O resfriamento microfluídico embutido suporta cerca de 1e3 W/cm2; a densidade de potência dos aceleradores continua a subir.

Mantida aberta por: Remoção de calor de alto fluxo

Capacidade ociosa e lotes pequenos desperdiçam energia

altaengenhariacamada: implantaçãopromissora

A energia por prompt em produção inclui a capacidade ociosa das máquinas e a sobrecarga do data center, não apenas a potência ativa dos aceleradores. O Google relata uma redução de 33x na energia por prompt de texto mediano do Gemini Apps em um ano, por eficiência de software e compra de energia limpa (o resumo declara o efeito combinado sobre a energia e não separa os dois). Novos ganhos dependem de agrupamento em lotes, roteamento e escolha do modelo.

Dependências

Depende de

  • Lógica além do CMOS A aritmética no acelerador é limitada pela energia de chaveamento da lógica CMOS, que, segundo estimativas, permite apenas cerca de duzentas vezes mais eficiência do que os microprocessadores atuais.
  • Movimentação de dados de baixa energia A geração de tokens lê da memória os pesos do modelo e o cache de chave-valor a cada token, de modo que o tráfego de memória e entre chips responde por uma grande parte da energia. Necessário: Energia por bit movido entre memória e processador igual ou inferior a 0,1 pJ, de modo que transmitir os pesos custe poucos watts por terabyte por segundo.
  • Remoção de calor de alto fluxo A potência entregue e a capacidade de resfriamento limitam quantos aceleradores cabem em um rack e, portanto, os tokens produzidos por instalação.

Necessária para

  • IA para a ciência Triagem e ciclos agênticos fazem muitas chamadas de modelo por experimento, de modo que a energia e o custo por token determinam até onde os ciclos de descoberta podem escalar.
  • Interface cérebro-computador de alta largura de banda A decodificação roda uma rede neural sobre o sinal neural; rodá-la em um dispositivo vestível ou implantado exige pouca energia por inferência.

As setas vão de uma tecnologia àquilo de que ela depende. Selecione um nó para abri-lo.

Evidências

Em The Alan Machine

TOML de origem · Página no GitHub · Sugerir uma correção