Nvidia R$ 2,5 trilhões em IA: como calcular custo por token

Nvidia R$ 2,5 trilhões em IA: como calcular custo por token

Na minha leitura, o movimento mais importante não é a Nvidia correr atrás de R$ 2,5 trilhões. É a tentativa de transformar data centers de IA em ativos financiáveis, com receita contratual e vida útil longa. Para quem programa, isso muda a pergunta: em vez de discutir apenas qual modelo é mais inteligente, vamos discutir qual workload consegue pagar por cada token, cada GPU e cada megawatt.

Quando o capital financeiro entra na infraestrutura, desempenho técnico e fluxo de caixa passam a ser o mesmo problema. Uma aplicação pode ser brilhante e, ainda assim, ser um péssimo negócio se ignorar latência, ociosidade, refrigeração, rede e custo de capital.

O que a Nvidia está tentando fazer em Wall Street

Segundo o Olhar Digital, a Nvidia anunciou uma parceria com seis grandes instituições financeiras para criar plataformas de financiamento de computação voltadas à infraestrutura de inteligência artificial. A meta é mobilizar mais de US$ 500 bilhões — cerca de R$ 2,5 trilhões na conversão usada pela matéria — em capital de terceiros ao longo do tempo.

Os memorandos de entendimento foram assinados com Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs e KRR. O uso de “plataformas” é importante. Não estamos falando de uma transferência única de R$ 2,5 trilhões para a conta da Nvidia. A estrutura final pode envolver diferentes combinações de dívida, equity, leasing e financiamento de projetos, mas os termos ainda não foram detalhados.

Eu não trataria esse valor como um pedido de compra já confirmado. A Nvidia está criando um mecanismo para conectar três partes que normalmente se movem em velocidades diferentes:

  • Fabricantes de tecnologia: fornecem GPUs, CPUs, redes, sistemas de armazenamento e software.
  • Operadores de data centers: precisam construir ou adaptar instalações, contratar energia e manter a operação.
  • Investidores institucionais: procuram ativos de grande porte, contratos previsíveis e alguma proteção contra a obsolescência tecnológica.

Na prática, a Nvidia tenta organizar o mercado inteiro ao redor de uma pergunta simples: quem paga pela capacidade computacional antes que ela seja construída? Essa é uma mudança relevante porque o data center não pode ser ligado como um notebook. Energia, refrigeração, licenças, conexão de rede e construção civil precisam existir antes da primeira chamada a uma API de inferência.

R$ 2,5 trilhões de infraestrutura de IA: o que está incluído?

Outro ponto que costuma ser esquecido: os mais de US$ 500 bilhões são uma meta de mobilização ao longo do tempo. Não devem ser comparados diretamente com os mais de US$ 730 bilhões que, segundo a matéria, as grandes empresas de tecnologia devem investir em IA neste ano. Os dois números se sobrepõem, mas não representam a mesma coisa.

Camada O que precisa ser financiado Risco para a operação
Aceleradores GPUs, CPUs, memória e placas aceleradoras Obsolescência,供应不足 e preço da nova geração
Rede Switches, fibra, InfiniBand ou Ethernet de alta velocidade Latência, gargalos e falhas entre máquinas
Energia e refrigeração Subestações, no-break, refrigeração líquida e redundância Disponibilidade, PUE e tempo de ativação
Armazenamento Object storage, checkpoints e datasets I/O, retenção e recuperação de falhas
Operação Salas, segurança, técnicos, peças de reposição e monitoramento Dependência de equipes especializadas

Uma GPU é apenas uma parte do custo. Um cluster de treinamento pode depender de armazenamento de alta vazão, rede de baixa latência, memória HBM, switches, cabos e um sistema elétrico capaz de entregar dezenas de quilowatts por rack. Se a rede for mal dimensionada, adicionar mais GPUs pode apenas aumentar o tempo ocioso.

Por isso, o preço de uma GPU não deve ser analisado isoladamente. O indicador correto é o custo por tarefa útil: tokens processados, imagens geradas, requisições concluídas ou horas de treinamento entregues com uma determinada latência. Eu usaria esta fórmula em qualquer decisão séria:

custo por 1 milhão de tokens = custo mensal total ÷ tokens processados × 1.000.000

Por que data center de IA virou produto financeiro

Treinamento e inferência têm economias diferentes. Um treinamento pode consumir um cluster inteiro durante semanas, com picos de demanda e pouca capacidade ociosa. Já a inferência pode operar 24 horas por dia, mas possui picos horários, variações no tamanho dos prompts e requisitos de latência bem diferentes.

Para uma instituição financeira, um workload de inferência com demanda contratual costuma ser mais fácil de modelar do que um projeto que depende de uma única empresa iniciar vários treinamentos no mesmo trimestre. É provável que as plataformas valorizem contratos de reserva e estruturas de “take-or-pay”, mas isso é uma leitura de lógica financeira, não um detalhe confirmado nos memorandos.

Também existe um descompasso entre a vida útil dos ativos. Um edifício, uma subestação e uma planta de refrigeração podem durar muitos anos. Uma geração de aceleradores pode perder valor comercial em poucos anos. O investidor precisa acreditar que o ativo poderá ser atualizado, reutilizado ou vendido para workloads menos exigentes.

Esse é o motivo pelo qual energia e localização importam tanto. GPUs podem ser transportadas, mas megawatts não. Uma instalação bem posicionada, com acesso à rede elétrica e contratos de energia previsíveis, vale mais do que um terreno barato sem capacidade de供电. A cloud não elimina esse problema: apenas transfere o custo para o provedor e, em algum momento, para o preço pago pelo cliente.

Cloud, neocloud, colocation ou projeto próprio?

A escolha não precisa ser “GPU da Nvidia contra CPU”. Na minha experiência, o melhor modelo depende da previsibilidade do workload e da capacidade da equipe de operar infraestrutura.

Modelo Vantagem Custo oculto Quando faz sentido
Cloud hyperscaler Elasticidade e implantação rápida Preço recorrente, cotas e dependência de região Demanda variável ou inicial
Neocloud de GPU GPUs recentes e foco em workloads de IA Mercado menos consolidado e capacidade variável Equipes que querem GPU sem comprar hardware
Colocation Controle do hardware e espaço físico tercerizado Energia, refrigeração, rede e operação continuam por conta da empresa Instalação estável e equipe técnica disponível
Leasing ou projeto financiado Preserva capital de giro e permite escala Compromisso de longo prazo e risco de obsolescência Workload bem medido e demanda recorrente

Financiar a infraestrutura pode tornar a quarta alternativa mais acessível, mas não transforma um workload ruim em bom. Se a equipe usa 5% de um cluster durante a maior parte do dia, o projeto continuará com o mesmo problema de ociosidade. O capital apenas adia a conta.

O que muda para quem desenvolve software de IA

Eu observo uma mudança prática: o benchmark técnico precisa vir acompanhado de benchmark financeiro. Um sistema que entrega 2.000 tokens por segundo pode ser uma péssima escolha se a fila está grande, o consumo de memória explode e o contrato de energia cobra capacidade não utilizada.

  • Meça custo por tarefa concluída: some retries, tokens de entrada e saída, armazenamento, rede e chamadas de ferramentas.
  • Use latência p95 e p99: a média esconde filas e timeouts que quebram a experiência de uma aplicação web.
  • Modele a ociosidade: GPU desligada ou subutilizada é custo fixo, não capacidade “gratuita”.
  • Evite dependência cega de CUDA: kernels, NCCL, TensorRT e operadores específicos podem dificultar migrar para ROCm, TPU, CPU ou outro provedor.

Para uma aplicação web, eu começaria com streaming, timeout explícito, fila assíncrona e fallback para um modelo menor. RAG, cache de contexto, quantização, roteamento entre modelos e processamento em lote também costumam entregar mais economia do que simplesmente contratar uma GPU maior.

Outro cuidado é preservar portabilidade. Use uma camada de abstração para o provedor, exporte modelos quando possível e teste uma alternativa não Nvidia antes de escolher uma operação crítica. Isso não significa abandonar CUDA; significa evitar que uma decisão de infraestrutura vire uma decisão irreversível de produto.

Na prática: calcule o ponto de equilíbrio antes de comprar GPU

Imagine um nó com oito GPUs, US$ 1,2 milhão de investimento, 35 kW de potência de TI, vida útil contábil de três anos e 3.000 tokens por segundo para um workload específico. São valores hipotéticos, não cotação de mercado. O objetivo é mostrar o raciocínio.

  1. Defina a unidade de trabalho: no exemplo, um token processado, combinando entrada e saída.
  2. Meça o throughput real: use sequência média, concorrência, quantização e tamanho de batch do seu workload.
  3. Inclua CapEx e OpEx: depreciation, manutenção, energia, PUE e custo de capital.
  4. Compare com uma API: use o preço efetivo depois de descontos, limites e chamadas desperdiçadas.
  5. Teste o pior caso: calcule o custo quando o volume cai e quando a fila estoura.
from dataclasses import dataclass


@dataclass
class Deployment:
    capex_usd: float = 1_200_000
    useful_life_months: int = 36
    monthly_tokens: float = 300_000_000
    throughput_tokens_per_sec: float = 3_000
    utilization: float = 0.70
    it_power_kw: float = 35
    pue: float = 1.25
    electricity_usd_per_kwh: float = 0.08
    annual_maintenance_rate: float = 0.03
    api_usd_per_million_tokens: float = 3.00

    def monthly_fixed_cost(self) -> float:
        depreciation = self.capex_usd / self.useful_life_months
        maintenance = self.capex_usd * self.annual_maintenance_rate / 12
        return depreciation + maintenance

    def monthly_power_cost(self) -> float:
        hours_per_month = 730
        return (
            self.it_power_kw
            * self.pue
            * hours_per_month
            * self.electricity_usd_per_kwh
        )

    def monthly_capacity_tokens(self) -> float:
        hours_per_month = 730
        return (
            self.throughput_tokens_per_sec
            * 3600
            * 24
            * hours_per_month
            * self.utilization
        )

    def monthly_self_hosting_cost(self) -> float:
        return self.monthly_fixed_cost() + self.monthly_power_cost()

    def monthly_api_cost(self) -> float:
        return (
            self.monthly_tokens
            / 1_000_000
            * self.api_usd_per_million_tokens
        )

    def self_hosting_cost_per_million_tokens(self) -> float:
        return (
            self.monthly_self_hosting_cost()
            * 1_000_000
            / self.monthly_tokens
        )

    def break_even_monthly_tokens(self) -> float:
        return (
            self.monthly_self_hosting_cost()
            / self.api_usd_per_million_tokens
            * 1_000_000
        )


if __name__ == "__main__":
    deployment = Deployment()

    print(
        f"TCO mensal: US$ {deployment.monthly_self_hosting_cost():,.2f}"
    )
    print(f"API mensal: US$ {deployment.monthly_api_cost():,.2f}")
    print(
        f"Capacidade: {deployment.monthly_capacity_tokens():,.0f} tokens/mês"
    )
    print(
        f"Break-even: {deployment.break_even_monthly_tokens():,.0f} tokens/mês"
    )
    print(
        f"Self-hosting: US$ "
        f"{deployment.self_hosting_cost_per_million_tokens():.2f}/M tokens"
    )

    if deployment.monthly_tokens > deployment.monthly_capacity_tokens():
        print("ATENCAO: o volume excede a capacidade estimada.")

Com esses dados, o custo mensal simplificado fica em aproximadamente US$ 38,9 mil: cerca de US$ 36,3 mil de custo fixo e US$ 2,6 mil de energia. Para 300 milhões de tokens, o custo self-hosted fica em torno de US$ 129,63 por milhão, contra uma API hipotética de US$ 3 por milhão.

O ponto de equilíbrio calculado é de aproximadamente 12,96 bilhões de tokens por mês. O número não é uma recomendação de compra. Ele mostra como a utilização e o preço da API mudam completamente a decisão. O código ainda não inclui equipe, impostos, juros, armazenamento, rede, redundância, licenças e perdas de capacidade.

Erros comuns ao avaliar infraestrutura de IA

  • Tratar o financiamento como dinheiro já liberado: memorandos de entendimento não equivalem a contratos finais ou capital imediatamente disponível.
  • Comparar US$ 500 bilhões com US$ 730 bilhões: um é capital potencial ao longo do tempo; o outro é uma estimativa de gastos do setor em um período específico.
  • Comprar GPU pelo pico de FLOPS: memória, largura de banda, comunicação entre dispositivos e latência podem dominar o resultado.
  • Ignorar energia, PUE e refrigeração: uma sala sem potência disponível ou sem散热 adequado não entrega GPU útil.
  • Usar benchmark de laboratório: prompts curtos em batch único não representam usuários reais, picos de tráfego e sessões longas.
  • Fixar toda a stack em CUDA: a migração fica mais difícil quando kernels, operadores e pipelines dependem de uma única fabricante.
  • Esquecer o custo de oportunidade: capital preso em hardware ocioso poderia financiar produto, dados, segurança ou aquisição de clientes.

Minha leitura sobre o próximo ciclo

Eu vejo a iniciativa da Nvidia como uma resposta a um problema real: a construção de capacidade de IA exige tanto dinheiro quanto tecnologia. A fabricante possui o ecossistema de software mais consolidado, mas não controla toda a energia, toda a construção civil e todo o crédito necessário para sustentar esse crescimento.

As instituições financeiras estão entrando porqueデータ centers podem oferecer receita recorrente, contratos de longo prazo e uma camada de ativos físicos. O risco é que a demanda não seja均匀, a próxima geração de chips deprecie o investimento mais rápido do que o esperado ou os custos de energia subam.

Para nós, desenvolvedores, o efeito mais imediato não será um GPU gratuito. Será uma oferta maior de capacidade, novos modelos de leasing, mais especialização entre provedores e uma cobrança cada vez maior por eficiência. A equipe que mede tokens por dólar, latência por watt e receita por workload terá uma vantagem enorme.

FAQ: Nvidia e os US$ 500 bilhões para infraestrutura de IA

A Nvidia está emprestando US$ 500 bilhões?

Não necessariamente. A Nvidia assinou memorandos com seis instituições para estabelecer plataformas que podem mobilizar capital de terceiros. Os valores não significam um empréstimo único, uma transferência imediata nem US$ 500 bilhões no caixa da empresa.

Isso significa que o preço das GPUs vai cair?

Não há garantia. Mais financiamento pode aumentar a oferta de data centers e reduzir gargalos, mas também pode financiar a compra de uma nova geração de hardware. Preço depende de utilization, energia, depreciação, demanda e das margens dos provedores.

Devo comprar GPUs para minha aplicação?

Eu só consideraria hardware próprio quando houvesse demanda previsível, alta utilização, requisitos claros de privacidade ou latência e equipe para operar o ambiente. Para workloads variáveis, cloud ou neocloud costuma ser mais seguro financeiramente.

Qual métrica um desenvolvedor deveria acompanhar?

Começaria por custo por tarefa concluída, tokens por segundo, p95 e p99 de latência, consumo por requisição, taxa de erro, tamanho da fila, cache hit e percentual de utilização do cluster. Um FLOPS isolado não explica o custo do produto.

AMD, TPU, CPU e edge podem substituir a Nvidia?

Podem ser alternativas reais para partes específicas do workload. O ecossistema CUDA ainda é uma vantagem competitiva enorme da Nvidia, mas eu manteria os modelos e pipelines testáveis em mais de um backend. Portabilidade é uma decisão de engenharia, não uma discussão religiosa.

Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.

Y

Yuri Sousa

Front-End Developer / Designer

Desenvolvedor apaixonado por criar experiências digitais acessíveis e visualmente perfeitas. Escrevo sobre desenvolvimento web, design e tecnologia.