Nvidia dobrou receita e ações caíram: o que muda para devs de IA

Nvidia dobrou receita e ações caíram: o que muda para devs de IA

A Nvidia reportou receita de US$ 96,22 bilhões no segundo trimestre fiscal e as ações caíram. Se você não entendeu essa contradição, leia até o final — ela revela mais sobre o ciclo atual da IA do que qualquer thread no X.

Segundo o Olhardigital.com.br, a empresa superou as projeções em lucro (US$ 2,22 vs. US$ 2,10 esperados) e receita (US$ 96,22 bi vs. US$ 92,17 bi projetados). Mesmo assim, o papel recuou no after-market. Na minha leitura, isso não é irracionalidade do mercado — é o mercado precificando o que vem depois do hype. E é exatamente aqui que mora o que interessa para quem programa.

Por que o “mais que dobrou” não é mais suficiente

Receita passou de US$ 46,7 bi para US$ 96,22 bi em um ano. Crescimento de ~106% YoY. Impressionante? Sim. Mas o consenso de Wall Street já estava precificando aceleração, não apenas manutenção. Quando uma empresa do porte da Nvidia “apenas” entrega o esperado, o múltiplo de valuation sofre. É a mesma lógica que aplicamos quando otimizamos uma query que já roda em 50ms — reduzir para 45ms não impressiona ninguém.

Para nós, devs, isso importa porque define o próximo ciclo de preços de GPUs, disponibilidade de chips e o ritmo em que provedores de cloud vão repassar custo. A Nvidia está no centro da pilha de IA — CUDA, TensorRT, NeMo, DGX, tudo passa por hardware deles. Se o capex esfria, a oferta de H100/H200/B200 em cloud aperta e o preço da hora-GPU sobe.

O movimento silencioso que ninguém comenta: Nvidia como financiador de data centers

A parte mais estratégica da matéria — e que pouca gente está prestando atenção — é a expansão da Nvidia no financiamento de infraestrutura. Segundo a CNBC, citada pelo Olhar Digital, a empresa está fornecendo garantias e acordos que viabilizam a construção de novos data centers de IA.

Traduzindo para quem trabalha com isso: a Nvidia está virando um banco de infraestrutura. Ela não vende só o chip, ela viabiliza a obra civil, a energia, o resfriamento. É o mesmo movimento que a AWS fez nos anos 2010 com créditos para Reserved Instances — subsidiar o ecossistema para travar o stack proprietário.

Implicação prática: daqui pra frente, treinar um modelo foundation em cloud vai ficar mais barato em GPU-hours, mas mais caro em lock-in de ferramentas Nvidia. Cuidado ao assinar contratos longos sem cláusula de portabilidade real — já vi empresa presa a CUDA kernel que não roda em ROCm nem com reescrita.

Na Prática: como dev, o que muda no seu pipeline de IA hoje

Vamos aterrizar. Se você roda workloads de IA em produção (ou pensa em rodar), aqui está o passo a passo que aplico nos meus projetos:

  1. Audite onde você paga GPU-hour. Liste todos os serviços cloud que cobram por GPU. Compare custo efetivo por token gerado ou por imagem inferida, não só o preço nominal.
  2. Separe inferência de treino. Treino roda spot/preemptible com H100 ou A100. Inferência roda em endpoints gerenciados com L4/T4 ou chips próprios. Misturar os dois é o erro mais caro que vejo.
  3. Use quantização agressiva no que vai pra edge. GGUF q4_k_m para LLMs locais, ONNX int8 para visão. Você ganha 4x de redução de VRAM sem perda perceptível em 90% dos casos.
  4. Cache agressivo de embeddings e prefixos. vLLM com prefix caching, ou SGLang com RadixAttention. Em produção, isso derruba custo de inferência em 60–80%.
  5. Monitore utilization real. Não a métrica bonita do dashboard. Rode nvidia-smi em loop ou use Prometheus exporter. GPU abaixo de 40% utilization = dinheiro queimando.

Exemplo real de como eu configuro monitoramento mínimo viável para um cluster de inferência:

# monitor_gpu.py — roda como sidecar no k8s
import subprocess
import time
import json
from prometheus_client import Gauge, start_http_server

gpu_util = Gauge('gpu_utilization_percent', 'GPU core utilization', ['gpu_id'])
gpu_mem = Gauge('gpu_memory_used_mb', 'GPU memory used', ['gpu_id'])

def parse_nvidia_smi():
    out = subprocess.check_output([
        'nvidia-smi',
        '--query-gpu=index,utilization.gpu,memory.used',
        '--format=csv,noheader,nounits'
    ]).decode()
    for line in out.strip().split('\n'):
        idx, util, mem = line.split(', ')
        gpu_util.labels(gpu_id=idx).set(float(util))
        gpu_mem.labels(gpu_id=idx).set(float(mem))

if __name__ == '__main__':
    start_http_server(9100)
    while True:
        parse_nvidia_smi()
        time.sleep(5)

Rode isso como DaemonSet no cluster e você tem visibilidade real. Se o gauge ficar abaixo de 30% por mais de 10 minutos em horário de produção, é bug de batching ou cliente mandando requisição uma a uma — o que custa 10x mais.

Erros comuns que devs cometem (e que o ciclo Nvidia expõe)

Lista honesta, sem filtro, do que vejo em código de produção e em decisões arquiteturais:

  • Treinar em GPU cara o que poderia ser fine-tuned em CPU. LoRA e QLoRA permitem ajustar modelos 7B–13B em uma A10 ou até em RTX 4090. Não precisa de H100 para 80% dos ajustes.
  • Escolher provedor pelo preço/hora da GPU, não pelo TCO. H100 a $2/hora parece bom até você somar egress, storage e o lock-in. Multi-cloud é caro, mas single-cloud mal escolhido é falência.
  • Ignorar o custo do contexto longo. Um LLM com 128k de contexto custa 4x mais que um com 8k, mesmo em inferência. Compressão de prompt não é otimização prematura — é economia direta.
  • Não versionar dataset e modelo junto. Quando o modelo dérift na produção, você precisa saber qual versão do dado gerou qual checkpoint. DVC, MLflow, Weights & Biases — escolha um e use.
  • Achar que CUDA é eterno. ROCm está amadurecendo, Apple Silicon tem MPS maduro para inferência, e chips de startups (Cerebras, Groq, SambaNova) já quebraram recordes de latência. Não coloque 100% do seu stack em CUDA proprietária sem plano B.

O “porquê” por trás dos números da Nvidia

Por que a Nvidia cresce mesmo com a queda das ações? Porque os data centers de hyperscalers (Azure, AWS, GCP, Meta, Oracle) continuam comprando a todo vapor. Treinar GPT-5, Gemini 2, Claude 4 — cada geração consome 5–10x mais compute que a anterior. A demanda por capacidade é inelástica no curto prazo.

O recuo das ações vem de outra conta: se a Nvidia financia data centers, ela está expondo seu balanço ao risco de crédito desses projetos. Se um hyperscaler atrasar pagamento, ou se um data center ficar ocioso, a Nvidia absorve o prejuízo. É a diferença entre ser fornecedor (recebe antecipado) e ser investidor (recebe no longo prazo, se receber). Mercado precifica o risco, não a receita.

Para nós, devs, isso significa uma coisa concreta: nos próximos 12–24 meses, a oferta de GPU em cloud deve continuar alta e os preços devem cair em termos reais. Janela boa para renegociar contratos e migrar workloads experimentais que estavam congelados por custo.

Comparação rápida: onde colocar cada workload em 2026

Cenário Melhor opção hoje Quando evitar
Treino de modelo foundation (70B+) H100/H200 cluster em cloud (RunPod, Lambda, CoreWeave) Hardware próprio. CAPEX não compensa.
Fine-tuning LoRA A100 spot ou RTX 4090/5090 local GPU K80 ou T4. Lento demais.
Inferência LLM alta vazão vLLM em L4 ou A10g, batching contínuo Endpoint serverless para tráfego < 5 req/s
Inferência baixa latência Groq, Cerebras ou GPU dedicada com cache de KV API compartilhada com limite de rate
Visão computacional edge ONNX int8 em Jetson ou Coral Enviar frame pra cloud. Latência mata.

FAQ — perguntas que devs realmente fazem

A Nvidia vai continuar crescendo nesse ritmo?

Improvável manter 100% YoY. Crescimento deve desacelerar para 40–60% nos próximos trimestres, mas isso ainda é estrondoso para uma empresa de US$ 400 bi de receita anual. A queda das ações reflete normalização, não deterioração.

Vale comprar GPU Nvidia para workstation de dev?

Se você roda modelos locais e usa o equipamento 8+ horas por dia, sim. RTX 5090 com 32GB VRAM entrega ~80% do que uma H100 custa em cloud, com payback em 6–9 meses para workloads intensos. Para uso esporádico, cloud spot é mais barato.

CUDA vai morrer?

Não no curto prazo (5+ anos). Mas a Nvidia está blindando o ecossistema com software (TensorRT, NeMo, cuDNN) justamente porque sabe que a competição em hardware (AMD MI300/MI400, Intel Gaudi, chips custom de hyperscalers) está apertando. Como dev, invista em PyTorch puro com módulos agnósticos quando possível.

O que o financiamento de data centers significa para cloud?

A Nvidia está garantindo que a oferta de IA em cloud continue crescendo mesmo se os hyperscalers apertarem o capex. Para o consumidor (nós), isso tende a manter preços competitivos. Para o ecossistema, significa lock-in mais profundo no stack Nvidia.

Devo aprender CUDA em 2026?

Depende. Para 95% dos devs de IA, não. PyTorch + kernels prontos resolvem. Para quem trabalha em otimização de inferência, treinamento de modelos grandes ou pesquisa, sim — e é uma skill raríssima e bem paga. Comece com CUDA Zone oficial e o livro “Programming Massively Parallel Processors”.

Fechando

A Nvidia dobrou a receita, mas o mercado leu nas entrelinhas: financiar data centers é assumir risco novo. Para quem programa IA em produção, o recado é claro — otimize o que já roda, diversifique o stack quando possível e fique de olho nos movimentos de capacidade nos próximos trimestres. A janela de preços baixos em GPU cloud não vai durar pra sempre.

Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.

Y

Yuri Sousa

Front-End Developer / Designer

Desenvolvedor apaixonado por criar experiências digitais acessíveis e visualmente perfeitas. Escrevo sobre desenvolvimento web, design e tecnologia.