A Nvidia reportou receita de US$ 96,22 bilhões no segundo trimestre fiscal e as ações caíram. Se você não entendeu essa contradição, leia até o final — ela revela mais sobre o ciclo atual da IA do que qualquer thread no X.
Segundo o Olhardigital.com.br, a empresa superou as projeções em lucro (US$ 2,22 vs. US$ 2,10 esperados) e receita (US$ 96,22 bi vs. US$ 92,17 bi projetados). Mesmo assim, o papel recuou no after-market. Na minha leitura, isso não é irracionalidade do mercado — é o mercado precificando o que vem depois do hype. E é exatamente aqui que mora o que interessa para quem programa.
Por que o “mais que dobrou” não é mais suficiente
Receita passou de US$ 46,7 bi para US$ 96,22 bi em um ano. Crescimento de ~106% YoY. Impressionante? Sim. Mas o consenso de Wall Street já estava precificando aceleração, não apenas manutenção. Quando uma empresa do porte da Nvidia “apenas” entrega o esperado, o múltiplo de valuation sofre. É a mesma lógica que aplicamos quando otimizamos uma query que já roda em 50ms — reduzir para 45ms não impressiona ninguém.
Para nós, devs, isso importa porque define o próximo ciclo de preços de GPUs, disponibilidade de chips e o ritmo em que provedores de cloud vão repassar custo. A Nvidia está no centro da pilha de IA — CUDA, TensorRT, NeMo, DGX, tudo passa por hardware deles. Se o capex esfria, a oferta de H100/H200/B200 em cloud aperta e o preço da hora-GPU sobe.
O movimento silencioso que ninguém comenta: Nvidia como financiador de data centers
A parte mais estratégica da matéria — e que pouca gente está prestando atenção — é a expansão da Nvidia no financiamento de infraestrutura. Segundo a CNBC, citada pelo Olhar Digital, a empresa está fornecendo garantias e acordos que viabilizam a construção de novos data centers de IA.
Traduzindo para quem trabalha com isso: a Nvidia está virando um banco de infraestrutura. Ela não vende só o chip, ela viabiliza a obra civil, a energia, o resfriamento. É o mesmo movimento que a AWS fez nos anos 2010 com créditos para Reserved Instances — subsidiar o ecossistema para travar o stack proprietário.
Implicação prática: daqui pra frente, treinar um modelo foundation em cloud vai ficar mais barato em GPU-hours, mas mais caro em lock-in de ferramentas Nvidia. Cuidado ao assinar contratos longos sem cláusula de portabilidade real — já vi empresa presa a CUDA kernel que não roda em ROCm nem com reescrita.
Na Prática: como dev, o que muda no seu pipeline de IA hoje
Vamos aterrizar. Se você roda workloads de IA em produção (ou pensa em rodar), aqui está o passo a passo que aplico nos meus projetos:
- Audite onde você paga GPU-hour. Liste todos os serviços cloud que cobram por GPU. Compare custo efetivo por token gerado ou por imagem inferida, não só o preço nominal.
- Separe inferência de treino. Treino roda spot/preemptible com H100 ou A100. Inferência roda em endpoints gerenciados com L4/T4 ou chips próprios. Misturar os dois é o erro mais caro que vejo.
- Use quantização agressiva no que vai pra edge. GGUF q4_k_m para LLMs locais, ONNX int8 para visão. Você ganha 4x de redução de VRAM sem perda perceptível em 90% dos casos.
- Cache agressivo de embeddings e prefixos. vLLM com prefix caching, ou SGLang com RadixAttention. Em produção, isso derruba custo de inferência em 60–80%.
- Monitore utilization real. Não a métrica bonita do dashboard. Rode
nvidia-smiem loop ou use Prometheus exporter. GPU abaixo de 40% utilization = dinheiro queimando.
Exemplo real de como eu configuro monitoramento mínimo viável para um cluster de inferência:
# monitor_gpu.py — roda como sidecar no k8s
import subprocess
import time
import json
from prometheus_client import Gauge, start_http_server
gpu_util = Gauge('gpu_utilization_percent', 'GPU core utilization', ['gpu_id'])
gpu_mem = Gauge('gpu_memory_used_mb', 'GPU memory used', ['gpu_id'])
def parse_nvidia_smi():
out = subprocess.check_output([
'nvidia-smi',
'--query-gpu=index,utilization.gpu,memory.used',
'--format=csv,noheader,nounits'
]).decode()
for line in out.strip().split('\n'):
idx, util, mem = line.split(', ')
gpu_util.labels(gpu_id=idx).set(float(util))
gpu_mem.labels(gpu_id=idx).set(float(mem))
if __name__ == '__main__':
start_http_server(9100)
while True:
parse_nvidia_smi()
time.sleep(5)
Rode isso como DaemonSet no cluster e você tem visibilidade real. Se o gauge ficar abaixo de 30% por mais de 10 minutos em horário de produção, é bug de batching ou cliente mandando requisição uma a uma — o que custa 10x mais.
Erros comuns que devs cometem (e que o ciclo Nvidia expõe)
Lista honesta, sem filtro, do que vejo em código de produção e em decisões arquiteturais:
- Treinar em GPU cara o que poderia ser fine-tuned em CPU. LoRA e QLoRA permitem ajustar modelos 7B–13B em uma A10 ou até em RTX 4090. Não precisa de H100 para 80% dos ajustes.
- Escolher provedor pelo preço/hora da GPU, não pelo TCO. H100 a $2/hora parece bom até você somar egress, storage e o lock-in. Multi-cloud é caro, mas single-cloud mal escolhido é falência.
- Ignorar o custo do contexto longo. Um LLM com 128k de contexto custa 4x mais que um com 8k, mesmo em inferência. Compressão de prompt não é otimização prematura — é economia direta.
- Não versionar dataset e modelo junto. Quando o modelo dérift na produção, você precisa saber qual versão do dado gerou qual checkpoint. DVC, MLflow, Weights & Biases — escolha um e use.
- Achar que CUDA é eterno. ROCm está amadurecendo, Apple Silicon tem MPS maduro para inferência, e chips de startups (Cerebras, Groq, SambaNova) já quebraram recordes de latência. Não coloque 100% do seu stack em CUDA proprietária sem plano B.
O “porquê” por trás dos números da Nvidia
Por que a Nvidia cresce mesmo com a queda das ações? Porque os data centers de hyperscalers (Azure, AWS, GCP, Meta, Oracle) continuam comprando a todo vapor. Treinar GPT-5, Gemini 2, Claude 4 — cada geração consome 5–10x mais compute que a anterior. A demanda por capacidade é inelástica no curto prazo.
O recuo das ações vem de outra conta: se a Nvidia financia data centers, ela está expondo seu balanço ao risco de crédito desses projetos. Se um hyperscaler atrasar pagamento, ou se um data center ficar ocioso, a Nvidia absorve o prejuízo. É a diferença entre ser fornecedor (recebe antecipado) e ser investidor (recebe no longo prazo, se receber). Mercado precifica o risco, não a receita.
Para nós, devs, isso significa uma coisa concreta: nos próximos 12–24 meses, a oferta de GPU em cloud deve continuar alta e os preços devem cair em termos reais. Janela boa para renegociar contratos e migrar workloads experimentais que estavam congelados por custo.
Comparação rápida: onde colocar cada workload em 2026
| Cenário | Melhor opção hoje | Quando evitar |
|---|---|---|
| Treino de modelo foundation (70B+) | H100/H200 cluster em cloud (RunPod, Lambda, CoreWeave) | Hardware próprio. CAPEX não compensa. |
| Fine-tuning LoRA | A100 spot ou RTX 4090/5090 local | GPU K80 ou T4. Lento demais. |
| Inferência LLM alta vazão | vLLM em L4 ou A10g, batching contínuo | Endpoint serverless para tráfego < 5 req/s |
| Inferência baixa latência | Groq, Cerebras ou GPU dedicada com cache de KV | API compartilhada com limite de rate |
| Visão computacional edge | ONNX int8 em Jetson ou Coral | Enviar frame pra cloud. Latência mata. |
FAQ — perguntas que devs realmente fazem
A Nvidia vai continuar crescendo nesse ritmo?
Improvável manter 100% YoY. Crescimento deve desacelerar para 40–60% nos próximos trimestres, mas isso ainda é estrondoso para uma empresa de US$ 400 bi de receita anual. A queda das ações reflete normalização, não deterioração.
Vale comprar GPU Nvidia para workstation de dev?
Se você roda modelos locais e usa o equipamento 8+ horas por dia, sim. RTX 5090 com 32GB VRAM entrega ~80% do que uma H100 custa em cloud, com payback em 6–9 meses para workloads intensos. Para uso esporádico, cloud spot é mais barato.
CUDA vai morrer?
Não no curto prazo (5+ anos). Mas a Nvidia está blindando o ecossistema com software (TensorRT, NeMo, cuDNN) justamente porque sabe que a competição em hardware (AMD MI300/MI400, Intel Gaudi, chips custom de hyperscalers) está apertando. Como dev, invista em PyTorch puro com módulos agnósticos quando possível.
O que o financiamento de data centers significa para cloud?
A Nvidia está garantindo que a oferta de IA em cloud continue crescendo mesmo se os hyperscalers apertarem o capex. Para o consumidor (nós), isso tende a manter preços competitivos. Para o ecossistema, significa lock-in mais profundo no stack Nvidia.
Devo aprender CUDA em 2026?
Depende. Para 95% dos devs de IA, não. PyTorch + kernels prontos resolvem. Para quem trabalha em otimização de inferência, treinamento de modelos grandes ou pesquisa, sim — e é uma skill raríssima e bem paga. Comece com CUDA Zone oficial e o livro “Programming Massively Parallel Processors”.
Fechando
A Nvidia dobrou a receita, mas o mercado leu nas entrelinhas: financiar data centers é assumir risco novo. Para quem programa IA em produção, o recado é claro — otimize o que já roda, diversifique o stack quando possível e fique de olho nos movimentos de capacidade nos próximos trimestres. A janela de preços baixos em GPU cloud não vai durar pra sempre.
Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.