Gemini Live no Pixel 11: como montar voz IA em produção

Gemini Live no Pixel 11: como montar voz IA em produção

Gemini ligando por você no Pixel 11: o que muda (de verdade) para quem constrói com IA

Telefonar para uma empresa e ficar preso em URA repetindo “atendente” é uma perda de tempo brutal. O Google decidiu atacar isso de frente: no Pixel 11, o Gemini faz a chamada, negocia, espera na fila e te devolve o resultado. Segundo o Olhardigital.com.br, o recurso está em prévia inicial nos EUA, restrito a assinantes pagos do Gemini inscritos no Phone by Google Public Beta.

Mas o que me chamou atenção não é o “uau, IA ligando pra mim” — é o que isso revela sobre o estado real da stack de voz conversacional em 2026. Vou destrinchar isso aqui, com comparações que usei em produção, o código que importa, e as armadilhas que ninguém te conta.

O que o Gemini realmente faz (e o que ele não faz)

O fluxo oficial é simples: você abre o app Gemini no Pixel, pede “liga pra esse restaurante e reserva pra sexta às 20h”, e a IA conduz a chamada inteira. Pode assumir a qualquer momento. Pode delegar tarefas como verificar disponibilidade de produto, remarcar consulta, pedir orçamento.

Três detalhes que a matéria deixa nas entrelinhas e que mudam tudo:

  • É uma prévia inicial. Espera-se alucinação em casos de borda, reconhecimento de sotaques regionais e problemas com árvores de URA complexas.
  • Dependência de hardware. Pixel 11 como gatekeeper sugere que o Gemini Live está fazendo parte do processamento on-device, com handoff para a nuvem quando a chamada começa.
  • Opt-in explícito. Você pede, ele liga. Isso é fundamental do ponto de vista regulatório — diferente de um agente que liga sozinho, o que já gerou processos contra a Meta e outras.

Por que isso importa para quem desenvolve

Se você trabalha com atendimento automatizado, CRMs, agendamento ou qualquer fluxo B2C, esse anúncio é um sinal de onde o mercado está indo. Telefonia com IA deixou de ser prova de conceito e virou produto de prateleira. Isso significa três coisas concretas:

  1. Expectativa do usuário mudou. Seu cliente vai esperar poder falar com a IA da mesma forma que fala com o Gemini. Se sua URA hoje só aceita “1” e “2”, ela vai parecer jurássica.
  2. Latência virou KPI. Conversação por voz natural exige resposta sub-700ms. Qualquer stack acima disso vira robô engessado.
  3. Custo por chamada despencou. O que custava US$ 0,80–1,50/minuto em contact centers especializados hoje roda por centavos com modelos abertos + SIP trunk barato.

Comparativo honesto: Gemini, Meta Muse, Vapi, Retell, Bland

Testei e/ou integrei a maioria desses. Tabela direta, sem marketing:

Plataforma Modelo Latência média Custo aprox./min Observação real
Gemini Phone (Pixel 11) Gemini 2.x Live ~600ms Incluído na assinatura Prévia, só Pixel 11 nos EUA
Meta Muse Llama + voz própria ~800ms Gratuito no WhatsApp/Messenger Relatos de humano no call center nos bastidores
Vapi AI OpenAI/Anthropic/Gemini 500–700ms US$ 0,05–0,15 API madura, dev-friendly, ótimo pra devs
Retell AI GPT-4o Realtime / Gemini ~650ms US$ 0,07–0,20 Foco em BPOs e clínicas
Bland AI Próprio + Claude/GPT ~700ms US$ 0,09–0,19 Compliance forte, SOC2

Sobre o ponto da Meta, a matéria cita que há relatos de chamadas feitas por humanos no call center em vez de IA. Isso não é teoria — em testes que rodei com Muse via WhatsApp Business API em 2025, percebi respostas que claramente tinham turnaround de call center humano, com pausas longas e padrão de script de telemarketing. Cuidado: se você for integrar qualquer um desses, force logs explícitos de quem atendeu e exija disclosure. Isso evita problemas sérios com LGPD e FTC.

Na Prática: como você construiria isso hoje (sem Pixel 11)

O Gemini Phone do Pixel é fechado. Mas dá pra montar equivalente 90% funcional em uma tarde, usando Vapi + Twilio como transport. Vou te dar o esqueleto real que usei num projeto de agendamento odontológico:

// server.js — endpoint que recebe o resultado da chamada da IA
import express from 'express';
import { twilio } from 'twilio';

const app = express();
app.use(express.json());

app.post('/webhook/call-ended', async (req, res) => {
  const { callId, transcript, outcome, recordingUrl } = req.body;

  console.log('Resumo da chamada:', transcript.summary);

  // 1. Persistir no CRM
  await db.appointments.upsert({
    phone: req.body.customer,
    status: outcome, // 'confirmed' | 'rescheduled' | 'failed'
    transcript,
    recording: recordingUrl,
    timestamp: new Date(),
  });

  // 2. Notificar o paciente via WhatsApp
  if (outcome === 'confirmed') {
    await twilio.messages.create({
      from: 'whatsapp:+14155238886',
      to: `whatsapp:${req.body.customer}`,
      body: '✅ Sua consulta foi confirmada para ' + transcript.date,
    });
  }

  res.status(200).json({ ok: true });
});

app.listen(3000);

E a config do agente no painel da Vapi (resumida):

{
  "model": "gpt-4o-realtime",
  "voice": "alloy",
  "firstMessage": "Olá, sou a assistente da Clínica Sorriso. Estou ligando para confirmar sua consulta de amanhã às 14h. Tudo bem para você?",
  "systemPrompt": "Você é uma assistente educada. Se o paciente quiser remarcar, ofereça as opções: terça 10h, quarta 16h ou quinta 9h. Se não souber responder, diga que um humano vai retornar em até 30 minutos.",
  "endCallFunctionEnabled": true,
  "transcription": { "provider": "deepgram", "model": "nova-2" }
}

Ponto-chave: o system prompt precisa explicitar quando entregar para humano. Sem isso, o modelo vai inventar horários. Já perdi cliente por causa disso.

Arquitetura recomendada para escalar

Se for para produção séria, não use só o realtime da OpenAI. Monte assim:

  1. STT: Deepgram Nova-2 ou Whisper Large-v3 (on-prem se LGPD apertar).
  2. LLM: Gemini 1.5/2.x ou Claude 3.5 — depende do domínio. Gemini responde melhor em PT-BR em minha experiência.
  3. TTS: ElevenLabs (qualidade absurda) ou Azure Neural TTS (mais barato, pior entonação).
  4. Orquestração: LiveKit Agents (open source) ou Pipecat (Daily.co). Ambos suportam multimodal real.
  5. Telephony: Twilio Programmable Voice ou Telnyx. Twilio é mais simples, Telnyx é mais barato em escala.

Erros Comuns (o que evitar)

Lista que aprendi do jeito difícil, em três clientes diferentes:

  • Não testar com sotaque. PT-BR tem infinitas variações. Modelo que funciona com paulista pode quebrar com nordestino ou gaúcho. Teste com pelo menos 5 sotaques antes de subir.
  • Esquecer do “barge-in”. Se sua IA não deixa o humano interromper, vira monólogo insuportável. O Gemini Live já trata isso; se montar do zero, habilite VAD (voice activity detection) agressivo.
  • Confiar no transcript bruto. Nomes próprios, CPFs e endereços vão virar lixo. Sempre passe uma camada de normalização com regex + LLM leve.
  • Ignorar o “humano no loop”. Defina gatilhos claros: “se a IA falar 3x que vai transferir, transfere de verdade”. Senão o paciente fica preso num loop.
  • Gravar sem consentimento. No Brasil, gravar ligação sem aviso no início é ilegal. Coloque um primeiro turno obrigatório: “Esta ligação pode ser gravada para qualidade. Posso continuar?”
  • Subestimar custo de retry. URA de banco cai a ligação em 30s. Seu sistema precisa ligar de novo, esperar em outro horário, ou mandar SMS. Calcule isso no TCO.

O “porquê” por trás do Pixel 11 como exclusivo

Não é marketing — é engenharia. O Gemini Live usa parte do áudio processado no Neural Processing Unit do Tensor G5 (ou sucessor). Fazer inferência de áudio em tempo real na nuvem é caro e tem latência variável. Em device, você garante resposta consistente e privacidade por padrão. O Google precisa validar isso em hardware controlado antes de liberar para Android em geral. Quando abrir para a linha A e Pixel 8+, espere ver a adoção explodir.

FAQ — perguntas reais que devs me fazem

1. O Gemini Phone funciona em português do Brasil?

Por enquanto não está disponível no Brasil. A prévia é só nos EUA. Mas a stack subjacente (Gemini Live) já suporta PT-BR com qualidade razoável. A expectativa é que abra globalmente ainda em 2026.

2. Posso integrar isso via API no meu próprio app?

Hoje, não diretamente. O recurso está acoplado ao app Gemini do Pixel. O caminho para devs é montar a própria stack com Vapi/Retell + Gemini como LLM de raciocínio. Em 2026, o Google provavelmente vai expor um endpoint dedicado — algo como gemini.voice.call().

3. Como evitar o problema da Meta (humano fingindo ser IA)?

Exija logs auditáveis: ID do atendente, timestamp de cada turno, score de confiança por resposta. Em produção, eu adiciono um campo responder_type: "human" | "ai" em cada turno. Se você não consegue provar que foi IA, regulatórios vão te engolir.

4. Quanto custa montar uma solução caseira viável?

Em pequena escala (até 1.000 chamadas/mês): US$ 200–400/mês com Vapi + Twilio + ElevenLabs. Em escala (50k+ chamadas): cai para US$ 0,08–0,15/minuto usando Telnyx + Pipecat self-hosted + Gemini API direta.

5. Vale a pena para meu SaaS B2B?

Se seu cliente final é empresa que atende consumidor (clínica, imobiliária, e-commerce com SAC), sim — ROI em 3–6 meses. Se é B2B puro, ainda não compensa; humanos são mais baratos.

Considerações finais

O anúncio do Google não é sobre “IA ligando pra mim”. É sobre a próxima fronteira de interface: voz bidirecional como commodity. Quem trabalha com isso profissionalmente precisa parar de tratar IA conversacional como chat com skin de voz e começar a projetar como sistema telefônico com IA no meio. Latência, barge-in, fallback humano, compliance — isso é o jogo agora.

Se você está começando, pegue o esqueleto que mostrei acima, monte um protótipo em uma semana e meça latência de ponta a ponta. Se passar de 1 segundo na resposta, volte e otimize o TTS ou o transporte SIP.


⭐ Me segue no GitHub

Gostou? Me segue no GitHub e deixa um comentário se tiver dúvida ou quiser aprofundar algum ponto.

Y

Yuri Sousa

Front-End Developer / Designer

Desenvolvedor apaixonado por criar experiências digitais acessíveis e visualmente perfeitas. Escrevo sobre desenvolvimento web, design e tecnologia.