A pesquisa por voz em 2026 é AEO com três restrições: 30 a 50 palavras, pergunta conversacional, uma fonte só. Não é um canal autónomo nem exige uma estratégia separada. É um multiplicador do trabalho de otimização para respostas que já está a ser feito, com um custo marginal baixo.
Menos do que os artigos de tendências prometeram, e mais do que dá para ignorar.
Há cerca de 8,4 mil milhões de assistentes de voz ativos no mundo, um número maior que a população humana, porque cada pessoa carrega vários (telefone, carro, coluna, televisão, relógio). A utilização real está bastante abaixo disso: cerca de 35% dos adultos nos Estados Unidos têm um smart speaker em casa, segundo os dados compilados pela DigitalApplied em 2026, e as estimativas de quota de pesquisa falada variam entre 20% e 31% dependendo de quem conta e do que conta como pesquisa.
Essa dispersão nos números diz algo útil: ninguém sabe medir bem isto, porque a fronteira entre "pesquisa por voz" e "falar com uma IA" desapareceu. Perguntar ao Google Assistant qual é o horário de uma loja e ditar um parágrafo ao ChatGPT contam ambos como voz, mas são comportamentos completamente diferentes.
A conclusão prática não muda: a pesquisa por voz não é o canal principal de ninguém e provavelmente nunca vai ser. É um multiplicador do trabalho de AEO já em curso, com um custo marginal baixo.
Três coisas mudaram, e todas empurram na mesma direção.
Primeira: o assistente deixou de procurar e passou a responder. A versão antiga do Google Assistant fazia uma pesquisa, ia buscar o featured snippet e lia-o em voz alta. A versão de 2026 gera uma resposta a partir de várias fontes. A diferença é que já não existe um resultado óbvio para ocupar. Existe uma síntese, e ou se entra nela ou não.
Segunda: as conversas ficaram com memória. "Qual é o melhor restaurante italiano aqui perto?" seguido de "e está aberto agora?" já é entendido como uma sequência. Isto significa que a pessoa faz três ou quatro perguntas em vez de uma, e cada uma é uma oportunidade separada de citação.
Terceira: a fragmentação entre assistentes. O Google Assistant e a Siri lideram a utilização com cerca de 36% cada, e a Alexa fica nos 25%. Cada um usa um motor de recuperação diferente. Não há uma otimização única que sirva os três, o que na prática significa que o denominador comum (conteúdo bem estruturado, factos verificáveis, respostas curtas) é o único investimento defensável.
Em três dimensões mensuráveis:
A tradução operacional é simples e quase todos os artigos sobre o tema a complicam. Não é preciso uma lista de "keywords de voz". É preciso que os H2 sejam perguntas escritas como uma pessoa as diria em voz alta, muitas delas já visíveis na caixa As pessoas também perguntam. "Preço" não é um H2 útil. "Quanto custa?" é.
Um bloco curto, autossuficiente e imediatamente depois da pergunta.
A referência útil é 30 a 50 palavras. É o intervalo que um assistente consegue ler sem cortar a meio nem soar a leitura de documento. Repare que é mais apertado do que as 40 a 60 palavras que funcionam para citação em texto: falar consome mais tempo por palavra do que ler.
A estrutura que funciona tem três movimentos:
Há um dado que ancora todo este esforço: mais de 80% das respostas que o Google Assistant lê vêm dos três primeiros resultados orgânicos. A conquista de featured snippets e a otimização para voz não são projetos distintos. São o mesmo projeto, e o primeiro é a condição do segundo.
Serve, e por uma razão que mudou desde 2024.
O speakable é uma propriedade de schema que marca as passagens de uma página adequadas para leitura em voz alta. Nasceu limitada a publishers de notícias e nunca teve adoção em massa. Em 2026 ganhou relevância nova: com o FAQPage e o HowTo a deixarem de produzir rich results visíveis, o Speakable passou a ser um dos poucos sinais explícitos que dizem a um sistema qual é a passagem citável de uma página.
Continua a não ser garantia de nada. É barato de implementar e aponta o motor para o parágrafo escolhido em vez de o deixar adivinhar, o que já justifica o esforço. Marque o bloco de resposta, não a introdução.
Se está a construir o inventário de schema do site, o Speakable entra depois do essencial: Organization, Article e a marcação de autoria. É um acabamento, não uma fundação.
Em boa parte, sim, e é aqui que existe retorno imediato para negócios com morada.
Uma fração significativa das queries faladas tem intenção local implícita: "aqui perto", "aberto agora", "o mais próximo". O assistente resolve isso com dados de entidade, não com o texto da página. O que decide a presença é o perfil de negócio (horários corretos, categoria certa, morada consistente), as menções coerentes em diretórios, e as avaliações.
Para um restaurante, uma clínica ou uma oficina, uma hora a corrigir horários e categorias no perfil de negócio vale mais do que dez artigos de blog otimizados para voz. Vale a pena dizer isto sem rodeios, porque é a intervenção que mais gente com negócio local ignora.
Mal, e é melhor assumi-lo do que fingir o contrário. Não existe Search Console para voz. Nenhum assistente reporta impressões faladas.
O que dá para fazer é medição por proxy, com três indicadores:
Se este último indicador parece o mesmo que se usa para AEO em geral, é porque é. Isso é a conclusão do artigo, não uma falha da medição.
Não. É preciso AEO bem feito, com uma exigência extra na abertura de cada secção: a primeira frase depois de cada pergunta tem de funcionar isolada, em 30 a 50 palavras. Se as suas páginas já cumprem isso, a otimização para voz está praticamente feita.
Vale, mas por último. É barato e indica explicitamente qual é a passagem citável, o que ganhou peso desde que o FAQPage deixou de gerar rich results visíveis. Só faz sentido depois de ter Organization, Article e autoria marcados.
Sobretudo respostas sem clique. Num smart speaker não há sítio para clicar. O retorno é reconhecimento de marca e presença na resposta, não sessões. Trate-a como um canal de notoriedade, e meça-a como tal.
Quer saber mais? Consulte a nossa página sobre SEO, AEO e GEO ou peça uma análise gratuita de AEO ao seu website.