WhatsApp e API

Teste A/B de mensagem no WhatsApp: o que variar, quantos contatos e como decidir

Mandar a versão errada da campanha para a base inteira custa a tarifa e o desgaste. Testar numa amostra custa uma fração disso. Veja o que vale testar, por que dividir sempre por entregues, quantos contatos cada grupo precisa para a diferença não ser acaso e como o limite de 250 mensagens de um portfólio novo muda o calendário.

Teste A/B de mensagem no WhatsApp: o que variar, quantos contatos e como decidir

Teste A/B de mensagem no WhatsApp parece coisa de empresa grande, até a conta chegar. Uma campanha de marketing para 3.000 contatos custa até R$ 965,10 em tarifa da Meta no Brasil (R$ 0,3217 por mensagem entregue, tabela de outubro de 2026). Mandar a versão errada para todo mundo custa esse valor e mais o desgaste da base. Testar antes, numa amostra, custa uma fração disso e responde a pergunta que a intuição não responde: qual das duas mensagens faz mais gente agir.

TL;DR: teste A/B de mensagem no WhatsApp é mandar duas versões de um template para dois grupos sorteados da mesma base, medir uma métrica escolhida antes (de preferência respostas ou cliques por mensagem entregue) e só então mandar a vencedora para o resto. Mude uma coisa por vez. Com taxas de resposta na faixa de 10%, grupos de 250 pessoas só detectam diferenças grandes; para diferenças de poucos pontos, são precisos centenas de contatos por grupo. E lembre do limite de mensagens: um portfólio novo começa com 250 destinatários únicos por dia fora da janela de atendimento.

O que testar (e o que não vale o teste)

Um teste A/B compara duas versões que diferem em um único elemento. Se você muda a abertura, a oferta e o botão ao mesmo tempo, a versão B pode ganhar e você não vai saber por quê, então não vai saber repetir.

O que costuma valer testar, em ordem de quanto pode mexer no resultado:

  1. A oferta. Frete grátis contra 10% de desconto. Brinde contra condição de pagamento. É onde costumam estar as maiores diferenças.
  2. O motivo do contato. “Você comprou X” contra “chegou a novidade Y”. Muda a sensação de quem recebe sobre por que foi escolhido.
  3. A ação pedida. Botão “Ver ofertas” (leva para fora) contra “Quero saber mais” (abre conversa). Um gera clique, o outro gera atendimento.
  4. O cabeçalho. Com imagem do produto ou só texto.
  5. O horário, com a mesma mensagem. O raciocínio está em melhor horário para disparo no WhatsApp.

O que raramente vale o teste: trocar uma palavra no meio do texto, emoji ou não, “Oi” contra “Olá”. A diferença, se existir, vai ser menor do que o seu teste consegue enxergar (a conta está mais abaixo).

Um detalhe prático da API oficial: cada versão é um template diferente, e cada template passa pela revisão da Meta, que leva até 24 horas. Cadastre as duas com antecedência.

Escolha a métrica antes de mandar

Se você decide depois de ver o resultado, sempre vai achar uma métrica em que a sua favorita ganhou. Escolha antes, e escolha a que está mais perto do que você quer.

Métrica Mede Quando usar
Lidas / entregues Se a mensagem foi aberta Quase nunca como decisão; o cabeçalho e o nome da empresa pesam mais que o texto
Respostas / entregues Se a pessoa agiu dentro do WhatsApp Campanha que pede resposta ou toque em botão
Cliques / entregues Se a pessoa foi ao link Campanha com botão de link para loja ou página
Vendas / entregues Resultado Quando o volume de vendas permite comparar (raro em amostra pequena)
Pedidos de saída / entregues Rejeição Sempre como trava: a versão que vende mais e gera o dobro de saídas não ganhou

Divida sempre por entregues, não por enviadas. Mensagem que não chegou não teve chance de funcionar, e a taxa de entrega pode variar entre grupos por motivos que nada têm a ver com o texto.

Quantos contatos por grupo

É nesta conta que a maioria dos testes de WhatsApp em pequena empresa se engana. Com amostra pequena, a diferença entre duas versões oscila muito por acaso.

Uma conta aproximada, com premissa declarada: se a taxa de resposta das duas versões fica em torno de 10%, a margem de erro da diferença entre elas, com 95% de confiança, é mais ou menos esta:

Contatos por grupo Margem da diferença (aprox.) O que dá para concluir
250 ± 5,3 pontos Só diferenças grandes, como 8% contra 15%
500 ± 3,7 pontos Diferenças médias, como 9% contra 13%
1.000 ± 2,6 pontos Diferenças de 3 pontos para cima

A conta usa a aproximação normal para diferença de duas proporções (1,96 × raiz de 2 × 0,10 × 0,90 ÷ n). Ela serve para dar escala, não para publicar em artigo científico. Para ter boa chance (80%) de detectar uma melhora de 10% para 15%, o cálculo padrão de tamanho de amostra pede por volta de 690 contatos por grupo.

O que isso muda na prática: se a sua base tem 1.500 contatos, um teste com dois grupos de 250 só vai separar versões muito diferentes. Isso é argumento para testar ofertas e motivos (que mudam muito o resultado), não vírgulas.

O limite de mensagens decide o calendário do teste

Pela documentação de limites de mensagens da Meta (2026), um portfólio novo começa com 250 destinatários únicos em 24 horas móveis, contados fora da janela de atendimento. O próximo degrau é 2.000, alcançado pela verificação da empresa ou por volume entregue com qualidade.

A consequência: com limite de 250, um teste de dois grupos de 250 leva dois dias, um grupo por dia. Isso mistura o efeito da mensagem com o efeito do dia. A saída é mandar metade de cada grupo em cada dia (125 de A e 125 de B no primeiro, o mesmo no segundo), para que os dois sofram o mesmo efeito de calendário. Os degraus e como subir estão em limite de mensagens da API oficial.

Como sortear os grupos

Os grupos precisam ser parecidos em tudo, menos na mensagem. “Clientes de São Paulo recebem A, os do Rio recebem B” não é teste, é comparação de cidades.

Um jeito simples de sortear sem ferramenta estatística: use o último dígito do telefone. Final par recebe A, final ímpar recebe B. O dígito final não tem relação com comportamento de compra, então funciona como sorteio. Se a sua ferramenta permite marcar contatos com etiqueta a partir de uma planilha, exporte o segmento, marque a coluna do grupo e importe de volta.

Conheça o CRM white label →

Antes de sortear, aplique os filtros da campanha (opt-in, quem pediu para sair, quem tem problema em aberto) à base inteira. Se você filtra depois, pode filtrar mais de um grupo que de outro.

Como decidir

Exemplo ilustrativo. Uma loja testa duas ofertas para clientes que não compram há 4 meses, com 500 contatos por grupo:

  • Versão A, 10% de desconto: 480 entregues, 43 respostas (9,0%), 6 pedidos de saída.
  • Versão B, frete grátis: 485 entregues, 68 respostas (14,0%), 5 pedidos de saída.

A diferença é de 5 pontos, maior que a margem de cerca de 3,7 pontos para esse tamanho de grupo. As saídas estão parecidas. B ganha. A tarifa do teste: cerca de 965 mensagens entregues × R$ 0,3217, por volta de R$ 310. Mandar a versão B para os 3.000 restantes passa a ser uma decisão, não um palpite.

Se a diferença tivesse ficado em 1 ou 2 pontos, a conclusão honesta seria “empate”. Nesse caso, escolha a versão mais barata de operar (a oferta que custa menos margem, o botão que dá menos trabalho ao time) e use o próximo teste para algo com mais chance de mexer no resultado.

Duas armadilhas na hora de ler:

  • Olhar o resultado antes da hora. As respostas chegam ao longo de horas e às vezes dias. Defina antes quando vai ler (por exemplo, 48 horas depois do último envio) e não pare o teste porque uma versão “disparou” na primeira hora.
  • Ignorar a qualidade do template. A Meta avalia cada template pelo feedback negativo e pela taxa de leitura, segundo a documentação de qualidade de templates (2026). E, pela documentação sobre pausa de templates, pode segurar parte dos envios de um template para observar a reação antes de liberar o resto (o chamado pacing). Uma versão que ganha em resposta e cai para qualidade baixa não serve para escalar.

Interesse declarado: a Cubo Suite vende disparo e CRM para WhatsApp. Na Cubo, você marca cada grupo com uma etiqueta ou campo (a marcação pode entrar pela importação de CSV), dispara um template oficial para cada etapa como campanhas separadas e compara, no relatório de cada uma, quantos receberam, leram e responderam. Quem responde vira negócio no funil, o que permite acompanhar até a venda. Dá para rodar o primeiro teste no período grátis de 3 dias.

Como ler cada número do relatório e qual deles indica problema está em métricas de campanha no WhatsApp. As regras que valem para qualquer campanha estão em regras do WhatsApp para empresas.

Perguntas frequentes

O WhatsApp tem teste A/B nativo?

Para campanha por template, o caminho é montar o teste como duas campanhas: dois templates aprovados, dois grupos sorteados e a comparação dos relatórios. Algumas ferramentas automatizam a divisão; o princípio é o mesmo.

Quantas pessoas preciso para um teste A/B no WhatsApp?

Depende do tamanho da diferença que você quer enxergar. Com taxa de resposta perto de 10%, grupos de 250 só detectam diferenças grandes, de uns 5 pontos para cima. Para diferenças de 2 ou 3 pontos, são precisos mil contatos ou mais por grupo.

Posso testar mais de duas versões ao mesmo tempo?

Pode, mas cada versão a mais divide a amostra. Com base pequena, três ou quatro versões deixam cada grupo pequeno demais para concluir algo. Na nossa leitura, duas versões por vez é o mais útil para pequena e média empresa.

Quanto custa um teste A/B no WhatsApp?

A tarifa da Meta para marketing no Brasil é R$ 0,3217 por mensagem entregue na tabela de outubro de 2026. Dois grupos de 500 contatos custam até cerca de R$ 320 em tarifa, fora a mensalidade da ferramenta.

Se você quer testar duas ofertas com a sua base e ver o resultado lado a lado, crie a conta grátis da Cubo, sem cartão.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Conhecer o white label →