
Antes de discutir por 3 reuniões, teste por 3 dias.
Na Academia Ritmo
A pauta “volume da música” chegou à terceira reunião consecutiva na Academia Ritmo, rede de academias com três unidades, com as mesmas duas torcidas e nenhum dado novo. Fábio, o dono, sustentava que música alta é energia: “aluno treina mais, fica mais”. Renata, a gerente, sustentava que o volume espantava o pessoal da manhã e os alunos de mais idade: “e aluno que não gosta não reclama; some”. A ata da reunião anterior podia ser lida em voz alta: era idêntica ao debate em curso.
No minuto quarenta, Renata desistiu de vencer e fez a proposta que encerrou o loop:
— A gente já gastou três reuniões de opinião. Isso custa mais caro que o teste. Duas unidades com volume menor de manhã, uma como está, duas semanas. A realidade desempata, e ela não cobra hora.
A reunião em loop
Toda empresa conhece a cena: uma ideia divide o time. Metade acha que vai funcionar, metade acha que não. Argumentos de um lado, argumentos do outro. A reunião acaba sem decisão. Duas semanas depois, a mesma discussão, com os mesmos argumentos, porque nenhuma informação nova entrou na sala.
O empate entre opiniões não se resolve com mais opinião. Se resolve com dado novo. E a forma mais barata de fabricar dado novo tem nome: experimento.
A proposta deste artigo é mostrar como aplicar, no dia a dia de qualquer equipe, o mesmo método científico que sustenta uma boa pesquisa de satisfação: testar antes de apostar alto.
A regra de ouro: aposte pequeno para aprender rápido
A lógica do experimento interno é economia pura: qual é o jeito mais barato e rápido de descobrir se essa ideia funciona?
- Antes de reformular o onboarding inteiro, teste o novo fluxo com os próximos 5 clientes.
- Antes de contratar a campanha do ano, rode duas versões pequenas por uma semana.
- Antes de mudar o processo de toda a equipe, peça a uma dupla que trabalhe do jeito novo por um ciclo.
Essa filosofia tem lastro: é o núcleo do movimento Lean Startup, de Eric Ries (construir o teste mínimo, medir, aprender, e só então escalar), e é prática consolidada nas empresas de tecnologia mais estudadas do mundo. O motivo é um dado humilhante e libertador que essas empresas divulgam: a maioria das ideias testadas falha em produzir o efeito esperado. Ron Kohavi, que liderou experimentação na Microsoft, relata que só cerca de um terço das ideias testadas por lá melhorava de fato as métricas que pretendia melhorar; um terço não fazia diferença e um terço piorava. E eram ideias propostas por especialistas. Se especialistas erram dois terços dos palpites, a conclusão não é “não tenha ideias”; é “não aposte alto em palpite não testado”.
A ficha de experimento: 5 campos antes de começar
Um experimento se diferencia de “vamos tentar e ver no que dá” por um detalhe: as regras são definidas antes. Sem isso, o viés de confirmação redige a conclusão depois: qualquer resultado vira “deu certo”. A ficha mínima:
- Hipótese. No formato: acreditamos que [mudança] causará [efeito] em [público/contexto]. “Acreditamos que enviar o relatório mensal com um resumo executivo de 5 linhas aumentará a taxa de abertura pelos gestores.”
- Métrica de sucesso. O número que decidirá, escolhido antes. “Taxa de abertura do e-mail do relatório.”
- Critério de decisão. Quanto, para valer a pena. É a linha que separa experimento de opinião com cronograma. “Se a abertura subir de 40% para 55% ou mais, adotamos para todos. Abaixo disso, descartamos.”
- Escopo e prazo. Pequeno e curto o bastante para errar sem dor. “20 clientes da carteira A, durante 2 meses.”
- O advogado do contra. A pergunta feynmaniana: que resultado nos faria desistir da ideia? Se nenhum resultado imaginável mata a ideia, isso deixa de ser experimento e vira inauguração disfarçada.
Cinco campos, meia página. O custo de preenchê-la é 20 minutos; o custo de não preenchê-la é descobrir em produção, seis meses depois, que a aposta era ruim. Ou, tão ruim quanto: nunca descobrir.
As armadilhas de quem começa
Testar tudo ao mesmo tempo. Mudou o preço, o texto e o público na mesma semana? Se melhorar, foi o quê? Uma variável por experimento, ou aceite que só saberá o efeito do pacote.
Escolher a métrica depois. Com liberdade para escolher a métrica após o resultado, alguma sempre terá subido. É a versão corporativa do atirador que desenha o alvo em volta do tiro.
Encerrar quando está ganhando. Definiu duas semanas? São duas semanas. Parar no dia em que o número está bonito é colher ruído, não sinal (lembre-se da margem de erro: números pequenos balançam).
Ignorar o contexto. O teste rodou na semana de promoção? Na baixa temporada? Anote junto ao resultado. Experimento interno raramente tem a pureza de laboratório; honestidade sobre as condições vale mais que fingir rigor.
Confundir “falhou” com “fracassou”. A hipótese derrubada por um teste de 3 dias e R$ 0 é um dos produtos mais valiosos que existem: uma aposta ruim cancelada pelo preço de um palpite. No placar científico, “aprendemos que não” é vitória.
Como isso conversa com a priorização de iniciativas
Isso conversa direto com frameworks de priorização de iniciativas como o ICE score (impacto, confiança e esforço, popularizado por Sean Ellis): o experimento é o que alimenta o “C” de confiança. Uma iniciativa com hipótese testada em pequena escala sobe de confiança com dado em vez de retórica. O ciclo ideal: ideia → ficha de iniciativa → experimento pequeno → resultado → decisão de escalar (ou arquivar), com o aprendizado registrado para o time inteiro, inclusive quando a resposta é “não”.
De volta à Ritmo
Na Ritmo, a ficha de experimento saiu preenchida antes do café esfriar: hipótese (volume menor de manhã aumenta frequência e nota do turno), unidades pareadas, duas semanas, critérios combinados de antemão. Catorze dias depois, a realidade votou: a tarde não mudou nada, e a manhã surpreendeu: check-ins 9% maiores nas unidades de volume reduzido, com comentários novos do tipo “finalmente dá para conversar com o professor”.
Fábio aceitou a derrota com a elegância de quem perdeu para o método, não para a Renata. A regra ficou na parede da sala: “terceira reunião sobre o mesmo empate é proibida; no lugar dela, marca-se o teste”.
O resumo de uma frase (teste Feynman)
“Empate de opinião não se desempata com voz mais alta; se desempata com um teste pequeno, combinado antes, que deixe a realidade dar o voto de minerva.”
Fontes e leituras recomendadas
RIES, Eric. A Startup Enxuta. Sextante, 2019.
KOHAVI, Ron; TANG, Diane; XU, Ya. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020.
THOMKE, Stefan. Experimentation Works: The Surprising Power of Business Experiments. Harvard Business Review Press, 2020.
ELLIS, Sean; BROWN, Morgan. Hacking Growth. HarperCollins, 2017. (Origem prática do ICE score.)
KOHAVI, Ron; CROOK, Thomas; LONGBOTHAM, Roger. “Online Experimentation at Microsoft”. Third Workshop on Data Mining Case Studies, 2009. (Fonte do dado “um terço melhora, um terço não muda, um terço piora”.)












