Medindo gente: pesquisa para avaliar ações de RH e treinamentos

Tempo de Leitura: 8 minutos

Aplausos no fim do curso não são evidência de que a avaliação de treinamento funcionou; são educação. E o RH que só colhe aplausos está dirigindo sem painel.

No Sabor Central

O treinamento de atendimento das equipes de balcão do Sabor Central, empresa de refeições coletivas, terminou em aplausos sinceros. O instrutor contratado era ótimo de palco, o formulário de saída deu 9,4 e o RH arquivou o projeto na pasta dos sucessos.

Três meses depois, Paula, a nutricionista-chefe, cruzou o formulário com o painel dos refeitórios e trouxe o incômodo para a reunião: as notas de atendimento dadas pelos comensais não tinham se movido um milímetro. Nem as reclamações de má vontade no balcão, nem os elogios nominais. Nada.

— "A gente mediu se as equipes gostaram do show. Em nenhum momento medimos se alguém passou a atender diferente. O 9,4 é nota do quê, exatamente?"

O silêncio na sala respondeu antes do RH: era nota do instrutor. Do treinamento, ninguém sabia.

O problema que vai além do treinamento

Todo treinamento corporativo termina com a mesma pergunta implícita: como saber se funcionou?

"O pessoal gostou" não basta. Isso é apenas o primeiro degrau da escada de evidência, colhido com viés de gentileza, de quem acabou de viver a experiência e ainda não teve chance de aplicar nada.

Mas o problema vai além de qualquer treinamento isolado. Avaliar treinamento é um problema de pesquisa como outro qualquer. E treinamento é só o caso mais visível de uma família inteira: o onboarding que o RH redesenhou, o benefício que mudou, a nova escala de trabalho, o programa de liderança. Toda ação de RH é uma aposta de que algo vai melhorar. E aposta, se testa, não paga pra ver. A boa notícia é que o instrumental para testar já existe: questionário bem desenhado, coleta no momento certo, leitura honesta — o mesmo método usado para medir a experiência do cliente, aplicado agora para dentro.

Os quatro níveis de Kirkpatrick

Em 1959, Donald Kirkpatrick, então professor da Universidade de Wisconsin, propôs avaliar treinamentos em quatro níveis sucessivos, um modelo tão duradouro que segue sendo o padrão da indústria de T&D:

Nível 1 (Reação): eles gostaram?
A pesquisa de satisfação do treinamento: relevância percebida, clareza, formato. É o nível mais fácil de medir e o mais fraco como evidência: a literatura de T&D mostra correlação baixa entre "gostar do curso" e "aprender com o curso". Um treinamento pode ser divertidíssimo e vazio; outro, árido e transformador. Serve para: melhorar o material e o formato. Não serve para: declarar vitória.

Nível 2 (Aprendizado): eles saíram sabendo?
Conhecimento, habilidade ou atitude adquiridos, medidos, idealmente, com comparação antes/depois. É aqui que entra o bom e velho teste, o quiz, o exercício prático. Sem medir o "antes", cuidado: o "depois" sozinho não separa o que o treinamento ensinou do que as pessoas já sabiam.

Nível 3 (Comportamento): eles usam no trabalho?
A pergunta que separa treinamento de entretenimento corporativo: semanas ou meses depois, o comportamento no trabalho mudou? É o nível mais negligenciado, e o mais importante. Aprender e não aplicar é o desfecho mais comum: a curva do esquecimento de Ebbinghaus corrói rápido o que não é usado, e o ambiente de trabalho (tempo, incentivos, chefia) decide se o novo comportamento sobrevive.

Nível 4 (Resultados): o negócio mudou?
O efeito final nos indicadores: qualidade, retenção, vendas, erros. É o nível mais difícil, porque aqui entram todos os fantasmas metodológicos de sempre: correlação vs. causa, variáveis de fundo, séries temporais. Raramente se consegue atribuição limpa; consegue-se evidência convergente.

Repare no padrão: cada nível acima custa mais para medir e vale mais como evidência. É a mesma economia do cardápio de perguntas, em outra escala.

O instrumental de pesquisa, nível por nível

Kirkpatrick não é uma teoria de RH, é um plano de coleta. Cada nível tem uma pesquisa certa, um momento certo e uma armadilha conhecida.

Nível 1 pede uma pesquisa transacional: a foto, colhida na saída, com a memória fresca. Três perguntas em escala de 5 pontos rotulada, sobre clareza, utilidade percebida e ritmo, mais uma aberta opcional. A regra de ouro: logo após, pergunte sobre percepção, não sobre eficácia. "O conteúdo foi claro?" é respondível na hora. "Você aplicará isso?" colhe intenção educada, que a literatura mostra ser péssimo preditor de comportamento. E resista à tentação do questionário longo: o formulário de reação disputa a atenção de quem quer ir embora, com o mesmo orçamento de 30 segundos do ponto de venda.

Nível 2 pede linha de base. O quiz aplicado depois mede uma mistura de treinamento com bagagem prévia; o mesmo quiz aplicado antes, numa turma-piloto, separa as duas coisas. É o "antes e depois" na sua forma mais barata. Prefira situações práticas a definições; decoreba mede memória; cenário mede julgamento.

Nível 3 pede pesquisa de acompanhamento 30 a 60 dias depois, com mais de uma fonte. O pacote completo:

  • Aplicação concreta, não impressão: "Nas últimas duas semanas, você usou [a técnica X do treinamento] em alguma situação real?" [S/N + qual]. Específico e verificável, ao contrário de "o treinamento foi útil para seu desenvolvimento?".
  • Pergunte também ao redor: o gestor da pessoa nota mudança? O modelo revisado por Kirkpatrick (o "New World Kirkpatrick Model") enfatiza justamente monitorar o nível 3 com múltiplas fontes em vez de autorrelato solitário.
  • Meça a barreira, não só o sucesso: "o que impediu de aplicar?" é a pergunta que transforma avaliação em melhoria do programa. Se a resposta recorrente é "meu chefe decide", o problema não é o curso: é o ambiente, e nenhuma reedição do curso resolve.
  • Comportamento observável conta como dado: vocabulário novo aparecendo em reunião, artefatos do curso preenchidos por iniciativa própria. Dá para contar; contagem é pesquisa.

Nível 4 pede as ferramentas estatísticas de sempre. Ligar treinamento a indicador de negócio é a travessia mais minada da avaliação: a equipe treinada no pior mês melhora sozinha (regressão à média); a variação pode ser ruído ou estação. As defesas para isso são as de sempre: treinar em ondas e comparar quem já passou com quem ainda não passou, buscar dose-resposta, exigir o mecanismo plausível para o acontecimento. Todo cronograma escalonado traz de brinde um grupo de controle gratuito — os que ainda não passaram pelo treinamento podem balizar a comparação. Honestidade metodológica: aqui é aceitável evidência convergente em vez de prova.

Aplicando os quatro níveis a um programa de treinamento

Um exemplo de como isso se organiza na prática, nível por nível:

  • Reação: pesquisa curta logo após cada módulo do treinamento;
  • Aprendizado: quiz situacional por bloco de conteúdo, com linha de base colhida numa turma-piloto;
  • Comportamento: sinais observáveis de que o conteúdo pegou — vocabulário novo aparecendo em reunião, ferramentas do curso sendo usadas por iniciativa própria;
  • Resultados: mais lento e difuso — decisões revertidas por dados, propostas que passam a citar evidência em vez de opinião.

Além do treinamento: a jornada do colaborador tem momentos da verdade

Agora amplie o zoom. A experiência do cliente se mede no momento em que acontece. A jornada do colaborador é feita da mesma matéria: uma sequência de episódios (chegada, aprendizado, mudanças, saída), e cada um tem sua pesquisa certa. O RH que só faz a pesquisa de clima anual está na posição do varejista que só pergunta ao cliente uma vez por ano: o filme existe, mas ninguém tirou as fotos.

Onboarding: a pesquisa de 7, 30 e 90 dias. Os primeiros meses concentram tanto a formação do vínculo quanto o risco de desistência precoce. E a memória do que confunde um novato evapora com a adaptação: em seis meses, ninguém mais lembra o que era confuso, e o processo nunca melhora. Três toques curtos: aos 7 dias ("o que quase te fez desistir nesta semana?", a pergunta-barreira de novo), aos 30 ("o que você ainda não sabe fazer e precisava?"), aos 90 ("o trabalho é o que te prometeram na contratação?"). Essa última é a mais valiosa: a distância entre promessa e realidade é o defeito de fabricação do turnover precoce.

Mudança de RH é experimento: trate como tal. Novo benefício, novo cargo, nova escala, novo plano de carreira: cada uma dessas decisões é uma hipótese sobre pessoas ("isso vai melhorar retenção/clima/produtividade"). A mesma ficha de experimento se aplica inteira: hipótese, critério de sucesso definido antes, e medição antes/depois. O pulso curto colhido antes da mudança é a linha de base que quase todo RH esquece de tirar. Sem ela, a discussão de seis meses depois volta ao achismo: "eu acho que o pessoal gostou do horário novo". Com ela: "a satisfação com jornada subiu 12 pontos no grupo que mudou e ficou estável no que não mudou". Evidência de verdade, dentro do RH.

Clima e pulso: o filme e as fotos. A pesquisa de clima anual é a relacional do mundo interno: profunda, estrutural, lenta. O pulso quinzenal ou mensal é a transacional: curto, frequente, sensível ao este mês. Além de termômetros do ambiente, clima e pulso são a régua com que se mede cada ação de RH lançada entre uma onda e outra. Ação de RH sem leitura no pulso seguinte é iniciativa sem critério de sucesso.

Saída: a última pesquisa. A entrevista de desligamento é a pesquisa com a amostra mais sincera da empresa (quem sai não tem mais nada a perder, e carrega os vieses de quem já decidiu sair); a entrevista de permanência (stay interview) é a versão preventiva, feita com quem a empresa não quer perder. As duas fecham o ciclo da jornada e alimentam a próxima rodada de ações, que por sua vez serão avaliadas pelo mesmo sistema.

As regras do jogo quando o respondente é de casa

Medir gente de dentro tem física própria, e três leis já conhecidas se aplicam com força redobrada:

1. Anonimato crível ou nada. O colaborador que teme identificação responde o que é seguro, não o que é verdade. Amostra mínima por recorte e jamais caçar o autor do comentário duro.

2. Turma é amostra pequena: leia como tal. A avaliação média do módulo caiu de 4,6 para 4,3 entre turmas de 15 pessoas? Isso é ruído. Some turmas, olhe a tendência de várias edições, e só então julgue o curso, ou o instrutor.

3. Goodhart ronda o RH também. Nota de reação atrelada ao bônus do instrutor produz curso agradável, não curso eficaz (é a correlação fraca do nível 1 sendo explorada). eNPS cobrado do gerente produz clima de fachada. Toda métrica de RH com consequência precisa da sua guardiã: reação vigiada por aprendizado, clima vigiado por turnover real.

A ponte entre medir o cliente e medir o colaborador

Há uma conexão que vale destacar: uma empresa que já mede a experiência do cliente no momento certo tem, na mesma infraestrutura de pesquisa, o que precisa para medir a experiência do colaborador — o pulso na saída do turno, a pesquisa de reação na saída do treinamento, o acompanhamento de 30 a 60 dias, o antes/depois de cada ação de RH. Quem domina Kirkpatrick e a jornada do colaborador consegue conversar com o RH no mesmo nível em que conversa com operações, e transforma pesquisa de satisfação isolada num programa de escuta que atravessa a empresa inteira.

De volta ao Sabor Central

No Sabor Central, o treinamento seguinte já nasceu com quatro andares de medição: a reação na saída (que continuou importando, só parou de reinar sozinha), um teste curto duas semanas depois (aprenderam?), a observação de três comportamentos combinados no balcão no mês seguinte (usam?) e a nota de atendimento do comensal no trimestre (mudou o resultado?). Linha de base registrada antes, para a comparação ter chão.

O segundo instrutor era menos engraçado que o primeiro. Aplausos menores, formulário 8,1. Mas os três comportamentos apareceram no balcão, e a nota de atendimento subiu 0,3 no trimestre. O RH emoldurou a lição junto com o resultado, com o trocadilho que a casa merecia: "aplauso é sobremesa; mudança de comportamento é o prato principal".

O resumo de uma frase (teste Feynman)

"Treinamento e ação de RH se avaliam como qualquer aposta: pergunta certa na hora certa (gostaram, aprenderam, usam, mudou o resultado), com linha de base antes e leitura honesta depois; aplausos são só o primeiro degrau."

Fontes e leituras recomendadas

KIRKPATRICK, Donald L.; KIRKPATRICK, James D. Evaluating Training Programs: The Four Levels. Berrett-Koehler, 3ª ed., 2006.

KIRKPATRICK, James D.; KIRKPATRICK, Wendy Kayser. Kirkpatrick’s Four Levels of Training Evaluation. ATD Press, 2016. (O "New World Model" e o nível 3 com múltiplas fontes.)

ALLIGER, George M. et al. "A Meta-Analysis of the Relations Among Training Criteria". Personnel Psychology, v. 50, 1997.

SALAS, Eduardo et al. "The Science of Training and Development in Organizations: What Matters in Practice". Psychological Science in the Public Interest, v. 13, 2012.

BRINKERHOFF, Robert O. The Success Case Method. Berrett-Koehler, 2003.

PHILLIPS, Jack J. Return on Investment in Training and Performance Improvement Programs. Routledge, 2ª ed., 2003.

HESKETT, James L. et al. "Putting the Service-Profit Chain to Work". Harvard Business Review, mar.-abr. 1994.

Gostou do Conteúdo?

Últimos artigos