--- title: "Machine Learning na pesquisa: 6 sinais de que você NÃO precisa dele" url: https://www.blog.psicometriaonline.com.br/machine-learning-na-pesquisa-6-sinais-de-que-voce-nao-precisa-dele canonical: https://www.blog.psicometriaonline.com.br/machine-learning-na-pesquisa-6-sinais-de-que-voce-nao-precisa-dele language: pt-BR published: 2026-10-03T14:27:34.099Z updated: 2026-10-03T14:29:18.633Z modified: 2026-10-03T14:29:18.633Z author: "Alessandro Reis" categories: ["Inteligência artificial", "Metodologia científica"] tags: ["pressupostos estatísticos", "machine learning", "planejamento de pesquisa"] description: "Seis situações em que usar machine learning na pesquisa acadêmica é um erro metodológico, não um avanço: da pergunta descritiva à amostra pequena demais para su" source: Blog Psicometria Online --- # Machine Learning na pesquisa: 6 sinais de que você NÃO precisa dele > Seis situações em que usar machine learning na pesquisa acadêmica é um erro metodológico, não um avanço: da pergunta descritiva à amostra pequena demais para sustentar um modelo complexo. Machine learning virou sinônimo de rigor em muitos projetos de pesquisa, como se a presença de um algoritmo de aprendizado automático tornasse um estudo automaticamente mais robusto. Essa associação é enganosa. Machine learning é uma ferramenta construída para um tipo específico de problema, o problema preditivo, e aplicá-la fora desse contexto costuma produzir resultados difíceis de justificar, de interpretar e de defender em uma banca ou em um parecer de revisão. Este post organiza seis sinais que indicam que sua pesquisa não precisa de machine learning. Eles não são regras absolutas, mas funcionam como um checklist de bom senso metodológico antes de investir tempo em um pipeline de aprendizado de máquina que a pergunta de pesquisa nunca exigiu. ## Não use quando sua pesquisa é apenas descritiva Se o objetivo do estudo é descrever a distribuição de uma variável, comparar médias entre grupos ou caracterizar uma amostra, o trabalho pede estatística descritiva e, no máximo, testes de hipótese simples. Machine learning não tem papel nesse tipo de pergunta porque ele não foi desenhado para resumir dados, e sim para generalizar padrões a novos casos. Descrever o perfil sociodemográfico de uma amostra clínica, por exemplo, não ganha nada em rigor ao ser processado por um algoritmo de clustering não supervisionado se o que se quer é apenas relatar frequências e médias. ## Não use quando sua pergunta é testar uma hipótese específica Pesquisa confirmatória, aquela em que o pesquisador parte de uma hipótese teórica definida a priori e quer testar se os dados a sustentam, pede modelos estatísticos clássicos, como regressão, ANOVA ou modelagem de equações estruturais. Esses modelos têm algo que a maioria dos algoritmos de machine learning não entrega de forma nativa, que é um teste de significância associado a um parâmetro teoricamente interpretável. Quando a pergunta é do tipo 'o suporte social modera a relação entre estresse e burnout', o caminho natural é um modelo de moderação com inferência estatística, não um algoritmo de ensemble otimizado para acurácia preditiva. ## Não use quando você não tem um problema genuinamente preditivo Este é o critério mais decisivo de todos e, por isso, merece ser detalhado. Um problema é genuinamente preditivo quando o objetivo central é estimar o valor de uma variável ainda desconhecida, em casos novos, com base em padrões aprendidos em dados anteriores. Isso aparece com clareza em perguntas como 'este paciente vai responder ao tratamento', 'este aluno vai evadir do curso' ou 'este respondente está em risco de recaída'. Nesses casos, o que importa é a capacidade de generalização do modelo para dados que ele nunca viu, e é exatamente isso que machine learning otimiza. O problema é que muita pesquisa em ciências humanas, sociais e da saúde é formulada em termos explicativos, mesmo quando usa um vocabulário que soa preditivo. Perguntar 'quais variáveis predizem a satisfação no trabalho' pode, na prática, ser uma pergunta sobre associação e peso relativo de preditores em uma amostra já coletada, sem nenhuma intenção real de aplicar o modelo a um caso novo no futuro. Se não existe um caso futuro concreto para o qual o modelo vai gerar uma previsão, o problema não é preditivo, é explicativo disfarçado de preditivo, e discutimos esse ponto com mais detalhe no post sobre [se você deve ou consegue usar machine learning no seu problema](/devo-ou-consigo-usar-machine-learning-no-meu-problema). Um teste simples ajuda a diferenciar os dois casos. Suponha um estudo com duzentos participantes em que o pesquisador quer saber se ansiedade, autoestima e qualidade do sono explicam a variância em desempenho acadêmico. Se o relatório final vai apresentar os coeficientes dessas três variáveis e discutir seu significado teórico, a pergunta é explicativa e pede regressão linear múltipla. Se, em vez disso, o objetivo é construir uma ferramenta que, a partir de respostas de um novo aluno ainda não avaliado, estime a probabilidade de reprovação para alimentar um sistema de alerta precoce, aí sim existe um problema preditivo que pode justificar comparar uma regressão logística com algoritmos como random forest ou gradient boosting. ## Não use quando sua amostra é pequena demais para sustentar um modelo complexo Modelos de machine learning com muitos parâmetros, como florestas aleatórias profundas, redes neurais ou gradient boosting com muitas árvores, precisam de volume de dados proporcional à sua complexidade para não memorizar ruído em vez de aprender padrão real. Esse fenômeno, chamado overfitting, é especialmente traiçoeiro em amostras pequenas porque o modelo pode apresentar desempenho excelente nos dados de treino e ainda assim falhar completamente quando aplicado a dados novos. A literatura sobre modelagem preditiva em saúde oferece um parâmetro útil mesmo para quem não trabalha com desfechos clínicos: o número de eventos por variável preditora. Em modelos de regressão logística, a prática consolidada recomenda uma razão mínima de eventos por preditor incluído no modelo para manter estimativas estáveis, e modelos de machine learning tendem a exigir volumes ainda maiores para superar métodos estatísticos tradicionais (van der Ploeg, Austin & Steyerberg, 2014). Suponha um estudo com cento e vinte participantes e um desfecho binário com apenas dezoito casos positivos. Tentar ajustar um random forest com dezenas de variáveis nesse cenário é pedir para o algoritmo decorar as dezoito observações raras, não para generalizar um padrão. Uma revisão sistemática que comparou modelos de machine learning com regressão logística em centenas de estudos clínicos de predição não encontrou vantagem sistemática de desempenho dos métodos mais complexos, e parte importante dessa equivalência se explica justamente pelo tamanho amostral limitado dos estudos avaliados (Christodoulou et al., 2019). A lição prática é direta: amostra pequena não impede toda e qualquer predição, mas favorece fortemente modelos estatísticos parcimoniosos, com poucos parâmetros e pressupostos explícitos, em vez de algoritmos flexíveis que só mostram sua vantagem quando há dados suficientes para ela se manifestar. Os cuidados com preparação e volume de dados antes de treinar qualquer algoritmo são tratados com mais profundidade no post sobre [a preparação de dados que decide o sucesso do machine learning](/antes-do-algoritmo-por-que-a-preparacao-de-dados-decide-o-sucesso-do-seu-machine-learning). ## Não use quando você precisa principalmente interpretar relações entre variáveis Existe uma distinção clássica na literatura metodológica entre modelar para explicar e modelar para prever, formalizada por Shmueli (2010) no artigo que se tornou referência obrigatória sobre o tema. Explicar significa estimar, com base em teoria, o efeito de uma variável sobre outra, controlando confundidores, e reportar esse efeito com magnitude, direção e intervalo de confiança interpretáveis. Prever significa apenas acertar o valor futuro de um desfecho, sem exigir que o mecanismo interno do modelo seja compreensível. A maioria dos algoritmos de machine learning foi otimizada para a segunda tarefa, não para a primeira. Um gradient boosting pode ser excelente em prever quem vai abandonar um tratamento psicoterapêutico e, ao mesmo tempo, ser quase inútil para responder à pergunta teórica de por que isso acontece, porque suas estimativas internas não correspondem a coeficientes com interpretação causal ou mesmo associativa limpa. Técnicas de interpretabilidade posteriores, como importância de variáveis ou valores de Shapley, ajudam a abrir um pouco essa caixa, mas não substituem a clareza de um coeficiente de regressão estimado sob um modelo teórico explícito. Yarkoni e Westfall (2017) argumentam que a psicologia como campo tem subutilizado a predição justamente porque sua cultura de pesquisa valoriza quase exclusivamente a explicação de mecanismos, e isso é um ponto importante na direção oposta ao sinal discutido aqui. Mas o argumento dos autores reforça exatamente a distinção que importa neste post: a escolha entre machine learning e modelagem estatística clássica depende do que o pesquisador quer entregar no final, um coeficiente interpretável ou uma previsão acurada, e essas duas entregas raramente são otimizadas pelo mesmo tipo de modelo ao mesmo tempo, uma tensão que opõe duas tradições de modelagem estatística com objetivos e critérios de qualidade distintos. ## Não use quando a única justificativa é tornar sua pesquisa “mais sofisticada” Se a razão para incluir machine learning no projeto é a impressão de que isso vai parecer mais avançado para uma banca, um periódico ou uma agência de fomento, esse é o sinal mais claro de que o método não deveria entrar. Escolha de método se justifica pela pergunta de pesquisa e pela natureza dos dados, nunca pelo efeito estético que ela produz no manuscrito. Esse tipo de uso decorativo costuma gerar os mesmos erros discutidos nos posts sobre [os erros mais comuns no uso de machine learning em pesquisas](/os-10-erros-mais-comuns-no-uso-de-machine-learning-em-pesquisas-parte-1), como ausência de validação cruzada adequada ou reporte de métricas sem contexto teórico. Um revisor atento percebe rapidamente quando o algoritmo foi encaixado a posteriori em uma pergunta que já tinha, e merecia, uma resposta estatística mais simples. ## Perguntas frequentes Machine learning nunca serve para pesquisa explicativa? Pode servir como etapa exploratória, para gerar hipóteses, mas a confirmação teórica ainda depende de modelos estatísticos com inferência interpretável. Qual o tamanho mínimo de amostra para usar machine learning com segurança? Não existe um número universal, mas quanto mais complexo o algoritmo, maior o volume de dados necessário para evitar overfitting, e amostras de algumas dezenas ou poucas centenas de casos costumam favorecer modelos estatísticos parcimoniosos. Dá para usar machine learning e ainda assim interpretar os resultados? Em parte, com técnicas de interpretabilidade como importância de variáveis, mas essa interpretação é aproximada e não substitui a clareza de um coeficiente estimado sob um modelo teórico explícito. Como decidir, na prática, entre regressão clássica e machine learning? Pergunte se o objetivo final é prever um caso novo concreto ou explicar uma relação teórica entre variáveis já observadas; a primeira resposta aponta para machine learning, a segunda para modelagem estatística tradicional. ## Referencias 1. Shmueli (2010) To Explain or to Predict?. Statistical Science. https://doi.org/10.1214/10-sts330 2. Yarkoni, Westfall (2017) Choosing Prediction Over Explanation in Psychology: Lessons From Machine Learning. Perspectives on Psychological Science. https://doi.org/10.1177/1745691617693393 3. Christodoulou et al. (2019) A systematic review shows no performance benefit of machine learning over logistic regression for clinical prediction models. Journal of Clinical Epidemiology. https://doi.org/10.1016/j.jclinepi.2019.02.004 4. van der Ploeg, Austin, Steyerberg (2014) Modern modelling techniques are data hungry: a simulation study for predicting dichotomous endpoints. BMC Medical Research Methodology. https://doi.org/10.1186/1471-2288-14-137 **Continue aprendendo:** para dominar este tema na pratica, conheca a formacao *Construcao, Adaptacao e Validacao de Instrumentos* da Psicometria Online Academy. *Este conteudo e educativo; verifique os pressupostos e adapte ao seu desenho de pesquisa e aos seus dados.* > **Como citar este artigo:** Reis, A. (2026, 3 de outubro). Machine learning na pesquisa: 6 sinais de que você não precisa dele. *Blog Psicometria Online*. https://www.blog.psicometriaonline.com.br/machine-learning-na-pesquisa-6-sinais-de-que-voce-nao-precisa-dele