Machine Learning
Dados paraprever e decidir.
Aplicação de modelos estatísticos e algoritmos de Machine Learning para classificação, explicação de fenômenos e previsão de comportamentos ao longo do tempo.
Três problemas, três abordagens
A escolha do modelo começa pelo problema. Classificação, modelos explicativos e forecasting possuem objetivos diferentes e, por isso, exigem formas diferentes de construção e avaliação.
Prever a probabilidade de um evento
Modelos de classificação transformam características observadas em uma probabilidade ou categoria. O objetivo é identificar padrões que permitam diferenciar observações com maior ou menor probabilidade de apresentar determinado evento.
Churn
Identificar clientes com maior probabilidade de cancelar um serviço.
Inadimplência
Estimar quais clientes apresentam maior risco de atraso ou não pagamento.
Fraude
Classificar transações ou operações com comportamento potencialmente suspeito.
Dados
Entender a variável resposta e as características disponíveis.
Preparação
Tratar, transformar e selecionar as variáveis utilizadas.
Modelagem
Comparar diferentes algoritmos de classificação.
Avaliação
Medir desempenho e investigar os principais erros.
Regressão logística
Baseline interpretável para estimar probabilidades.
Random Forest
Conjunto de árvores capaz de capturar relações não lineares.
Gradient Boosting
Combinação sequencial de modelos para melhorar a previsão.
XGBoost
Algoritmo de boosting otimizado para dados tabulares.
O erro mais importante depende do problema
Accuracy pode esconder problemas quando as classes são desbalanceadas. Por isso, precision, recall, F1-score, ROC-AUC e a matriz de confusão são analisados de acordo com o custo de cada tipo de erro.