Machine Learning

Dados paraprever e decidir.

Aplicação de modelos estatísticos e algoritmos de Machine Learning para classificação, explicação de fenômenos e previsão de comportamentos ao longo do tempo.

PROJETOS

Três problemas, três abordagens

A escolha do modelo começa pelo problema. Classificação, modelos explicativos e forecasting possuem objetivos diferentes e, por isso, exigem formas diferentes de construção e avaliação.

01 · CLASSIFICAÇÃO

Prever a probabilidade de um evento

Modelos de classificação transformam características observadas em uma probabilidade ou categoria. O objetivo é identificar padrões que permitam diferenciar observações com maior ou menor probabilidade de apresentar determinado evento.

EXEMPLOS DE NEGÓCIO

Churn

Identificar clientes com maior probabilidade de cancelar um serviço.

Inadimplência

Estimar quais clientes apresentam maior risco de atraso ou não pagamento.

Fraude

Classificar transações ou operações com comportamento potencialmente suspeito.

PIPELINE

Dados

Entender a variável resposta e as características disponíveis.

Preparação

Tratar, transformar e selecionar as variáveis utilizadas.

Modelagem

Comparar diferentes algoritmos de classificação.

Avaliação

Medir desempenho e investigar os principais erros.

MODELOS

Regressão logística

Baseline interpretável para estimar probabilidades.

Random Forest

Conjunto de árvores capaz de capturar relações não lineares.

Gradient Boosting

Combinação sequencial de modelos para melhorar a previsão.

XGBoost

Algoritmo de boosting otimizado para dados tabulares.

AVALIAÇÃO

O erro mais importante depende do problema

Accuracy pode esconder problemas quando as classes são desbalanceadas. Por isso, precision, recall, F1-score, ROC-AUC e a matriz de confusão são analisados de acordo com o custo de cada tipo de erro.

PrecisionRecallF1-scoreROC-AUCMatriz de confusão
STACK

Ferramentas

PythonPandasNumPyScikit-learnMatplotlibRSQL