Para reproduzir esse repositório em sua máquina local, não são necessárias instalações adicionais. Você só deve garantir que todas as bibliotécas, presentes no inicio de cada arquivo Python, estão disponíveis em sua plataforma de copilação Python (IDE).
O arquivo "Data_analysis.py" apresenta ferramentas de análise dos dados, visual e por métricas.
Dois casos foram criados para estudar o DataFrame de spam. O primeiro caso consiste no uso de todos os dados disponíveis, sem qualquer tipo de análise. O segundo caso só possuí as features que obtiveram maior relevância para a variável de interesse, utilizando a métrica chi².
Para a análise dois métodos foram aplicados ao Dataframe, são esses Radom Forest e Support Vector Machine.
Para comparar os métodos de aprendizado de máquina algumas métricas foram aderidas. A exatidão (Accuracy), a matrix de confusão, a pontuação f1 (F1 score) e a curva AUC. Todas as métricas estão presentes no arquivo "Classification.py".
Para executar qualquer arquivo basta rodar o código (arquivo com formato .py) diretamente na plataforma copiladora da linguagem Python (IDE). O arquivo de formato (.csv) deve obrigatóriamente estar no mesmo diretório que o arquivo de execução.