Projetos de Ciência de Dados com Python
Abordagem de estudo de caso para a criação de projetos de ciência de dados bem-sucedidos usando Python, pandas e scikit-learn
Descrição do livro
Projetos de ciência de dados com Python foi pensado para oferecer orientação prática sobre ferramentas padrão para análise de dados e machine learning em Python com a ajuda de dados reais. O curso o ajudará a entender como usar pandas e o Matplotlib para examinar criticamente um dataset com sínteses estatísticas e gráficos e extrair os insights que deseja obter. Você continuará adquirindo conhecimento ao aprender a preparar dados e a fornecê-los para algoritmos de machine learning, como o de regressão logística regularizada e o de floresta aleatória, usando o pacote scikit-learn. Também aprenderá como ajustar algoritmos para fornecer as melhores previsões sobre dados novos não conhecidos. À medida que percorrer os capítulos mais avançados, conhecerá o funcionamento e a saída desses algoritmos e entenderá melhor não só os recursos preditivos dos modelos, mas também o que os leva a fazer essas previsões.
No fim do curso, você terá as habilidades necessárias para usar confiantemente vários algoritmos de machine learning a fim de executar análises de dados detalhadas e extrair insights significativos dos dados.
Ver menos ▲Sumário
Sumário
- Prefácio
- Exploração e limpeza de dados
- Introdução
- Python e o sistema de gerenciamento de pacotes Anaconda
- A indexação e o operador slice
- Exercício 1: Examinando o Anaconda e familiarizando-se com o Python
- Diferentes tipos de problemas da ciência de dados
- Carregando os dados do estudo de caso com o Jupyter e o pandas
- Exercício 2: Carregando os dados do estudo de caso em um Jupyter Notebook
- Familiarizando-se com os dados e executando sua limpeza
- O problema da empresa
- Etapas da exploração de dados
- Exercício 3: Verificando a integridade básica dos dados
- Máscaras booleanas
- Exercício 4: Continuando a verificação da integridade dos dados
- Exercício 5: Explorando e limpando os dados
- Exploração e garantia da qualidade dos dados
- Exercício 6: Explorando o limite de crédito e as características demográficas
- Aprofundamento nas características categóricas
- Exercício 7: Implementando a OHE para uma característica categórica
- Explorando as características de histórico financeiro do dataset
- Atividade 1: Explorando as características financeiras restantes do dataset
- Resumo
- Introdução ao Scikit-Learn e avaliação do modelo
- Introdução
- Examinando a variável de resposta e concluindo a exploração inicial
- Introdução ao scikit-learn
- Gerando dados sintéticos
- Dados para uma regressão linear
- Exercício 8: Regressão linear com o scikit-Learn
- Métricas de desempenho de modelos para a classificação binária
- Dividindo os dados: conjuntos de treinamento e de teste
- Acurácia da classificação
- Taxa de verdadeiros positivos, taxa de falsos positivos e matriz de confusão
- confusão em Python
- Descobrindo probabilidades previstas: como a regressão logística faz previsões?
- Curva receiver operating characteristic (ROC)
- Precisão
- precision-recall
- Resumo
- Detalhes da regressão logística e exploração de características
- Introdução
- Examinando os relacionamentos entre as características e a resposta
- Correlação de Pearson
- Teste F
- Exercício 11: Teste F e seleção de características univariada
- Hipóteses e próximas etapas
- Exercício 12: Visualizando o relacionamento entre as características e a resposta
- Seleção de características univariada: o que ela pode ou não fazer
- Entendendo a regressão logística com sintaxe de funções Python e a função sigmóide
- Exercício 13: Plotando a função sigmóide
- Escopo das funções
- Por que a regressão logística é considerada um modelo linear?
- Exercício 14: Examinando a conveniência das características para a regressão logística
- Dos coeficientes da regressão logística às previsões com o uso da função sigmóide
- Exercício 15: Limite de decisão linear da regressão logística
- Resumo
- O trade-off entre viés e variância
- Introdução
- Estimando os coeficientes e as interceptações da regressão logística
- Gradiente descendente para a descoberta de valores de parâmetros ótimos
- Exercício 16: Usando o gradiente descendente para reduzir a função custo
- Suposições da regressão logística
- Motivação para a regularização: O trade-off entre viés e variância
- Exercício 17: Gerando e modelando dados de classificação sintéticos
- Regularização lasso (L1) e ridge (L2)
- Validação cruzada: Selecionando o parâmetro de regularização e outros hiperparâmetros
- Exercício 18: Reduzindo o overfitting no problema de classificação de dados sintéticos
- Opções da regressão logística no scikit-learn
- Escalonamento de dados, pipelines e características de interação no scikit-learn
- Atividade 4: Validação cruzada e engenharia de características com os dados do estudo de caso
- Resumo
- Árvores de decisão e florestas aleatórias
- Objetivos do aprendizado
- Introdução
- Árvores de decisão
- Terminologia das árvores de decisão e conexões com o Machine Learning
- Exercício 19: Uma árvore de decisão no scikit-learn
- Treinando árvores de decisão: Impureza dos nós
- univariada e as interações
- Treinando árvores de decisão: Um algoritmo ganancioso
- Trenando árvores de decisão: Diferentes critérios de parada
- Usando árvores de decisão: Vantagens e probabilidades previstas
- Abordagem mais conveniente da validação cruzada
- Exercício 20: Encontrando hiperparâmetros ótimos para uma árvore de decisão
- Florestas aleatórias: Combinações de árvores de decisão
- Floresta aleatória: Previsões e interpretabilidade
- Exercício 21: Ajustando uma floresta aleatória
- Gráfico quadriculado (checkerboard)
- Atividade 5: Busca em grade na validação cruzada com floresta aleatória
- Resumo
- Imputação de dados faltantes, análise financeira e distribuição para o cliente
- Objetivos do aprendizado
- Introdução
- Revisão dos resultados dos modelos
- Lidando com dados faltantes: Estratégias de imputação
- Preparando amostras com dados faltantes
- Exercício 22: Limpando o dataset
- Exercício 23: Imputação de PAY_1 pela moda e aleatória
- Um modelo preditivo para PAY_1
- Exercício 24: Construindo um modelo de classificação multiclasse para a imputação
- Usando o modelo de imputação e comparando-o com outros métodos
- Confirmando o desempenho do modelo com o conjunto de teste desconhecido
- Análise financeira
- Conversa financeira com o cliente
- Exercício 25: Caracterizando custos e economias
- Atividade 6: Derivando insights financeiros
- Considerações finais sobre a distribuição do modelo preditivo para o cliente
- Resumo
- Apêndice
- Capítulo 1: Exploração e limpeza de dados
- Atividade 1: Explorando as características financeiras restantes do dataset
- Capítulo 2: Introdução ao Scikit-Learn e avaliação do modelo
- precision-recall
- Capítulo 3: Detalhes da regressão logística e exploração de características
- Capítulo 4: O trade-off entre viés e variância
- Capítulo 5: Árvores de decisão e florestas aleatórias
- Atividade 5: Busca em grade na validação cruzada com floresta aleatória
- Capítulo 6: Imputação de dados faltantes, análise financeira e distribuição para o cliente
- Atividade 6: Derivando insights financeiros
Sobre o autor
Stephen Klosterman é um cientista de dados da área de machine learning na CVS Health. Ele ajuda a acomodar os problemas dentro do contexto da ciência de dados e fornece soluções de machine learning que os stakeholders empresariais entendem e valorizam. Sua formação inclui um Ph.D. em biologia na Universidade de Harvard, onde foi professor assistente… Ver perfil completo ▶
Livros relacionados
Opinião dos leitores
WILLIAM R M
O livro se utiliza de um problema conhecido para demonstrar o uso de machine learning para descoberta do conhecimento. Por ser um livro prático, é muito útil para utilizar como estudo dirigido nas aulas.
Andre F M
Excelente livro, muito bem escrito e com exemplos que da para ter uma boa introdução a Machine Learning.
Ramon P M
O livro é bom, mas não indico para quem é novo nessa área. Tenha pelo menos 1 mês de estudos diários sobre data science. O autor entra muito rápido em Machine Learning, na página 60 ele já entra nesse assunto. Ele anda muito, mas muito rápido nos assuntos ao decorrer do livro. Mas caso você já tenha uma ideia sobre o assunto do livro, compre, vale muito a pena.
Paulo C F de O
Excelente leitura.






