Ir para o conteúdo
PyPro PyPro
Artigos Cursos Projetos Missão Sobre nós Contato

Data Insights Weekly

Trechos de Código Python Essenciais

Trechos de código Python fundamentais para cientistas de dados!

Por Dilermando Piva Jr. · 06/12/2024

Data Insights Weekly: Trechos de Código Python Essenciais

Olá, Caro Leitor e Entusiasta de Dados!

Bem-vindo(a) à Data Insights Weekly!

Nesta edição, vamos explorar trechos de código Python fundamentais para cientistas de dados, focando na manipulação e análise de dados com as poderosas bibliotecas Pandas e Scikit-Learn. Cada exemplo inclui uma explicação detalhada e mostra como aplicar esses conceitos em seus projetos de dados.

Trechos de Código Python para Ciência de Dados: Manipular e analisar dados de forma eficiente é uma habilidade crítica na área de Ciência de Dados. Para ajudar você a aprimorar seu fluxo de trabalho, reunimos uma seleção de trechos de código que cobrem tarefas comuns, desde a importação de dados até o agrupamento e análise de séries temporais. Confira a seguir:

1. Leitura de Dados CSV com Pandas

df = pd.read_csv('data.csv')

 

Explicação do Código: Carrega um arquivo CSV em um DataFrame do Pandas.

Possíveis Usos em Ciência de Dados: Importação de dados de diversas fontes para análise e manipulação.

 

2. Manipulação e Padronização de Strings

str.upper()

str.lower()

str.title()

str.replace("J", "P")

 

Explicação do Código: Métodos de manipulação de strings para alterar capitalização e substituir substrings.

Possíveis Usos em Ciência de Dados: Limpeza e padronização de dados textuais para análise.

 

3. Tratamento de Dados Ausentes e Duplicados

df.dropna(inplace=True)

df.fillna(df.mean(), inplace=True)

df.drop_duplicates(inplace=True)

 

Explicação do Código: Lida com valores ausentes e remove duplicatas em um DataFrame.

Possíveis Usos em Ciência de Dados: Preparação de dados para análise, garantindo qualidade e consistência.

 

4. Renomeando Colunas em um DataFrame

df.rename(columns={'old_name': 'new_name'}, inplace=True)

 

Explicação do Código: Renomeia colunas de um DataFrame.

Possíveis Usos em Ciência de Dados: Tornar nomes de colunas mais descritivos e amigáveis para análise.

 

5. Agrupamento e Agregação de Dados

grouped_df = df.groupby('column').agg({'col1': 'sum', 'col2': 'mean'})

 

Explicação do Código: Agrupa dados e aplica funções agregadas.

Possíveis Usos em Ciência de Dados: Análise de dados agregados e geração de estatísticas resumidas.

 

6. Junção de DataFrames por Coluna Comum

merged_df = pd.merge(df1, df2, on='common_column', how='inner')

 

Explicação do Código: Mescla dois DataFrames com base em uma coluna comum.

Possíveis Usos em Ciência de Dados: Combinação de diferentes fontes de dados para análise integrada.

 

7. Criação de Tabela Dinâmica com Pandas

pivot = df.pivot_table(values='value', index='index', columns='columns', aggfunc='mean')

 

Explicação do Código: Cria uma tabela dinâmica para resumir dados.

Possíveis Usos em Ciência de Dados: Análise multidimensional e geração de relatórios dinâmicos.

 

8. Aplicação de Função a Coluna de Dados

df['new_column'] = df['column'].apply(lambda x: x**2)

 

Explicação do Código: Aplica uma função a uma coluna do DataFrame.

Possíveis Usos em Ciência de Dados: Transformação de dados e criação de novas variáveis derivadas.

 

9. Avaliação de Modelos com Métricas de Erro

mse = mean_squared_error(y_test, predictions)

r2 = r2_score(y_test, predictions)

 

Explicação do Código: Calcula métricas de avaliação de modelo, como MSE e R².

Possíveis Usos em Ciência de Dados: Avaliação de performance de modelos de Machine Learning.

 

11. Salvando Modelos Treinados com joblib

import joblib

joblib.dump(model, 'model.pkl')

 

Explicação do Código: Salva um modelo treinado em um arquivo.

Possíveis Usos em Ciência de Dados: Persistência de modelos de Machine Learning para uso futuro e reuso em produção.

 

12. Conversão de Coluna para Data e Índice Temporal

df['date'] = pd.to_datetime(df['date'])

df.set_index('date', inplace=True)

 

Explicação do Código: Converte uma coluna para o tipo datetime e define como índice.

Possíveis Usos em Ciência de Dados: Análise de séries temporais e manipulação de dados baseados em tempo.

 

13. Cálculo de Média Móvel

df['rolling_mean'] = df['column'].rolling(window=12).mean()

 

Explicação do Código: Calcula a média móvel de uma coluna.

Possíveis Usos em Ciência de Dados: Suavização de séries temporais e detecção de tendências.

 

14. Análise de Componentes Principais (PCA)

from sklearn.decomposition import PCA

pca = PCA(n_components=2)

principal_components = pca.fit_transform(df_scaled)

 

Explicação do Código: Realiza Análise de Componentes Principais (PCA).

Possíveis Usos em Ciência de Dados: Redução de dimensionalidade e visualização de dados complexos.

 

15. Agrupamento com K-Means

from sklearn.cluster import KMeans

kmeans = KMeans(n_clusters=3)

kmeans.fit(df_scaled)

df['cluster'] = kmeans.labels_

 

Explicação do Código: Realiza agrupamento K-Means.

Possíveis Usos em Ciência de Dados: Segmentação de dados e descoberta de grupos naturais em bases de dados.

 

16. Consulta SQL em DataFrame com pandasql

import pandasql as psql

query = "SELECT * FROM df WHERE column > value"

result = psql.sqldf(query, locals())

 

Explicação do Código: Executa consultas SQL em um DataFrame.

Possíveis Usos em Ciência de Dados: Análise de dados usando sintaxe SQL dentro do ambiente Pandas, facilitando a transição entre análises em bancos relacionais e Python.

 

Esses exemplos abrangem operações como limpeza de dados, criação de novas variáveis, cálculos de métricas de avaliação e até a execução de consultas SQL diretamente em DataFrames. Dominar essas técnicas é essencial para criar análises robustas e obter insights valiosos.

Esperamos que essa coleção de trechos de código inspire você a experimentar e aplicar esses conceitos em seus próprios projetos. A prática é fundamental para desenvolver habilidades sólidas em análise de dados.

Fique atento às próximas edições, onde continuaremos a trazer mais técnicas e dicas valiosas!

Até lá, continue explorando e aprimorando suas habilidades em Ciência de Dados. E lembre-se: no pyPRO, há muito mais esperando por você!

Um forte abraço,

 


Prof. Dr. Dilermando Piva Jr.

Idealizador do pyPRO

Visite: https://pypro.com.br para mais informações sobre Python, Ciência de Dados e Git/GitHub.

← Voltar para artigos

pyPRO - Python para todos.

Instagram YouTube LinkedIn X (Twitter)