Ir para o conteúdo
PyPro PyPro
Artigos Cursos Projetos Missão Sobre nós Contato

Dicas Pythônicas

Extraindo Texto de um Arquivo PDF com Python

Esta habilidade é útil em diversas situações, como análise de documentos e extração de informações de relatórios.

Por Dilermando Piva Jr. · 27/01/2025

Olá, caro leitor! Seja muito bem-vindo a mais uma edição da "Dicas Pythonicas".

No pyPRO, continuamos trazendo dicas práticas para te ajudar a resolver problemas do mundo real com Python de maneira eficiente.

Hoje, vamos mostrar como extrair texto de um arquivo PDF usando Python. Esta habilidade é útil em diversas situações, como análise de documentos, extração de informações de relatórios, ou simplesmente para automatizar a leitura de conteúdo de PDFs.

Aqui está o código que utilizamos para essa tarefa:

# pip install PyPDF2

from PyPDF2 import PdfReader

# Define o caminho do arquivo PDF

pdf_file_name = 'teste.pdf'

# Abre o arquivo no modo binário de leitura

with open(pdf_file_name, 'rb') as pdf_file:

   # Lê o arquivo PDF

   pdf_reader = PdfReader(pdf_file)

   # Obtém o número de páginas

   page_nums = len(pdf_reader.pages)

   # Itera sobre as páginas, exibindo uma a uma

   for page_num in range(page_nums):

      # Lê a página do arquivo PDF

      page = pdf_reader.pages[page_num]

      # Extrai o texto da página

      text = page.extract_text()

      # Imprime o texto

      print(text)

 

Como Funciona?

Instalação de Dependências: Antes de começar, instale a biblioteca PyPDF2:

pip install PyPDF2

 

PyPDF2 é uma biblioteca poderosa para manipulação de arquivos PDF em Python.

Abertura do PDF: Usamos open() no modo binário ('rb') para abrir o arquivo PDF.

Leitura e Extração: Com PdfReader, lemos o arquivo PDF e determinamos o número de páginas com len(pdf_reader.pages). Depois, iteramos por cada página, usando

extract_text() para extrair o texto e imprimi-lo.

Esta abordagem permite extrair texto de cada página de um PDF, facilitando a análise e manipulação de documentos de forma programática.

Espero que esta dica te inspire a automatizar tarefas relacionadas a documentos PDF. Fique atento à próxima edição, onde traremos mais dicas práticas e úteis para aprimorar suas habilidades em Python!

Um forte abraço,

 

Prof. Dr. Dilermando Piva Jr.
Idealizador do pyPRO
Visite: https://pypro.com.br para mais informações sobre Python, Ciência de Dados e Git/GitHub.

← Voltar para artigos

pyPRO - Python para todos.

Instagram YouTube LinkedIn X (Twitter)