Extraia o texto de um PDF
Tire o texto de um PDF e baixe como arquivo TXT ou Word (.docx). O PDF é lido inteiramente dentro do seu navegador e nunca é enviado a lugar nenhum — o que importa quando o documento é um contrato, um currículo ou uma nota fiscal.
O que esta ferramenta faz e o que não faz
PDF é um formato de layout, não de documento — ele guarda onde cada caractere é desenhado, não como o texto está estruturado. Isso torna algumas coisas confiáveis e outras aproximadas, então aqui está o quadro honesto antes de você depender do resultado.
- O texto é reconstruído a partir da posição dos caracteres: as linhas são agrupadas por posição vertical e depois ordenadas da esquerda para a direita. Documentos comuns de uma coluna saem limpos.
- Layouts de várias colunas, tabelas, cabeçalhos e rodapés são aproximações. Colunas podem se intercalar e células de tabela perdem a grade, porque essa estrutura nunca foi guardada no arquivo.
- PDFs digitalizados não contêm texto nenhum. A ferramenta avisa em vez de baixar um arquivo vazio, mas não consegue lê-los — isso exige OCR.
- A formatação não é preservada. Negrito, fontes, tamanhos, cores e imagens são descartados; você recebe as palavras.
- PDFs protegidos por senha não podem ser abertos, e isso é informado.
- Nada é enviado. O PDF é interpretado pelo seu próprio navegador, incluindo o arquivo de worker do leitor, que é servido por este site e não por uma CDN de terceiros.
Perguntas frequentes
Meu PDF é enviado para um servidor?
Não. O PDF é lido inteiramente pelo seu próprio navegador, e o arquivo de worker do leitor é servido por este site e não por uma CDN de terceiros, então abrir um documento não gera nenhuma requisição levando seu arquivo para fora. Você pode confirmar extraindo o texto com a rede desconectada depois que a página carregou.
Por que o texto extraído saiu vazio?
Quase certamente porque o PDF é uma digitalização: páginas guardadas como imagens, sem caracteres no arquivo para extrair. A ferramenta detecta isso e avisa em vez de baixar um arquivo vazio. Ler uma digitalização exige OCR, que é uma técnica diferente — reconhecer letras dentro de uma imagem — e esta ferramenta não faz isso.
Posso receber um arquivo .doc em vez de .docx?
Não, e isso é proposital. O .doc antigo é um formato binário legado da era do Word 97, que não é razoável gerar num navegador. Algumas ferramentas contornam isso renomeando um arquivo HTML para .doc, o que faz o arquivo mentir sobre o próprio formato e pode gerar um aviso no Word. O .docx daqui é um arquivo Word genuíno, então abre sem problema no Word, Google Docs, LibreOffice e Pages.
Por que a ordem do texto saiu errada no meu documento?
Um PDF registra onde cada caractere é desenhado, não a ordem em que deve ser lido, então a ordem precisa ser reconstruída a partir da posição. Esta ferramenta agrupa os caracteres em linhas por posição vertical e depois lê cada linha da esquerda para a direita, o que funciona bem em documentos normais. Layouts de duas colunas e tabelas são onde isso falha, já que o arquivo nunca registrou que aquilo eram colunas ou células.
A formatação é mantida no DOCX?
Não. Você recebe o texto em parágrafos — um por linha extraída — sem negrito, fontes, tamanhos, cores ou imagens. O objetivo é tirar as palavras de dentro do PDF e colocá-las em algo editável, não reconstruir o design original.
Qual o tamanho máximo de PDF?
Até 100MB. O limite existe porque o navegador mantém o arquivo inteiro mais cada página interpretada na memória, e a contagem de páginas pesa mais que o tamanho do arquivo — um PDF de 5MB cheio de texto pode ter milhares de páginas. Se o seu for recusado, dividir em partes resolve.