Extrae el texto de un PDF
Saca el texto de un PDF y descárgalo como TXT o Word (.docx). El PDF se lee por completo dentro de tu navegador y nunca se sube a ningún servidor, lo que importa cuando el documento es un contrato, un CV o una factura.
Qué puede y qué no puede hacer
PDF es un formato de maquetación, no de documento: guarda dónde se dibuja cada carácter, no cómo está estructurado el texto. Por eso algunas cosas son fiables y otras aproximadas.
- El texto se reconstruye a partir de la posición de los caracteres: las líneas se agrupan por posición vertical y luego se ordenan de izquierda a derecha. Los documentos de una sola columna salen limpios.
- Los diseños de varias columnas, las tablas, los encabezados y los pies de página son aproximaciones. Las columnas pueden entremezclarse y las celdas pierden su cuadrícula, porque esa estructura nunca se guardó en el archivo.
- Los PDF escaneados no contienen texto. La herramienta te lo avisa en lugar de descargar un archivo vacío, pero no puede leerlos: eso requiere OCR.
- El formato no se conserva. Negritas, tipografías, tamaños, colores e imágenes se descartan; obtienes las palabras.
- Los PDF protegidos con contraseña no se pueden abrir, y se informa de ello.
- No se sube nada. El PDF lo procesa tu propio navegador, incluido el archivo worker del lector, servido desde este sitio y no desde una CDN de terceros.
Preguntas frecuentes
¿Se sube mi PDF a un servidor?
No. El PDF lo lee por completo tu propio navegador, y el archivo worker del lector se sirve desde este sitio y no desde una CDN de terceros, así que abrir un documento no genera ninguna petición que se lleve tu archivo. Puedes comprobarlo extrayendo el texto con la red desconectada una vez cargada la página.
¿Por qué el texto extraído está vacío?
Casi seguro porque el PDF es un escaneo: páginas guardadas como imágenes, sin caracteres que extraer. La herramienta lo detecta y te lo dice en lugar de descargar un archivo vacío. Leer un escaneo requiere OCR, una técnica distinta, y esta herramienta no lo hace.
¿Puedo obtener un .doc en lugar de .docx?
No, y es a propósito. El .doc antiguo es un formato binario heredado de Word 97 que no es razonable generar en un navegador. Algunas herramientas lo esquivan renombrando un HTML como .doc, lo que hace que el archivo mienta sobre su propio formato y puede provocar un aviso en Word. El .docx de aquí es un archivo de Word genuino y abre bien en Word, Google Docs, LibreOffice y Pages.
¿Por qué el orden del texto sale mal?
Un PDF registra dónde se dibuja cada carácter, no en qué orden debe leerse, así que hay que reconstruirlo desde la posición. La herramienta agrupa los caracteres en líneas por posición vertical y lee cada línea de izquierda a derecha, lo que funciona bien en documentos normales. Falla en diseños de dos columnas y tablas, porque el archivo nunca registró que fueran columnas o celdas.
¿Se mantiene el formato en el DOCX?
No. Obtienes el texto en párrafos, uno por línea extraída, sin negritas, tipografías, tamaños, colores ni imágenes. La idea es sacar las palabras del PDF y llevarlas a algo editable, no reconstruir el diseño.
¿Qué tamaño de PDF admite?
Hasta 100MB. El límite existe porque el navegador mantiene en memoria el archivo completo y cada página procesada, y el número de páginas pesa más que el tamaño: un PDF de 5MB lleno de texto puede tener miles de páginas. Si el tuyo se rechaza, divídelo en partes.