Daldal Tools

Extraer texto de PDF

Saca el texto de un PDF para copiarlo o guardarlo como archivo .txt. Las líneas se reconstruyen página a página, con separadores opcionales, dentro de tu navegador.

Se procesa en tu navegador

Los archivos se procesan en tu navegador y nunca se suben a ningún servidor.

Cómo se usa

Carga un PDF y en pocos segundos el texto de todas las páginas aparece en el recuadro de abajo. Cópialo con un clic o descárgalo como archivo .txt con el nombre del documento original. Marca la opción de separadores para insertar una línea "--- Página N ---" antes de cada página y saber así dónde termina una y empieza la siguiente.

La herramienta lee la capa de texto que el PDF ya contiene y reconstruye las líneas a partir de la posición de cada fragmento en la página. Funciona bien con documentos exportados desde Word, Google Docs, LaTeX o un navegador. Los diseños a varias columnas, las tablas y el texto colocado sobre imágenes pueden salir en un orden distinto al de lectura, así que revisa el resultado antes de usarlo.

Un PDF escaneado es un montón de fotografías, no texto, así que esta herramienta no devuelve nada con él. No hay paso de OCR. Si el archivo viene de un escáner o de la cámara del móvil, necesitas antes una herramienta de OCR que reconozca los caracteres. Los PDF protegidos con contraseña tampoco se pueden abrir; quita la contraseña e inténtalo de nuevo.

El archivo se queda en tu ordenador. La extracción se hace por completo dentro de tu navegador y no se sube nada, así que puedes trabajar sin riesgo con contratos, extractos bancarios e informes internos.

Herramientas que se usan a continuación