OCR de PDF
Reconoce el texto de un PDF escaneado y recupera un archivo que puedes buscar y copiar.
El reconocimiento corre en tu dispositivo, así que los registros y archivos escaneados se quedan contigo. Solo se descargan los datos de idioma, una vez, y el navegador los cachea.
Convierte el resultado buscable a Word
Acerca de OCR de PDF
Un PDF escaneado es una fotografía de un documento. Tú puedes leerlo, pero nada más: la búsqueda no encuentra nada, copiar no da nada y cualquier herramienta que trabaje con texto se queda sin materia prima. El reconocimiento de texto lo arregla leyendo las formas de las letras y escribiendo lo que encuentra dentro del archivo como una capa invisible situada exactamente sobre las palabras impresas. La página sigue viéndose idéntica —el escaneo no se toca—, pero el documento ya se puede buscar, seleccionar y convertir. El reconocimiento corre en tu navegador, en cualquiera de doce idiomas.
Características
- El reconocimiento corre en tu navegador: las páginas nunca se suben
- Doce idiomas, incluidos hindi, ruso, chino, japonés y árabe
- La capa de texto invisible se sitúa sobre el escaneo original, que queda intacto
- Dos calidades de escaneo, cambiando velocidad por precisión con letra pequeña
- Salida de texto plano además del PDF buscable
- Progreso por página, con un control para detener documentos largos
- Los datos de idioma se descargan una vez y quedan en la caché del navegador
Cómo usar OCR de PDF
- Suelta el PDF escaneado en la página
- Elige el idioma impreso en la página y una calidad de escaneo
- Inicia el reconocimiento y observa cómo avanza por las páginas
- Descarga el PDF buscable, o solo el texto reconocido
Ejemplo
Entrada
1987-minutes.pdf — 8 scanned pages, typewritten English
Salida
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
La página visible no cambia; lo que cambia es que las palabras ya están dentro del archivo.
Errores comunes y solución de problemas
- El texto reconocido está lleno de errores. — El reconocimiento depende del escaneo. Prueba la calidad superior y comprueba que el idioma coincide con la página: datos de inglés sobre una página en alemán producen exactamente esto.
- El reconocimiento es muy lento. — Es un trabajo genuinamente pesado, y ocurre en tu propio procesador y no en un servidor. Usa la calidad rápida y divide los documentos largos.
- Un documento con dos idiomas se reconoce mal. — Se usa un idioma por ejecución. Divide el documento por idioma, reconoce cada parte y une los resultados.
- No se reconoció la escritura a mano. — Esto reconoce texto impreso y mecanografiado. La escritura a mano necesita otra clase de modelo por completo.
Preguntas frecuentes
- ¿El texto reconocido sustituye al escaneo?
- No. La imagen queda exactamente como estaba y el texto se añade detrás, invisible. Eso es lo que hace que un PDF buscable se vea idéntico al original.
- ¿Se suben mis páginas escaneadas para reconocerlas?
- No. El motor de reconocimiento corre en tu navegador. Lo único que se descarga son los datos de idioma, una vez, y el navegador los guarda en caché.
- ¿Cuántas páginas puedo reconocer de una vez?
- Hasta treinta por ejecución, porque el reconocimiento es lo bastante lento como para que convenga tratar los documentos largos por tandas.
- ¿Qué calidad debo elegir?
- Empieza por la rápida. Pasa a la superior cuando la letra sea pequeña, el escaneo sea antiguo o el primer intento salga desordenado.
- ¿Puedo pasar OCR a un PDF que ya tiene texto?
- Puedes, pero no tiene sentido: compruébalo antes intentando seleccionar una palabra. Si ya hay texto, conviértelo directamente.
Herramientas relacionadas
- PDF a texto — Extrae texto seleccionable de un PDF como texto plano o Markdown.
- Escanear a PDF — Usa la cámara como escáner y guarda las páginas en PDF.
- PDF a Word — Reconstruye un PDF como documento .docx editable.
- PDF a Excel — Extrae las tablas de un PDF a un libro .xlsx o a CSV.
- PDF a HTML — Convierte un PDF en HTML limpio y buscable.
- Comprimir PDF — Reduce un PDF rerenderizando cada página a JPEG con la calidad y resolución elegidas.
- Resumidor de PDF — Resume un PDF largo por secciones, en tu dispositivo.
Todas las herramientas de ArrayKit