Un PDF escaneado no contiene texto: contiene una fotografía de un texto. Por eso Ctrl+F no encuentra nada y no puedes seleccionar ni una palabra. El OCR (reconocimiento óptico de caracteres) analiza esa imagen, identifica las letras y añade debajo una capa de texto invisible perfectamente alineada con lo que ves. El documento sigue teniendo el mismo aspecto, pero pasa a ser buscable, seleccionable y copiable. Para hacerlo gratis: arrastra el PDF a una herramienta de OCR, selecciona español como idioma de reconocimiento —este es el paso que casi todo el mundo se salta y el que arruina el resultado, porque sin él las tildes y la ñ se pierden— y descarga el archivo. Un detalle de orden que ahorra disgustos: haz el OCR antes de comprimir, nunca después.
Hay un momento reconocible en cualquier oficina española: alguien recibe un expediente de cuarenta páginas escaneado, necesita localizar un NIF concreto, pulsa Ctrl+F, escribe los ocho dígitos y el visor responde con un silencio absoluto. El documento está ahí, el dato está ahí, y sin embargo el ordenador no ve nada. Esta guía explica por qué ocurre, cómo se arregla gratis y qué decisiones —una en particular, la del idioma— separan un OCR aprovechable de uno que hay que repetir.
Por qué un PDF escaneado no tiene texto
Un PDF puede almacenar dos cosas muy distintas en una página: objetos de texto, que son caracteres con una fuente y una posición, u objetos de imagen, que son mapas de píxeles. Un escáner solo sabe producir lo segundo. La página resultante es un único rectángulo de píxeles que a nuestros ojos forma palabras y para el software no es más que una fotografía.
Cuando abres un PDF nativo —el que sale de exportar un documento de Word, una factura generada por un programa de gestión o un modelo descargado de la sede electrónica—, el flujo de contenido de la página incluye instrucciones del tipo "usa esta fuente, colócate en esta coordenada, dibuja estos caracteres". El visor conoce cada letra, su posición y su código. Por eso puedes buscar, seleccionar, copiar y hasta que un lector de pantalla te lo lea en voz alta.
Cuando abres un PDF escaneado, el flujo de contenido dice algo mucho más pobre: "coloca esta imagen ocupando toda la página". Dentro del archivo hay un objeto de imagen, normalmente comprimido en JPEG o en un formato de dos tonos como CCITT o JBIG2, y cero información de caracteres. No hay fuentes incrustadas porque no hay texto que representar. El significado existe únicamente en la retina de quien mira.
Esto explica varios síntomas que suelen desconcertar:
- Ctrl+F no encuentra nada, ni siquiera una palabra que ves clarísima en pantalla.
- No puedes seleccionar texto: el cursor arrastra un rectángulo de selección de imagen, no un cursor de escritura.
- El archivo pesa mucho para lo poco que contiene: una página de texto nativo ocupa unos pocos kilobytes; la misma página como imagen a resolución decente ocupa órdenes de magnitud más.
- La conversión a Word devuelve una imagen, no párrafos editables. Si has intentado usar pdf a word sobre un escaneado sin OCR previo, ya sabes de qué hablamos.
La prueba definitiva cabe en cinco segundos: intenta seleccionar una palabra con el ratón. Si se selecciona, hay texto y no necesitas OCR. Si aparece un recuadro azul que abarca toda la página, es una imagen.
Cómo hacer OCR a un PDF gratis, paso a paso
El proceso completo son cuatro decisiones y una espera. La única que puede echar a perder el resultado es la del idioma.
- Abre ocr pdf y arrastra el documento escaneado.
- Selecciona español como idioma de reconocimiento. Si el documento mezcla idiomas —un contrato bilingüe, un certificado con anexo en inglés— comprueba si la herramienta permite marcar varios; si solo admite uno, elige el idioma dominante y revisa a mano el resto.
- Elige la salida. Lo habitual y recomendable es PDF buscable: conserva la imagen original intacta y añade la capa de texto debajo. La alternativa, "solo texto", descarta el aspecto visual y devuelve un
.txto un documento de procesador de textos; es útil para volcar contenido, no para conservar el documento. - Lanza el reconocimiento y espera. El tiempo depende del número de páginas y de la resolución, no del peso del archivo.
- Verifica antes de archivar. Abre el PDF resultante, pulsa Ctrl+F y busca dos o tres palabras con tildes o con ñ que aparezcan en el documento: años, señor, también, dirección. Si aparecen, el idioma estaba bien configurado. Si no aparece ninguna pero sí encuentras palabras sin acentos, has hecho el OCR con el idioma equivocado y hay que repetirlo.
- Solo cuando el resultado sea correcto, aplica comprimir pdf si necesitas reducir el peso para enviarlo por correo.
El paso 5 no es paranoia. Es la diferencia entre archivar un expediente que dentro de dos años seguirá siendo localizable y archivar uno que parecerá buscable y no lo será.
El idioma de reconocimiento: por qué en español no es opcional
Un motor de OCR no reconoce letras aisladas: reconoce formas y después las contrasta con un modelo estadístico del idioma. Si le dices que el texto está en inglés, ese modelo no contempla tildes ni la ñ, y el motor las corrige "hacia" lo que cree que debería haber. El resultado son palabras castellanas mutiladas.
El reconocimiento tiene dos fases. La primera es puramente visual: segmentar la imagen en líneas, palabras y glifos, y clasificar cada glifo comparándolo con formas conocidas. La segunda es lingüística: el motor usa un diccionario y un modelo de secuencias de caracteres del idioma seleccionado para resolver las dudas de la primera fase. Cuando la forma es ambigua entre ó y 6, o entre ñ y n con una mancha encima, es el modelo del idioma quien decide.
Ahí está el problema. En un modelo inglés:
- La ñ no existe como carácter esperado. El motor la resuelve como
n, o comoń, o —cuando el escaneo es mediocre— parte el glifo en dos y devuelvefi,rion̄. Año se convierte en ano, señor en senor, diseño en diseno. - Las vocales acentuadas se aplanan. Dirección pasa a direccion, José a Jose, jurídico a juridico. Parece inofensivo hasta que buscas dirección en el archivo y no aparece nada.
- Los signos de apertura
¿y¡desaparecen o se interpretan como manchas y se descartan. - El diccionario juega en contra. Ante contribuyente mal escaneado, un modelo inglés no tiene esa palabra y no puede corregir la lectura; un modelo español sí, y arregla la ambigüedad automáticamente.
Y hay un efecto de segundo orden que casi nadie anticipa: la búsqueda posterior también se rompe. Si la capa de texto guarda ano donde el documento dice año, quien busque año dentro de dos años no encontrará nada, aunque el documento esté perfectamente legible en pantalla. El error no se ve. Se descubre tarde.
En España hay además un caso frecuente que merece atención: los documentos en catalán, gallego o euskera. Sus modelos son distintos del castellano, y el catalán añade caracteres que el modelo español no espera, como la ela geminada (l·l) o la ç. Si digitalizas documentación autonómica, selecciona el idioma correcto o, si la herramienta lo permite, combina castellano con el cooficial.
Qué añade exactamente el OCR al archivo
Un PDF buscable —a veces llamado PDF sándwich— guarda dos capas superpuestas: la imagen escaneada, que es lo que ves, y encima un texto renderizado en modo invisible, que es lo que el ordenador lee. El aspecto del documento no cambia ni un píxel.
El formato PDF define un operador de modo de renderizado de texto que permite dibujar caracteres sin pintarlos. El motor de OCR lo aprovecha: por cada palabra reconocida escribe un objeto de texto real, con su fuente, su tamaño aproximado y su posición calculada para caer exactamente sobre la palabra de la imagen, y lo marca como invisible. El visor lo tiene en cuenta para buscar, seleccionar y copiar, pero no lo muestra.
Esta arquitectura tiene tres consecuencias prácticas:
- El original nunca se altera. Si el OCR se equivoca, el documento sigue siendo exactamente el mismo que salió del escáner. No hay pérdida documental. Es la razón por la que el OCR es aceptable incluso en flujos de digitalización con valor probatorio.
- Al copiar y pegar obtienes la lectura del motor, no lo que ves. Si el reconocimiento leyó Rodriguez donde pone Rodríguez, eso es lo que se pega. Verifica siempre los datos críticos —importes, NIF, fechas— contra la imagen antes de reutilizarlos.
- El texto está alineado palabra a palabra. Por eso al seleccionar con el ratón la selección "cuadra" con lo que ves. Cuando el escaneo está torcido, esa alineación se degrada y la selección se vuelve errática: es un buen indicador visual de un OCR de baja calidad.
Si lo que necesitas es únicamente el contenido en bruto —para volcarlo a una base de datos, a una hoja de cálculo o a un correo—, extraer texto pdf trabaja sobre esa capa una vez creada.
Comparativa de métodos de OCR
Todos estos caminos producen un PDF buscable. Se diferencian en si permiten elegir el idioma, en si conservan el diseño original y en lo que exigen instalar o registrar.
| Método | Selección de idioma | Conserva la imagen original | Varias páginas de golpe | Requiere instalación | Requiere cuenta |
|---|---|---|---|---|---|
| iFillPDF (navegador) | Sí | Sí | Sí | No | No |
| Tesseract (línea de comandos) | Sí | Sí | Sí | Sí | No |
| OCRmyPDF (sobre Tesseract) | Sí | Sí | Sí | Sí | No |
| Adobe Acrobat Pro | Sí | Sí | Sí | Sí | Sí |
| Google Drive (abrir con Documentos) | Automática | No | Parcial | No | Sí |
| Notas / Archivos en iOS y Android | Automática | Sí | Parcial | Incluido en el sistema | No |
Dos advertencias sobre la tabla. Google Drive hace OCR al abrir un PDF con Documentos de Google, pero devuelve un documento de texto con el diseño reconstruido a su manera: pierde la imagen original y suele desmontar tablas y columnas. Sirve para leer, no para archivar. Y la detección automática de idioma de los sistemas móviles funciona bien en textos largos y limpios, y falla en documentos cortos, con muchos números o con nombres propios, que es justamente el perfil de la documentación administrativa.
Tesseract merece una mención aparte porque es el motor libre que hay debajo de buena parte de las soluciones gratuitas. Su paquete de idioma español se instala por separado y se invoca explícitamente:
# OCR sobre un PDF conservando la imagen y añadiendo la capa de texto
ocrmypdf -l spa escaneado.pdf buscable.pdf
# Documento que mezcla castellano e inglés
ocrmypdf -l spa+eng bilingue.pdf buscable.pdf
# Enderezar y limpiar antes de reconocer
ocrmypdf -l spa --deskew --clean escaneado.pdf buscable.pdf
El indicador -l spa es literalmente el parámetro que decide si tu documento conservará las tildes. Sin él, Tesseract asume inglés.
El orden correcto: escanear, enderezar, OCR y solo entonces comprimir
Comprimir antes de hacer OCR destruye la información que el motor necesita. Comprimir después es seguro para la capa de texto, salvo que el compresor rasterice el documento. La secuencia correcta es: escanear a buena resolución, enderezar, reconocer y comprimir al final.
La compresión de un PDF escaneado actúa sobre la imagen: baja la resolución y vuelve a codificar en JPEG con mayor pérdida. Los artefactos de esa recodificación se concentran precisamente en los bordes de alto contraste, que es donde viven los perfiles de las letras. Para el ojo humano el texto sigue leyéndose sin esfuerzo, porque el cerebro reconstruye la palabra entera. Para el motor de OCR, que clasifica cada glifo por su forma, esos bordes emborronados son ruido: los trazos finos desaparecen, la tilde se funde con la vocal, el punto de la i se pierde, y la ñ acaba pareciéndose demasiado a una n.
De ahí la regla: primero el OCR, después la compresión. Una vez creada, la capa de texto no depende de la imagen; puedes comprimir el documento con agresividad y las búsquedas seguirán funcionando exactamente igual.
Con una excepción importante que conviene conocer: algunos compresores muy agresivos rasterizan el PDF, es decir, convierten cada página en una nueva imagen plana. Eso borra todos los objetos de texto, incluida la capa invisible del OCR, y devuelve un documento otra vez ciego. Si después de comprimir Ctrl+F deja de encontrar palabras que antes encontraba, es exactamente lo que ha pasado. La solución es usar una compresión que actúe sobre las imágenes incrustadas y no sobre la página entera.
En cuanto a la calidad de partida, tres factores mandan por encima de todos:
- Resolución. Por debajo de unos 200 puntos por pulgada, el reconocimiento se degrada rápido; 300 ppp es el punto dulce para texto impreso corriente. Subir mucho más no mejora el resultado y multiplica el tiempo de proceso.
- Contraste y modo de captura. Escala de grises o blanco y negro bien umbralizado funciona mejor que color con sombras. Una fotografía de móvil con el propio cuerpo proyectando sombra sobre el folio es el peor escenario posible.
- Inclinación. Un escaneo torcido reduce la precisión porque el motor segmenta las líneas horizontalmente. Enderezar (deskew) antes de reconocer es de las intervenciones más rentables. Si el documento entró girado, rotar pdf lo arregla en un clic; el OCR sobre una página del revés no reconoce nada en absoluto.
Casos límite
El OCR es fiable en texto impreso, limpio y horizontal. Fuera de ese terreno, conviene saber qué esperar antes de confiar el resultado a un archivo definitivo.
Manuscrito. El reconocimiento de escritura a mano es un problema distinto del OCR clásico y las herramientas gratuitas de propósito general no lo resuelven. En un formulario oficial impreso y cumplimentado a bolígrafo, cuenta con que se reconocerá la parte impresa y no la manuscrita.
Tablas. El motor lee líneas de texto, no estructuras. Una tabla se convierte en una secuencia de celdas leídas de izquierda a derecha, y la relación entre columnas se pierde. Si lo que necesitas son los datos tabulados, apoya el resultado en extraer tablas pdf o en pdf a excel en lugar de copiar y pegar a mano.
Columnas y diseño complejo. Boletines oficiales, folletos y documentos a dos columnas pueden salir con el texto intercalado si el motor no detecta bien el orden de lectura. La búsqueda seguirá funcionando palabra a palabra; el copiado en bloque, no.
Sellos, firmas y membretes. Un sello de registro superpuesto al texto degrada la zona que cubre. Es normal que la fecha de entrada estampada sobre un párrafo salga mal reconocida.
Documentos con texto parcial. Muchos expedientes mezclan páginas nativas con páginas escaneadas —por ejemplo, un modelo generado por ordenador al que se han añadido anexos fotocopiados—. El OCR debe aplicarse al conjunto; las páginas que ya tienen texto se dejan intactas y solo se procesan las que son imagen. Si tu herramienta duplica la capa de texto en páginas nativas, obtendrás resultados de búsqueda repetidos.
PDF cifrado. Un documento protegido con contraseña de apertura no se puede procesar: hay que descifrarlo primero. Es la misma lógica que en la compresión, y otra razón para dejar el cifrado como último paso de la cadena.
Documentos de archivo. Si el destino es la conservación a largo plazo, el perfil PDF/A-2u exige precisamente que todo el texto tenga una representación Unicode fiable, que es lo que aporta una capa de OCR bien hecha. Un escaneado sin OCR no cumple ese nivel.
Errores frecuentes
- Dejar el idioma en inglés o en "automático" con documentos en castellano. El fallo más caro, y el que menos se nota en el momento.
- Comprimir antes del OCR. Reduce la tasa de acierto de forma irreversible: la información visual ya no está en el archivo.
- Escanear a resolución baja "para que pese menos". Es un ahorro que se paga después. Escanea a 300 ppp, reconoce y comprime al final.
- Fotografiar el documento con el móvil en lugar de escanearlo. Sombra, perspectiva y enfoque desigual son tres enemigos simultáneos. Si no hay más remedio, usa el modo de escaneo de documentos del propio teléfono, que endereza y umbraliza automáticamente.
- Dar por buena la capa de texto sin revisarla. Copiar un IBAN o un NIF directamente del OCR y pegarlo en una transferencia o en un modelo tributario es una fuente clásica de errores.
- Buscar sin acentos y concluir que el OCR falló. A veces es al revés: el reconocimiento es correcto y quien busca escribe direccion sin tilde. Prueba las dos formas antes de repetir el proceso.
- Aplicar OCR a un documento que ya tiene texto. No aporta nada y puede duplicar la capa, generando dobles resultados de búsqueda. Comprueba antes con la prueba de la selección.
- Subir documentación con datos personales a un servicio de OCR sin comprobar dónde se procesa. Un expediente laboral o clínico digitalizado sigue conteniendo datos personales, y su tratamiento por un tercero exige la base jurídica correspondiente.
Preguntas frecuentes
¿Cómo sé si mi PDF necesita OCR?
Intenta seleccionar una palabra con el ratón. Si se resalta como texto, no lo necesita. Si aparece un rectángulo de selección que abarca toda la página, es una imagen y sí lo necesita. La segunda prueba es buscar con Ctrl+F una palabra que veas en pantalla: si no la encuentra, no hay capa de texto.
¿El OCR modifica el aspecto de mi documento escaneado?
No. La imagen original se conserva íntegra y el texto reconocido se añade en una capa invisible superpuesta. Visualmente el documento es idéntico; lo único que cambia es que ahora se puede buscar, seleccionar y copiar.
¿Por qué el OCR se come las tildes y la ñ?
Porque se ejecutó con un modelo de idioma que no las contempla, casi siempre inglés o una detección automática que falló. El motor resuelve las formas ambiguas usando el diccionario del idioma seleccionado, y si ese diccionario no tiene año ni señor, devuelve ano y senor. La solución es repetir el OCR indicando español expresamente.
¿Puedo hacer OCR a un documento manuscrito?
Con herramientas gratuitas de propósito general, no de forma fiable. El reconocimiento de escritura manual requiere modelos específicos y una calidad de imagen alta. En formularios rellenados a mano, espera que se reconozca la parte impresa y no la escrita.
¿Es mejor hacer el OCR antes o después de comprimir el PDF?
Antes, siempre. La compresión introduce artefactos justo en los bordes de las letras, que es donde el motor toma sus decisiones. Una vez creada la capa de texto, comprimir es seguro —salvo que el compresor rasterice el documento y borre esa capa—. Puedes ajustar el peso después con comprimir pdf.
¿Cómo hago OCR a un expediente de varios documentos sueltos?
Combínalos primero en un único archivo con unir pdf y reconoce el conjunto de una sola vez: mantiene la numeración coherente y evita repetir la configuración de idioma en cada pieza. Si prefieres tratarlos por separado, verifica la capa de texto documento a documento.
Convierte tu escaneado en un documento buscable ahora. Arrastra el archivo a ocr pdf, selecciona español como idioma de reconocimiento y descarga un PDF idéntico por fuera y localizable por dentro. Después podrás aligerarlo con comprimir pdf, separarlo por expedientes con dividir pdf o pasarlo a texto editable siguiendo la guía de convertir pdf a word gratis. Consulta las opciones disponibles en precios.