OCR de PDF escaneado, en español y sin subir el archivo
Respuesta rápida
Sube el PDF escaneado y el reconocimiento corre dentro de tu navegador: la primera vez se descargan ~5 MB de motor y modelo a tu dispositivo, y desde ahí el archivo nunca viaja a ningún servidor. El texto sale en español, separado por páginas, para copiar o bajar en .txt. Hasta 50 páginas por tanda; revisa siempre cifras y nombres.
El escaneo no sale de tu equipo: el motor de reconocimiento se descarga A tu navegador y trabaja ahí.
Modelo entrenado para español: tildes, eñes y el vocabulario con que están escritos tus documentos.
La primera vez baja ~5 MB de motor y modelo; quedan en la caché del navegador para las siguientes.
Salida honesta: texto plano para copiar o bajar en .txt, con el aviso de revisar cifras y nombres.
Arrastra el PDF escaneado aquí
Hasta 50 páginas por tanda, en español
Tus archivos no salen de tu dispositivo. KippiLex no los recibe ni los guarda: todo se hace dentro de tu navegador. Cómo comprobarlo.
La primera vez tu navegador descarga ~5 MB de motor y modelo — hacia tu dispositivo, nunca al revés. Después quedan en caché.
Cada página tarda varios segundos: un expediente de 40 folios son varios minutos. Deja la pestaña abierta.
La calidad depende del escaneo: una copia torcida, borrosa o con sellos encima sale con más errores.
Revisa siempre cifras, fechas y nombres contra el original antes de usar el texto en algo que importe.
¿Cómo funciona, paso a paso?
1
Abre el PDF escaneado
Arrastra el archivo o búscalo en tu equipo. Hasta 50 páginas por tanda: si el expediente es más largo, divídelo primero y pasa las partes una por una.
2
Deja que el motor se prepare
La primera vez, tu navegador descarga unos 5 MB: el motor de reconocimiento (Tesseract compilado a WebAssembly) y el modelo de español. La dirección de esa descarga importa: va DE nuestro servidor HACIA tu dispositivo, nunca al revés. En los usos siguientes ya está en caché y arranca de una.
3
Espera el reconocimiento, página por página
Cada página se convierte en una imagen a 200 puntos por pulgada y el motor la lee. Verás por cuál va y el porcentaje de esa página. Es trabajo de verdad para tu procesador: un documento de 40 folios tarda varios minutos, más en un teléfono. Deja la pestaña abierta.
4
Copia el texto y revísalo
El resultado sale como texto plano, separado por páginas, con «Copiar todo» y «Descargar .txt». Antes de usarlo en algo que importe, compara las cifras, las fechas y los nombres contra el documento original: es exactamente donde el OCR más falla.
El OCR que se descarga a tu equipo, en vez de subirte el documento
Casi todos los OCR gratuitos de internet funcionan igual: subes el escaneo a su servidor, ellos lo procesan y te devuelven el resultado. El trato implícito es que confías tu documento —la escritura, la historia clínica, el expediente con cédulas de terceros— a un servicio del que no sabes nada, a cambio de que borre la copia cuando termine. Esta herramienta invierte la dirección del viaje: en lugar de mandar tu documento adonde está el motor, el motor viene adonde está tu documento.
En concreto: la primera vez que la usas, tu navegador descarga Tesseract —el motor de reconocimiento de código abierto que Google mantuvo durante años— compilado a WebAssembly, junto con su modelo de español. Son unos 5 MB en total, servidos desde este mismo sitio, y quedan en la caché del navegador. Desde ese momento el reconocimiento corre en tu procesador, dentro de la pestaña. No hay petición de red que lleve tu archivo porque no hay adónde: el sitio ni siquiera tiene un endpoint que reciba documentos, y puedes verificarlo en la pestaña Red de las herramientas de desarrollador.
El modelo es la variante tessdata_fast de español: una versión comprimida del modelo completo, pensada para dispositivos donde el tamaño y la velocidad importan. La contrapartida es honesta: reconoce algo peor que el modelo completo, que pesa varias veces más, y esa diferencia se nota sobre todo en escaneos mediocres. Para el uso real —leer qué dice el documento, copiar un párrafo, buscar un nombre— es más que suficiente; para transcripción certificada, ningún OCR lo es.
Por qué hay que revisar las cifras, siempre
Un OCR no lee: reconoce formas y les asigna la letra más probable. En un párrafo corriente, el contexto lo salva — si reconoce «contrto», cualquiera ve que era «contrato». Con los números no hay contexto que ayude: un 3 con mala tinta se parece a un 8, un 1 a una l, un 5 a una S, y «$12.500.000» puede salir como «$12.600.000» sin que nada en la frase lo delate. Lo mismo pasa con las cédulas, los números de radicado y los apellidos poco comunes.
Por eso el resultado sale con una advertencia que no es un descargo de responsabilidad de cajón, sino una instrucción de trabajo: antes de usar el texto, compara cada cifra, cada fecha y cada nombre contra el documento original. Toma dos minutos y es la diferencia entre citar bien un auto y llevarle a un juzgado un número de radicado que no existe. El párrafo confíaselo al motor; el dato, revísalo tú.
Y una nota sobre lo que el texto reconocido es y no es: sirve para trabajar —buscar dentro del expediente, citar un aparte, armar una cronología—, pero el documento sigue siendo el escaneo original. Si el papel va a un proceso, lo que se aporta es el original o su copia; el .txt es tu herramienta de lectura, no tu prueba.
Cómo mejorar el resultado antes de empezar
La calidad del texto es la calidad del escaneo, así que lo que hagas antes vale más que cualquier ajuste después. Si el documento salió torcido del escáner, enderézalo primero con la herramienta de rotar PDF: el motor tolera unos grados de inclinación, no una página acostada. Si vas a escanear tú, hazlo a 300 puntos por pulgada, en blanco y negro o escala de grises, con el papel plano; la foto de un documento arrugado sobre la cama es el peor punto de partida posible.
Para expedientes largos, el flujo que funciona: divide el PDF en tandas de hasta 50 páginas, pásalas una por una y ve pegando los .txt. Cada tanda sale con sus números de página, así que rearmar el orden es trivial. Y si lo que tienes no es un PDF sino la foto suelta de un contrato o un pagaré, hay una herramienta más directa: imagen a texto, con el mismo motor y la cámara del celular como entrada.
Preguntas frecuentes
¿Cómo paso un PDF escaneado a texto en español?›
Abriéndolo en esta página. El navegador convierte cada página del escaneo en una imagen y un motor de reconocimiento óptico (OCR) entrenado para español la lee y deduce las letras. El resultado es el texto completo, separado por páginas, para copiar o descargar como .txt. Todo ocurre en tu dispositivo: el archivo no se sube a ningún servidor.
¿De verdad el archivo no se sube a ningún servidor?›
De verdad, y la arquitectura es la prueba: en lugar de mandar tu PDF a un servidor con OCR, el OCR viene a ti. La primera vez el navegador descarga el motor (~5 MB entre WebAssembly y modelo de español) y desde ahí todo el reconocimiento corre en tu propio procesador. Puedes comprobarlo con las herramientas de desarrollador (F12), pestaña Red: verás la descarga del motor y ninguna petición que lleve tu archivo.
¿Qué tan preciso es el reconocimiento?›
Depende casi por completo del escaneo. Con una copia nítida, derecha y a buena resolución, el texto sale casi perfecto. Con un escaneo torcido, borroso, con sellos o firmas encima del texto, o fotocopiado varias veces, los errores crecen — y se concentran donde más duele: un 3 que se vuelve 8, un 1 que se vuelve l, un apellido cambiado. La regla práctica: el párrafo confíaselo al OCR, la cifra revísala tú.
¿El resultado es un «PDF con búsqueda» o texto plano?›
Texto plano, y es una diferencia importante. Muchos servicios de OCR devuelven un «PDF con búsqueda»: la misma foto de tu documento con el texto reconocido escondido en una capa invisible debajo, que sirve para buscar y copiar pero no se puede editar como texto. Aquí la salida es el texto mismo, para pegarlo en Word, en un correo o donde lo necesites. Si lo que quieres conservar es el PDF, guarda el original: esta herramienta no lo modifica.
¿Por qué el límite es de 50 páginas?›
Porque el reconocimiento lo hace tu propio equipo y cada página cuesta varios segundos de procesador. Cincuenta páginas son varios minutos en un computador y bastantes más en un teléfono; más allá, la espera deja de ser razonable y la pestaña puede quedarse sin memoria. Para un expediente largo, divídelo primero con la herramienta de dividir PDF y pasa las tandas una por una: el texto de cada tanda sale con sus números de página.
¿Reconoce manuscritos, firmas o letra a mano?›
No con calidad utilizable. El motor está entrenado para letra impresa; la letra manuscrita —un acta a mano, una nota marginal, una firma— sale como ruido o no sale. Para documentos impresos con anotaciones a mano, el texto impreso se reconoce y las anotaciones se pierden: revisa el original para no perder lo que alguien escribió al margen.
¿Funciona sin conexión a internet?›
Después de la primera vez, en la práctica sí: el motor y el modelo quedan en la caché del navegador, así que el reconocimiento en sí no necesita red. La primera carga sí requiere conexión para bajar esos ~5 MB desde nuestro propio sitio.
¿Qué hago con el texto si el documento es parte de un pleito?›
El texto reconocido sirve para trabajar —buscar, citar, armar la línea de tiempo—, pero no reemplaza al documento: en un proceso lo que prueba es el escaneo original (o mejor, el documento físico o su copia auténtica). Usa el texto para entender y preparar, y conserva el archivo original intacto. Si necesitas orientación sobre el fondo, cuenta tu caso gratis y un abogado verificado te responde con el documento completo a la vista.
¿Ya leíste el expediente y el problema sigue ahí?
Reconocer el texto de una escritura vieja o de un expediente es el primer paso; entender qué implica y qué hacer con él es el que importa. Cuenta tu caso gratis y recibe propuestas de abogados verificados, con precio y tiempos, sin comisiones.