IureOCR - busca texto en documentos escaneados y edita pdf

App gratuita de iurefficient para aplicar OCR y editar PDFs. Reconoce el texto de escaneos y fotos de documentos en tu propio equipo y deja un PDF con texto buscable, listo para subir a Iurefficient. Es la cuarta app de escritorio de Iurefficient, junto a IureTranscribe, IureEditor e IureDav, y comparte con ellas la cuenta, el llavero y la sesión.
Reconoce el texto de escaneos y fotos de documentos en tu propio equipo y deja un PDF con texto buscable, listo para subir a Iurefficient. Es la cuarta app de escritorio de Iurefficient, junto a IureTranscribe, IureEditor e IureDav, y comparte con ellas la cuenta, el llavero y la sesión.
Qué hace
- OCR local con Tesseract en español e inglés (más idiomas si tu Tesseract los tiene). Nada sale del equipo: ni el documento ni el texto.
- Acepta PDF escaneados e imágenes (JPG, PNG, TIFF, BMP, WEBP). El resultado es un PDF con la imagen original y, encima, una capa de texto invisible: se puede buscar, copiar y el servidor de Iurefficient lo indexa sin volver a procesarlo. Además deja un
.txtcon el texto plano. - Omite los PDF que ya tienen texto (mismo criterio que el servidor: menos de 100 caracteres en las tres primeras páginas = hay que reconocer). Se puede forzar.
- Guardar en Iurefficient: en un proyecto (API REST) o en cualquier carpeta del árbol de documentos (WebDAV). Con la unidad de IureDav montada, basta con elegirla como carpeta de salida.
- Cola con progreso por página, cancelación y reintento. Arrastra archivos a la ventana, ábrelos con IureOCR desde el sistema o con enlaces
iureocr://ocr?file=…. - Para editar el resultado sugiere OnlyOffice Desktop Editors: lo detecta si está instalado y, si no, enlaza su descarga. No se incluye.
- Interfaz en inglés y español: inglés por defecto y español si el sistema operativo está en español; se puede elegir en Ajustes → Apariencia. Es independiente de los idiomas del texto que reconoce Tesseract.
Pendiente para versiones siguientes (ver CHANGELOG): herramientas PDF (unir, dividir, extraer y borrar páginas, rotar, proteger con contraseña, marca de agua, numerar), compresión real de imágenes, rescate de páginas ilegibles con un modelo de visión y la lista de documentos pendientes de OCR de la instancia.
Cómo funciona por dentro
- pdfium rasteriza cada página del PDF a JPEG a la resolución elegida (300 ppp por defecto). Las imágenes se pasan tal cual.
- Tesseract recibe la lista de páginas y produce, él mismo, el PDF con la capa de texto (su renderizador
pdf, el mismo que usa ocrmypdf) y el.txt. - El resultado se guarda junto al original con el sufijo
- OCR(configurable) o en una carpeta fija.
Un PDF con texto ya legible no se rasteriza: se avisa y se ofrece forzarlo.
Tesseract en cada sistema
| Sistema De dónde sale Tesseract Modelos de idioma | ||
| Linux | el paquete del sistema: el .deb/.rpm dependen de tesseract-ocr con spa y eng | los incluidos en la app (tessdata_fast) |
| Windows | incluido en el instalador (build de UB Mannheim, Apache-2.0) | incluidos |
| macOS | brew install tesseract (por ahora no va incluido) | incluidos |
La app busca Tesseract en este orden: la variable IUREOCR_TESSERACT, el que viene dentro del instalador, las rutas habituales del sistema y el PATH. En Ajustes se ve cuál encontró, su versión y los idiomas disponibles.
Es la cuarta app de escritorio de Iurefficient, junto a IureTranscribe, IureEditor e IureDav, y comparte con ellas la cuenta, el llavero y la sesión.
¿Quieres ver Iurefficient en acción?
Agenda una demostración o empieza tu prueba gratuita hoy mismo.
Solicitar demo