Skip to main content

Descripción general

El PDF es uno de los formatos más versátiles para entrenar tu IA. Cargue informes, libros electrónicos, documentos escaneados y más.

Tipos admitidos

  • PDF de texto: PDF digitales nativos
  • PDF escaneados: extracción de texto OCR
  • Formularios: extrae campos y valores del formulario
  • Multipágina: páginas ilimitadas

Carga rápida

1

Prepare PDF

Asegúrese de que el PDF no esté protegido con contraseña
2

Upload

Almacén de datos → Agregar fuente de datos → Carga de archivo
3

OCR

PDF escaneados procesados automáticamente con OCR

Características

Extracción de texto inteligente

  • Mantiene la estructura del documento.
  • Conserva tablas y listas.
  • Extrae hipervínculos
  • Lee encabezados y pies de página

OCR para documentos escaneados

  • Convierte imágenes en texto con capacidad de búsqueda
  • Admite más de 50 idiomas
  • Procesa la escritura a mano (con limitaciones)

Mejores prácticas

Escaneos de alta calidad: 300 DPI o superior ✅ Eliminar contraseñas: desbloquea archivos PDF antes de cargarlos ✅ Fusionar archivos PDF relacionados: combinar capítulos/secciones ✅ Marcadores: Úselo para documentos largos

Casos de uso

  • 📄 Contratos y documentos legales
  • 📖 Libros electrónicos y guías
  • 📊 Informes anuales
  • 🎓 Artículos de investigación

Solución de problemas

Problemas de calidad de OCR:
  • Utilice escaneos de alta resolución
  • Asegurar una buena iluminación.
  • Evite páginas torcidas
Tamaños de archivos grandes:
  • Comprimir PDF (reducir la calidad de la imagen)
  • Dividir en archivos más pequeños

Límites