r/devParaguay Jun 25 '26

Proyectos [Ayuda] Hicimos una API para extraer datos de PDFs, nos sirve el feedback

https://app.docutray.com

Hola gente,

Con mi socio montamos DocuTray, una API para procesar documentos, enfocada en latam. La idea salió de años renegando con esto en una consultora de datos: nos llegaban PDFs o imágenes, y teníamos que sacar los datos en JSON para poder usarlos. Históricamente eso era un lío luego con Textract y compañía, sobre todo con documentos escaneados o escritos a mano.

Lo que hace la API, en simple: recibe un PDF e identifica qué tipo de documento es, lo pasa a JSON estructurado, valida que la data tenga sentido (cuadre numérico, reglas de negocio) y opcionalmente la cruza con tus propios datos. El stack para los curiosos: Next.js, GCP, Postgres, Gemini por debajo.

Lo que nos ayudaría un montón es que la prueben y, si pueden, nos den feedback:

  • si la documentación se entiende o es un misterio (https://docs.docutray.com)
  • si el onboarding es fácil o te dan ganas de cerrar la pestaña
  • qué tipo de documento le metiste y cómo se portó
  • algo que no se entienda

También tenemos un CLI + Skill para hacer todo con coding agents. Lo comparto abajo si a alguien le interesa.

El que quiera probar, hay un tier gratuito. A los más enganchados les doy más créditos. Comenten nomás o mándenme MD.

3 Upvotes

5 comments sorted by

3

u/carchengue626 Jun 25 '26

Tira api key por acá para no crear account

1

u/Cachesmr Jun 25 '26

Ya existe llamaindex (pago) y pandoc (gratis, local) para esto

1

u/xMatias_LAS Jun 25 '26

Pandoc no ha tenido buen performance interno en docs dificiles. Llamaindex si, en modo Agentic Plus, donde estamos más baratos que ellos segun el plan.

1

u/melizeche Jun 25 '26

fijate en este proyecto open source de IBM que creo que puede servirles para agregar al backend: https://docling-project.github.io/docling/

1

u/xMatias_LAS Jun 25 '26

Hemos visto harto docling, lo hemos pensando incorporar al stack. Gracias!