Pular para o conteúdo principal

Documentos

O módulo de Documentos permite gerenciar documentos clínicos com upload, indexação e busca.

O que faz

  • Upload: PDFs, imagens, documentos Office
  • Indexação: extração de texto e metadados automaticamente
  • Busca: busca híbrida (BM25 + vetorial) no corpus de documentos
  • Organização: documentos associados a pacientes e grupos

Como funciona

1. Upload

  • Arraste e solte ou selecione arquivos
  • Formatos suportados: PDF, imagens (JPG, PNG), Office (DOCX, XLSX)
  • Processamento automático com OCR para documentos escaneados

2. Indexação

Os documentos são processados pelo pipeline de ingestão:

  1. PaddleOCR 3.x: OCR com detecção de layout (padrão para PDFs escaneados e imagens)
  2. pdfplumber: extração estruturada com bounding boxes (PDFs born-digital)
  3. pypdf: último recurso para texto simples

3. Busca

  • Busca por palavras-chave (BM25)
  • Busca semântica (vetorial)
  • Filtros por paciente, grupo, data, tipo de documento

Integração com RAG

Documentos indexados fazem parte do corpus de evidências usado pelo Clinical Research Agent. Quando o agente pesquisa evidências, ele busca tanto em fontes externas (PubMed, etc.) quanto no corpus local de documentos.

Privacidade

  • Documentos são escopados por tenant (isolamento via RLS)
  • PHI scanning antes de indexação
  • Hash de identificadores em logs de acesso