Capacidade comprovada

Quando o problema é o volume

Acervo na ordem de um milhão de documentos, publicado com portal isolado por cliente, busca por conteúdo e conferência integral antes de liberar qualquer acesso.

Os números

O que foi entregue, em ordem de grandeza

Execução real. Não citamos contratante, setor nem tipo de documento, porque isso pertence ao cliente. O método e o custo são nossos, e estão aqui.

Publicados numa única rodada Cada ponto representa 10.000 documentos
Escala do acervo, em documentos
MedidaValor
Total1.000.000
Publicados numa única rodada400.000
Cada ponto representa10.000
Resultados da entrega, por indicador
IndicadorResultado O que significa
Documentos publicados e indexadosquase 1 milhãoAcervo completo, não recorte dos últimos meses. Alguns com histórico de mais de cinco anos.
Organizações atendidas em paraleloquase 100Cada uma com endereço próprio e acesso que só funciona no endereço dela.
Divergência na conferênciazeroDocumento a documento contra a origem. Nenhum acesso foi liberado antes dessa conferência fechar.
Custo de computação do processamentocerca de R$ 50Para mais de 400 mil documentos numa única execução. Menos de R$ 1 por cada 8 mil documentos.
Custo recorrente de manter no arcerca de R$ 28 por mêsArmazenamento do volume adicionado. Cresce proporcional ao acervo, não ao número de consultas.
Tempo para publicar uma organização novaminutosO processo é o mesmo do primeiro. Remessa nova não vira projeto novo.

Como funciona

Quatro etapas, e uma delas pode barrar as outras

A conferência não é relatório no fim: ela tem poder de parar a publicação. É o que garante que ninguém receba acervo incompleto.

  1. Recebe o acervo

    Leitura do que veio, sem alterar nada. O original entra em retenção com bloqueio de exclusão e passa a ser a fonte de verdade.

  2. Confere contra a origem

    Contagem e integridade documento a documento. Divergência interrompe o processo, porque publicar acervo incompleto é pior que não publicar.

  3. Indexa o conteúdo

    Extração dos campos que existem dentro do documento, para a busca ser por conteúdo e não por nome de arquivo.

  4. Publica isolado

    Endereço por cliente, com acesso que só funciona nele. O isolamento é testado a cada publicação, e falha impede a liberação.

Etapas do processamento do acervo
EtapaO que acontece
01. Recebe o acervoLeitura do que veio, sem alterar nada. O original entra em retenção com bloqueio de exclusão e passa a ser a fonte de verdade.
02. Confere contra a origemContagem e integridade documento a documento. Divergência interrompe o processo, porque publicar acervo incompleto é pior que não publicar.
03. Indexa o conteúdoExtração dos campos que existem dentro do documento, para a busca ser por conteúdo e não por nome de arquivo.
04. Publica isoladoEndereço por cliente, com acesso que só funciona nele. O isolamento é testado a cada publicação, e falha impede a liberação.

Contexto

O problema que quase ninguém sabe nomear

Existe um tipo de problema que não aparece em reunião de tecnologia porque ninguém sabe como descrever. A empresa tem um acervo grande de documentos que importam, e ele está num formato que na prática ninguém consulta. Pasta compartilhada com dezenas de gigabytes. Arquivo compactado por período. Sistema de um fornecedor que vai ser desligado.

O acervo não está perdido, mas está inalcançável, o que dá no mesmo no dia em que alguém precisa de um documento específico para sustentar uma cobrança, responder uma auditoria ou instruir um processo. E quando esse acervo pertence a vários clientes ao mesmo tempo, aparece o agravante: entregar para o cliente certo, sem nunca entregar para o errado.

Esse foi o problema que a gente resolveu na escala descrita abaixo. Os números são de uma execução real. Não citamos o contratante, o setor nem o tipo de documento, porque isso é do cliente. O que é nosso, e está aqui, é o método e o custo.

Classes de problema

Onde esse mesmo método se aplica

Cinco situações diferentes que compartilham a mesma raiz. Em cada uma, o que a solução faz e onde ela não serve.

Acervo grande que ninguém consegue consultar

Para achar um documento é preciso baixar a base inteira, ou pedir para alguém procurar. Quando o acervo passa de alguns gigabytes, achar deixa de ser possível e a resposta padrão vira "não temos mais isso".

O que a solução faz

  • Indexação do conteúdo, não só do nome do arquivo
  • Busca por qualquer campo que exista dentro do documento
  • Navegação por período, sem carregar o acervo inteiro
  • Abertura na tela e download individual ou em lote

Quando não serve: Se o acervo é pequeno e uma pessoa acha o que precisa em dois minutos, isso é solução para um problema que você não tem.

Troca de fornecedor que deixa o histórico órfão

O fornecedor novo cobre o fluxo do dia a dia, mas não importa o que já existia. No dia em que o contrato antigo encerra, o histórico sai do alcance, e normalmente ninguém percebe até precisar dele.

O que a solução faz

  • Extração do acervo antes do desligamento, com prazo negociado
  • Conferência de contagem e de integridade contra a origem
  • Publicação em plataforma que não depende do fornecedor anterior
  • Retenção com bloqueio de alteração e de exclusão

Quando não serve: Se o contrato antigo já encerrou e o fornecedor apagou a base, não existe engenharia que recupere. Esse trabalho tem janela.

Entregar documento a muitos clientes sem misturar nada

Cada cliente precisa ver só o que é dele. A saída improvisada é pasta compartilhada com permissão concedida na mão, e aí o isolamento passa a depender de alguém não errar num clique, cliente por cliente, todas as vezes.

O que a solução faz

  • Endereço próprio por cliente, com acesso que só vale nele
  • Isolamento verificado a cada publicação, não presumido
  • Revogação e reemissão pontuais, sem afetar os outros clientes
  • Armazenamento fechado, entrega só pela camada de distribuição

Quando não serve: Link de acesso é portador: quem tem o endereço entra. Se o seu caso exige provar quem é a pessoa, e não só limitar o que ela alcança, isso é login com identidade e muda o desenho e o custo.

Dado que existe, mas não é pesquisável

A informação está dentro de PDF, imagem digitalizada ou e-mail arquivado. Existe, ninguém duvida, mas responder "quantas vezes isso aconteceu" exige alguém abrir arquivo por arquivo.

O que a solução faz

  • Leitura do conteúdo com extração dos campos que importam
  • Estrutura pesquisável construída a partir do documento
  • Conferência por amostra contra o original, com taxa de erro medida
  • O documento original permanece intocado como fonte de verdade

Quando não serve: Documento manuscrito, digitalização torta ou de baixa qualidade reduzem a precisão. Nesse caso medimos a taxa de erro antes e dizemos se compensa, em vez de prometer e entregar ruído.

Concessão de acesso que consome hora de gente todo mês

Alguém da operação passa parte do mês concedendo, revisando e revogando permissão. É trabalho que não aparece em relatório, não escala e é onde o erro de exposição acontece.

O que a solução faz

  • Painel próprio da área de operação, sem depender do time técnico
  • Busca por nome ou documento, e o acesso pronto para copiar
  • Texto de comunicação já montado, para reduzir erro de envio
  • Registro de quem emitiu e quando

Quando não serve: Painel de distribuição concentra acesso, então ele mesmo precisa de credencial nominal por pessoa e não de senha compartilhada. Vale dizer isso antes, porque é o ponto que costuma ser tratado depois.

Custo

Por que sai mais barato do que se imagina

A objeção mais comum a automação com IA não é técnica, é a conta. A pessoa imagina custo por documento que explode com o volume, e prefere manter o processo manual porque nele o custo já é conhecido, mesmo sendo maior.

Na prática o medo está no lugar errado. A maior parte do trabalho de um acervo grande não passa por modelo de linguagem: ler arquivo, conferir contagem, indexar, organizar por período e publicar é código comum. É mais barato, mais rápido e mais auditável que pedir para um modelo fazer.

O modelo entra onde há texto não estruturado ou julgamento, que é uma fração pequena do total. É por isso que processar mais de 400 mil documentos ficou na casa de R$ 50 de computação, e não de milhares.

Como o trabalho é dividido

Divisão do trabalho por tipo de execução
Determinístico, sem IALeitura, contagem, conferência, indexação, organização, publicação, trilha de auditoria. A maior parte do volume.
Modelo pequeno e baratoClassificação, triagem, extração de campo em documento previsível.
Modelo melhor, só onde pagaDocumento longo, linguagem ambígua, decisão que precisa de justificativa legível.

Escolher o que não passa por IA é a decisão de engenharia que mais mexe no custo final. Mais que negociar preço de fornecedor de modelo.

Custo para tratar 400 mil documentos

Conferência manual, hora a hora

Custo para tratar 400 mil documentos
AtividadeManualAutomatizadoRedução
Conferência manual, hora a horaR$ 83.325R$ 50100%

Premissas do lado manual: 30 segundos por documento e R$ 25 por hora, o que dá 3.333 horas. O lado automatizado é o custo de computação medido na execução real, e ainda inclui indexação e publicação, que a conferência manual não entrega.

Limites

O que não prometemos

Limite dito antes é escopo. Limite descoberto depois é problema.

  • Não prometemos precisão que não medimos. Quando há extração de documento, a taxa de erro é medida por amostra antes de virar processo.
  • Não apagamos o original. O documento de origem fica sob retenção com bloqueio de exclusão, e o que a gente publica é sempre derivado dele.
  • Não entregamos acesso antes da conferência fechar. Portal incompleto é pior que portal ausente, porque o usuário conclui que o documento não existe e para de procurar.
  • Não tratamos link de acesso como se fosse autenticação. Se o caso exige identidade da pessoa, dizemos que exige, e isso muda escopo e preço.

Perguntas

Dúvidas frequentes

Vocês trabalham com que volume?

A execução descrita nesta página passou de 400 mil documentos numa rodada, num acervo total próximo de um milhão. O limite prático não é o volume, é a qualidade do que chega e o tempo de transferência.

Quanto custa processar um acervo grande?

A computação é a parte barata: a rodada citada ficou em torno de R$ 50 para mais de 400 mil documentos. O que custa é o trabalho de entender o formato de origem, tratar exceção e conferir. Por isso o diagnóstico vem antes do preço.

O acervo fica dependente de vocês?

Não. Os arquivos ficam em armazenamento seu, sob sua conta, com retenção que impede exclusão acidental. Se a relação terminar, o acervo continua onde está e o acesso é seu.

Como garantem que um cliente não vê o dado de outro?

Cada endereço aceita apenas o acesso emitido para ele, e isso é testado a cada publicação, não assumido pelo desenho. O teste faz parte da esteira: se o isolamento falhar, a publicação não conclui.

Dá para pesquisar dentro dos documentos?

Sim. A busca é pelo conteúdo, não pelo nome do arquivo. Vale para qualquer campo que exista dentro do documento, como partes envolvidas, datas, valores, número de referência e texto livre.

Tem um acervo parado?

O diagnóstico mede volume, formato e esforço antes de qualquer proposta. É gratuito e termina com número.

Quero o diagnóstico