Converter PDF para CSV
PDF para CSV: extraia tabelas de um PDF com texto selecionável para arquivos CSV, um arquivo por tabela. Digitalizações precisam antes de OCR. Seus arquivos ficam no seu navegador.
Pequeno download do conversor no primeiro uso.
Tabelas detectadas
Esta ferramenta foi útil?
Testar com um exemplo
Baixar exemploO CSV deve conter quatro linhas e três colunas separadas por ponto e vírgula, com Item, Qtd., Valor e o total 148,50. Várias tabelas são baixadas como arquivos CSV separados em um ZIP.
O que esperar
Para PDFs com texto incorporado e linhas de tabela regulares. Digitalizações precisam de OCR antes. A detecção pode deixar passar tabelas ou colocar texto na célula errada; compare o arquivo baixado com o seu PDF. Células mescladas e a formatação original não são reconstruídas.
Cada tabela vira um arquivo CSV ou uma planilha do Excel própria. Os valores permanecem como texto. Valores de CSV que poderiam ser interpretados como fórmulas recebem um apóstrofo no início; as células do Excel são gravadas explicitamente como texto. Ao importar o CSV em uma planilha, escolha colunas de texto para preservar zeros à esquerda e a formatação dos números.
Até 10 MiB de entrada, 200 páginas, 100 tabelas, 100.000 células, 256 colunas e 8 MiB de saída. O processamento é interrompido após 30 segundos. Linhas irregulares são recusadas em vez de serem deslocadas em silêncio.
Na primeira execução, os arquivos do conversor podem ser baixados e isso pode levar um momento. Se falhar, verifique sua conexão ou tente um arquivo menor. “Cancelar” interrompe o processamento em andamento; você pode selecionar outro arquivo e tentar novamente.
Licenças e código-fonte dos motores
Um guia prático
Tabela detectada, CSV criado.
- Selecione um PDF com texto selecionável.
- Execute “PDF para CSV”.
- Confira as linhas e colunas de cada CSV com a tabela de origem.
Teste este exemplo
Extraia de um PDF uma tabela com três colunas e oito linhas; o CSV deve conter exatamente essas oito linhas e três colunas.
Antes de começar: A detecção pode deixar passar tabelas complexas ou sem bordas, e páginas digitalizadas não geram resultado enquanto não passarem antes por OCR.