PyPDF2掛起處理

Question

我正在使用PyPDF2處理多個pdf文件，但是我的腳本掛在了某個地方。 我在控制台中看到的只是一些“與偏移量在同一行上的startxref”，我是對的，這是一個警告，因此，正確的是，它仍應轉到finally塊並返回空字符串。

難道我做錯了什么？

import PyPDF2
import sys
import os
def decode_pdf(src_filename):           
    out_str=""
    try:
        f = open(str(src_filename), "rb")           
        read_pdf = PyPDF2.PdfFileReader(f)
        number_of_pages = read_pdf.getNumPages()
        for i in range(0,number_of_pages):
            page = read_pdf.getPage(i)
            out_str = out_str + " " + page.extractText()
        out_str = ''.join(out_str.splitlines())
        f.close()
    except:
        print("Exception on pdf")
        print(sys.exc_info())
        out_str = ""
    finally:
        return out_str

Answer 1

我也面臨這個問題，無法使用PyPDF2解決。 我從這里使用示例用pdfminer解決了我的問題

在下面復制相關代碼

from cStringIO import StringIO
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from pdfminer.pdfpage import PDFPage

def convert(fname, pages=None):
    if not pages:
        pagenums = set()
    else:
        pagenums = set(pages)

    output = StringIO()
    manager = PDFResourceManager()
    converter = TextConverter(manager, output, laparams=LAParams())
    interpreter = PDFPageInterpreter(manager, converter)

    infile = file(fname, 'rb')
    for page in PDFPage.get_pages(infile, pagenums):
        interpreter.process_page(page)
    infile.close()
    converter.close()
    text = output.getvalue()
    output.close
    return text

如下調用函數convert（）

convert('myfile.pdf', pages=[5,7])

PyPDF2掛起處理

問題描述

1 個解決方案

解決方案1
0 2018-01-26 23:22:56

PyPDF2掛起處理

問題描述

1 個解決方案

解決方案1 0 2018-01-26 23:22:56

解決方案1
0 2018-01-26 23:22:56