從Python中的HTML鏈接下載文本數據

Question

嗨，我想下載HTML鏈接上托管的帶分隔符的文本。 （該鏈接只能在專用網絡上訪問，因此不能在此處共享）。

在R中，以下功能解決了這個問題（所有其他功能都給出了“未經授權的訪問”或“ 401”錯誤）

url = 'https://dw-results.ansms.com/dw-platform/servlet/results? job_id=13802737&encoding=UTF8&mimeType=plain'
download.file(url, "~/insights_dashboard/testing_file.tsv")
a = read.csv("~/insights_dashboard/testing_file.tsv",header = T,stringsAsFactors = F,sep='\t')

我想在Python中做同樣的事情，為此我使用了：

（A）urllib和request.get（）

import urllib.request

url_get = requests.get(url, verify=False)
urllib.request.urlretrieve(url_get, 'C:\\Users\\cssaxena\\Desktop\\24.tsv')

（B）requests.get（）和read.html

url='https://dw-results.ansms.com/dw-platform/servlet/results? job_id=13802737&encoding=UTF8&mimeType=plain'
s = requests.get(url, verify=False)
a = pd.read_html(io.StringIO(s.decode('utf-8')))

（C）使用wget：

import wget
url = 'https://dw-results.ansms.com/dw-platform/servlet/results? job_id=13802737&encoding=UTF8&mimeType=plain'  
wget.download(url,--auth-no-challenge, 'C:\\Users\\cssaxena\\Desktop\\24.tsv')

要么

wget --server-response -owget.log "https://dw-results.ansms.com/dw-platform/servlet/results? job_id=13802737&encoding=UTF8&mimeType=plain"

注意：URL不需要任何憑據，瀏覽器可以訪問該URL，並且可以使用R和download.file進行下載。 我正在尋找Python中的解決方案

Answer 1

def geturls(path):
    yy=open(path,'rb').read()
    yy="".join(str(yy))
    yy=yy.split('<a')

    out=[]
    for d in yy:
        z=d.find('href="')
        if z>-1:
            x=d[z+6:len(d)]
            r=x.find('"')
            x=x[:r]
            x=x.strip(' ./')
                 #
            if (len(x)>2) and (x.find(";")==-1):
                out.append(x.strip(" /"))
    out=set(out)
    return(out)

pg="./test.html"# your html

url=geturls(pg)

print(url)

從Python中的HTML鏈接下載文本數據

問題描述

1 個解決方案

解決方案1
0 2018-08-27 15:40:04

從Python中的HTML鏈接下載文本數據

問題描述

1 個解決方案

解決方案1 0 2018-08-27 15:40:04

解決方案1
0 2018-08-27 15:40:04