Python精美汤解析每个Div中的第一个Href

Question

给出以下代码：

# import the module
import bs4 as bs
import urllib.request
import re

masterURL = 'http://www.metrolyrics.com/top100.html'
sauce = urllib.request.urlopen(masterURL).read()
soup = bs.BeautifulSoup(sauce,'lxml')




for div in soup.findAll('ul', {'class': 'song-list'}):
    for span in div:
        for link in span:
            for a in link:
                print(a)

我可以解析多个div，结果如下：

我的问题是，没有获得div的全部内容，我如何只返回突出显示的部分Href的URL？

Answer 1

尝试这个。 您需要指定正确的class来获取连接到它的URL。

from bs4 import BeautifulSoup
import urllib.request

masterURL = 'http://www.metrolyrics.com/top100.html'
sauce = urllib.request.urlopen(masterURL).read()
soup = BeautifulSoup(sauce,'lxml')

for div in soup.find_all(class_='subtitle'):
    print(div.get("href"))

输出：

http://www.metrolyrics.com/charles-goose-lyrics.html
http://www.metrolyrics.com/param-singh-lyrics.html
http://www.metrolyrics.com/westlife-lyrics.html
http://www.metrolyrics.com/luis-fonsi-lyrics.html
http://www.metrolyrics.com/grease-lyrics.html
http://www.metrolyrics.com/shanti-dope-lyrics.html

等等 - -

Answer 2

if 'href' in a.attrs:
     a.attrs['href']

这将为您提供所需的东西。

Python精美汤解析每个Div中的第一个Href

问题描述

2 个解决方案

解决方案1
1 已采纳 2018-05-18 22:42:02

解决方案2
0 2018-05-18 21:53:17

Python精美汤解析每个Div中的第一个Href

问题描述

2 个解决方案

解决方案1 1 已采纳 2018-05-18 22:42:02

解决方案2 0 2018-05-18 21:53:17

解决方案1
1 已采纳 2018-05-18 22:42:02

解决方案2
0 2018-05-18 21:53:17