最新公告
  • 欢迎您光临站盟网(原知事网),一个优质的网站源码基地、精品网站模板和插件。欢迎加入永久SVIP
  • python爬虫中Beautiful Soup有哪些种类?

    正文概述 知事网   2020-11-12 11:11   65

    作为python中优秀获取数据的工具,Beautiful Soup种类也比较多。每一个种类对应着不同的知识点,小伙伴们学习的时候要用心记忆。当然知识不是一天就能学会的,就像罗马也不是一天就建成的。勤学勤练才是进阶python大神的唯一路径。接下来就开始我们今天对于Beautiful Soup的学习吧。

    一、Tag

    Tag 是什么?通俗点讲就是 HTML 中的一个个标签,例如

    <title>The Dormouse's story</title>
    <a href="http://example.com/elsie" id="link1">Elsie</a>

    二、NavigableString

    既然我们已经得到了标签的内容,那么问题来了,我们要想获取标签内部的文字怎么办呢?很简单,用 .string 即可,例如

    print soup.p.string
    #The Dormouse's story

    三、BeautifulSoup

    BeautifulSoup 对象表示的是一个文档的全部内容。大部分时候,可以把它当作 Tag 对象,是一个特殊的 Tag,我们可以分别获取它的类型,名称,以及属性来感受一下

    print type(soup.name)
    #<type 'unicode'>
    print soup.name
    # [document]
    print soup.attrs
    #{} 空字典

    四、Comment

    Comment 对象是一个特殊类型的 NavigableString 对象,其实输出的内容仍然不包括注释符号,但是如果不好好处理它,可能会对我们的文本处理造成意想不到的麻烦。 我们找一个带注释的标签

    print soup.a
    print soup.a.string
    print type(soup.a.string)

    以上就是python爬虫中Beautiful Soup的4个种类。更多Python学习推荐:PyThon学习网教学中心。


    站盟网 » python爬虫中Beautiful Soup有哪些种类?

    发表评论

    还没有评论,快来抢沙发吧!

    如需帝国cms功能定制以及二次开发请联系我们

    联系作者
    请选择支付方式
    ×
    支付宝支付
    微信支付
    余额支付
    ×
    微信扫码支付 0 元