Skip to content

FateGitHub/PythonDocument

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

页面解析和数据提取

一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。

  • 非结构化数据:先有数据,再有结构,
  • 结构化数据:先有结构、再有数据
  • 不同类型的数据,我们需要采用不同的方式来处理。

非结构化的数据处理 {#非结构化的数据处理}

文本、电话号码、邮箱地址 {#文本、电话号码、邮箱地址}
  • 正则表达式
HTML 文件 {#html-文件}
  • 正则表达式
  • XPath
  • CSS选择器

结构化的数据处理 {#结构化的数据处理}

JSON 文件 {#json-文件}
  • JSON Path
  • 转化成Python类型进行操作(json类)
XML 文件 {#xml-文件}
  • 转化成Python类型(xmltodict)
  • XPath
  • CSS选择器
  • 正则表达式

2.Beautiful Soup 4.2.0 文档

https://www.crummy.com/software/BeautifulSoup/bs4/doc/index.zh.html

About

Python文档

Resources

Stars

Watchers

Forks

Releases

No releases published

Packages

No packages published