用Pyquery重写崔庆才的《Python3网络爬虫开发实战》的

作者: PJCK | 来源:发表于2018-09-17 19:42 被阅读15次

用Python爬取猫眼电影排行榜TOP100
mitmproxy代理使用(一)
用Pyquery重写崔庆才的《Python3网络爬虫开发实战》的
Scrapy爬虫实战项目【002】 - 抓取360摄影美图
Python3网络爬虫开发实战（崔庆才）电子版下载
Splash 提供的 Web 页面输入网址无法渲染问题解决
mac系统下安装tesserocr错误以及解决方法
python3爬虫学习笔记(一)
【华为云社区18年 11月刊】本期推荐：Python3网络爬虫从
反爬必修课之----(3)极验滑动验证码识别

目前正在学Python爬虫，正在读崔庆才的《Python3网络爬虫开发实战》，之前学习正则表达式，但是由于太难，最后放弃了（学渣的眼泪。。。。），在这本书上的抓取猫眼电影排行上，后来自学了pyquery，发现用pyquery可以解决这个问题，目前自己试着写了代码

附上代码：

import requests
from pyquery import PyQuery as pq
import time

def get_one_page(url):

headers = {

    'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.79 Safari/537.36'

}

html = requests.get(url=url,headers=headers)

return html.text

def parse_one_page(html):

doc = pq(html)

items = doc('dd').items()

for item in items:

    item1 = item.find('.board-item-main .board-item-content .movie-item-info')#空格表示嵌套

    item2 = item.find('.board-index')

    print('名次:' + item2.text())

    name = item1.find('.name').text()

    star = item1.find('.star').text()

    time = item1.find('.releasetime').text()

    score = item1.siblings('.movie-item-number .score .integer').text() + item1.siblings('.movie-item-number .score .fraction').text()

    print('电影名:' + name + '\n' +

          star + '\n' + time + '\n' + '评分:'+score +'\n')

def main(offset):

url = 'http://maoyan.com/board/4?offset=' + str(offset) #设置偏移量

html = get_one_page(url)

parse_one_page(html)

if name == 'main':

for i in range(10):

    main(offset = i * 10)

    time.sleep(1)#由于现在猫眼多了反爬虫，如果速度过快则无响应，所以要添加延时等待。

抱歉，第一次用MarkDown编辑器。。。。
代码在https://github.com/PJCKR/Python3Spyder/blob/master/python3%E5%B4%94%E5%BA%86%E6%89%8D.py
欢迎来start

网友评论

本文标题：用Pyquery重写崔庆才的《Python3网络爬虫开发实战》的

本文链接：https://www.haomeiwen.com/subject/sdkdnftx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

用Pyquery重写崔庆才的《Python3网络爬虫开发实战》的

相关文章

用Python爬取猫眼电影排行榜TOP100

mitmproxy代理使用(一)

用Pyquery重写崔庆才的《Python3网络爬虫开发实战》的

Scrapy爬虫实战项目【002】 - 抓取360摄影美图

Python3网络爬虫开发实战（崔庆才）电子版下载

Splash 提供的 Web 页面输入网址无法渲染问题解决

mac系统下安装tesserocr错误以及解决方法

python3爬虫学习笔记(一)

【华为云社区18年 11月刊】本期推荐：Python3网络爬虫从

反爬必修课之----(3)极验滑动验证码识别

网友评论

延伸阅读

深度阅读

栏目导航

热点阅读

爬虫专题

大数据爬虫Python AI Sql

python爬虫总结