背景交代
在反爬圈子的一个大类,涉及的网站其实蛮多的,目前比较常被爬虫coder欺负的网站,猫眼影视,汽车之家,大众点评,58同城,天眼查…还是蛮多的,技术高手千千万,总有五花八门的反爬技术出现,对于爬虫coder来说,干!就完了,反正也996了~
作为一个系列的文章,那免不了,依旧拿猫眼影视“学习”吧,为什么?因为它比较典型~
猫眼影视
打开猫眼专业版,常规操作,谷歌浏览器,开发者工具,抓取DOM节点,
注意下图所有的数字位置,在DOM结构中,都是方块。
字体反爬扫盲
字体反爬,是一种常见的反爬技术,网站采用了自定义的字体文件,在浏览器上正常显示,但是爬虫抓取下来的数据要么就是乱码,要么就是变成其他字符。采用自定义字体文件是CSS3的新特性,熟悉前端的同学可能知道,就是font-face属性
。
一些重要破解素材的收集
找到font-family
属性,查看设置的内容,发现是cs字体,这明显是自定义字体了,在网页中检索cs
。