zoukankan      html  css  js  c++  java
  • Python爬虫如何应对Cloudflare邮箱加密

    最近写一个小爬虫,需要拿到邮箱信息,发现拿不到,也不是ajax接口。最后查资料发现是被Cloudflare加密起来了,有加密肯定有解密。
    柠之漠然:
    这个解密方式就是从那段 js 代码转换过来的
    其中最主要的一句话
    for (e = ”, r = ‘0x' + a.substr(0, 2) | 0, n = 2; a.length – n; n += 2) e += ‘%' + (‘0' + (‘0x' + a.substr(n, 2) ^ r).toString(16)).slice( – 2);
    前面的 2 位数字转化成 16 进制之后就是秘钥, 接下来的每两位字符跟秘钥异或操作之后转成16进制, 然后转换成字符
    最后将所有解出来的字符拼成一起, 就得到邮箱 abc@abc.com 了
    js 这边是用 urlencode 的方式
    下面是复现的js解密代码:
    function jiemi(val) {
    for (e = '', r = '0x' + val.substr(0, 2) | 0, n = 2; val.length - n; n += 2) e += '%' + ('0' + ('0x' + val.substr(n, 2) ^ r).toString(16)).slice(-2); return decodeURIComponent(e)
    }
    

      

     
    然后通过python调用js完美搞定:
    import execjs
     
    def get_js():
    # f = open("./../js/my.js", 'r', encoding='utf-8') # 打开JS文件
    f = open("./jiemi.js", 'r', encoding='utf-8') # 打开JS文件
    line = f.readline()
    htmlstr = ''
    while line:
    htmlstr = htmlstr+line
    line = f.readline()
    return htmlstr
     
     
    def get_des_psswd(e):
    js_str = get_js()
    ctx = execjs.compile(js_str) #加载JS文件
    return (ctx.call('jiemi', e)) #调用js方法 第一个参数是JS的方法名,后面的data和key是js方法的参数
     
     
    if __name__ == '__main__':
    print(get_des_psswd(e='30515253705152531e535f5d'))
    

      

     
    以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持。
  • 相关阅读:
    python中有哪些类型的布尔值是False?
    django中间件(获取请求ip)
    用python进行月份加减的函数
    Python取整函数
    Python里面search()和match()的区别
    在追灿公司的学习笔记
    Maven学习笔记
    天梯赛练习 L3-006 迎风一刀斩 (30分) 几何关系
    PAT甲级 1155 Heap Paths (30分) 堆模拟
    天梯赛练习 L3-016 二叉搜索树的结构 (30分)
  • 原文地址:https://www.cnblogs.com/nanhe/p/13848739.html
Copyright © 2011-2022 走看看