zoukankan      html  css  js  c++  java
  • python 爬虫遇到 Cloudflare 邮箱加密

    最近写一个小爬虫,需要拿到邮箱信息,发现拿不到,也不是ajax接口。最后查资料发现是被Cloudflare加密起来了,有加密肯定有解密。

    通过大佬https://blog.shiniv.com/2016/09/decode-encode-cloudflare-address-obfuscation/了解到了加密算法。

    参考大佬的原话搞起来就好:

    柠之漠然:

    这个解密方式就是从那段 js 代码转换过来的 其中最主要的一句话 for (e = ”, r = ‘0x’ + a.substr(0, 2) | 0, n = 2; a.length – n; n += 2) e += ‘%’ + (‘0’ + (‘0x’ + a.substr(n, 2) ^ r).toString(16)).slice( – 2); 前面的 2 位数字转化成 16 进制之后就是秘钥, 接下来的每两位字符跟秘钥异或操作之后转成16进制, 然后转换成字符 最后将所有解出来的字符拼成一起, 就得到邮箱 abc@abc.com 了 js 这边是用 urlencode 的方式

    下面是复现的js解密代码:

    function jiemi(val) {
        for (e = '', r = '0x' + val.substr(0, 2) | 0, n = 2; val.length - n; n += 2) e += '%' + ('0' + ('0x' + val.substr(n, 2) ^ r).toString(16)).slice(-2); return decodeURIComponent(e)
    }

    然后通过python调用js完美搞定:

    import execjs
    
    def get_js():
        # f = open("./../js/my.js", 'r', encoding='utf-8') # 打开JS文件
        f = open("./jiemi.js", 'r', encoding='utf-8') # 打开JS文件
        line = f.readline()
        htmlstr = ''
        while line:
            htmlstr = htmlstr+line
            line = f.readline()
        return htmlstr
    
    
    def get_des_psswd(e):
        js_str = get_js()
        ctx = execjs.compile(js_str) #加载JS文件
        return (ctx.call('jiemi', e))  #调用js方法  第一个参数是JS的方法名,后面的data和key是js方法的参数
    
    
    if __name__ == '__main__':
        print(get_des_psswd(e='30515253705152531e535f5d'))
  • 相关阅读:
    [九度][何海涛] 顺时针打印矩阵
    [何海涛] 求二元查找树的镜像
    [九度][何海涛] 二叉树中和为某一值的路径
    [面试] 水杯题实现
    [九度][何海涛] 最小的K个数
    [九度][何海涛] 字符串的排序
    如何扩展Orchard
    IoC容器Autofac(3) 理解Autofac原理,我实现的部分Autofac功能(附源码)
    使用PrivateObject帮助单元测试
    Nuget如何自动下载依赖DLL引用
  • 原文地址:https://www.cnblogs.com/zy-mousai/p/13172350.html
Copyright © 2011-2022 走看看