python 爬虫遇到 Cloudflare 邮箱加密
最近写一个小爬虫,需要拿到邮箱信息,发现拿不到,也不是ajax接口。最后查资料发现是被Cloudflare加密起来了,有加密肯定有解密。
通过大佬https://blog.shiniv.com/2016/09/decode-encode-cloudflare-address-obfuscation/了解到了加密算法。
参考大佬的原话搞起来就好:
柠之漠然:这个解密方式就是从那段 js 代码转换过来的 其中最主要的一句话 for (e = ”, r = ‘0x’ + a.substr(0, 2) | 0, n = 2; a.length – n; n += 2) e += ‘%’ + (‘0’ + (‘0x’ + a.substr(n, 2) ^ r).toString(16)).slice( – 2); 前面的 2 位数字转化成 16 进制之后就是秘钥, 接下来的每两位字符跟秘钥异或操作之后转成16进制, 然后转换成字符 最后将所有解出来的字符拼成一起, 就得到邮箱 了 js 这边是用 urlencode 的方式
下面是复现的js解密代码:
function jiemi(val) { for (e = ‘‘, r = ‘0x‘ + val.substr(0, 2) | 0, n = 2; val.length - n; n += 2) e += ‘%‘ + (‘0‘ + (‘0x‘ + val.substr(n, 2) ^ r).toString(16)).slice(-2); return decodeURIComponent(e) }
然后通过python调用js完美搞定:
import execjs def get_js(): # f = open("./../js/my.js", ‘r‘, encoding=‘utf-8‘) # 打开JS文件 f = open("./jiemi.js", ‘r‘, encoding=‘utf-8‘) # 打开JS文件 line = f.readline() htmlstr = ‘‘ while line: htmlstr = htmlstr+line line = f.readline() return htmlstr def get_des_psswd(e): js_str = get_js() ctx = execjs.compile(js_str) #加载JS文件 return (ctx.call(‘jiemi‘, e)) #调用js方法 第一个参数是JS的方法名,后面的data和key是js方法的参数 if __name__ == ‘__main__‘: print(get_des_psswd(e=‘30515253705152531e535f5d‘))
相关推荐
88274956 2020-11-03
runner 2020-09-01
梦的天空 2020-08-25
移动开发与培训 2020-08-16
ReunionIsland 2020-08-16
lyqdanang 2020-08-16
MyNameIsXiaoLai 2020-07-08
星辰的笔记 2020-07-04
csstpeixun 2020-06-28
letheashura 2020-06-26
liaoxuewu 2020-06-26
FEvivi 2020-06-16
坚持着执着 2020-06-16
waterv 2020-06-14
xiaoge00 2020-06-14
firejq 2020-06-14
firstboy0 2020-06-14
e度空间 2020-06-12
zhongweinan 2020-06-10