使用 python 破除网页限制
来源:互联网 发布:大学女生室友礼物知乎 编辑:程序博客网 时间:2024/06/11 07:20
昨天找到一个比较好的人工智能网站, 其中有一些很不错的 prolog 文章,我很感兴趣。文中有很多示例程序,可是网页的右键被禁止了,也不能选择,不能保存,不能察看源代码!!
实在不爽,信息本来就要共享嘛!
只好发扬下 hack 精神,冲破限制。还好,有 python 方便多了。
网页中增加限制,无非是在 html 中设置脚本,既然浏览器可以显示出来,就一定能得到它的文本。
第一步,在 python shell 中执行:
>>> import urllib
>>> urllib.urlretrieve("http://www.chinaai.org/Article_Show.asp?ArticleID=315","c:/tmp.html")
urlretrieve 可以把一个网页保存到本地文件。
第二步,分析这个 tmp.html 文件,发现其中的 < body > 标签比较恶心:
body leftmargin=0 topmargin=0 onmousemove='HideMenu()' oncontextmenu="return false" ondragstart="return false" onselectstart ="return false" onselect="document.selection.empty()" oncopy="document.selection.empty()" onbeforecopy="return false" onmouseup="document.selection.empty()"
把这个标签换成比较干净的:body leftmargin=0 topmargin=0 onmousemove='HideMenu()'
(注意, < > 在这里省略了)
浏览这个文件, ok 限制解除。
第三步, 自动下载网页,进行“净化”处理, 编写一个python 程序:
import urllib
urls = {'http://www.chinaai.org/Article_Show.asp?ArticleID=315':'prolog2.html'}
new_tag = ""
for url in urls:
filename = urls[url]
urllib.urlretrieve(url,filename)
f = open(filename,'r')
content = f.read()
f.close()
l_pos = content.find('<body')
r_pos = content.find('>', l_pos)
cont1 = content[:l_pos]
cont2 = content[r_pos + 1:]
content = cont1 + new_tag + cont2
f = open('tmp.html','w')
f.write(content)
f.close()
程序中 urls 是一个 字典,里面是 url 和 相应的本地文件名, 使用者可以根据自己的情况添加。
注意,这个程序是专门针对这个网站的, 对于其他的网站,可能使用的方法会有不同,但是按照上面的步骤,相信大家都能搞定。
我们的口号是,“还我自由!”
- 使用 python 破除网页限制
- winmail中web界面破除用户限制
- 破除BC上的制度限制
- 看科技文章有感----破除U盘容量限制
- 如何破除对于自动化沟通行为的限制
- 限制必须使用微信打开网页
- 使用DOS命令破除UNIX管理员口令
- 使用python打开网页
- 使用python抓取网页
- 破除网页鼠标右键禁用的十大绝招
- 用python搜google,突破网页限制(forbidden)
- python使用代理读取网页
- 使用Python抓取网页信息
- python使用urllib2抓取网页
- 使用Python抓取网页信息
- 使用Python工具抓取网页
- 使用python解析网页内容
- 使用 Python 轻松抓取网页
- 俺的BLOG今天开张了……
- SQL Server应用程序中的高级SQL注入
- MS术语对照
- 保护SQL Server的十个步骤
- 进程在内存中的影像
- 使用 python 破除网页限制
- overload和override
- 安装PetShop问题
- 改变人生的五句话
- SQL Server数据库的性能优化
- 分布式Cache ecache
- [日记] 今天发单了,等待数码相机的到来
- 男友5.0升级到老公1.0的BUG
- 2004.09.01,Wed - 关于VC和Platform SDK