使用python破除网页限制
2008-02-23 05:59:34来源:互联网 阅读 ()
昨天找到一个比较好的人工智能网站, 其中有一些很不错的 prolog 文章,我很感兴趣。文中有很多示例程式,可是网页的右键被禁止了,也不能选择,不能保存,不能察看源代码!!
??? 实在不爽,信息本来就要共享嘛!
??? 只好发扬下 hack 精神,冲破限制。还好,有 python 方便多了。
??? 网页中增加限制,无非是在 html 中配置脚本,既然浏览器能够显示出来,就一定能得到他的文本。
第一步,在 python shell 中执行:
>>> import urllib
>>> urllib.urlretrieve("http://www.chinaai.org/Article_Show.asp?ArticleID=315","c:/tmp.html")
urlretrieve 能够把一个网页保存到本地文档。
第二步,分析这个 tmp.html 文档,发现其中的?< body > 标签比较恶心:
body leftmargin=0 topmargin=0 onmousemove='HideMenu()' oncontextmenu="return false" ondragstart="return false" onselectstart ="return false" onselect="document.selection.empty()" oncopy="document.selection.empty()" onbeforecopy="return false" onmouseup="document.selection.empty()"
把这个标签换成比较干净的:body leftmargin=0 topmargin=0 onmousemove='HideMenu()'
(注意, < > 在这里省略了)
浏览这个文档, ok 限制解除。
第三步, 自动下载网页,进行“净化”处理, 编写一个python?程式:
import urllib
urls = {'http://www.chinaai.org/Article_Show.asp?ArticleID=315':'prolog2.html'}
new_tag = ""
for url in urls:
??filename = urls[url]
??urllib.urlretrieve(url,filename)
??f = open(filename,'r')
??content = f.read()
??f.close()
??l_pos = content.find('<body')
??r_pos = content.find('>', l_pos)
??cont1 = content[:l_pos]
??cont2 = content[r_pos 1:]
??content = cont1 new_tag cont2
??f = open('tmp.html','w')
??f.write(content)
??f.close()
程式中 urls 是个 字典,里面是 url 和 相应的本地文档名, 使用者能够根据自己的情况添加。
注意,这个程式是专门针对这个网站的, 对于其他的网站,可能使用的方法会有不同,但是按照上面的步骤,相信大家都能搞定。
我们的口号是,“还我自由!”
标签:
版权申明:本站文章部分自网络,如有侵权,请联系:west999com@outlook.com
特别注意:本站所有转载文章言论不代表本站观点,本站所提供的摄影照片,插画,设计作品,如需使用,请与原作者联系,版权归原作者所有
上一篇: Dreamwaver常见问答解答
下一篇: Dreamweaver行为的应用
IDC资讯: 主机资讯 注册资讯 托管资讯 vps资讯 网站建设
网站运营: 建站经验 策划盈利 搜索优化 网站推广 免费资源
网络编程: Asp.Net编程 Asp编程 Php编程 Xml编程 Access Mssql Mysql 其它
服务器技术: Web服务器 Ftp服务器 Mail服务器 Dns服务器 安全防护
软件技巧: 其它软件 Word Excel Powerpoint Ghost Vista QQ空间 QQ FlashGet 迅雷
网页制作: FrontPages Dreamweaver Javascript css photoshop fireworks Flash