爬取马蜂窝网站上的首页热门城市重要信息,语言为python语言。
运行run.py开始爬取
需要在爬取时一直登陆马蜂窝网站,timeout时需要重新登录,注意爬取的时效性,为2025.3.19。
属于暴力爬取,一直没能设计出自动爬取连续网页的代码,因为202问题无法自动访问马蜂窝网站,只好手动下载网页源码,哈哈,投机取巧可还行,也没办法解决一直需要人工登录的问题,怪累人的。
test.py为初始测试爬取代码,不列入主要程序,testonce.py为爬取一页网页上全部信息的尝试,也不列入主要程序。