# Python微博搜索关键词爬取数据 **Repository Path**: brucewong96/python_microblog_search_keywords_crawl_data ## Basic Information - **Project Name**: Python微博搜索关键词爬取数据 - **Description**: 基于Python的爬虫项目 - **Primary Language**: Python - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 7 - **Forks**: 1 - **Created**: 2018-04-03 - **Last Updated**: 2021-08-04 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README ### Python微博搜索关键词爬取数据 0. 本项目是基于Python的爬虫实验,比较简单直接,若想获取不同的关键词爬虫数据只需要,修改代码中的title属性即可。 1. 本项目配置环境:Python 3.6 + PyCharm + MongoDB 3.2.17 + MongoVUE 1.6.9 2. MongoDB 不建议下载高版本,因为可能与MongoVUE 不匹配。 3. 项目创建:在编译器PyCharm中,创建weibo项目,下载本项目中的getPage.py即可。 4. 以下是本项目过程中遇到的问题: ``` 4.1. MongoVUE 一般新用户可以免费试用15天,以下是软件安装包及破解说明 链接:https://pan.baidu.com/s/1W2PezHHWH0rOMZ-arnpflg 密码:z7ot 4.2 mongoVUE 连接MongoDB3.2不能正常显示collection的问题: - 引擎的原因,只要降到2.X版本就可以显示了 - 3.x默认是wiredTiger 引擎,2.x默认是mmapv1 引擎 - 打开MongoDB服务器,打开管理软件连接到服务器,此时如果数据库是默认条件下打开的,那么MongoVUE的collection列表是没法 检测到,也没法新建的。这是因为MongoDB 3.2之后默认启动的是wiredTiger引擎,这个引擎和之前的引擎不同,而管理软件匹配 的还是之前的引擎,所以无法使用。 - 此时要重新启动MongoDB服务器。**启动命令**是: mongod –storageEngine mmapv1 –dbpath C:\data 其中C:\data是数据 库存储路径(需要自己创建此空文件夹)。 4.3 在PyCharm需要下载urllib, pyquery 和 pymongo。 ``` 5. 以下是部分步骤截图: **cmd启动数据库服务器** ![cmd启动数据库服务器](https://gitee.com/github-29974394/python_microblog_search_keywords_crawl_data/raw/d1c9bd0e79425af07ba5afa83b014993d6721393/weibo/picture/cmd.png "cmd启动数据库服务器") **程序运行结果** ![程序运行结果](https://gitee.com/github-29974394/python_microblog_search_keywords_crawl_data/raw/d1c9bd0e79425af07ba5afa83b014993d6721393/weibo/picture/result.png "程序运行结果") 6. 如有任何疑问请联系 m15069394700@163.com 欢迎交流