爬虫小工具合集 | 不会编制程序也能爬数据

爬虫小工具合集 | 不会编制程序也能爬数据

时下的主流爬虫手段是用Python编制程序,Python的兵不血刃毋庸置疑,但初学者学习Python依旧要求一多少个月时间的。有没有部分更简便的爬取数据格局呢?答案是一对,DataCastle为您准备了之类小工具,对于每一种小工具你只必要花十几分钟时间,跟着作者的手续走3遍就足以操纵它啦~

一、Microsoft Excel

先是教大家3个用Excel爬取多少的章程,那里用的Microsoft Excel
二零一二本子,上面手把手早先教学~

(1)新建Excel,打开它,如下图所示

(2)点击“数据”——“自网站”

(3)在弹出的对话框中输入目的网址,那里以全国实时间和空间气品质网站为例,点击转到,再导入

选择导入地点,明确

(4)结果如下图所示,怎么着,是否十分的赞?

(5)要是要实时更新数据,能够在“数据”——“全体制改良进”——“连接属性”中举行设置,输入更新频率即可

二、Google Sheet

应用谷歌(Google)Sheet爬取多少前,要确定保证三点:使用Chrome浏览器、拥有谷歌(Google)账号、电脑已翻墙。如若那多少个标准有所了的话,上面我们就起来吧~

(1)打开Google
Sheet
网站:

(2)在首页上点击“转到谷歌(Google)表格”,然后登录本身的账号,能够看看如下界面,再点击“+”创制新的表格

新建的表格如下:

(3)打开要爬取的对象网站,贰个全国实时间和空间气品质网站
,目的网站上的报表结构如下图所示

(4)回到谷歌 sheet页面,使用函数=IMPO君越THTML(网址, 查询,
索引),“网址”就是要爬取数据的目的网站,“查询”中输入“list”或“table”,那么些取决于数量的现实性协会类型,“索引”填阿拉伯数字,从1开首,对应着网站中定义的哪一份报表或列表

对于我们要爬取的网站,大家在谷歌(Google)sheet的A1单元格中输入函数=IMPO凯雷德THTML(“http://www.pm25.in/rank“,”table”,1),回车后就爬得多少啦

(5)将爬取好的报表存到本地

是还是不是感觉超级不难?

三、you-get

那是二个程序员基于python
3开发的品种,已经在github上边开源,支持陆15个网站,包涵优酷、土豆、爱奇艺、b站、酷狗音乐、虾米……总而言之你能体会通晓的网站都有!
还有1个黑科技(science and technology)的地点,尽管是名单上尚无的网站,当你输入链接,程序也会嫌疑你想要下载什么,然后帮你下载。当然you-get要在python3条件下进展设置,用pip安装好后,在终端输入“you
get+你想下载财富的链接”就足以等着收藏能源了。

此处给3个you-get的中文使用表明,遵照表明上写的按步骤操作就能够啊。

未完待续……以往DataCastle还会接二连三补充部分大致好用的爬虫小工具的,记得援救一下呀~

admin

网站地图xml地图