网站怎么采集 wordpress如何实现自动采集

2018-11-02    来源:学做网站论坛

容器云强势上线!快速搭建集群,上万Linux镜像随意使用

WordPress是一种使用PHP语言开发的建站程序平台,现在做博客用wp的已经很多了,很多网站制作培训都使用的是wp,特别是在做采集站的时候wordpress的共能很强大。下面就给大家介绍如何实现wp的自动采集功能。

  1. 安装网站采集插件:WP-AutoPost(插件下载地址:https://www.xuewangzhan.com/cj/11379.html)wordpress如何实现自动采集5
  2. 点击“新建任务”后,输入任务名称,即可创建新任务,创建好新任务之后可以在任务列表中查看到该任务,就可对该任务进行更多设置。(这一部分不需要修改设置,唯一需要改动的就是采集的时间。)
  3. 文章来源设置。在该选项卡下我们需要设置文章来源的?文章列表网址?及?具体文章的匹配规则。我们以采集”新浪互联网新闻“为例,文章列表网址为http://roll.tech.sina.com.cn/internet_worldlist/index.shtml,因此在?手工指定文章列表网址?中输入该网址即可,如下所示:wordpress如何实现自动采集6
  4. 文章网址匹配规则。文章网址匹配规则的设置非常简单,无需复杂设置,提供两种匹配模式,可以使用URL通配符匹配,也可以使用CSS选择器进行匹配,通常使用URL通配符匹配较为简单,但有时使用CSS选择器更为精确。
  5. ?使用URL通配符匹配。通过点击列表网址?http://roll.tech.sina.com.cn/internet_worldlist/index.shtml?上的文章,我们可以发现每篇文章的URL都为如下结构:http://tech.sina.com.cn/i/2013-06-27/16328485884.shtml,因此将URL中变化的数字或字母替换为通配符??(*)??即可,如:http://tech.sina.com.cn/i/(*)/(*).shtml 。重复的网址可以使用301重定向。
  6. 使用CSS选择器进行匹配。使用CSS选择器进行匹配,我们只需要设置文章网址的CSS选择器即可,通过查看列表网址http://roll.tech.sina.com.cn/internet_worldlist/index.shtml的源代码即可轻松设置,找到列表网址下文章超链接的代码,如下所示:wordpress如何实现自动采集7
  7. 可以看到,文章的超链接A标签在class为“contList”的标签内部,因此文章网址的CSS选择器只需要设置为??.contList a? 即可,如下所示:wordpress如何实现自动采集10
  8. 设置完成之后,不知道设置是否正确,可以点击上图中的测试按钮,如果设置正确,将列出该列表网址下所有文章名称和对应的网页地址,如下所示:wordpress如何实现自动采集11
  9. 其他的设置可以不用修改。
  10. 以上采集方法适用于WordPress多站点功能。

标签: 代码 互联网 建站 建站程序 网站制作

版权申明:本站文章部分自网络,如有侵权,请联系:west999com@outlook.com
特别注意:本站所有转载文章言论不代表本站观点!
本站所提供的图片等素材,版权归原作者所有,如需使用,请与原作者联系。

上一篇:如何去除WordPress网站上传图片默认链接

下一篇:wordpress网站如何做URL伪静态设置[PHP全能空间通用]