您的位置首页百科问答

织梦采集功能的使用方法

织梦采集功能的使用方法

的有关信息介绍如下:

织梦采集功能的使用方法

织梦采集功能的使用方法,dedecms自带了文章和图片采集功能,对于不熟悉的新手建站,采集规则配置起来很麻烦,经常在采集时出错,或者乱码,现在就向朋友介绍dedecms的采集功能。

进入采集节点管理界面,在后台管理界面的主菜单中单击“采集”,然后单击“采集节点管理”,即可进入采集节点管理界面。

在采集节点管理界面中,单击左下角的“增加新节点”或者右上角的“添加新节点”如图,都可进入“选择内容模型”界面,如图所示,

设置节点基本信息

目标页面编码:设定被采集目标页的编码格式,有GB2312、UTF8和BIG5三种。可通过在被采集目标页面上,单击右键后选择“查看源文件”来获取。

操作步骤:

(a)打开被采集的目标页:http://网站域名/knowledge/web-based/dreamweaver/;

单击右键后选择“查看源文件”,找到“charset

其等号后面的代码就是所需的“编码格式”,这里是“gb2312”。

“区域匹配模式”:设定如何匹配所需采集的内容部分,可采用字符串或者正则表达式。系统默认的模式是字符串。如果比较了解正则表达式的朋友,可以在这里选择正则表达式的模式。

“内容导入顺序”:指定文章列表导入时候的顺序,可以选择“与目标站一致”或“与目标站相反”。

“防盗链模式”:针对被采集的目标站点有无刷新限制。一开始很难判断出来,需要测试后才能知道。如果有的话,这里需要设置一下“资源下载超时时间”。

“引用网址”:填入任何一个即将被采集的文章内容页面的网址。

在已打开的文章列表页中,单击第一篇文章的

此时在浏览器的URL地址栏中显示的网址,即为需要填写在“引用网址”处的网址,如(图)所示

到这里,“节点基本信息”就设置完成了。最后结果,如(图)所示,

检查无误后,进入下一步设置。

设置列表网址获取规则

这里是设置被采集的文章列表页的匹配规则。如果被采集的文章列表页有一定的规律,可选择“批量生成列表网址”;如果被采集的文章列表页完全没有规律可循,那么可选择“手工指定列表网址”;如果被采集的站点提供了RSS,则可以选择“从RSS中获取”。对于特殊情况,例如:部分列表页有规律,而其余的又没有规律,则可在“匹配网址”中填上有规律的部分,然后把没有规律的部分填写在“手动指定网址”。