火车采集 | 火车采集器破解版

社会2023/05/19网友84050

火车采集器怎么编辑标签 火车采集器标签编辑教程

标签编辑

数据内容标签进行编辑定义,数据的获取方式有

A).从源码中获取数据

B).生成固定格式的数据

C).已有标签组合

A).从源码中获取数据:可精确地设置标签的来源是从默认页的源码、返回头信息和网页地址中,

或者是分页、循环分块、多页中。

其数据提取方式包括:

A.a).前后截取

A.b).正则提取

A.c).正文提取

A.d).Xpath提取

A.e).JSON提取

B).生成固定格式的数据:可生成固定的字符串、系统时间、随机字符串、随机数字、系统时间戳、随机抽取信息

C).已有标签组合:可通过组合已有的标签,来生成新的标签内容

A.a).前后截取

通过设置开始字符串和结束字符串,来获取中间的字符,可以在开始和结束字符串中设置通配符(*)

A.b).正则提取

支持两种正则,一个纯正则,一个参数正则。

先介绍纯正则,举个例子,

如:前字符串(?content[sS]*?)后字符串,这个正则其实效果跟前后截取一样,

如需要获取全部代码,则为^(?content[sS]*?)$,此功能运用需有一定的正则基础。

关于参数正则,是通过参数组合,来生成内容。

比如说要匹配标题为“新用户注册”和作者“神秘嘉宾”,代码如下:

divclass=content

h2新用户注册h2

火车采集 | 火车采集器破解版

火车采集器关联多页采集设置

关联多页

当采集的信息不在当前默认页,而在当前默认页某一个链接的所在页时,此时就要用到多页管理了,

多页管理界面如下:

来获取获取它的公司介绍和联系方式页面的联系方式信息。

公司介绍在网址里获取,而联系方式信息在网址里获取。所以我们需要借助多页功能来实现。

前者叫默认页地址,后者叫做多页地址。

流程:点击①创建多页,进行②多页设置,然后在数据来源③选择多页调用,最后根据多页源代码设置提取方式。

下面重点讲解②,多页地址获取方式:

a.页面地址替换

b.源码中截取

a.页面地址替换:也就是默认页和多页地址有相同的地方,通过简单的替换就可以变成多页地址。

b.源码中截取:也就是多页的地址在默认页的页面源代码里面。

下面就上述网址来说明下这两种方式如何获取多页。

a.页面地址替换

比较默认页“;和多页地址:“;之间的共同点,默认页“credITdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。

设置如下图:

正则表达式中(。*)为任意通配符。

$1,$2…$数字来按照顺序对应上面(。*)表示的部分。

若要对多页源码部分区域做限定,可在指定多页源码区域设置。

若留空则默认返回多页整个源代码。

设置好以后,点击测试查看结果。

b.源码中截取

可以看到默认页源码中有多页地址

所以设置如下:

保存即可。

最后设置数据来源和提取方式,如图:

注:如需要多级多页,则在多页地址获取方式:选择需要的多页即可

火车采集器怎么采集json里面的数据

private void button1_Click(object sender, System.EventArgs e)
public override void Display(int depth)
{
Console.WriteLine(new string(-, depth) + name);
foreach (Component component in children)
{
component.Display(depth + 2);
}
}

相关文章