将 Semrush MCP 连接到 AI
全球最强大的流量、可见度和市场数据集。已融入您的 AI 助手中。
免费试用 Semrush One
统一 SEO 权威和 AI 可见度的领先平台。
立即获取门票
为期一天。实战策略。专为志在必得的营销人打造。
2026 年 10 月 13 日英国伦敦
知识库
Semrush 工具箱
SEO
网站检测
配置网站检测

配置网站检测

当您在 Semrush 中创建第一个文件夹时,系统会自动为您提供的域名配置并启动网站检测。 初始抓取完成后,您可以从左侧菜单进入网站检测工具,或从主页查看结果。

对于您创建的任何后续文件夹,您需要手动配置网站检测。 为此,请从网站检测创建一个新文件夹,并按照提示配置并启动您的检测营销活动。

如果您在运行网站检测时遇到问题,请参考网站检测故障排除获取帮助。

常规设置

您将进入设置向导的第一部分,标题为"常规设置。" 在这里,您可以选择“开始检测”,系统会立即使用默认设置对您的网站进行检测;也可以继续自定义检测设置。 不过请放心,您始终可以在初始设置后更改设置,并重新运行检测,以抓取网站中更具体的区域。

网站检测设置向导,显示第一步:常规设置。

抓取范围

要抓取特定的域名,子域名或子文件夹,您可以将其输入到“范围”字段中。 如果您在此字段中输入域名,系统会提供一个复选框,允许您抓取该域名下的所有子域名。

默认情况下,该工具会检查根域名,其中包括您网站的所有可用子域名和子文件夹。 在网站检测设置中,您可以将子域名或子文件夹指定为抓取范围;如果您不想抓取其他子域名,可以取消勾选

例如,您只想检测网站的博客。 您可以将抓取范围指定为 blog.semrush.comsemrush.com/blog/,具体取决于它是以子域名还是子文件夹的形式实现。

显示网站检测设置的窗口,包含抓取范围,页面数量上限和抓取来源选项。 红色箭头指向抓取范围下方的“示例”链接,该链接会显示根域名,子域名和子文件夹的示例格式。

每次检测的页面数量上限

接下来,请选择每次检测要抓取多少个页面。 您应根据订阅等级以及计划重新检测网站的频率,谨慎选择这个数量。

  • Pro SEO 工具箱 用户每月最多可抓取 100,000 个页面,每次检测最多可抓取 20,000 个页面
  • Guru SEO 工具箱 用户每月可抓取 300,000 个页面,每次检测可抓取 20,000 个页面
  • Business SEO 工具箱用户每月可抓取最多 1 million 个页面,每次检测可抓取 100,000 个页面

要抓取的页面

设置“要抓取的页面”会决定 Semrush 网站检测机器人如何抓取您的网站并查找要检测的页面。 除了设置抓取来源外,您还可以在设置向导的第 3 步和第 4 步中配置要包含到检测中或从检测中排除的屏蔽和参数。

共有 4 个选项可设置"要抓取的页面":网站,Robots.txt 站点地图,按 URL 的站点地图,以及 URL 文件。

1。 从网站抓取表示我们会像 GoogleBot 一样抓取您的网站,使用广度优先搜索算法,并从首页开始,沿着页面代码中看到的链接进行导航。

如果您只想抓取网站中最重要的页面,那么选择从站点地图而不是从网站抓取,将使检测抓取最重要的页面,而不仅仅是那些从首页最容易访问的页面。

2。 从 Robots.txt 站点地图抓取意味着我们只会抓取 robots.txt 文件中链接的站点地图里找到的 URL。

3。 从按 URL 的站点地图抓取与从“Robots.txt 站点地图”抓取类似,但此选项允许您直接输入站点地图 URL。

由于搜索引擎使用站点地图来了解哪些页面应该抓取,因此您应尽量保持站点地图始终尽可能最新,并在我们的工具中将其用作抓取来源,以获得准确的检测结果。

备注:网站检测一次只能将一个站点地图 URL 用作抓取来源,因此如果您的网站有多个站点地图,下一项 (从文件导入 URL) 可能是一个变通方法。

4。 从包含 URL 的文件抓取可让您对网站上一组高度特定的页面进行检测。 请确保您的文件格式正确,为 .csv 或 .txt,并且每行一个 URL,然后直接从您的计算机上传到 Semrush。

如果您想检查特定页面并节省抓取配额,这是一种实用的方法。 如果您只对网站中的一小部分页面进行了更改,并且希望检查这些页面,您可以使用此方法运行特定检测,而不会浪费抓取配额。

上传文件后,向导会告诉您检测到多少个 URL,这样您就可以在运行检测前再次确认是否正常工作。

网站检测设置窗口,选中并突出显示“要抓取的页面”下方的文件中的 URL。 文件中识别出的 URL 数量也被突出显示。

排期

最后,选择我们自动审核您网站的频率。 您的选项是:

  • 每周(可选择一周中的任意一天)
  • 每日
  • 一次

您随时都可以重新运行检测。

计划选项示例。 展开下拉菜单,显示每周每天,每天和仅抓取一次的选项。

完成所有所需设置后,选择“开始检测”。

高级设置和配置

注意:以下配置步骤属于高级选项,且为可选。

抓取器设置

您可以在此选择要用于抓取网站的用户代理。 首先,通过在 SemrushBot 或 GoogleBot 的移动版和桌面版之间进行选择,设置检测的用户代理。 您也可以选择 OpenAI-Search 用户代理,该代理会检查您的网站是否可以被新的搜索机器人抓取。

默认情况下,我们会使用移动抓取机器人检查您的网站,该机器人会以与 Google 的移动抓取器访问您的网站相同的方式帮助完成网站检测。 您可以随时将机器人更改为 Semrush 桌面抓取器。 

网站检测设置菜单,打开第二个选项卡“抓取器”。 用户代理部分被突出显示,显示已选择 SiteAuditBot-Mobile 作为当前选项。

随着您更改用户代理,下面对话框中的代码也会随之变化。 这是用户代理的代码,如果您想自行测试该用户代理,可在 curl 中使用。

抓取延迟选项

接下来,您有 3 个设置抓取延迟的选项:最小延迟,遵循 robots.txt,以及每 2 秒 1 个 URL。

如果您保留勾选此页面之间的最小延迟,机器人将以其正常速度抓取您的网站。 默认情况下,SemrushBot 会等待大约一秒,然后再开始抓取另一个页面。

如果您的网站上有 robots.txt 文件,并且已指定抓取延迟,您可以选择"遵循 robots.txt 抓取延迟"选项,让我们的网站检测抓取器按照该指示的延迟进行抓取。

下面展示了 robots.txt 文件中的抓取延迟示例:

Crawl-delay: 20

如果我们的抓取器拖慢了您的网站,而且您的 robots.txt 文件中没有抓取延迟指令,您可以告诉 Semrush 每 2 秒抓取 1 个 URL。 这可能会使检测完成所需的时间更长,但在检测期间,会为您网站上的实际用户带来更少的潜在速度问题。

JavaScript 抓取

如果您的网站使用 JavaScript,您可以在网站检测活动的设置中启用 JS 渲染。 JavaScript 渲染允许我们的抓取器执行 JS 文件,并查看与访客相同的内容。 这样,您可以获得更准确的抓取结果(与 Googlebot 的结果非常相似),并更全面地了解您网站的健康状况。

如果已禁用 JS 渲染,网站检测只会查看您网站的 HTML。 虽然抓取 HTML 更快,而且不会减慢您网站的速度,但检测结果的准确性会较低。

“网站检测”设置窗口,显示第二个选项卡“抓取器设置”。 JS 渲染部分是此选项卡中的最后一项,并已高亮显示,以便更容易找到此选项。

请注意,此功能仅适用于 Guru 或 Business SEO 工具箱订阅。

允许/禁止规则

如需抓取网站的特定子文件夹或阻止某些子文件夹,请参阅"允许/禁止 URL"网站检测设置步骤。 此步骤还允许一次审核多个特定子文件夹。

请在下方文本框中输入顶级域名之后 URL 中的全部内容。 例如,如果您想抓取子文件夹 http://www.example.com/shoes/mens/,请在左侧的允许框中输入 /shoes/mens/。

网站检测设置中的“允许/禁止 URL”步骤。 显示两个输入字段,分别用于允许和禁止的掩码,并附有示例。

要避免抓取特定子文件夹,您需要在禁止框中输入该子文件夹的路径。 例如,如果您想抓取男鞋类别,但避开男鞋下的徒步靴子子类别(https://example.com/shoes/mens/hiking-boots/),请在“禁止”框中输入 /shoes/mens/hiking-boots/。

示例展示如何细化允许/禁止掩码设置。允许字段高亮显示 /shoes/mens/ 路径,而禁止字段高亮显示 /shoes/mens/hiking-boots 子文件夹,说明即使允许了更宽泛的路径,也可以排除特定子文件夹。

如果您忘记在“禁止”框中的 URL 末尾输入 /(例如:/shoes),那么 Semrush 将跳过 /shoes/ 子文件夹中的所有页面,以及所有以 /shoes 开头的 URL(例如 www.example.com/shoes-men)。 

URL 参数规则

URL 参数(也称为查询字符串)是 URL 中不符合层级路径结构的元素。 相反,它们会添加到 URL 末尾,并向网页浏览器提供逻辑指令。

URL 参数始终由一个 ? 开头 后面跟着参数名称(page,utm_medium 等)和 =。

因此,“?page=3”是一个简单的 URL 参数,可能表示单个 URL 上滚动到的第 3 页。

网站检测配置的第 4 步允许您指定网站使用的任何 URL 参数,以便在抓取时将其从 URL 中移除。 这有助于 Semrush 在您的审核中避免抓取同一页面两次。 如果机器人检测到两个 URL:一个带参数,一个不带参数,它可能会同时抓取两个页面,从而浪费抓取预算。

网站检测设置中的 URL 参数规则步骤。 参数字段中显示并高亮了几个示例条目,用于说明 URL 参数的正确格式。

例如,如果您在此框中输入"page",系统会移除所有在 URL 路径中包含"page"的 URL。 这类 URL 的值可能是 ?page=1,?page=2 等。 这样就可以避免在抓取过程中重复抓取同一页面(例如,将“/shoes”和“/shoes/?page=1”视为一个 URL)。

URL 参数的常见用途包括页面,语言和子分类。 这类参数适用于拥有大型产品或信息目录的网站。 另一种常见的 URL 参数类型是 UTM,用于跟踪营销活动中的点击和流量。

如果您已经设置了网站检测营销活动,并希望更改设置,可以使用“设置”齿轮进行操作:

网站检测概览报告,其中设置菜单通过右上角的齿轮图标打开。 设置菜单是一个下拉菜单,您可以向下滚动查看更多设置选项。 这些选项列表以及齿轮图标都用红色标出,以便更容易找到。

您将按照上面的相同说明,选择“Masks”和“Removed Parameters”选项。

绕过限制

要检测预发布网站,或通过基本访问身份验证隐藏的网站,步骤 5 提供了三种选项:

网站检测设置中的“绕过限制”步骤。 标有 1 的红色箭头指向“绕过 robots.txt 和 meta robots 标签中的禁止规则”选项。 标注为 2 的第二个箭头指向“使用我的凭据抓取”选项,该选项会显示用户名和密码输入字段。

网站检测设置中显示"绕过限制"部分,并有箭头指向"使用 Web Bot Auth 签名抓取"。

绕过 robots.txt 和 robots 元标签中的 disallow 指令

如果您想绕过 robots.txt 或 meta 标签中的 disallow 指令(通常位于您网站的 标签中),则必须将 Semrush 提供的 .txt 文件上传到您网站的主文件夹中。 此过程会验证您的所有权,并允许我们的机器人抓取该网站。

使用您的凭据进行抓取

建议用于非公开网站或正在开发中的网站。 只需输入您用于访问网站隐藏部分的用户名和密码。 我们的机器人将使用这些登录信息绕过受密码保护的区域,并提供您的审核结果。

使用 Web Bot Auth 签名抓取

某些托管平台(例如 Shopify)可能会出于安全或性能原因默认阻止未知机器人。 添加 Web Bot Auth 签名后,Semrush 抓取器可以表明自身身份,并证明它有权访问您的网站。

配置方法如下:

  • 选中 使用 Web Bot Auth 签名抓取复选框。
  • Signature Agent:输入代理 URL(例如,“https://shopify.com”)。
  • Signature Input:输入您的主机要求的特定输入字符串。
  • Signature:输入由您的平台提供的唯一加密签名。

疑难解答

如果出现"审核域名失败"对话框,您需要检查我们的网站检测抓取器是否被您的服务器阻止。 为确保正确抓取,请按照我们的网站检测故障排查步骤,将我们的机器人加入白名单。 

或者,您可以下载抓取失败时生成的日志文件,并将该日志文件提供给您的网站管理员,以便他们分析情况,并尝试找出我们被阻止抓取的原因。

连接 Google Analytics(分析)和网站检测

完成设置向导后,您将能够连接您的 Google Analytics(分析)账户,以包含与您浏览量最高的页面相关的问题。 

如果运行网站检测时问题仍然存在,请尝试排查网站检测故障