页面标题(Title Tag)和 Meta 描述是搜索引擎理解页面内容的第一入口,也是影响点击率的关键因素。当一个网站拥有成百上千个页面时,逐页检查标题和描述几乎不可能靠人工完成。Screaming Frog SEO Spider 的 自定义提取(Custom Extraction) 功能,正是为解决这类批量审计需求而设计的利器。
本文将系统讲解如何配置自定义提取规则,批量抓取页面标题与 Meta 描述,并在此基础上完成常见 SEO 问题的快速排查。
为什么不用默认的页面标题与 Meta 描述面板?
Screaming Frog 本身就会在抓取时自动收集每个页面的标题和 Meta 描述,并显示在 Page Titles 和 Meta Description 两个标签页中。对于常规审计,这已经足够。
但在以下场景中,默认面板会显得力不从心:
- 需要同时对比多个字段:比如把标题、描述、H1、规范链接放在同一张表里交叉分析。
- 需要自定义判断逻辑:默认面板只显示长度和重复情况,无法按业务规则标记“标题缺少品牌词”“描述未包含目标关键词”等问题。
- 需要导出结构化数据做二次处理:默认导出字段固定,无法灵活组合。
- 页面使用了 JS 渲染或非标准写法:默认解析可能遗漏,需要通过 XPath 或 CSS Path 精准定位。
自定义提取的核心价值在于:你可以精确指定“从页面的哪个位置、以什么规则、提取什么内容”,并将结果输出为可自由排序、筛选和导出的表格。
自定义提取的三种模式
在 Screaming Frog 中,自定义提取位于 Configuration → Custom → Extraction。它支持三种提取方式:
- CSS Path:通过 CSS 选择器定位元素,语法简洁,适合大多数标准 HTML 结构。
- XPath:功能最强,支持复杂的层级和条件定位,适合结构不规范或需要精确匹配的场景。
- Regex(正则表达式):直接从 HTML 源码中匹配文本,适合提取非标签包裹的内容。
对于标题和 Meta 描述,最稳妥的方式是使用 XPath,因为这两种元素通常位于 <head> 区域,且可能存在多个同名标签(如多个 <title> 或重复的 <meta name="description">)。
配置标题提取规则
假设我们要提取每个页面的 <title> 标签内容,操作步骤如下:
- 打开 Configuration → Custom → Extraction。
- 在 Extractor 1 的 Name 栏填入
Page Title。 - Type 选择
XPath。 - Expression 填入:
//title/text()
- 勾选 Extract HTML / Inner Text(根据需求选择,通常选 Inner Text 即可)。
- 点击 OK 保存。
如果页面标题是通过 JavaScript 动态写入的,需要在 Rendering 标签中开启 JavaScript Rendering,否则提取结果可能为空。
配置 Meta 描述提取规则
Meta 描述的提取稍微复杂一些,因为并非所有页面都有描述标签,而且写法可能不统一。推荐使用以下 XPath:
//meta[@name='description']/@content
配置方式与标题类似:
- 在 Extractor 2 的 Name 栏填入
Meta Description。 - Type 选择
XPath。 - Expression 填入上述表达式。
- 保存后重新抓取。
如果网站同时使用了 og:description 或 twitter:description,也可以额外添加提取器,用于对比社交描述与 SEO 描述是否一致。
批量审计中的实战用法
配置好提取规则后,重新抓取网站,切换到 Custom → Extraction 标签页,你就能看到所有页面的标题和描述被集中列出。接下来可以做以下几类审计:
1. 快速定位缺失与重复
- 按
Meta Description列排序,空白单元格即为缺失描述的页面。 - 使用 Excel 或 Google Sheets 的 条件格式 → 重复值,一键标出重复标题或重复描述。
- 结合 Screaming Frog 自带的 Page Titles 面板交叉验证,避免因提取规则写错导致误判。
2. 检查长度是否符合规范
将提取结果导出为 CSV 后,用公式计算字符数:
=LEN(B2)
一般建议:
- 标题控制在 50–60 个字符(约 30 个中文字符)以内,避免 SERP 截断。
- Meta 描述控制在 120–155 个字符(约 70–80 个中文字符)之间。
超出或过短的页面可以单独标记,优先处理重要落地页。
3. 结合 H1 做一致性检查
再添加一个提取器,用 XPath 提取 H1:
//h1/text()
然后在导出表格中对比 Title 与 H1 是否语义一致。如果两者差异过大,可能意味着页面主题不聚焦,影响相关性评分。
4. 检查品牌词与关键词覆盖
如果品牌要求标题末尾统一带品牌名,可以用公式检查:
=ISNUMBER(SEARCH("品牌名",B2))
返回 FALSE 的页面即为不符合规范的页面。同理,可以检查 Meta 描述是否包含目标关键词。
5. 监控模板化问题
批量提取后,很容易发现某些栏目页使用了完全相同的标题模板,只是替换了城市名或分类名。这类页面若数量庞大,容易触发搜索引擎的“低质量批量内容”判断,需要针对性优化。
进阶技巧与注意事项
- 使用 XPath 处理多值情况:如果页面存在多个 description 标签,
//meta[@name='description']/@content只会返回第一个。可以用(//meta[@name='description']/@content)[1]明确指定。 - 区分大小写:部分网站的 Meta 标签写作
Description或DESCRIPTION,此时 XPath 需要改为//meta[translate(@name,'ABCDEFGHIJKLMNOPQRSTUVWXYZ','abcdefghijklmnopqrstuvwxyz')='description']/@content。 - 配合 Include / Exclude 过滤:在 Configuration → Include 中限制抓取范围,避免把标签页、分页参数页混入审计结果。
- 定期保存配置:自定义提取规则可以导出为
.seospiderconfig文件,方便团队共享和复用。 - 注意抓取预算:开启 JavaScript Rendering 会显著增加抓取时间,建议先用小批量 URL 测试规则是否正确,再全站运行。
总结
Screaming Frog 的自定义提取功能,把原本分散在页面源码中的标题和 Meta 描述转化为一张可批量分析的结构化表格。通过合理配置 XPath 规则,再结合导出后的公式筛选,你可以在几十分钟内完成过去需要数天的人工审计工作。
核心流程可以归纳为四步:配置提取器 → 全站抓取 → 导出数据 → 公式化排查。掌握这套方法后,无论是日常巡检还是大型站点的 SEO 诊断,都能显著提升效率和准确度。
未经允许不得转载:任鹏个人博客 » 用 Screaming Frog 自定义提取规则批量审计页面标题与 Meta 描述


朋友圈点赞图在线生成源码