# sortmyhouse.co.uk 被 AI 引用体检：84/100 · 基础扎实，细节待补

- 目标：https://sortmyhouse.co.uk/
- 扫描时间：2026-09-07T12:22:26.620Z（耗时 1975 ms）
- 报告：https://madeinred.com/scan/sortmyhouse.co.uk
- JSON：https://madeinred.com/api/v1/report?url=https%3A%2F%2Fsortmyhouse.co.uk%2F

## 分层得分

| 层 | 得分 | 通过 |
|---|---|---|
| 抓取许可（不开门，推了也白推） | 45 / 45 | 12 / 12 |
| 推送就绪（等价于 GSC 的那个按钮） | 19.4 / 25 | 6 / 9 |
| 引用形态（推不动，只能塑形） | 15.9 / 30 | 4 / 13 |
| 新兴信号（有则加分，无不扣分） | +3.5 / 5 | 3 / 6 |

## 全身检查（抽样页面的引用形态）

| 类型 | 页面 | HTTP | 引用形态 | 缺口 |
|---|---|---|---|---|
| 其它页 | https://sortmyhouse.co.uk/buying/roof-drainage-ground-checks/ | 200 | 73% | H2 使用问句 / 对比句；标题后紧跟 40–80 词直接结论；发布 / 更新日期可机读；作者 / 发布者可机读 |

- sitemap 抽检：1 / 1 存活
- 信任页：关于 ✓，联系 ✓，政策 ✓

## 优先修复

### 01 Bing Webmaster Tools 验证痕迹 · 推送就绪 · 未通过

证据：没有 msvalidate.01 meta，也没有 /BingSiteAuth.xml。（若通过 DNS CNAME 验证则站外不可见，可忽略此项。）

修复：

注册 Bing Webmaster Tools（bing.com/webmasters），选择"从 Google Search Console 导入"一键同步站点与 sitemap；验证后对重点页面用 URL Inspection → Request Indexing 手动请求收录——这就是那个"pin"按钮。

### 02 RSS / Atom 订阅源可发现 · 推送就绪 · 未通过

证据：<head> 中没有 RSS/Atom 的 <link rel="alternate">。

修复：

输出 RSS 或 Atom（WordPress 默认有 /feed/），在 <head> 声明 <link rel="alternate" type="application/rss+xml" href="...">，并在 Bing Webmaster Tools 的 Sitemaps 里一并提交订阅源。

### 03 Google Search Console 验证痕迹 · 推送就绪 · 部分

证据：没有 google-site-verification meta。GSC 常用 DNS / GA / GTM 验证，站外无法确认，仅扣一半。

修复：

确认站点已在 Google Search Console 验证并提交 sitemap（喂 AI Overviews 与 Gemini）。

### 04 发布 / 更新日期可机读 · 引用形态 · 未通过

证据：没有机读的发布/更新日期（JSON-LD、article:*_time、<time datetime> 均未发现）。

修复：

在 JSON-LD 中输出 datePublished 与 dateModified，并在页面可见处用 <time datetime="2026-…">更新于 …</time>。

### 05 可抽取的列表 / 表格 · 引用形态 · 未通过

证据：正文区没有 ≥3 项的列表，也没有表格。

修复：

把参数、对比、步骤改写成 <ul>/<ol>/<table>（不要用 div 模拟），这是最容易被整块摘录的形态。

### 06 引用外部来源 · 引用形态 · 未通过

证据：正文没有引用任何外部来源（社媒链接不计）。

修复：

为关键数据、标准与结论加 2 个以上权威外链。注意："有其他站佐证"指的是别人引用你，站外无法在此验证——这里量的是你引用别人，是可信度的下限。

### 07 服务端渲染的正文 · 引用形态 · 部分

证据：原始 HTML 正文 422 字符 / 约 76 词，文本占比 2.4%，H1 1 个，HTML 18 KB。 正文偏少（<500 字符），可摘录的内容不足。

修复：

在原始 HTML 中提供至少 500 字符的有意义正文（不是导航与按钮文字）。

### 08 抽样页面的引用形态（产品 / 文章 / 分类） · 引用形态 · 部分

证据：抽样 1 个页面的引用形态得分率：其它页 73%（平均 73%）。共同缺口：H2 使用问句 / 对比句（1/1 页）；标题后紧跟 40–80 词直接结论（1/1 页）；发布 / 更新日期可机读（1/1 页）；作者 / 发布者可机读（1/1 页）。

修复：

按页面类型修模板，而不是逐页改：最弱的是 其它页（73%，https://sortmyhouse.co.uk/buying/roof-drainage-ground-checks/）。跨页面最常见的缺口：H2 使用问句 / 对比句（1/1 页）；标题后紧跟 40–80 词直接结论（1/1 页）；发布 / 更新日期可机读（1/1 页）；作者 / 发布者可机读（1/1 页）。这些多半来自同一个页面模板，改模板一次即可覆盖全站同类页面。

### 09 标题层级清晰 · 引用形态 · 部分

证据：H2 只有 0 个。共 1 个标题。

修复：

一页一个 H1；用 ≥2 个 H2 划分问题；不要跳级（H2 下用 H3）。

### 10 作者 / 发布者可机读 · 引用形态 · 部分

证据：有 Organization 结构化数据，但页面没有 author 归属。

修复：

文章类页面在 JSON-LD 中加 author（Person 或 Organization，含 name 与 url）；品牌页至少给 publisher。

### 11 品牌实体（Organization + sameAs） · 引用形态 · 部分

证据：有 Organization，但没有 sameAs 指向官方社媒 / LinkedIn / Wikidata / Crunchbase 等。

修复：

在 Organization 中加 sameAs 数组，列出所有官方外部身份页，让引擎把"其他站的佐证"归到同一实体。

### 12 Open Graph 完整 · 引用形态 · 部分

证据：缺少：og:image。

修复：

补齐 Open Graph 四要素，og:image 用 1200×630 的品牌图。

## 实测抓取（按 User-Agent）

| 身份 | HTTP | 正文字符 | 耗时 | 判定 |
|---|---|---|---|---|
| 普通浏览器 | 200 | 3054 | 438 ms | 正常 |
| OAI-SearchBot | 200 | 3054 | 196 ms | 正常 |
| ChatGPT-User | 200 | 3054 | 163 ms | 正常 |
| Bingbot | 200 | 3054 | 179 ms | 正常 |

## 抓取许可 · 不开门，推了也白推

- ✓ **robots.txt 放行 OAI-SearchBot** — 专属分组 User-agent: OAI-SearchBot 允许抓取 /（显式放行）。
- ✓ **实测：OAI-SearchBot 身份可抓取** — 以 OAI-SearchBot 身份抓取正常。HTTP 200，18600 字节，正文 3054 字符（浏览器基线 422 字符），196 ms。
- ✓ **robots.txt 放行 ChatGPT-User** — 专属分组 User-agent: ChatGPT-User 允许抓取 /（显式放行）。
- ✓ **robots.txt 放行 Bingbot** — 专属分组 User-agent: Bingbot 允许抓取 /（显式放行）。
- ✓ **实测：ChatGPT-User 身份可抓取** — 以 ChatGPT-User 身份抓取正常。HTTP 200，18600 字节，正文 3054 字符（浏览器基线 422 字符），163 ms。
- ✓ **页面允许索引** — 没有 meta robots / X-Robots-Tag 限制，默认可索引。
- ✓ **实测：Bingbot 身份可抓取** — 以 Bingbot 身份抓取正常。HTTP 200，18600 字节，正文 3054 字符（浏览器基线 422 字符），179 ms。
- ✓ **放行其它 AI 答案引擎** — 8 个答案引擎爬虫（PerplexityBot, Perplexity-User, Claude-SearchBot, Claude-User, DuckAssistBot, Applebot, Amazonbot, MistralAI-User）全部放行。
- ✓ **允许摘录片段** — 未设置摘录限制。
- ✓ **HTTP 基础健康** — HTTP 200，HTTPS，0 次跳转，首字节 438 ms（含正文 438 ms），18600 字节，Content-Type text/html。
- ✓ **robots.txt 放行 Googlebot** — 专属分组 User-agent: Googlebot 允许抓取 /（显式放行）。
- ✓ **不存在的路径返回真实 404** — 随机不存在路径返回 HTTP 404。
- i **GPTBot（训练爬虫）策略**（仅展示） — GPTBot（训练爬虫）目前放行。放不放行不影响 ChatGPT 搜索引用，纯属你对训练数据的态度。
- i **CDN / WAF 识别**（仅展示） — 站点走 Cloudflare（cf-ray a375adc42bf91e0f-LAX，cf-cache-status DYNAMIC）。Bot Fight Mode / AI Crawl Control 的默认策略会拦截 AI 爬虫，请对照上面三条"实测"结果逐项核查。
- — **Content-Signal 未禁止 AI 检索** — robots.txt 中没有 Content-Signal 指令（未使用 Cloudflare 内容信号），不适用。

## 推送就绪 · 等价于 GSC 的那个按钮

- ✕ **Bing Webmaster Tools 验证痕迹** — 没有 msvalidate.01 meta，也没有 /BingSiteAuth.xml。（若通过 DNS CNAME 验证则站外不可见，可忽略此项。）
- ✕ **RSS / Atom 订阅源可发现** — <head> 中没有 RSS/Atom 的 <link rel="alternate">。
- ~ **Google Search Console 验证痕迹** — 没有 google-site-verification meta。GSC 常用 DNS / GA / GTM 验证，站外无法确认，仅扣一半。
- ✓ **sitemap.xml 存在且被 robots.txt 声明** — sitemap 索引 https://sortmyhouse.co.uk/sitemap.xml，1 条（抽样子图 https://sortmyhouse.co.uk/sitemaps/buying-00001.xml），已在 robots.txt 声明。
- ✓ **sitemap 里的 URL 真实存活** — 抽检 1 条 URL 全部返回 2xx（sitemap 共 1 条）。
- ✓ **sitemap 带 lastmod 且近期更新** — 1/1 条带 lastmod（100%），最新 2026-08-14（24 天前）。
- ✓ **canonical 自指向** — canonical 自指向：https://sortmyhouse.co.uk/
- ✓ **http 自动跳转 https** — http:// 经 1 跳（301）到 https://sortmyhouse.co.uk/
- ✓ **title 与 meta description 完备** — title「What can a postcode lookup show in England and Wales? | Home」(64)；description 143 字符。
- i **IndexNow 即时推送**（仅展示） — IndexNow 的 key 文件名不可预测，站外无法验证是否接入。若你的发布流程已经在推送，忽略此项。
- — **多语言 hreflang** — 未声明 hreflang。单语站不适用；若你有多语言版本，请为每种语言互相声明 <link rel="alternate" hreflang="..."> 并含 x-default。

## 引用形态 · 推不动，只能塑形

- ✕ **发布 / 更新日期可机读** — 没有机读的发布/更新日期（JSON-LD、article:*_time、<time datetime> 均未发现）。
- ✕ **可抽取的列表 / 表格** — 正文区没有 ≥3 项的列表，也没有表格。
- ✕ **引用外部来源** — 正文没有引用任何外部来源（社媒链接不计）。
- ~ **服务端渲染的正文** — 原始 HTML 正文 422 字符 / 约 76 词，文本占比 2.4%，H1 1 个，HTML 18 KB。 正文偏少（<500 字符），可摘录的内容不足。
- ~ **抽样页面的引用形态（产品 / 文章 / 分类）** — 抽样 1 个页面的引用形态得分率：其它页 73%（平均 73%）。共同缺口：H2 使用问句 / 对比句（1/1 页）；标题后紧跟 40–80 词直接结论（1/1 页）；发布 / 更新日期可机读（1/1 页）；作者 / 发布者可机读（1/1 页）。
- ~ **标题层级清晰** — H2 只有 0 个。共 1 个标题。
- ~ **作者 / 发布者可机读** — 有 Organization 结构化数据，但页面没有 author 归属。
- ~ **品牌实体（Organization + sameAs）** — 有 Organization，但没有 sameAs 指向官方社媒 / LinkedIn / Wikidata / Crunchbase 等。
- ~ **Open Graph 完整** — 缺少：og:image。
- ✓ **JSON-LD 结构化数据** — 1 段 JSON-LD，类型：Organization, WebSite, WebPage。
- ✓ **关于 / 联系 / 政策页可抓取** — 关于、联系、政策页均可抓取：关于、联系、政策（退换 / 隐私 / 条款）。
- ✓ **<html lang> 声明** — <html lang="en-gb">
- ✓ **<main> / <article> 语义容器** — 存在 <main>。
- — **H2 使用问句 / 对比句** — H2/H3 少于 2 个，无法评估问句比例（先修"标题层级"）。
- — **标题后紧跟 40–80 词直接结论** — H2/H3 少于 2 个，无法评估结论段。
- — **Product / Offer 结构化数据完整** — 未发现产品页（sitemap 与内链里没有 /products/ 类路径，页面也没有 Product 结构化数据）。非电商站可忽略。
- — **图片 alt 文本** — 正文区没有图片。

## 新兴信号 · 有则加分，无不扣分

- ✕ **Accept: text/markdown 内容协商** — Accept: text/markdown 返回 text/html，未做内容协商。
- ✕ **FAQPage / HowTo 结构化数据** — 没有 FAQPage / HowTo 结构化数据。
- ✕ **/.well-known/api-catalog** — /.well-known/api-catalog 不存在。
- ✓ **/llms.txt** — /llms.txt 存在（872 字符），首行：# What can a postcode lookup show in England and Wales?
- ✓ **/llms-full.txt** — /llms-full.txt 存在（716 字节）。
- ✓ **ETag / Last-Modified** — 响应带 last-modified。
- — **AggregateRating / Review 结构化数据** — 无产品页。

---
方法论：https://madeinred.com/methodology · 共 50 项检查，本次计分 40 项。