基础扎实,细节待补
0/ 100
分数与每项证据公开;修复提示词(每项的证据、原始数据与改法打包成一段可贴给 Cursor / Codex 的话)需要注册后领取,免费,30 秒,注册后这个站会自动进你的「我的站点」。
优先修复 · 抓取许可优先,其次推送就绪,再是引用形态
01
Bing Webmaster Tools 验证痕迹 未通过需站主操作
推送就绪 · 权重 5 · 注册 Bing 站长平台才能手动请求收录——这就是那个"pin"按钮。
02
title 与 meta description 完备 部分通过 (40%)
推送就绪 · 权重 2 · Bing 索引条目的骨架,也是 ChatGPT 引用卡片的标题来源。
03
Google Search Console 验证痕迹 部分通过 (50%)需站主操作
推送就绪 · 权重 1 · GSC 照旧走,喂 AI Overviews 与 Gemini。可能通过 DNS 验证,站外不可见。
04
抽样页面的引用形态(产品 / 文章 / 分类) 未通过
引用形态 · 权重 5 · AI 引用发生在页面级,被引的从来不是首页。从 sitemap 抽产品页、文章页、分类页各一个,按同一套引用形态标准打分。
05
H2 使用问句 / 对比句 未通过
引用形态 · 权重 4 · ChatGPT 按用户问题匹配段落,问句式标题命中率最高。
06
标题后紧跟 40–80 词直接结论 未通过
引用形态 · 权重 4 · 能被整段摘走的答案块,是被引用的最小单元。
07
JSON-LD 结构化数据 未通过
引用形态 · 权重 3 · Article / Product / Organization 等 schema 帮引擎理解页面是什么。
08
作者 / 发布者可机读 未通过
引用形态 · 权重 2 · 归属明确的内容更可信,E-E-A-T 的基础。
09
品牌实体(Organization + sameAs) 未通过
引用形态 · 权重 2 · 让引擎把站点、社媒、Wikidata 等身份连成一个实体,"有其他站佐证"的起点。
10
引用外部来源 未通过
引用形态 · 权重 2 · 有据可查的内容更像"可信资料",而不是营销页。
11
Open Graph 完整 未通过
引用形态 · 权重 1 · ChatGPT 引用卡片与分享预览的标题、描述、图片来源。
12
服务端渲染的正文 部分通过 (35%)
引用形态 · 权重 6 · OAI-SearchBot 与 ChatGPT-User 不执行 JavaScript,看到的就是原始 HTML。
13
发布 / 更新日期可机读 部分通过 (60%)
引用形态 · 权重 3 · 带日期的页面更容易被选为"最新"来源;一年内更新加分。
基于上面的证据生成,主链路 Codex,兜底 Cursor 池。
ChatGPT 视角 · OAI-SearchBot 不执行 JavaScript,它看到的正文就是左边这段;右边是能被整段摘走的块
爬虫看到的正文 268 字符
Latest Release See All Releases Latest Posts See All Posts People of WordPress People of WordPress: Sunita Rai People of WordPress: Artemy Kaydash People of WordPress: Ihtisham Zahoor People of WordPress: Allison Dye People of WordPress: Stefano Cassone See All People
可摘录块 0 可整段引用 · 0 需改写 · 8 无段落
✕Latest Release
标题后面没有段落——ChatGPT 拿不到可摘录的答案
✕Latest Posts
标题后面没有段落——ChatGPT 拿不到可摘录的答案
✕People of WordPress
标题后面没有段落——ChatGPT 拿不到可摘录的答案
✕People of WordPress: Sunita Rai
标题后面没有段落——ChatGPT 拿不到可摘录的答案
✕People of WordPress: Artemy Kaydash
标题后面没有段落——ChatGPT 拿不到可摘录的答案
✕People of WordPress: Ihtisham Zahoor
标题后面没有段落——ChatGPT 拿不到可摘录的答案
✕People of WordPress: Allison Dye
标题后面没有段落——ChatGPT 拿不到可摘录的答案
✕People of WordPress: Stefano Cassone
标题后面没有段落——ChatGPT 拿不到可摘录的答案
让模型扮演 ChatGPT 搜索做引用选择,只引用页面原文。
全身检查 · 引用发生在页面级:从 sitemap 抽产品页 / 文章页 / 分类页各一个,按同一套引用形态标准打分
| 类型 | 页面 | HTTP | 引用形态 | 缺口 |
|---|---|---|---|---|
| 其它页 | /about/privacy/cookies/ Cookie Policy – WordPress.org | 200 | 45% | 服务端渲染的正文 H2 使用问句 / 对比句 标题后紧跟 40–80 词直接结论 发布 / 更新日期可机读 作者 / 发布者可机读 JSON-LD 结构化数据 |
| 其它页 | /about/privacy/data-export-request/ Data Export Request – WordPress.org | 200 | 30% | 服务端渲染的正文 标题层级清晰 发布 / 更新日期可机读 作者 / 发布者可机读 JSON-LD 结构化数据 可抽取的列表 / 表格 引用外部来源 |
| 其它页 | /about/privacy/data-erasure-request/ Data Erasure Request – WordPress.org | 200 | 28% | 服务端渲染的正文 标题层级清晰 发布 / 更新日期可机读 作者 / 发布者可机读 JSON-LD 结构化数据 可抽取的列表 / 表格 引用外部来源 |
sitemap 抽检
6 / 6 存活
抽样的 URL 全部返回 2xx
信任页
3 / 3
✓ 关于 200
✓ 联系(猜测路径) 200
✓ 政策 200
✓ 联系(猜测路径) 200
✓ 政策 200
分数里的"抽样页面的引用形态"就来自这张表。同类页面多半共用一个模板:修模板一次,全站同类页面一起好。站点在 Bing 里收了多少页,这里不猜——以 Bing Webmaster Tools 的收录数为准。
实测抓取 · 同一 URL,不同 User-Agent
| 身份 | HTTP | 正文字符 | 耗时 | 判定 |
|---|---|---|---|---|
| 普通浏览器 | 200 | 2,712 | 136 ms | 正常 |
| OAI-SearchBot | 200 | 2,712 | 18 ms | 正常 |
| ChatGPT-User | 200 | 2,712 | 19 ms | 正常 |
| Bingbot | 200 | 2,712 | 25 ms | 正常 |
出口 IP 不是各爬虫的官方 IP 段:IP 白名单式放行在此看不到,UA 级封禁会原形毕露。以服务器日志里真实爬虫回 200 为最终确认。
审计每一项 · 50 项检查,本次计分 43 项;通过项也附证据与"为什么重要"
▸第 1 层 抓取许可 · 不开门,推了也白推12 / 12 通过 · 45 / 45
✓
robots.txt 放行 OAI-SearchBot权重 10 · 通过
通配分组 User-agent: * 允许抓取 /news/(未被 Disallow 命中,默认放行)。
为什么重要 · OAI-SearchBot 建 ChatGPT 搜索索引,封了它等于永久放弃被引用。
✓
实测:OAI-SearchBot 身份可抓取权重 9 · 通过
以 OAI-SearchBot 身份抓取正常。HTTP 200,149954 字节,正文 2712 字符(浏览器基线 268 字符),18 ms。
为什么重要 · robots.txt 写得再对,WAF 在前面拦一下就全白搭。以 OAI-SearchBot UA 实抓验证。
✓
robots.txt 放行 ChatGPT-User权重 5 · 通过
通配分组 User-agent: * 允许抓取 /news/(未被 Disallow 命中,默认放行)。
为什么重要 · 用户提问时的实时抓取,决定 ChatGPT 能否当场读到你的页面。
✓
robots.txt 放行 Bingbot权重 5 · 通过
通配分组 User-agent: * 允许抓取 /news/(未被 Disallow 命中,默认放行)。
为什么重要 · ChatGPT 搜索的检索层建在 Bing 索引上。
✓
实测:ChatGPT-User 身份可抓取权重 5 · 通过
以 ChatGPT-User 身份抓取正常。HTTP 200,149954 字节,正文 2712 字符(浏览器基线 268 字符),19 ms。
为什么重要 · 实时抓取的身份,同样会被 Bot Fight Mode / AI 爬虫拦截规则误伤。
✓
页面允许索引权重 5 · 通过
robots 指令存在但不含 noindex:meta: max-image-preview:large。
为什么重要 · noindex(meta 或 X-Robots-Tag)会让页面从任何索引中消失。
✓
实测:Bingbot 身份可抓取权重 4 · 通过
以 Bingbot 身份抓取正常。HTTP 200,149954 字节,正文 2712 字符(浏览器基线 268 字符),25 ms。
为什么重要 · 进不了 Bing 索引,ChatGPT 搜索就找不到你。
✓
放行其它 AI 答案引擎权重 3 · 通过
8 个答案引擎爬虫(PerplexityBot, Perplexity-User, Claude-SearchBot, Claude-User, DuckAssistBot, Applebot, Amazonbot, MistralAI-User)全部放行。
为什么重要 · Perplexity、Claude、DuckDuckGo AI、Apple、Amazon 的检索爬虫,同一套逻辑。
✓
允许摘录片段权重 3 · 通过
未设置摘录限制。
为什么重要 · nosnippet / max-snippet:0 直接禁止引擎摘录你的文字。
✓
HTTP 基础健康权重 3 · 通过
HTTP 200,HTTPS,0 次跳转,首字节 127 ms(含正文 136 ms),149954 字节,Content-Type text/html; charset=UTF-8。
为什么重要 · HTTPS、200、短跳转链、合理响应时间是爬虫预算的前提。
✓
robots.txt 放行 Googlebot权重 2 · 通过
通配分组 User-agent: * 允许抓取 /news/(未被 Disallow 命中,默认放行)。
为什么重要 · 喂 AI Overviews 与 Gemini。
✓
不存在的路径返回真实 404权重 2 · 通过
随机不存在路径返回 HTTP 404。
为什么重要 · 软 404 会让爬虫以为所有路径都存在,浪费抓取预算并污染索引。
i
GPTBot(训练爬虫)策略仅展示
GPTBot(训练爬虫)目前放行。放不放行不影响 ChatGPT 搜索引用,纯属你对训练数据的态度。
i
CDN / WAF 识别仅展示
站点走 Cloudflare(cf-ray a34df9a0ce14de02-BOS,cf-cache-status DYNAMIC)。Bot Fight Mode / AI Crawl Control 的默认策略会拦截 AI 爬虫,请对照上面三条"实测"结果逐项核查。
改法已生成(546 字)· 登录后查看
—
Content-Signal 未禁止 AI 检索权重 3 · 不适用
robots.txt 中没有 Content-Signal 指令(未使用 Cloudflare 内容信号),不适用。
▸第 2 层 推送就绪 · 等价于 GSC 的那个按钮6 / 9 通过 · 19.2 / 25
✕
Bing Webmaster Tools 验证痕迹权重 5 · 未通过
没有 msvalidate.01 meta,也没有 /BingSiteAuth.xml。(若通过 DNS CNAME 验证则站外不可见,可忽略此项。)
改法已生成(156 字)· 登录后查看
~
title 与 meta description 完备权重 2 · 部分通过 (40%)
<title> 76 字符(建议 10–70);缺少 meta description。
改法已生成(55 字)· 登录后查看
~
Google Search Console 验证痕迹权重 1 · 部分通过 (50%)
没有 google-site-verification meta。GSC 常用 DNS / GA / GTM 验证,站外无法确认,仅扣一半。
改法已生成(68 字)· 登录后查看
✓
sitemap.xml 存在且被 robots.txt 声明权重 6 · 通过
sitemap 索引 https://wordpress.org/sitemap.xml,52 条(抽样子图 https://wordpress.org/sitemap-1.xml),已在 robots.txt 声明。
为什么重要 · Bing Webmaster Tools 一键导入与 URL 提交都以 sitemap 为骨架。
✓
sitemap 里的 URL 真实存活权重 5 · 通过
抽检 6 条 URL 全部返回 2xx(sitemap 共 52 条)。
为什么重要 · sitemap 是你交给引擎的清单;里面的死链会让 OAI-SearchBot 把抓取预算花在 404 上,引用机会直接丢掉。抽检最多 8 条。
✓
sitemap 带 lastmod 且近期更新权重 4 · 通过
52/52 条带 lastmod(100%),最新 2026-09-01(1 天前)。
为什么重要 · lastmod 是 Bing 判断"要不要重抓"的主要信号。
✓
canonical 自指向权重 3 · 通过
canonical 自指向:https://wordpress.org/news/
为什么重要 · 避免推送的 URL 与索引的 URL 不一致,权重被分散。
✓
http 自动跳转 https权重 2 · 通过
http:// 经 1 跳(301)到 https://wordpress.org/
为什么重要 · 推送的 URL 与最终 URL 必须一致,避免重复实体。
✓
RSS / Atom 订阅源可发现权重 1 · 通过
发现订阅源:https://wordpress.org/news/feed/, https://wordpress.org/news/comments/feed/, https://wordpress.org/news/feed/podcast
为什么重要 · Bing 支持订阅源提交,新文章发布可被快速发现。
i
Bing 索引里有没有你仅展示
未能可靠查询 Bing(Bing 前 9 条结果都不在本站(Bing 对匿名 site: 查询经常返回无关结果),无法据此判断收录)。
改法已生成(57 字)· 登录后查看
i
—
多语言 hreflang权重 2 · 不适用
未声明 hreflang。单语站不适用;若你有多语言版本,请为每种语言互相声明 <link rel="alternate" hreflang="..."> 并含 x-default。
▸第 3 层 引用形态 · 推不动,只能塑形6 / 16 通过 · 9.9 / 30
✕
抽样页面的引用形态(产品 / 文章 / 分类)权重 5 · 未通过
抽样 3 个页面的引用形态得分率:其它页 45%,其它页 30%,其它页 28%(平均 34%)。共同缺口:服务端渲染的正文(3/3 页);发布 / 更新日期可机读(3/3 页);作者 / 发布者可机读(3/3 页);JSON-LD 结构化数据(3/3 页)。
改法已生成(204 字)· 登录后查看
✕
H2 使用问句 / 对比句权重 4 · 未通过
8 个 H2/H3 全是名词短语,没有一个是问句或对比句:「Latest Release」 「Latest Posts」 「People of WordPress」
改法已生成(145 字)· 登录后查看
✕
标题后紧跟 40–80 词直接结论权重 4 · 未通过
8 个 H2/H3 中 0 个后面紧跟 40–80 词的结论段;8 个后面没有段落,0 个段落过短,0 个段落过长。
改法已生成(81 字)· 登录后查看
✕
✕
✕
✕
✕
~
服务端渲染的正文权重 6 · 部分通过 (35%)
原始 HTML 正文 268 字符 / 约 41 词,文本占比 0.2%,H1 1 个,HTML 146 KB。 正文偏少(<500 字符),可摘录的内容不足。
改法已生成(39 字)· 登录后查看
~
发布 / 更新日期可机读权重 3 · 部分通过 (60%)
发布 2026-08-19,更新 —(13 天前),来源:<time datetime>。 缺少 dateModified。
改法已生成(45 字)· 登录后查看
✓
标题层级清晰权重 3 · 通过
1 个 H1、3 个 H2、共 9 个标题,层级顺序正常。
为什么重要 · 唯一 H1 + 多个 H2,层级不跳跃,是可摘录内容的骨架。
✓
关于 / 联系 / 政策页可抓取权重 2 · 通过
关于、联系、政策页均可抓取:关于、联系(猜测路径)、政策(退换 / 隐私 / 条款)。
为什么重要 · 引擎判断"这是一家真实商家"的最低门槛,也是 Agentic Commerce 要求的退换货 / 隐私政策 URL 的来源。
✓
可抽取的列表 / 表格权重 2 · 通过
正文区有 2 个列表(≥3 项)与 0 个表格。
为什么重要 · 对比表、步骤列表最容易被整块摘录。
✓
<html lang> 声明权重 1 · 通过
<html lang="en-us">
为什么重要 · 让引擎把页面归入正确的语言市场。
✓
<main> / <article> 语义容器权重 1 · 通过
存在 <main>。
为什么重要 · 帮抽取器区分正文与导航噪音。
✓
图片 alt 文本权重 1 · 通过
5/5 张图片有 alt(100%)。
为什么重要 · 多模态检索与无障碍的共同基础。
—
Product / Offer 结构化数据完整权重 3 · 不适用
未发现产品页(sitemap 与内链里没有 /products/ 类路径,页面也没有 Product 结构化数据)。非电商站可忽略。
▸加分 新兴信号 · 有则加分,无不扣分2 / 6 通过 · +3.5 / 5
✕
✕
✕
✕
✓
/llms.txt权重 2 · 通过
/llms.txt 存在(5763 字符),首行:# WordPress
为什么重要 · 面向 LLM 的站点导览,告诉 agent 你是谁、何时该用你。
✓
Accept: text/markdown 内容协商权重 1.5 · 通过
Accept: text/markdown 返回 text/markdown; charset=utf-8(2896 字节)。
为什么重要 · 同一 URL 给 agent 返回 Markdown,摘录零噪音。
—
AggregateRating / Review 结构化数据权重 1 · 不适用
无产品页。
最终 URL https://wordpress.org/news/
标题 WordPress News – The latest news about WordPress and the WordPress community
lang en-us
server cloudflare