一、AI 引用决策逻辑:网站建设必须反向设计的六项标准
AI 搜索引擎(豆包、DeepSeek、文心一言、通义千问、Kimi、ChatGPT、Perplexity)在决定是否引用某页内容时,并非按"关键词匹配"工作,而是按语义理解评估内容的可用性。根据对主流 AI 引擎引用行为的观测,决策优先级如下:
| 优先级 | 评估维度 | 网站建设对应动作 |
|---|---|---|
| 1 | 可提取性 | 页面能拆分为独立、语义完整的段落,不混入按钮、表单等干扰元素 |
| 2 | 结构清晰度 | 标题层级规范(每页唯一 H1、3-8 个 H2),列表、表格语义化 |
| 3 | 权威性 | 第三方背书、专家资质、真实数据、可验证实体信息 |
| 4 | 机器可读性 | Schema.org 结构化数据标记(JSON-LD 格式) |
| 5 | 信息密度 | 单位篇幅内的有效信息量,100-250 字高密度知识段落 |
| 6 | 新鲜度 | 内容发布与更新时间可见(time 标签 + lastmod) |
这六项标准决定了 GEO 与 SEO 的根本差异:SEO 优化"搜索结果页的链接排名",GEO 优化"AI 回答中的内容引用位"。前者比拼关键词匹配与权重,后者比拼语义理解与可验证性。对企业而言,SEO 解决存量搜索流量,GEO 抢占 AI 引用增量——两者共享优质内容资产,但建设侧重点不同。
二、服务器与基础设施层:爬虫放行是 GEO 的前提条件
AI 引擎的爬虫与搜索引擎爬虫使用完全不同的用户代理(User-Agent)。默认情况下,部分 AI 爬虫可能被服务器拦截或限速,导致品牌内容永远无法进入 AI 的训练与引用池。这是 GEO 优化中最常见、也最容易被忽视的失败原因——内容质量再高,爬虫进不来就等于零。
2.1 robots.txt 完整代码(GEO 优化版,可直接复制)
以下 robots.txt 覆盖国内搜索引擎、字节跳动系与全部主流 AI 爬虫,AI 爬虫单独列出并显式 Allow,传递主动放行信号:
# ============================================ # robots.txt - GEO 优化版 # ============================================ # ===== 通用规则(兜底)===== User-agent: * Allow: / Disallow: /admin/ Disallow: /api/ Disallow: /runtime/ Disallow: /search? Disallow: /*?*utm_ Disallow: /*?*from= Disallow: /*?*spm= # ===== 国内搜索引擎 ===== User-agent: Baiduspider Allow: / User-agent: ShenmaBot Allow: / User-agent: 360Spider Allow: / User-agent: Sogou web spider Allow: / User-agent: bingbot Allow: / User-agent: Googlebot Allow: / # ===== 字节跳动(头条搜索 / 豆包 / 抖音搜索)===== User-agent: Bytespider Allow: / User-agent: DoubaoBot Allow: / User-agent: ByteDance Allow: / # ===== AI 搜索引擎(显式放行,GEO 核心)===== User-agent: GPTBot Allow: / User-agent: ClaudeBot Allow: / User-agent: anthropic-ai Allow: / User-agent: Google-Extended Allow: / User-agent: CCBot Allow: / User-agent: PerplexityBot Allow: / User-agent: DeepSeekBot Allow: / User-agent: cohere-ai Allow: / # ===== 站点地图 ===== Sitemap: https://www.example.com/sitemap.xml
规则要点:通用规则屏蔽后台、API、搜索结果页与带追踪参数的重复 URL,避免 AI 爬虫抓取无价值页面稀释站点权重;AI 爬虫逐类列出并放行,比"只放行 * 通配符"更能传递信号——部分 AI 引擎会校验 robots 中是否有自己的专属条目。
2.2 sitemap.xml 规范
sitemap 必须为 XML 格式、位于站点根目录,每条 URL 含 lastmod(真实最后修改日期,禁止全站统一)、changefreq 与 priority。优先级分配规则:首页 1.0/daily,核心栏目页 0.9/weekly,分类与语种页 0.8/weekly,文章详情页 0.7/monthly,关于/联系等固定页 0.6/yearly。单条格式如下:
<url> <loc>https://www.example.com/page-url/</loc> <lastmod>2026-08-18</lastmod> <changefreq>weekly</changefreq> <priority>0.8</priority> </url>
2.3 HTTP 与域名规范
全站 HTTPS(HTTP 301 跳转);www 与非 www 二选一并 301 统一;带斜杠与不带斜杠二选一;正常页 200、跳转 301、不存在 404(禁止软 404);Content-Type 声明 charset=utf-8;TLS 1.2 以上。域名统一的意义在于:AI 引擎交叉验证品牌信息时,www 与裸域名不一致会被识别为两个实体,稀释品牌权威。
三、HTML 语义化结构层:让 AI 读懂页面骨架
AI 引擎解析页面依赖语义标签理解内容层级,而非视觉样式。规范要求:每页有且仅有 1 个 H1;H2 按内容区块划分(每页 3-8 个);H3 作为 H2 的子标题不跳级;标题标签只用于语义,不用来单纯控制字号。跳级(如 H1 直接到 H3)会破坏内容层级模型,降低 AI 对页面结构的理解准确率。
语义化标签使用标准:独立文章用 article,页面主内容用 main,导航用 nav,页头页脚用 header/footer,章节用 section(内部必须有标题),图片与说明用 figure+figcaption,时间用 time 标签并带 datetime 属性,地址用 address,术语强调用 dfn/strong/em。这些标签让 AI 能准确识别"谁写了什么、写于何时、主体内容是什么"。
文档基本结构示例:
<!DOCTYPE html> <html lang="zh-CN"> <head> <meta charset="UTF-8"> <meta name="viewport" content="width=device-width, initial-scale=1.0"> </head> <body> <header><nav aria-label="主导航">...</nav></header> <main><article>...</article></main> <aside>...</aside> <footer>...</footer> </body> </html>
四、Meta 标签与结构化数据层:机器可读的完整清单
4.1 必须的 Meta 标签(每页完整输出)
<meta charset="UTF-8"> <meta name="viewport" content="width=device-width, initial-scale=1.0"> <title>页面标题 - 品牌名</title> <meta name="description" content="页面描述,120-160字"> <meta name="keywords" content="关键词1,关键词2,关键词3"> <link rel="canonical" href="https://www.example.com/page-url/"> <meta property="og:type" content="website"> <meta property="og:site_name" content="品牌名"> <meta property="og:title" content="页面标题"> <meta property="og:description" content="页面描述"> <meta property="og:url" content="https://www.example.com/page-url/"> <meta property="og:image" content="https://www.example.com/og-image.jpg"> <meta property="og:locale" content="zh_CN"> <meta name="twitter:card" content="summary_large_image"> <meta name="twitter:title" content="页面标题"> <meta name="twitter:description" content="页面描述"> <meta name="twitter:image" content="https://www.example.com/og-image.jpg"> <link rel="icon" href="/favicon.ico" type="image/x-icon">
Title 编写规范:25-35 个中文字符(含品牌名),格式为"核心关键词-二级分类-品牌名",核心关键词放最前,每页不同。文章页额外输出 author、article:published_time、article:modified_time、article:section、article:tag。
4.2 各页面 Schema 输出规则
| 页面类型 | 必须输出的 Schema |
|---|---|
| 所有页面 | Organization(含 legalName、logo、地址、contactPoint) |
| 首页 | Organization + WebSite + FAQPage +(真实评价时)AggregateRating |
| 栏目/列表页 | Organization + BreadcrumbList |
| 服务/产品详情页 | Organization + BreadcrumbList + Service/Product + FAQPage |
| 文章详情页 | Organization + BreadcrumbList + Article(含 author、publisher、datePublished) |
| 关于我们页 | Organization + BreadcrumbList + Person(创始人/核心团队) |
| 联系/门店页 | Organization + BreadcrumbList + LocalBusiness(含经纬度) |
4.3 Organization 完整 JSON-LD 模板
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "Organization",
"name": "品牌全称",
"alternateName": ["品牌简称", "英文名"],
"legalName": "工商注册全称",
"url": "https://www.example.com/",
"logo": "https://www.example.com/logo.png",
"description": "品牌一句话介绍",
"telephone": "400-xxx-xxxx",
"email": "contact@example.com",
"areaServed": "中国",
"address": {
"@type": "PostalAddress",
"streetAddress": "详细地址",
"addressLocality": "城市",
"addressRegion": "省份",
"postalCode": "邮编",
"addressCountry": "CN"
},
"contactPoint": {
"@type": "ContactPoint",
"telephone": "400-xxx-xxxx",
"contactType": "customer service",
"areaServed": "CN",
"availableLanguage": ["Chinese"]
},
"sameAs": ["微博URL", "知乎URL", "小红书URL", "抖音URL"],
"foundingDate": "2015"
}
</script>
4.4 FAQPage 规范与要求
FAQPage 的 name 和 text 必须与页面 HTML 显示的文字完全一致;每页至少 3 个、建议 6-12 个;答案 50-300 字、信息完整,禁止写"请咨询客服"。FAQ 区块必须页面可见,只写 Schema 不显示内容属于作弊行为。BreadcrumbList 最后一项(当前页)不写 item 属性。所有 JSON-LD 放在 head 结束前或 body 结束前。
五、内容结构层:高密度知识段落与对比表格
每个核心页面至少 2-3 段高密度知识段落(Citable Paragraph),满足:长度 100-250 字;独立成段不依赖上下文;包含具体数据、定义、流程或对比;位于页面前部(H2 下第一段);使用纯 p 标签不混入按钮或链接。这类段落是 AI 直接摘取引用的最小单元。
正面示例:"GEO(Generative Engine Optimization,生成式引擎优化)是针对 AI 搜索引擎的优化技术。与传统 SEO 优化搜索引擎排名不同,GEO 的目标是让品牌信息在豆包、DeepSeek、文心一言等 AI 生成式搜索引擎的回答中被优先识别和引用。核心手段包括结构化数据标记、内容结构化重构、权威信源建设和多平台信息一致性,通常 1-3 个月可见效果。"
反面示例:"我们拥有专业团队,丰富经验,为您提供优质服务,助力增长,欢迎咨询。"——无数据、无定义、无对比,AI 无法提取任何可引用信息。
表格引用率远高于纯文本:每个核心栏目页至少 1 个语义化对比表格(table/thead/tbody),内容用 ul/ol 列表而非 br 模拟。所有数字必须有依据不编造,第三方数据标注来源,自有数据标注统计截止时间,避免"最""第一""唯一"等绝对化用语(广告法合规)。
六、图片、URL 与性能层:被忽略的引用权重项
图片规范:所有 img 必须有描述性 alt(5-30 字,不堆砌关键词,装饰图 alt="");内容图宽度不超过 1920px 且单张不超过 300KB,首屏图不超过 150KB;非首屏图加 loading="lazy" 并写 width/height 防 CLS;WebP 优先。每页独立 og:image(1200x630 含品牌 logo 与页面标题),至少首页、栏目页、文章页配置。
URL 规范:全小写、连字符分隔、不含中文、层级不超过 3 层、后缀统一(.html 或无后缀)、语义化体现内容主题、长度不超 80 字符;一个内容一个 URL,其他 301。站内链接:锚文本描述目标页面(不用"点击这里")、详情页底部 3-5 条相关推荐、内页可见面包屑、任何页面从首页点击不超过 3 次可达、出站链接加 rel="noopener noreferrer"。
性能指标:LCP 小于 2.5s、FID 小于 100ms、CLS 小于 0.1、首屏小于 2s(4G)、TTFB 小于 600ms、HTML 未压缩小于 200KB。可访问性:图片全 alt、表单 input 关联 label、对比度 4.5:1 以上、可 Tab 访问、html lang="zh-CN"。
七、上线前验证清单:40 项全量自检
| 类别 | 检查项 |
|---|---|
| 服务器 | robots.txt 存在且含 AI 爬虫放行规则;sitemap.xml 存在且 URL 可访问;全站 HTTPS;www 统一;404 返回 404 状态码;页面加载小于 3s |
| Meta | 每页唯一 title(25-35 字);每页唯一 description(70-160 字);每页 canonical;OG/Twitter Card 完整;每页 1 个 H1;标题层级不跳级 |
| 结构化数据 | 所有页面 Organization;首页 WebSite+FAQPage;所有内页 BreadcrumbList;文章页 Article;服务页 Service;专家页 Person;FAQ 区块配 FAQPage;JSON-LD 通过富结果测试 |
| 内容 | 首页 2-3 段高密度知识段落;首页 6+ FAQ;核心栏目页对比表格;文章页显示日期与作者;所有图片有 alt |
| 链接 | 内页有面包屑导航;无孤岛页;无死链;锚文本描述性 |
八、落地路线:三阶段推进法
阶段一(地基,第 1-2 周):完成 robots.txt、sitemap.xml、HTTPS 与域名统一;全站模板级接入 Organization 与 BreadcrumbList;建立 Meta 标准模板。阶段二(内容,第 3-8 周):按高密度段落标准重构首页与核心栏目页;上线 6-12 个真实 FAQ 并配 FAQPage;发布 8-12 篇深度文章(每篇含 Article schema 与对比表格)。阶段三(优化,第 9-12 周):补充行业专属 Schema(Course/Service/LocalBusiness/Product 等);接入百度/Google 站长平台提交 sitemap;按月度引用率数据迭代内容;逐步建设多平台品牌信息矩阵。
常见问题
Q:GEO 和 SEO 是二选一还是互补关系?
A:互补关系。SEO 解决存量搜索排名(百度、Google 结果页链接),GEO 抢占 AI 引用增量(豆包、DeepSeek、ChatGPT 回答引用)。两者共享优质内容资产,本规范中的 AI 爬虫放行与结构化数据建设同时服务两者,可协同推进。
Q:GEO 优化多久能看到效果?
A:引用率提升通常 1-3 个月可见,比 SEO 的 3-6 个月更快,因为 AI 引擎的语义理解对内容结构的响应比排名算法更快。但持续被引用需要内容资产持续更新与权威信源积累,建议按季度做引用率复盘。
Q:没有技术团队的企业能落地这套规范吗?
A:能。robots.txt、sitemap、Meta 标签与 FAQPage 可借助模板化建站系统(如 PbootCMS)的模板设置完成;内容结构(结论先行段落、对比表格、真实 FAQ)只需内容编辑遵守写作模板。建议优先落地"robots 放行 + 首页 FAQ + 文章页 Article + 高密度段落"四件事,覆盖约 70% 的 GEO 增量。
Q:结构化数据写错了会有风险吗?
A:有。编造评价数据(如虚构 AggregateRating)、FAQ 与页面内容不一致、Schema 与实体信息矛盾,会被 AI 引擎判定为垃圾信号并降权。原则是:只标记页面真实存在的信息,拿不准就不写。
Q:行业专属 Schema 和通用 Schema 怎么选?
A:教育用 EducationalOrganization+Course,医疗用 Hospital+Physician,法律用 LegalService+Attorney,电商用 Product,B2B 用 Service,本地生活用 LocalBusiness,家装用 HomeAndConstructionBusiness,制造用 Product 含技术参数。行业专属类型比通用 Organization 更精确,AI 匹配度更高,详见各行业分册。
Q:AI 爬虫抓取频率低怎么办?
A:先确认 robots.txt 未屏蔽且返回 200;其次保证 sitemap 有效并提交站长平台;再次提升内容新鲜度(每周至少 2-3 次更新信号)。AI 爬虫的抓取频率与站点内容更新频率强相关,持续更新是提升抓取的根本手段。
Q:网站是旧站改版,需要全站重做吗?
A:不需要。旧站改版优先做三件事:补 robots.txt AI 爬虫放行、全站统一接入 Organization 与 BreadcrumbList、把核心页面内容重构为高密度段落。这三件事可在现有模板上完成,不需要重做网站。
Q:多语言网站怎么处理 GEO?
A:每个语言版本独立 URL(hreflang 标注)、独立 sitemap、独立实体声明;同名实体跨语言保持一致(name 与 alternateName 统一)。AI 引擎按用户语言检索,多语言内容要确保各语言版本信息一致性,避免实体分裂。