访问
- 网址是否返回 200、用了多久
- 是否跳转、最终落在哪个网址
- 是否使用 HTTPS
GEO · AI 搜索优化入门与自查
填一个网址,我们真实抓取这一页和它的 robots.txt,逐项告诉你哪些 AI 爬虫被拦了、正文是不是写在 HTML 里、还差什么。
| 爬虫 | 用途 | 这一页 |
|---|---|---|
| OAI-SearchBot | OpenAI · 搜索展示 | 可抓 |
| Claude-SearchBot | Anthropic · 搜索展示 | 可抓 |
| PerplexityBot | Perplexity · 搜索展示 | 可抓 |
| GPTBot | OpenAI · 训练 | 可抓 |
| Googlebot | Google · 搜索展示 | 可抓 |
这是对 example.com 的一次真实检查的节选,共 16 项。看完整结果
自查会查什么
每一项只有四种结果:通过、注意、问题、说明。问题项会直接告诉你改哪里。
GEO 是什么
GEO 是 Generative Engine Optimization 的缩写,中文常叫生成式引擎优化或 AI 搜索优化。这个词出自 2023 年 11 月的一篇同名论文,指的是帮助内容创作者提升内容在生成式引擎回答中可见度的方法。
论文同时指出,这些方法的效果因领域而异。所以先把有官方依据的基础做对,比追逐技巧更稳。
Google 的站长文档写明,出现在 AI Overviews 和 AI Mode 不需要额外的要求或特殊优化;页面要已被收录、能显示摘要,重要内容要以文字形式提供。
依据:Google 搜索中心:AI features and your websiteOpenAI 用 OAI-SearchBot 做搜索展示、GPTBot 做训练相关抓取;Anthropic 分 Claude-SearchBot、Claude-User 和 ClaudeBot;Perplexity 说明 PerplexityBot 不用于训练基础模型。拦哪个、放哪个,后果不同。
依据:OpenAI 爬虫说明llms.txt 由 Jeremy Howard 在 2024 年 9 月提出。Google 的文档说,出现在它的 AI 功能里不需要新建机器可读文件或 AI 文本文件。做不做由你定。
依据:llms.txt 提案(llmstxt.org)找服务商前先问
不管是 GEO 优化还是 GEO 推广,先把这六个问题问完,再谈价格。
先定位页面能不能被抓到、读到,再谈优化。上来就承诺结果的,要多问一句依据。
页面、robots.txt、站点文件应该分开说明,每一项都能对照原始响应复核。
问题说明、修改建议、代为修改、后续复查,分别包不包含,写进合同。
各家 AI 产品的爬虫用途不同,放行和拦截的后果也不同,对方应该讲得清。
llms.txt 是提案不是标准。把它当成必做项来收费的,要看对方拿得出什么依据。
AI 回答引用谁由各家产品决定。说得清边界的服务方更可信。
常见问题
答案只用查得到出处的说法。没有依据的地方,会直接说没有。
GEO 是 Generative Engine Optimization(生成式引擎优化)的缩写,出自 2023 年 11 月发布的同名论文。论文把它定义为帮助内容创作者提升内容在生成式引擎回答中可见度的方法,并指出不同领域的效果不一样。
基础是同一套。Google 的文档写明,出现在 AI 概览和 AI 模式不需要额外要求或特殊优化,页面要先被收录、能显示摘要。不同的地方在于,其他 AI 产品各有自己的爬虫,要分别确认没有被拦。
llms.txt 是 2024 年 9 月提出的一份提案,不是正式标准。Google 明确说出现在它的 AI 功能里不需要这类文件。它对其他产品有多大作用,目前没有公开依据,可做可不做。
先看对方会不会从检查做起:页面能不能被抓到、robots.txt 拦了谁、正文是不是写在 HTML 里。再问清交付内容和保证不了的部分。上面「找服务商前先问」列了六个问题。
没有公开依据能给出统一的时间。论文指出不同领域效果不同;各家文档写到的时间只有技术层面的,例如 OpenAI 说 robots.txt 的改动大约 24 小时后生效。承诺具体见效时间的说法,要请对方给出依据。
它真实访问你填的网址、robots.txt、sitemap 和 llms.txt,按各家官方文档和 robots 协议逐项判断。它不查你在哪个 AI 产品里有没有被引用,也不给排名分数。