ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

treg SEO架构解析:robots.txt 与 sitemap 如何让你的 AI 工具目录可被爬取

treg SEO架构解析:robots.txt 与 sitemap 如何让你的 AI 工具目录可被爬取 treg SEO架构解析robots.txt 与 sitemap 如何让你的 AI 工具目录可被爬取【免费下载链接】tregOpenRouter for agent tools. Join community here: https://discord.gg/6mQYYfFMAn项目地址: https://gitcode.com/GitHub_Trending/treg/tregtreg是一个面向 AI 智能体Agent的工具目录平台可以把它理解为Agent 工具版的 OpenRouter。它的 SEO 架构非常值得新手学习通过一份精心设计的robots.txt爬虫策略、一个动态生成的 sitemap.xml以及全量服务端渲染的可爬取目录页让搜索引擎和 AI 爬虫都能完整发现每一个工具。下面带你完整拆解这套架构。一、robots.txt告诉爬虫哪些能进哪些别碰treg 的爬虫策略文件位于 src/treg/web/robots.txt核心思路一句话概括目录页全部放行花钱和需要登录的一律拦掉。策略分三类放行区Allow: /默认允许所有爬虫访问因为/catalog目录页是设计出来让人找到的登录区Disallow: /app、/login、/auth/、/oauth/—— 这些是认证后的单页应用或带一次性令牌的 OAuth 流程爬虫进去也拿不到任何有意义的内容计费区Disallow: /call/、/mcp—— 注释里写得很直白disallowed for cost, not for secrecy因为会花钱而不是因为机密。每一经由代理发出的请求都是真实的上游 API 调用消耗真实余额。一个很巧妙的细节robots.txt 末尾声明了Sitemap: {BASE}/sitemap.xml其中{BASE}是一个模板占位符。服务时在 src/treg/routers/web.py#L3315-L3325 中用部署配置的public_url替换它——这样自托管的用户也能广播自己域名下的 sitemap而不是指向官方站。二、动态生成的 sitemap.xml80 个 URL 随目录自动生长treg 的 sitemap.xml 不是写死的静态文件而是每次请求时实时生成原因写在源码注释里sitemap 中约 80 个 URL 是目录的平台货架页如/catalog/apify它们随目录数据变动而非随代码库变动。sitemap 的内容由四层拼成固定页面清单_SITEMAP_PAGESweb.py#L3347-L3378首页、/catalog、/pricing、/tutorial、/docs、博客文章等每个都标注priority优先级平台货架页/catalog/slug来自目录中所有已发布平台对比页/catalog/slug/capability来自compared()声明供应商工具页/tools/service每个 provider 一个入口。还有两个专业细节lastmod 真实可信目录页的lastmod取 catalog 目录下最新 YAML 文件的修改时间web.py#L3381-L3391而不是随便填今天绝不让 sitemap 列出重定向比如/use-cases/slug/带斜杠会 307 跳转到无斜杠形式sitemap 里就只列无斜杠的规范 URL——因为一个列出重定向的 sitemap 比没有 sitemap 更糟。三、可爬取目录页hub-and-spoke 结构 服务端渲染很多 SPA 站点做不了 SEO是因为爬虫看到的只有一屏空白 JS。treg 的目录页全部是服务端渲染的 HTML静态文件 路由注入爬虫直接拿到完整内容。结构上采用轮辐式hub-and-spoke/catalog是 hub各平台货架页/catalog/platform是 spoke。源码注释web.py#L1635提到一个关键教训sitemap 不是爬取路径——如果轮辐页只靠 sitemap 被收录Google 会对每个 URL 报URL is unknown to Google。所以轮辐页必须从 hub 页获得真实内链形成首页 → 目录 → 平台页 → 工具页的链接链。另外认证后的应用壳index.html默认带noindex而公共页面在渲染时会被显式移除 noindex 标签并注入index, followweb.py#L307-L327保证每个公开 URL 的 robots meta 状态精确可控。四、质量防线测试守护每一个 SEO 承诺treg 用自动化测试把 SEO 规则焊死在 CI 里tests/test_seo.pytest_every_sitemap_url_answers_200遍历 sitemap 中每一条 URL任何一条返回非 200 就让构建失败test_robots_txt_keeps_crawlers_out_of_what_costs_or_gates确保计费与登录路径始终在 Disallow 名单里test_sitemap_is_valid_xml_on_the_public_host校验 XML 合法性test_indexnow_key_is_served_from_the_root校验 IndexNow 密钥文件从根路径正确分发。更进一步treg 还接入了IndexNow协议Bing、Yandex 等共用部署完成后由 scripts/indexnow_submit.py 把 sitemap 里的所有 URL 主动推送给搜索引擎实现发布即收录不必等爬虫例行抓取。五、新手可抄的 5 个 SEO 实践从 treg 的这套架构里普通开发者可以直接借鉴robots.txt 按成本和会话划分禁区而不是凭感觉禁路径sitemap 动态生成让 URL 集合和站点真实内容永远同步sitemap 里绝不出现重定向和 404并用测试遍历校验轮辐页要有真实内链路径不能只依赖 sitemap 收录公开页与登录页的 robots meta 标签要显式区分别让整个 SPA 都被 noindex 误伤。完整的路由与 SEO 逻辑集中在 src/treg/routers/web.py静态资源含 robots 模板在 src/treg/web/想要自己给项目搭一套从这份源码抄作业即可。【免费下载链接】tregOpenRouter for agent tools. Join community here: https://discord.gg/6mQYYfFMAn项目地址: https://gitcode.com/GitHub_Trending/treg/treg创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表