robots.txt 生成器

生成 robots.txt 文件,包含 User-agent 规则、Allow/Disallow 路径和 Sitemap 链接

预设

从常见策略开始。应用预设会替换当前的 User-agent 分组

站点设置

添加 Sitemap URL,以及支持时可选的 Host/Crawl-delay 指令

高级设置Host(非标准)

User-agent 分组

定义每个分组针对哪些爬虫,以及它们可以抓取哪些路径

分组 1

留空将默认使用 *

规则类型

没有规则表示允许全部

输出

检查生成的 robots.txt,然后复制或下载

什么是 robots.txt 生成器?

robots.txt 生成器可帮助你创建一个纯文本文件,用来告诉爬虫网站的哪些部分可以抓取。它会把 User-agent 分组、允许/禁止规则、Sitemap 链接和可选指令组合成一个可直接发布到站点根目录的 robots.txt 文件

可以配置哪些内容?

你可以为不同爬虫创建独立的规则组,套用常见预设,填写一个或多个 Sitemap URL,并在目标爬虫支持时设置 Host 或 Crawl-delay。这样既可以为所有机器人设置通用规则,也可以对 /admin/ 或其他低价值路径使用更严格的抓取限制

应该如何发布这个文件?

先检查生成结果,再将文件保存为 robots.txt,并上传到域名根目录,例如 https://example.com/robots.txt。发布后,最好用搜索引擎控制台或爬虫测试工具验证规则是否生效,并确认路径和 Sitemap URL 与线上站点结构一致

有哪些限制?

robots.txt 只是抓取指令,不是访问控制系统。规范的爬虫通常会遵守它,但它不能保护私密内容,也不能阻止直接请求,因此敏感页面仍应使用登录、权限控制或其他服务端保护措施

使用方法

选择预设并编辑分组或条目,结果会自动更新,可复制或下载完整文件