SciRouterBot:我们的网页读取器
当用户在本平台的对话里要求读取某个网页时,平台服务器会以下面这个 User-Agent 取一次该页面。它不是搜索引擎爬虫,不做自动抓取,也不建索引。
User-Agent:SciRouterBot/1.0 (+https://www.scirouter.cn/bot)
它什么时候会来
- 只在用户主动要求时:用户在对话里贴了链接并打开「联网」,或者模型为回答用户的问题需要读取一个搜索结果里的页面。每次请求只取一次。
- 不做自动爬取:不会顺着页面里的链接继续访问,不会定期回访,也不会把页面内容存进任何索引或训练集。读取到的内容只用于生成那一次回答,不长期保存。
- 只读取对话里出现过的链接(用户贴的、或者搜索结果里的),不会读取模型自己「猜」出来的地址。
- 请求不带任何用户身份:没有 Cookie、不发 Referer,你的网站看到的是平台服务器,不是用户本人。
- 对同一个网站的并发不超过 2、每分钟不超过 20 次;同一页面 15 分钟内不会重复请求。响应体最多读取 2 MiB,只接受网页与纯文本。
它遵守哪些 robots.txt 规则
只遵守 robots.txt 里写给 SciRouterBot 的规则。要拒绝它,在 robots.txt 里加一段:
写给 * 的规则不适用:那是写给自动爬虫的,而 SciRouterBot 的每一次访问都是一位用户对一个具体页面的一次请求,和用户自己用浏览器打开这一页是一回事。
User-agent: SciRouterBot Disallow: /
robots.txt 按站点缓存 24 小时;新加的规则最迟一天内生效。
如何联系我们或要求屏蔽
除了 robots.txt,你也可以直接联系我们把整个域名加入拒绝名单。写明域名,以及方便的话在服务器日志里看到的请求时间。
联系邮箱:contacts@psy.ltd
日志里认它:User-Agent 以 SciRouterBot/ 开头,括号里的链接指向本页。