在Google网站管理员工具中,我得到了一个错误:
谷歌无法抓取你的网站,因为我们无法访问你网站的robots.txt文件
相关的帮助说:
如果您的robots.txt文件存在但不可访问(换句话说,如果它不返回200或404 HTTP状态代码),我们将推迟爬行,而不是冒险爬行不允许的URL
我的站点302将所有http流量重定向到HTTPS --所以访问http://blah/robots.txt的权限是302重定向到https://blah/robots.txt,因此它实际上不会像上面所要求的那样返回200或404。
我的问题是,Googlebot对象在尝试访问robots.txt文件时是否会重定向到302?
注意:许多服务器配置超出了我的控制范围,并且由于公司IT的原因,它是以这种方式配置的。我只是个可怜的家伙,尽管受到了种种限制,我还是得让这件事继续下去。
发布于 2013-11-24 12:23:23
这些引语是我从谷歌上摘得的。
文件位置和有效性范围 robots.txt文件必须位于主机的顶层目录中,可以通过适当的协议和端口号访问。robots.txt (和网站爬行)普遍接受的协议是"http“和"https”。在http和https上,robots.txt文件是使用HTTP非条件GET请求获取的。
而且还
3xx (重定向) 重定向通常会遵循,直到找到有效的结果(或识别循环)。我们将遵循有限数量的重定向跳(RFC 1945 for HTTP/1.0允许最多5跳),然后停止并将其视为404。
你可以/应该读谷歌的消息来源。
发布于 2013-11-19 06:56:08
很有可能是的,因为你使用的是302重定向,这是谷歌建议不要使用的临时重定向。您应该使用永久301重定向将HTTP重定向到HTTPS。
https://webmasters.stackexchange.com/questions/55324
复制相似问题