注册
登录
论坛
搜索
全国城市地图
帮助
导航
默认风格
宝石蓝
fervor
jeans
uchome
fashion
greenwall
私人消息 (0)
公共消息 (0)
系统消息 (0)
好友消息 (0)
帖子消息 (0)
IT家园
»
网站建设
»
网页设计
» 搜索引擎的蜘蛛人(ROBOTS)秘密
返回列表
发帖
MT99
发短消息
加为好友
MT99
当前离线
UID
302
帖子
517
精华
1
积分
1075
阅读权限
50
在线时间
27 小时
注册时间
2006-3-9
最后登录
2013-7-16
家园进士
帖子
517
积分
1075
注册时间
2006-3-9
1
#
跳转到
»
倒序看帖
打印
字体大小:
t
T
发表于 2006-9-27 17:10
|
只看该作者
搜索引擎的蜘蛛人(ROBOTS)秘密
我们知道,搜索引擎都有自己的“搜索机器人”(ROBOTS),并通过这些ROBOTS在网络上沿着网页上的链接(一般是http和src链接)不断抓取资料建立自己的数据库。
对于网站管理者和内容提供者来说,有时候会有一些站点内容,不希望被ROBOTS抓取而公开。为了解决这个问题,ROBOTS开发界提供了两个办法:一个是robots.txt,另一个是The Robots META标签。
一、 robots.txt
1、 什么是robots.txt?
robots.txt是一个纯文本文件,通过在这个文件中声明该网站中不想被robots访问的部分,这样,该网站的部分或全部内容就可以不被搜索引擎收录了,或者指定搜索引擎只收录指定的内容。
当一个搜索机器人访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果找到,搜索机器人就会按照该文件中的内容来确定访问的范围,如果该文件不存在,那么搜索机器人就沿着链接抓取。
robots.txt必须放置在一个站点的根目录下,而且文件名必须全部小写。
网站 URL
相应的 robots.txt的 URL
http://www.w3.org/
http://www.w3.org/robots.txt
http://www.w3.org:80/
http://www.w3.org:80/robots.txt
http://www.w3.org:1234/
http://www.w3.org:1234/robots.txt
http://w3.org/
http://w3.org/robots.txt
收藏
分享
返回列表
外语学习
病毒控制中心
企业网管
软件使用交流
DIY交流区
文学世界
健康生活
每日综合
江西省
供求信息
[收藏此主题]
[关注此主题的新回复]
[通过 QQ、MSN 分享给朋友]