好文档就是一把金锄头!
欢迎来到金锄头文库![会员中心]
电子文档交易市场
安卓APP | ios版本
电子文档交易市场
安卓APP | ios版本

常用检索工具.doc

3页
  • 卖家[上传人]:豆浆
  • 文档编号:4309074
  • 上传时间:2017-08-18
  • 文档格式:DOC
  • 文档大小:386KB
  • / 3 举报 版权申诉 马上下载
  • 文本预览
  • 下载提示
  • 常见问题
    • 常用检索工具1.检索工具的分类(1)按照信息搜集方法分类按照信息搜集方法的不同,搜索引擎系统可以分为三大类:1)目录式搜索引擎(Directory Search Engine)以人工方式或半自动方式搜集信息,由编辑员查看信息之后,人工形成信息摘要,并将信息置于事先确定的分类框架中信息大多面向网站,提供目录浏览服务和直接检索服务该类搜索引擎因为加入了人的智能,所以信息准确、导航质量高,缺点是需要人工介入(维护工作量大)、信息量少、信息更新不及时这类搜索引擎的代表是:Yahoo!、LookSmart、Ask Jeeves、Snap、Open Directory2)机器人搜索引擎(Crawler-Based Search Engine)由一个称为蜘蛛(Spider)的机器人程序以某种策略自动地在 Internet 中搜集和发现信息,由索引器为搜集到的信息建立索引,由检索器根据用户的查询输入检索索引库,并将查询结果返回给用户服务方式是面向网页的全文检索服务该类搜索引擎的优点是信息量大、更新及时、毋需人工干预,缺点是返回信息过多,有很多无关信息,用户必须从结果中筛选这类搜索引擎的代表是:AltaVista、Northern Light、Excite、Infoseek、Inktomi、FAST、Lycos、Google。

      3)元搜索引擎(Meta Search Engine)这类搜索引擎没有自己的数据,而是将用户的查询请求同时向多个搜索引擎递交,将返回的结果进行重复排除、重新排序等处理后,作为自己的结果返回给用户服务方式为面向网页的全文检索这类搜索引擎的优点是返回结果的信息量大,缺点是不能够充分使用元搜索引擎的功能,用户需要做更多的筛选这类搜索引擎的代表是WebCrawler、InfoMarket目前,商业的搜索引擎站点正在结合各种搜索引擎的优点,在类型上有逐渐融合的趋势例如,Yahoo!在保持人工分类的同时,使用 Inktomi 的机器人搜索引擎,用户查询时,如果选?quot;网站搜索"便搜索人工分类库,选择"网页搜索"便搜索机器人搜索引擎的索引库一些传统的机器人搜索引擎也增加了人工分类的内容,以提供高精度的导航信息另外搜索引擎站点有"门户化"的倾向,在提供搜索服务的同时,提供多样的网络服务,如新闻、股票、天气预报、虚拟社区、游戏、电子商务等等,成为名副其实的"网络门户"2)按照检索软件分类按照服务提供方式的不同,检索软件也可以分为三大类:全文数据库检索软件、非全文数据库检索软件、主题指南类检索软件全文数据库检索软件正常运作的前提是网站拥有大量的信息,因此必须依靠强大的数据库作为后盾。

      它能够提供完整的文献和信息检索,查全率很高但由于信息量非常大,检索起来比较困难,对检索技术的要求很高非全文数据库检索软件具有速度快、使用简便、索引量大的特点,但仅提供部分全文检索,有时需要二次检索,感到不太方便 主题指南类检索软件是目前网络检索中最常用的检索软件这种软件查准率高、速度快、使用方便现大部分网站都具备主题指南类检索功能3)按照检索语言分类目前,因特网几乎使用了世界所有语言每一种语言都形成了自己独特的检索体系比较常用的语言有英文、法文、德文、日文、俄文、中文等2.全文数据库的检索软件 (1)Alta Vista 检索引擎Alta Vista 检索引擎为数字设备公司(DEC)开发,号称是目前最大的 Web 索引数据库,图 3-3 是它的网络主页Alta Vista 检索引擎提供两种检索方法:简单检索和高级检索高级检索包括了简单检索的所有特性,还允许使用布尔运算符和接近操作符、括号等,查找的结果按关键词排序Alta Vista 总能返回有用的信息,但由于没有对内容进行选择,它的"信噪比"也是最大的 图 1-3-3 Alta Vista 检索引擎使用 Alta Vista 检索引擎时应注意:要进行有效的检索,最好尽可能多而精确地输入描述所感兴趣的主题的词或词组。

      提供的词组越精确,检索结果就越好 如果你输入的词包含大写字母,则检索对大小写就比较敏感如输入 Telephone 则只检索含有这个词的内容,而输入 telephone 则不论大小写都检索如果要把一些词作为词组或一个整体来查询时,最好把它们加上双引号如果要求特定单词包含在索引的文档中,可以在它前面加一个"+"号,如:+Telephone,并且在"+"号和单词之间不能有空格相应的,如果要排除含有特定单词的文档,可以在它前面加一个"-"号,如-cool进行简单查找的时候,可以在单词的末尾加一个通配符来代替任意的字母组合(最多可代替 5 个小写的字母)Alta Vista 的通配符是"*"号,星号不能用在单词的开始或中间Alta Vista 高级检索包含了简单检索的所有特性,还可以有布尔和接近操作符、括起来的逻辑组合等Alta Vista 支持的布尔和接近检索二元操作符有 AND(&)、 OR(|)、NEAR(~)和一元操作符 NOT(!)AND 连接的若干词在文件中要同时出现;OR 确保检索式中至少有一个词出现在文件中;NOT 将某一个词从检索中排除出去它们的优先级是递减的,另外要注意,如果把检索的表达式写成 sports NOT swimming,则语法上是不合逻辑的,正确的写法应该是 sports AND NOT swimming。

      NEAR 确保查询的两个词在 10 个字节内出现,它的优先级是最低的如果将上述符号用在检索表达式中,最好给检索表达式加上引号以减少检索表达式的混乱 Alta Vista 的优点是:在所有的检索软件中,它的功能最全面,查全率和查准率最高,全文标引系统质量可靠;在检索语句上与传统的联机检索语言类似,更容易掌握;系统反应速度快;网页链接可靠缺点是文件相关性评估的质量一般 (2)Excite 检索引擎Excite 检索引擎是 Architext 软件公司的产品,该数据库界面友好,用户可以利用关键词、词组和自然语言检索,自然语言检索越详细越好图 1-3-4 是 Excite 检索引擎的网络主页图 1-3-4 Excite 检索引擎网络主页 Excite 检索引擎有基本检索和高级检索两种检索方式其中,Excite 中要求的单词和排除的单词的使用方法同 Alta Vista 一样,使用"+"号和"-"号Excite 支持二元操作符AND、OR、AND NOT 和一元操作符 NOT它也支持用括号来构成逻辑组缺省的关键词使用的是隐式的 OR ,即它检索含有指定的任意的单词 Excite 的优点是采用了概念检索的技术。

      概念检索是指在检索文件的过程中,不仅能够检索到含有用户提出的关键词的文件,还能检索到与用户的检索主题密切相关、但并没有包括这些主题词的文件在所有的检索软件中,它的更新速度最快,且其数据库的规模也最大另外,它在提供相关信息方面表现颇佳Excite 的缺点是它的相关性排序质量一般,检索结果也显得不尽人意随着世界华人对因特网商业价值的认同,越来越多的华人开始利用因特网传递商业信息,中文网站内容也不断丰富面对巨大的市场利益的诱惑,出现了越来越多的中文检索工具,一些原来的英文搜索网站也纷纷推出自己的中文网站Excite 也不例外,图 1-3-5是 Excite 中文站点的起始页:。

      点击阅读更多内容
      关于金锄头网 - 版权申诉 - 免责声明 - 诚邀英才 - 联系我们
      手机版 | 川公网安备 51140202000112号 | 经营许可证(蜀ICP备13022795号)
      ©2008-2016 by Sichuan Goldhoe Inc. All Rights Reserved.