搜索引擎工作流程

3年前发布

搜索引擎工作流程主要有数据采集、数据预处理、数据处理、结果展示等阶段。在各工作阶段分别使用了网络爬虫、中文分词、大数据处理、数据挖掘等技术。

网络爬虫也被称为蜘蛛或者网络机器人，它是搜索引擎抓取系统的重要组成部分。网络爬虫根据相应的规则，以某些站点作为起始站点通过各页面上的超链接遍历整个互联网，利用URL弓I用根据广度优先遍历策略从一个html文档爬行到另一个html文档来抓取信息。

中文分词是中文搜索引擎中一个相当关键的技术，在创建索引之前需要将中文内容合理的进行分词。中文分词是文本挖掘的基础，对于输入的一段中文，成功的进行中文分词，可以达到电脑自动识别语句含义的效果。

大数据处理技术是通过运用大数据处理计算框架，对数据进行分布式计算。由于互联网数据量相当庞大，需要利用大数据处理技术来提高数据处理的效率。在搜索引擎中，大数据处理技术主要用来执行对网页重要度进行打分等数据计算。

数据挖掘就是从海量的数据中采用自动或半自动的建模算法，寻找隐藏在数据中的信息，是从数据库中发现知识的过程。数据挖掘一般和计算机科学相关，并通过机器学习、模式识别、统计学等方法来实现知识挖掘。在搜索引擎中主要是进行文本挖掘，搜索文本信息需要理解人类的自然语言，文本挖掘指从大量文本数据中抽取隐含的、未知的、可能有用的信息。

评分

欢迎为Ta评分

搜索引擎工作流程

网络技能