Sphinx全文索引 第一节


1 使用场景:用来解决站内搜索的一些应用场景。mysql

网站中的搜索(站内搜索)
系统后台中的搜索

第一种方式:PHP——>MySQL
第二种方式:MySQL<——>Sphinx;PHP——>Sphinx。


MySQL全文索引引擎也能够解决站内搜索,当数据库某张表数据量大的时候,作搜索花费时间多。
MySQL:添加索引 alert table 表名 add index 随便起索引名字(字段)

Sphinx将mysql数据生成一个索引数据表供前台检索能够提升检索效率。



2 Sphinxsql

Sphinx是一个基于SQL的全文检索引擎,能够结合MySQL,PostgreSQL作全文搜索,它能够提供比数据库自己更专业的搜索功能,使得应用程序更容易实现专业化的全文检索。

Sphinx特别为一些脚本语言设计搜索API接口,如PHP,Python,Perl,Ruby等,同时为MySQL也设计了一个存储引擎插件。
Sphinx 单一索引最大可包含1亿条记录,在1千万条记录状况下的查询速度为0.x秒(毫秒级)。

Sphinx建立索引的速度为:
建立100万条记录的索引只需 3~4分钟,建立1000万条记录的索引能够在50分钟内完成,而只包含最新10万条记录的增量索引,重建一次只需几十秒。

Sphinx的主要特性包括:数据库

高速索引 (在新款CPU上,近10 MB/秒); 
高速搜索 (2-4G的文本量中平均查询速度不到0.1秒); 
高可用性 (单CPU上最大可支持100 GB的文本,100M文档); 
提供良好的相关性排名 支持分布式搜索; 提供文档摘要生成; 
提供从MySQL内部的插件式存储引擎上搜索 支持布尔,短语, 和近义词查询; 
支持每一个文档多个全文检索域(默认最大32个); 
支持每一个文档多属性; 
支持断词; 
支持单字节编码与UTF-8编码;

 



3 两个重要的工具indexer 和 searched分布式

indexer:用于建立索引数据工具

/user/bin/indexer -config /etc/sphinxsearch/sphinx.conf -all

 



searched:后台进程,使用indexer工具生成的数据作查询

4 索引文件存储的数据种类网站

.spa 存储文档属性
.spd 存储每一个词ID可匹配的文档ID列表
.sph 存储索引头信息
.spi 存储词列表
.spm 存储MVA数据
.spp 存储每一个词的命中列表

 

5 查看sphinx数据编码

sphinx进入mysql的命令:spa

mysql -h0 -p9306(sphinx与数据库交互的端口号)
相关文章
相关标签/搜索