中文分词

mysql全文索引

mysql4.0以上支持全文检索,但是存储引擎类型必须为MYISAM

mysql5.6以上支持INODB引擎类型的全文检索

CREATE TABLE articles (
    id INT UNSIGNED AUTO_INCREMENT NOT NULL PRIMARY KEY,
    title VARCHAR(200),
    body TEXT,
    FULLTEXT (title,body)
) ENGINE=MyISAM  DEFAULT CHARSET=utf8;

查询语句:

SELECT * FROM articles
WHERE MATCH (title,body) AGAINST ('well hellow');

全文检索的原理是会把文本以空格标点符号分割成关键字,建立一个索引表,查询索引表
获取数据的绑定信息,取得原数据
基于这个原理,英文就非常好做全文索引了,但是中文呢

默认是自然检索,会自动计算权重,默认过滤超过50%的词汇出现率

改为布尔全文检索,会出现所有结果:

SELECT * FROM articles WHERE MATCH (title,body)
 AGAINST ('apple banana' IN BOOLEAN MODE);

修改最小匹配量:

可以在mysql配置文件my.ini 更改最小字符长度,方法是在my.ini 增加一行 
比如:ft_min_word_len = 2,改完后重启mysql即可。

一些运算符

+表示AND,即必须包含。- 表示NOT,即不包含

SELECT * FROM articles WHERE MATCH (title,body)
AGAINST ('+apple -banana' IN BOOLEAN MODE);

apple和banana之间是空格,空格表示OR,即至少包含apple、banana中的一个

SELECT * FROM articles WHERE MATCH (title,body)
AGAINST ('apple banana' IN BOOLEAN MODE);

返回同时包含apple和banana或者同时包含apple和orange的记录。但是同时包含apple和banana的记录的权重高于同时包含apple和orange的记录

SELECT * FROM articles WHERE MATCH (title,body)
AGAINST ('+apple +(>banana <orange)' IN BOOLEAN MODE);

中文分词

我们可以基于mysql全文索引的原理模拟出中文索引:

  1. 通过一系列的算法把中文文章分割成提取重要词语以空格隔开(基于词典)
  2. 然后建立一个全文索引表,一般以index_开头,专门存处理好的中文词,并把ID和原数据关联
  3. 查询的时候全文检索索引表,然后取得要查询的ID,通过ID命中源数据
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • 1. 要求 对文章内容进行关键词检索,找到符合的关键词的文章对数据库表优化(针对大型项目),进行分表读写数据(本次...
    呦丶耍脾气阅读 2,533评论 0 3
  • 前瞻 以前搜索功能一直使用的是like模糊查询,这种虽然操作简便,但是效果不好,需要搜索整个库,不如使用全文索引便...
    呦丶耍脾气阅读 5,796评论 0 3
  • 转载请注明:终小南 » 中文分词算法总结 什么是中文分词众所周知,英文是以 词为单位的,词和词之间是靠空格隔开,而...
    kirai阅读 9,922评论 3 24
  • 1)ICTCLAS 最早的中文开源分词项目之一,由中科院计算所的张华平、刘群所开发,采用C/C++编写,算法基于《...
    MobotStone阅读 5,781评论 1 15
  • 女儿三岁了,人家说三岁定八十。三岁是一个麻烦的年龄,是一个懵懵懂懂,刚刚认识自我,想好奇探索世界却毫无能力的小...
    甜甜妈妈wm阅读 229评论 0 0