simple 是一个支持中文和拼音的 sqlite3 fts5 拓展。它完整提供了 微信移动端的全文检索多音字问题解决方案 一文中的方案四,非常简单和高效地支持中文及拼音的搜索。
实现相关介绍:https://www.wangfenjin.com/posts/simple-tokenizer/
在此基础上,我们还支持通过 cppjieba 实现更精准的词组匹配,介绍文章见 https://www.wangfenjin.com/posts/simple-jieba-tokenizer/
- 下载已经编译好的插件:https://github.com/wangfenjin/simple/releases 参考 examples 目录,目前已经有 c++, python, go 和 node-sqlite3 的例子。
- iOS 可以参考这个例子 wangfenjin#73 和 @hxicoder 提供的 demo .
- 在 Rust 中使用的例子 wangfenjin#89 https://github.com/fundon/tiny-docs-se
- Java 例子 https://github.com/wangfenjin/sqlite-java-connect
首先需要确认你用到的 sqlite 版本支持 fts5 拓展,确认方法是:
select fts5(?1);
然后就可以使用了,具体的例子可以参考 example.sql 和 cpp
$ ./sqlite3
SQLite version 3.32.3 2020-06-18 14:00:33
Enter ".help" for usage hints.
Connected to a transient in-memory database.
Use ".open FILENAME" to reopen on a persistent database.
sqlite> .load libsimple
sqlite> CREATE VIRTUAL TABLE t1 USING fts5(text, tokenize = 'simple');
sqlite> INSERT INTO t1 VALUES ('中华人民共和国国歌');
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华国歌');
[中华]人民共和[国国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华国歌');
[中华]人民共和国[国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华人民共和国');
[中华人民共和国国]歌
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华人民共和国');
[中华人民共和国]国歌
- simple tokenizer 支持中文和拼音的分词,并且可通过开关控制是否需要支持拼音
- simple_query() 函数实现自动组装 match query 的功能,用户不用学习 fts5 query 的语法
- simple_highlight() 实现连续高亮 match 的词汇,与 sqlite 自带的 highlight 类似,但是 simple_highlight 实现了连续 match 的词汇分到同一组的逻辑,理论上用户更需要这样
- simple_highlight_pos() 实现返回 match 的词汇位置,用户可以自行决定怎么使用
- simple_snippet() 实现截取 match 片段的功能,与 sqlite 自带的 snippet 功能类似,同样是增强连续 match 的词汇分到同一组的逻辑
- jieba_query() 实现jieba分词的效果,在索引不变的情况下,可以实现更精准的匹配。可以通过
-DSIMPLE_WITH_JIEBA=OFF
关掉结巴分词的功能 #35 - jieba_dict() 指定 dict 的目录,只需要调用一次,需要在调用 jieba_query() 之前指定。
使用支持 c++14 以上的编译器编译,直接在根目录 ./build-and-run 就会编译所有需要的文件并运行测试。编译输出见 output 目录
也可以手动 cmake:
mkdir build; cd build
cmake ..
make -j 12
make install
./build-ios.sh
./build-builtin
或者指定 SIMPLE_BUILT_IN=ON
:
cmake -DSIMPLE_BUILT_IN=ON ..
用脚本编译时不会附带more不会集成jieba分词。
- 参考这里 配置好 Emscripten SDK.
- 用 emsdk 的包装工具配置和编译:
mkdir wasm-build; cd wasm-build
# 由于 wasm 只能使用 OPFS 文件系统,无法提供结巴词典,所以无法和结巴一起编译;
# 同时由于是要和 SQLite 代码一起打包,所以输出静态库
emcmake cmake -DSIMPLE_BUILT_IN=ON -DBUILD_STATIC=ON -DBUILD_TEST_EXAMPLE=OFF -DBUILD_WITH_JIEBA=OFF ..
emmake make
或者直接使用脚本编译:
./build-wasm
由于本人没看懂原作者的编译逻辑,所以只能将 simple 先编译为静态库,再集成到 SQLite。如果有高手可以直接把代码集成到 SQLite 中一起编译那是最好的。
过程比较复杂,这里只给出要做的事情:
- 修改
configure.ac
、Makefile.in
、main.mk
等文件,确保编译系统能指定正确的参数链接libsimple.a
。注意要添加-lstdc++
。 - 修改
main.c
,确保把sqlite3SimpleInit
加入到内置 extension 列表中以正确初始化(需要放在 FTS extension 后面);\、 修改mksqlite3c.tcl
,确保编译系统生成整合版sqlite3.c
时不要把sqlite3SimpleInit
标记为SQLITE_PRIVATE
。 - (Wasm)修改
ext\wasm\GNUMakefile
、ext\wasm\fiddle.mk
,添加合适的参数指定链接libsimple.a
。
src/entry
入口文件,注册 sqlite tokenizer 和函数src/simple_tokenizer
分词器实现src/simple_highlight
高亮函数,基于内置的高亮函数改的,让命中的相邻单词连续高亮src/pinyin
中文转拼音以及拼音拆 query 的实现