Views
No views yet

1If you need a faster query version, replace the files in the `fast_query` folder with those in the root directory.
2
3The initial loading time will be longer (approximately +4–5 seconds), but the query time can be reduced from around 25 seconds to under 1 second.
4
5如果你需要query更快的版本 把fast_query資料夾內的檔案覆蓋到主目錄下
6第一次載入會比較久 載入時間會多個4~5秒 但查詢時間可以從25秒壓到1秒內| metric | normal mode | fast_query mode |
|---|---|---|
| startup time (default) | ~7.3 s | ~13 s |
| query latency | 0.74 ~ 22 s | < 1 s ⚡🚀 |
| item | value |
|---|---|
| token size | 734803 |
| embedding dim | 512 |
| storage format | safetensors (FP16) |
| all data size | ~5.44 GB |
| model data size | ~728 MB |
| wiki data size | ~4.73 GB |
| languages | multilingual |
1git clone https://huggingface.co/WangKaiLin/PipeOwl-1.10.2-tw-wiki-rag/
2cd PipeOwl-1.10.2-tw-wiki-rag/
3
4pip install numpy safetensors
5
6python quickstart_wiki_merge.pybang dreamBanG_Dream!BanG_Dream!example.md for full examples.1PipeOwl-1.10.2-tw-wiki-rag/
2├─ quickstart_wiki_merge.py #入口
3├─ wiki_retriever_merge.py #wiki資料搜尋
4├─ entity_layer.py #同義層邏輯
5├─ tokenizer_priority.py #切詞器邏輯
6├─ engine.py #pipeowl核心模組入口
7├─ entity_alias.json #同義詞資料集 (未完備)
8├─ phrase_lexicon.txt #完整詞保護
9├─ tokenizer.json #核心tokenizer
10├─ pipeowl.safetensors #核心向量矩陣儲存
11├─ zhwiki_clean.jsonl #wikidata資料集
12└─ wiki_index_merge/
13 ├─ wiki_merge_meta.json
14 ├─ wiki_titles.txt
15 ├─ wiki_title_tokens.jsonl
16 ├─ wiki_title_tokens_offsets.json
17 ├─ wiki_token_to_title_ids.json
18 └─ wiki_title_offsets.json